球探系统最容易犯的错误,是把一名球员压缩成一个总评分。真正决定他适不适合某支球队的,往往恰恰是总评分看不到的角色差异。
先看一个具体的问题。下面是两名边锋的一组模拟示例数据,不代表任何真实球员或球队:
| 指标(每90分钟) | 边锋甲 | 边锋乙 |
|---|---|---|
| 进球 | 0.31 | 0.30 |
| 助攻 | 0.22 | 0.23 |
| 成功过人 | 2.4 | 2.5 |
| 传球成功率 | 81% | 80% |
| 抢断与拦截 | 1.6 | 1.5 |
按传统的筛选方式,这两个人几乎是同一个人。任何基于这几列数字的排序,都会把他们放在相邻的位置。可如果我们再补充两条背景:边锋甲所在的球队平均控球率接近六成,边锋乙所在的球队长期把控球留给对手,靠回收后的快速推进得分。这时候,两个人的数据是否还等价,就成了一个必须重新回答的问题。
同样一次助攻,难度并不一样
控球率高的球队,进攻大多发生在对手已经落位的阵地战里。边锋甲接球时,面前常常站着一条四人防线,加一个回撤的中场,他的可用空间很窄,每一次成功过人都是在密集人群里完成的。但他也有别的优势:球队给了他大量触球,队友会主动为他拉开宽度,他的传球选择大多是安全的、可以循序渐进的。
边锋乙的比赛则相反。他的球队接球时,对手往往刚刚压上,身后有大片空当。他的成功过人多发生在开阔区域,冲刺速度比技术细节更重要;他的进球有不少来自反击中的一对一或者远端接应。这不是说他更容易,而是他的工作性质不同:触球次数少,但每一次触球后面的距离更长,防守时还要经常长距离回追。
如果只拿数字做比较,球探得到的信息是“两人产出相当”。把环境放回去以后,得到的信息才变成:甲擅长在拥挤区域用小空间处理球,乙擅长在开放空间带球推进并承担更多回防。这两种能力,对不同球队的价值是完全不同的。
事件数据告诉你做了什么,追踪数据告诉你是在什么条件下做的
事件数据记录的是比赛里被标注出来的动作:传球、射门、过人、抢断、犯规,以及这些动作发生的位置与时间。它的好处是覆盖面广、成本相对低,可以横向比较很多联赛。它的问题是看不到没有球的时候发生了什么:球员有没有在无球时拉出宽度,防守时有没有及时回位,被压迫时身边有几个对手。
追踪数据补上了这一块。它记录的是所有球员在每一时刻的位置,因此可以推算出接球时最近对手的距离、球员的冲刺次数与距离、无球跑动的方向、球队阵型的宽度与压缩程度。江南体育AI球探把这两类数据放在一起使用:事件数据回答“他做了什么”,追踪数据回答“他是在多大的空间与压力下做的”。
但这里要老实说明一个限制:追踪数据并不是所有比赛都有。不少联赛、青年赛事和次级比赛只有事件数据,甚至只有赛后汇总。这种时候,模型不应该假装知道空间与压力,而是应该降低结论的置信度,明确提示“环境信息不完整”。在球探报告里,这种提示比一个漂亮的分数有价值得多。
先识别角色,再比较数字
“边锋”只是一个位置名称,不是一个角色。同样标注为右边锋的球员,有的主要在边路拉宽、传中;有的习惯内切、去肋部接球射门;有的经常回撤到中路参与组织。如果把这三类人放进同一份榜单比较,“传中次数”和“禁区内触球”这类指标会把角色差异误认为能力差异。
江南体育AI球探的思路,是用球员的触球位置分布、传球方向、跑动路线、防守动作的位置来学习一个角色向量,然后把球员放进角色相似的一组里去比。角色的划分并不是先验规定的,而是从数据里聚出来的,并且需要人来检查:聚出来的一组球员,是否真的像球探眼里的同一类人。关于这一点,可以延伸阅读同位置球员怎么比才公平?江南体育AI为什么先建立“角色相似组”。
角色识别也会出错。一名球员在一个赛季里因为伤病或教练调整被迫换了位置,他的角色向量就会混杂两种特征,模型可能把他归入一个并不存在的“混合类型”。遇到这种情况,比较合理的处理是把这个赛季拆开,按位置分段计算,而不是强行平均。
把球队环境拆成可以测量的几个变量
“比赛环境”听上去很大,实际做的时候要拆成具体、可以在数据里找到的变量:
- 球队控球与节奏:控球率、每次控球的平均传球数、推进速度,决定球员拿到的是阵地战还是转换机会。
- 对手压迫强度:对手在中前场的防守行动密度,影响球员接球时的时间与空间。
- 球队分工:同一条边路上,队友的边后卫是否经常插上,会影响这名边锋是否被要求提供宽度。
- 比赛状态:领先时的球队会回收,落后时会压上,同一名球员在不同比分下的数据分布差别很大。
- 联赛强度:不同联赛的对抗强度和技战术水平并不一致,直接对比数字,会把联赛差异误认为球员差异。
联赛强度这一项尤其容易被忽略。一名球员在强度较低的联赛里数据亮眼,到了强度更高的联赛,触球时间被压缩、被贴身的频率上升,数据往往会下降,这是所谓的“领域迁移”问题。这类联赛强度差异带来的领域迁移问题,站内另有文章单独展开。
模型怎样做“环境校正”,又在什么情况下会做错
环境校正的基本做法,是估计“在这样的环境里,一名典型的同角色球员,会有怎样的数据”,然后看这名球员相对于这个期望值高出或低出多少。控球强队的边锋,被期望有更多触球和更高传球成功率,因此单看这两项并不算突出;防守反击球队的边锋,触球少、射门机会稀疏,那么他每次机会的转化质量就更值得留意。
这类方法有几处容易出错的地方,设计上倾向于直接把它们暴露出来,而不是隐藏:
- 样本量不足。环境校正需要足够多的同类比赛作为参照。赛季中段的新球员、只踢了几场的球员,估计值的波动会很大,此时报告应该给出区间,而不是一个点。
- 球队与球员的混淆。一支球队的风格既可能塑造球员,也可能是由这名球员塑造的。当一名核心球员离队、球队数据整体变化时,模型很难分清哪一部分属于个人。
- 战术调整。教练在赛季中调整体系,环境变量就变了,过去的期望值不再适用。
- 数据标注差异。不同数据源对“过人”“抢断”的定义有出入,跨来源合并时,需要先做口径对齐。
这也意味着,有些结论是不能下的。比如,“这名球员在另一支球队里也会有同样的产出”这类结论,无论模型看起来多自信,都不应该被当成事实写进报告。模型能给出的,是“他的产出在原有环境里是否被高估或低估”,以及“他在什么类型的环境里更可能保持水平”。后者要涉及球员的风格与目标球队的匹配,这正是同一个球员为什么在不同战术里价值完全不同?江南体育AI开始计算“战术适配”要讨论的问题。
用一个简化的流程看整件事
把上面几步串起来,一名球员在江南体育AI球探里的大致处理路径是这样的:
- 汇总多个赛季、多个来源的事件数据,可用时补充追踪数据,做口径对齐与清洗。
- 按位置与触球分布识别角色,把球员放进同角色相似组。
- 估计球队控球、节奏、对手压迫、联赛强度等环境变量。
- 做环境校正,得到“相对期望”的偏差,以及偏差的不确定区间。
- 标记异常:数据和角色不符、样本过少、环境突变的球员,需要重点复核。
- 输出一份带证据的候选清单,交给球探。
注意最后一步的措辞:输出的是“候选清单”,不是“推荐签约名单”。一份好的清单,会把每名球员的关键数字、所在环境、角色标签和不确定因素放在一起,并且能对应到具体的比赛片段,方便球探有针对性地去看视频。这部分在球探报告里为什么既要有模型评分,也要保留比赛视频?里有更详细的讨论。
AI缩小范围,签不签仍然由人决定
需要把话说清楚:AI球探不能替代球探。它擅长的,是在几千名球员里发现一批值得看的人,指出那些数据和身份不相称的异常,把散落在各处的证据整理到一处。它不擅长,甚至做不到的事情包括:判断一名球员在更衣室里的状态,评估他面对压力时的心理反应,看出他的医疗记录是否有隐患,理解球队当下的预算和合同约束,判断这名球员是否符合教练的想法。
所以真正的签约决策,仍然要经过比赛视频复看、现场观察、医疗检查,以及对球队需求、预算和合同状况的综合评估。模型给出的环境校正结果,只是这条链条里的一环,它的作用是让球探把有限的时间花在更值得看的球员身上,而不是让一个分数替代判断。
回到开头的两名边锋。如果一支希望在阵地战中撕开密集防线的球队来找人,边锋甲的画像更值得看;如果这支球队想提高反击的速度,边锋乙的画像更合适。数字相同,结论相反。这就是“把球员放回比赛环境”的意义:不是让分数变得更复杂,而是让每一个分数背后的问题被问清楚。
从更长的时间看,同一名球员也会随着年龄增长而变化,一个赛季的环境校正,只是他成长曲线上的一个切片。这一点,本站另有文章专门谈成长轨迹,这里不再展开。
读到一份球探数据时,可以先问的五个问题
无论使用哪种工具,还是自己翻阅任何一份球员数据表,都可以在看数字之前先问这五个问题:这些数据来自什么水平的联赛?这名球员在球队里承担什么角色?球队整体的控球和节奏是怎样的?样本包含多少场比赛,其中有多少是首发?这些数字里,有没有一部分来自角色或位置的临时变化?如果一份数据表回答不了这些问题,那么它给出的排序就只应该被当作线索,而不是结论。
一个朴素的分工是:数据帮你找到人,眼睛帮你确认人。江南体育AI球探想做的,是让前半句更可靠一些,同时不让人误以为后半句可以省掉。