先设想一个很普通的需求:某支球队想补一名左后卫,二十四岁以下,能适应高位压迫,预算不高,最好惯用左脚。这句话里藏着五个条件,年龄和惯用脚是硬条件,容易筛;“适应高位压迫”是战术条件,要靠角色和风格去判断;“预算不高”其实是联赛、合同和身价的问题,模型看不到全部。江南体育官网上的AI球员分析流程,就是为了把这样的需求拆开,一步一步回答,并且每一步都留下可以回头检查的证据。
整条流程分九步:球员数据、数据清洗、位置与角色识别、同类球员比较、发展趋势、战术适配、风险因素、球探短名单、人工复核。下面按顺序讲,每一步都写清楚输入是什么、输出是什么,以及这一步最容易在哪里出错。
第一步和第二步:先把“同一个人”认对,再谈数据好不好
球员数据并不是一张干净的表。事件数据记录传球、射门、抢断、争顶这类有名字的动作,追踪数据记录每个人每一时刻在场上的位置和移动,比赛视频和体能测试又是另外两条线。不同来源对同一个球员的写法可能不同:姓名的拼写、转写、别名,转会后球队编号变了,青年队和一线队的记录被分在两处。如果这一层没有对齐,后面所有分析都建立在错误的人身上。江南体育在这一步做的是统一球员、球队、赛事、位置的编号,把同一个人在不同来源里的记录合并起来。
清洗的重点不是“把数据变漂亮”,而是识别哪些数据不该被使用。出场只有二十分钟的比赛,抢断数看起来很高,但样本太小;被换上场时球队已经领先三球,防守数据的含义与胶着比赛完全不同;同一场比赛的事件被两个来源重复记录,会让传球次数虚高。这一步会给每条记录带上“可信程度”的标记,而不是直接删除,因为后面的模型需要知道,哪些结论是建立在薄弱证据上的。
这里最容易出的错,是把缺失当成零。某个联赛没有记录压迫次数,不等于这个球员没有压迫;某个赛季没有追踪数据,不等于他没有跑动。所以缺失值要单独标注,不能悄悄补零。
第三步:判断他在场上到底做什么,而不是名单上写的位置
名单上的“左后卫”只是一个标签。同样标注为左后卫的两个人,一个整场压在边线上不断套边、传中,另一个经常内收到中路参与出球,还有一个几乎不过半场。江南体育的做法是根据事件位置、触球区域、传球方向、防守动作的分布,以及追踪数据里的平均站位,识别球员在比赛里的实际角色。一名球员可以同时带有多个角色权重,比如“边路推进”占六成、“内收组织”占三成,这比强行归入一个类别更接近真实。
角色识别会被球队打法误导。一名后卫在一支长期控球的球队里,自然会有更多触球和更靠前的站位,识别结果可能偏向“组织型”,换到一支习惯退守的球队,同一个人的表现可能完全不同。所以角色识别的输出不是终点,它只能说“在这支球队的这套体系里,他承担的是这样的任务”,能不能迁移到另一套体系,要放在第六步回答。关于把球员放回比赛环境里理解,可以看“进球多”就代表值得签吗?江南体育AI球探为什么开始把球员放回比赛环境里评价这篇文章,那里用两个数据相似的边锋讲了环境差异。
第四步:只在角色相近的人之间比较
识别出角色之后,才能谈比较。江南体育用球员Embedding,也就是把一个球员的技术动作、跑动方式、持球习惯、防守选择压缩成一组向量,去寻找风格相近的球员,再叠加年龄、联赛、出场时间等条件。这样得到的“同类球员”,不再是同一个位置的所有人,而是承担相近任务的一群人。左后卫要和左后卫比,但更准确的说法是:内收型左后卫要和内收型左后卫比。
比较的输出不是一个排名,而是一张相对位置图:在这个同类群体里,他的推进传球处于什么区间,回追次数处于什么区间,一对一防守成功率处于什么区间。这里必须写明,向量相似只说明“踢法像”,不说明“同样好”。两个人的Embedding很接近,可能一个是稳定的主力,另一个只是在低强度联赛里刷出了类似的数据。
第五步:看轨迹,而不是某一场的高光
发展趋势这一步会读取球员近几个赛季的变化:出场时间是否在稳步增加,位置是否变动过,关键技术指标是在改善、持平还是下降,赛季内是否有断层。一名二十一岁的球员,在过去三个赛季里从替补变成主力,同时传球选择在变得更冒险也更有效,这样的轨迹比他某个赛季的最高分更有信息量。反过来,一名数据突然爆发的球员,如果只有半个赛季的样本,就应该被标为“待观察”,而不是“上升期”。
年轻球员还要考虑成熟度和相对年龄,这在青训语境里尤其重要。对成年球员,发展趋势更多看伤病后的恢复曲线和年龄曲线。无论哪种,模型给出的是趋势区间和不确定性,不是一个“未来评分”。
第六步:这套踢法放进目标球队,会被放大还是被抵消
回到开头的需求,“适应高位压迫”是最难回答的条件。江南体育把目标球队也做成一份风格画像:防线站位高度、压迫触发的区域、出球习惯、边路推进的方式,然后拿球员的风格向量与球队的需求做匹配。一名速度出众、回追积极的后卫,在高位压迫体系里,身后大片空间被他的速度覆盖;但如果他的出球一直偏保守,那么在需要后卫直接参与组织的体系里,他的价值会下降。
这一步的结论只能是“适配程度较高或较低,以及原因”,不能写成“一定适合”。战术适配还受教练调整、队友搭配、赛程强度影响,模型看不到更衣室,也看不到教练下个赛季想改打法。更完整的讨论可以参考球探报告里为什么既要有模型评分,也要保留比赛视频?,那篇文章说明了为什么每一个适配结论都要连接到具体的比赛片段。
第七步:把风险单独列出来,不要混进总分
风险因素在江南体育的流程里是一个独立的输出,而不是扣分项。常见的几类包括:伤病史和出场断层;联赛强度差异,也就是他在一个强度较低的联赛里的数据,放到更高强度的联赛是否成立;样本过小;位置或角色近期发生变化,历史数据可比性下降;数据覆盖不足,比如某个赛季缺追踪数据。把它们单独列出来,球探才知道该先去核实哪一项。如果风险被折算成一个总分,一名“综合92分”的球员和另一名“综合92分”的球员看起来一样,但一个是因为数据扎实,另一个是因为样本小、爆发得早,两者含义完全不同。
第八步和第九步:一份带证据的短名单,交给人来决定
前面所有步骤汇总成球探短名单。名单里每个人都带着几样东西:为什么被选中,也就是与需求匹配的角色、趋势和适配理由;与同类球员相比的位置;主要风险因素;建议球探优先查看的比赛片段。整份名单通常只有十几人,而起点可能是几千人。模型的价值就在这里:缩小范围,发现被忽略的异常,把证据整理好。
它不能做的事同样明确。它没有看现场,不知道球员的训练态度和对抗时的表情;它没有做医疗检查,看不到旧伤的真实状况;它不了解球队的预算、合同结构、与经纪方的谈判空间;它也无法判断一名球员能否适应新的城市和语言。这些都需要人。江南体育在设计取向上,让模型的每一条判断都可以被展开、被质疑:球探可以点开一个结论,看到它依赖的数据、对应的比赛片段,以及模型不确定的部分。
用一个模拟示例把九步串起来
| 步骤 | 示意输入 | 示意输出 | 典型失真 |
|---|---|---|---|
| 数据清洗 | 三个来源的记录,合计5个赛季 | 合并为一个球员编号,标记2个出场不足的赛季 | 缺失被当成零 |
| 角色识别 | 触球区域、传球方向、站位 | 边路推进约60%、内收组织约30% | 被球队打法带偏 |
| 同类比较 | 约200名相近角色球员 | 推进传球处于同类中上区间 | 向量相似被当成同样好 |
| 发展趋势 | 近3个赛季出场与指标 | 出场稳步增加,防守选择变稳 | 小样本被当趋势 |
| 战术适配 | 球员风格向量与球队需求 | 高位压迫适配较高,出球适配中等 | 忽视教练调整 |
| 风险因素 | 伤病、联赛强度、样本 | 联赛强度差异需核实 | 风险被折成总分 |
| 短名单 | 以上全部 | 12人,附证据与片段 | 把名单当结论 |
这张表想说明的只是一件事:每一步的输出,都可能成为下一步的错误来源,所以流程里没有“一次跑完就相信”的环节。
什么时候这条流程会失效
有几种情况,模型给出的短名单可信度会明显下降。第一,联赛覆盖不足,某些赛事只有事件数据,没有追踪数据,角色识别就会变粗。第二,球员刚换位置,历史数据的可比性受损。第三,球队需求本身模糊,比如只说“要一个好的后卫”,没有风格描述,适配这一步就没有依据。第四,青少年球员,成长速度和成熟度带来的变化远大于成年球员,这部分需要另一套更谨慎的处理方式,江南体育官网另有专题谈这一点。
遇到这些情况,江南体育的思路是降低结论的措辞强度,把“不确定”写进输出,而不是给出一个看上去精确的数字。想了解官网如何把球探、青训、阵容和推荐放在同一套数据基础上,可以阅读江南体育官网为什么把球探、青训、阵容和赛事推荐放进同一个体育AI体系?。
最后一步为什么不能省
把人工复核写进流程的最后,并不是为了显得谨慎。球探在看比赛视频时,会注意到模型没有编码的东西:一个后卫在压迫失败后的补位速度,他在落后时是否还愿意冲刺回追,他和门将、中卫之间的沟通。这些细节有的可以被数据部分描述,有的目前无法量化。江南体育官网希望呈现的是这样一种分工:模型负责把庞大的数据变成一份可以查证的初筛,人负责判断这个人是否真的适合这支球队、这个价格和这个阶段。签约决策的责任在人,工具只是让这个决策建立在更完整的证据上。