先从一个具体的判断说起:某名中场“防守贡献低”。这句话如果只依据事件数据,意思是他的抢断、拦截次数不多。但事件数据看不到的是,他所在的球队长期控球,对手根本没有太多进攻机会让他去抢断;也看不到他是否每次都在对手接球前几秒就完成了站位封堵,从而根本不需要动手。同一条结论,换一种数据来看,可能完全相反。
所以江南体育AI大模型在设计数据层时,并不追求“把能找到的数据全接进来”,而是先问:这个问题用哪种证据回答最合适,这种证据在什么情况下会骗人。下面按数据种类逐一说明。
事件数据:擅长回答“做了什么”,回答不了“在哪种局面下做”
事件数据是每一次触球、传球、射门、抢断、犯规的记录,带有时间、位置和结果。它覆盖面广、成本低、历史长,所以是球员筛选的地基。江南体育AI用它完成最基础的几件事:统计产量(每90分钟的传球、推进、射门)、划分传球和射门的区域分布、识别球员大致的位置与倾向。
它的短板也很清楚。事件只在球员触球或发生对抗的瞬间产生,无球跑动、站位、牵制对手这些行为不会出现;同样是一脚成功的向前传球,是在无人压迫时完成的,还是在三名对手包夹下完成的,事件记录本身往往区分不了。此外,不同数据采集方对“抢断”“关键传球”的口径并不一致,把来自不同来源的事件数据直接拼接,容易产生虚假的差异。
因此模型里事件数据的角色是“初筛和画像底稿”,而不是最终判断。凡是需要说“他比同类球员好”的场合,都需要额外证据。
追踪数据:补上位置与空间,但覆盖有限
追踪数据记录的是场上球员和球在每一个时刻的坐标。有了它,才能讨论跑动距离、冲刺次数、与最近对手的距离、球队的阵型宽度和纵深、压迫时的距离收缩。上一段的例子,站位封堵是否有效,只有在追踪数据里才看得到。
近期的公开研究里,追踪数据也被用来学习球员的“打法表示”,用于寻找风格相近的球员;还有研究尝试从球员轨迹反推事件,说明两类数据有互补关系。但需要诚实说明的是,追踪数据的获取门槛高,很多赛事没有,或者只有部分比赛有;不同来源的坐标系和采样频率也不同。江南体育AI的处理思路是:有追踪数据时用它细化角色和空间判断,没有时明确标记“该结论只基于事件数据”,而不是用估计值悄悄填平缺口。
比赛视频:解释“为什么”,也是核对模型的最后一道关
视频是信息密度最高、也最难结构化的一类数据。它能回答其他数据回答不了的问题:这名边锋的持球推进,是因为他自己盘带能力强,还是因为队友总把球送到他脚下并给出宽度;这名中卫的失位,是个人判断问题,还是整条防线整体没有压上。
近年来体育领域出现了面向足球的视觉模型和视频与文本结合的多模态研究,方向是让模型直接从画面里识别动作、事件甚至战术上下文。这些工作大多仍处在研究和数据集阶段,在不同转播画面、不同赛事间的稳定性还需要外部验证。江南体育AI目前对视频的使用更克制:一是把模型发现的异常数据定位到具体的比赛片段,方便球探直接回看;二是用视频抽查来核对事件数据和追踪数据是否出错。视频在这里首先是证据,其次才是特征。这一点在体育AI为什么需要“可解释球探报告”中会展开说明。
体能数据与训练数据:对青少年尤其要谨慎
体能数据(速度、加速度、心肺指标、负荷)和训练数据(训练出勤、训练内容、伤病与恢复记录)回答的是另一类问题:一个球员能不能承受更高强度,训练里的进步是否已经在比赛里显现,近期状态起伏是伤病、疲劳还是单纯的对手变化。
这两类数据有两个要点。第一,它们高度依赖测试条件,不同俱乐部的设备、时间点、测试方法都不同,横向比较风险很大。第二,它们涉及健康和个人隐私,尤其是青少年球员。江南体育在这一类数据上的原则是最小化:只保留与观察目标直接相关的字段,限定访问权限,明确使用用途,涉及未成年人时需要监护人知情同意,并设定保存期限。体能数据也不宜被当作“潜力”的直接证据——身体发育阶段不同,同龄人之间的速度差距,很大程度上反映的是成熟度而不是长期能力。
历史数据:把一个时间点变成一条轨迹
历史数据不是新的数据类型,而是其他数据沿时间轴的累积:几个赛季的出场时间、位置变化、技术指标走势、伤病中断、所处联赛的变化。它的价值在于区分“这个球员现在这样”和“这个球员正在往哪里变化”。
同时它也是最容易被误用的数据。赛季之间球队战术换了,球员位置换了,联赛强度换了,直接把两个赛季的数值相减,得到的“进步”可能只是环境不同。比较跨联赛数据时的修正思路,可以参考小联赛的数据能直接和顶级联赛比较吗一文。
一张对照表:问题、数据与失效条件
| 要回答的问题 | 主要依赖的数据 | 最容易失效的情形 |
|---|---|---|
| 这个球员产出多少、倾向如何 | 事件数据 | 球队控球率极端,或数据口径不一致 |
| 他在场上如何占位、如何影响空间 | 追踪数据 | 该赛事没有追踪数据,或坐标质量差 |
| 这次表现为什么会发生 | 比赛视频 | 只看了少量片段,样本不足 |
| 他能否承受更高强度 | 体能与训练数据 | 测试条件不统一,成熟度差异被误读 |
| 他正在向哪个方向变化 | 历史数据 | 位置、球队、联赛在变,数值不可直接比较 |
数据多了以后,真正的麻烦是对齐
把六类数据放进同一个系统,最难的不是存储,而是对齐:同一个球员在事件数据里叫一个名字,在追踪数据里是一个编号,在训练记录里又是另一个拼写;同一场比赛的事件时间戳与视频时间码可能有几秒偏差。任何一处对错位,模型学到的就是错误的联系。这类问题在江南体育大模型里由实体对齐、比赛时间校准和抽样人工核对共同处理,而球员、球队、赛事之间的关系,又会进入知识图谱,供推荐和检索使用。
其次是缺失。真实的球员池里,顶级联赛的数据最全,下级联赛和青年赛事往往只有事件数据甚至只有比赛结果。模型如果对“缺失”没有显式处理,就会把“没有数据”当成“没有表现”,结果是系统性地低估数据薄弱地区的球员。合理的做法是让模型输出时同时给出数据完整度,缺哪类数据就在报告里写明,并调低相应结论的把握。
哪些结论用这些数据也不能下
- 不能仅凭数据判断一名球员“值得签约”。签约还涉及医疗检查、性格与团队融入、预算、合同状态和球队的具体需要,这些都不在上述数据里。
- 不能把体能测试成绩直接换算成青少年球员的长期潜力。
- 不能用单一赛季、单一位置的数据推断“稳定能力”。
- 不能在没有视频复核的情况下,把模型标出的异常直接当作“发现”。
回到开头的例子。一名被事件数据标为“防守贡献低”的中场,是否真的防守不足,需要追踪数据看他的站位,需要视频看他的选择,需要历史数据看他在不同球队里是否一致。数据种类的价值,不在于数量,而在于每一种都把另一种可能骗人的地方暴露出来。这也是江南体育官网把球探、青训、阵容和推荐放在同一套数据底座上的原因之一,整体思路可以看江南体育官网为什么把球探、青训、阵容和赛事推荐放进同一个体育AI体系。