青训AI该不该使用身高和体重?关键不是“用不用”,而是怎么解释 示意图
原创示意图,用于说明分析思路,非实拍画面
模拟示例说明:文中的身高、体重、百分位与模型贡献数值均为示意数据,只用于说明解释方式,不对应真实的孩子或球队,也不代表江南体育的实际评估。

假设一个示意的青训选材模型,训练时把身高、体重、30米冲刺、控球测试、传球决策等十几项指标一起输入,输出一个“发展观察等级”。上线后有人发现,等级靠前的孩子普遍比同龄人高半个头。这是模型的问题,还是数据的问题?两者都是,但更麻烦的是:不知道它到底是在用身高,还是在用和身高相关的所有东西——速度、对抗、射门力量,这些指标本身就随身高一起变。

于是团队里出现两种声音。一种说:删掉身高体重,问题就解决了。另一种说:删掉以后,模型就看不见成熟度的差别,反而更容易把早熟的孩子当作天才。这篇文章的立场是:这两种做法都不够,关键是怎么用,以及怎么解释

直接删掉,为什么并不能消除偏差

把身高体重从输入里拿走,听起来干净,实际上有两个漏洞。

第一,代理变量依然存在。冲刺速度、跳跃高度、对抗成功率、射门力量都高度受体型与成熟度影响,模型可以通过这些指标间接“看见”孩子有多早熟。删了身高,偏差只是换了个入口。

第二,你失去了校正的工具。如果想把成绩按成熟度做校正——把早熟孩子的速度优势折算掉,把晚熟孩子的暂时落后补回来——首先得知道孩子处在什么发育阶段。没有身高与生长速度的记录,校正无从谈起。近期有研究尝试用按生物年龄调整的冲刺百分位曲线来评估青少年,思路正是把体型和成熟度当成“坐标”,而不是“分数”。

所以这里的问题不是变量本身有毒,而是它在模型里被赋予了怎样的角色。

直接用,为什么又会奖励早熟

另一个极端是把身高体重和其他指标一视同仁地输入。这样训练出来的模型,会学到历史选拔里的偏好:过去被留下来的孩子,很大一部分是早熟者,于是“更高更壮”和“被评为优秀”之间建立了统计关联。模型并没有做错,它只是忠实地复制了过去的选拔偏向。近期关于AI足球人才识别的综述提到的样本偏差与早熟偏置,说的就是这一类问题。

更隐蔽的是,这种偏向读起来像是“客观数据”。当报告上出现“身体条件优秀”这样的字样时,看的人很难分清,这是长期潜力的信号,还是发育进度的信号。

身高体重的三种读法

同一个数字,可以有完全不同的读法。江南体育青训AI在设计取向上,希望把它限制在前两种,避免第三种。

  1. 作为成熟度背景。用身高、生长速度、(在合规条件下的)骨龄或其他成熟度估算,判断孩子当前处于发育的哪个阶段。它回答的是“这个孩子现在身体走到哪一步了”,不产生任何“高就是好”的含义。
  2. 作为校正基准。把速度、力量类成绩放到“同成熟度的同伴”中去比较,而不是放到“同出生年份的同伴”中去比较。此时身高体重是尺子,不是被评价的对象。
  3. 作为直接加分项。让“更高、更重”本身提高评分。这一读法应当避免,尤其是在位置差异很大的情况下:门将、中卫、边路球员对体型的需求并不相同,把体型一概当作优势并不合理。

当然,第一种和第二种的边界并不总是清晰。生物成熟度的估算本身就带误差,比如依赖父母身高推算成年身高,就存在遗传估算的不确定性。因此江南体育青训AI在报告中,更倾向于把成熟度背景写成“估计区间”而不是一个确定的数字。

怎么向教练解释一个特征在起什么作用

“可解释”在青训里有很具体的含义:教练拿到一份评估,应当能回答“这个孩子的等级,有多少来自身体尺寸,多少来自技术与决策”。一种可行的呈现是把模型的判断拆成几个来源,而不是给一个总数:

  • 技术类指标(控球、传球、一对一处理)的贡献;
  • 决策类指标(选择、跑位、比赛阅读)的贡献;
  • 体能类指标在成熟度校正前后的差别;
  • 成熟度背景(估计区间)以及它对结论的影响幅度。

举一个示意的情形:某孩子的体能类指标在校正前排在年龄组前列,校正后回到中间;技术与决策类指标则一直稳定在中上。报告应当直接说明:“这个孩子早期的体能优势有较大一部分与发育进度有关;他的长期观察重点在技术与决策的持续提升。”这句话比“综合等级:良好”有用得多,它给教练指出了下一次该看什么。这一思路和青训选材为什么容易错过“晚熟球员”?江南体育AI如何处理生物成熟度偏差一文是相互补充的:那篇讲偏差是怎么产生的,这篇讲它在特征层面怎么被看见。

该检查的,不只是“用没用”

特征处理好了,还需要检查模型的整体行为,几个基本检查是:

  • 分层比较:把孩子按成熟度阶段分组,检查模型在早熟组和晚熟组的评分分布是否差得过大;
  • 反事实检查:保持技术与决策指标不变,只调整成熟度背景,看评分变化多少,变化过大说明模型对成熟度过于敏感;
  • 出生月份检查:看同一年龄组内,上半年与下半年出生的孩子,被评为靠前的比例是否明显失衡,这是相对年龄效应最直接的信号;
  • 外部验证:在不同地区、不同训练体系的数据上复测,观察结论是否稳定。这部分在青训AI为什么越来越重视长期验证?江南体育观察“小时候预测未来”的真正难点中有更多讨论。

这些检查不能保证模型没有偏差,但能保证偏差是可以被发现的。发现不了的偏差,才是真正危险的偏差。

哪些结论不能下

即使特征处理规范,也有几类结论不应由这类模型给出:

  • 不能说“这个孩子身体条件差,不适合踢球”。青少年体型变化剧烈,今天的数字对成年后没有直接的决定意义;
  • 不能把体型当作位置分配的唯一理由。位置适配还取决于技术、决策和意愿;
  • 不能把单一等级用作淘汰依据。任何评估只能是持续观察中的一个参考,需要与教练观察、训练表现和长期数据一起看,也不应给出看似精确的“潜力分数”。

身体数据是敏感数据

身高、体重、骨龄、身体成分、体测视频,都是关于未成年人身体的信息,属于应当谨慎对待的数据。使用时至少应做到:只收集评估确实需要的项目,不做“先收集再想用途”;明确告知用途并取得家长或监护人同意;限制访问范围,教练和评估人员只看到与职责相关的部分;设定保留期限,目的结束后删除或匿名化;不将这类数据用于与发展跟踪无关的其他目的,比如商业推送。江南体育青训AI在设计上,把数据最小化、访问权限和生命周期管理视为评估流程的一部分,而不是可选的附加项。

回到开头的问题:该不该用身高体重?可以用,但要清楚地说明它是尺子,还是分数;要能够解释它在模型里起了什么作用;更要承认,即使这些都做到了,我们依然是在用不完整的数据去描述一个还在成长的人。这也是13岁跑得最快的孩子,18岁还会最快吗?江南体育AI为什么必须理解成长想强调的:孩子的发展需要持续观察,而不是一次判断。