大模型负责“读球探报告”,机器学习负责“算潜力”:江南体育为什么需要多模型协作 示意图
原创示意图,用于说明分析思路,非实拍画面

设想一位球探在江南体育的系统里输入这样一句话:“找一名22岁以下、能在高位压迫体系里踢边后卫、最近两个赛季出场时间在上升、最好不是已经被大量报道的球员。”这句话看似简单,背后至少包含四种完全不同的计算:理解一句自然语言的意图,把“高位压迫体系里的边后卫”变成可比较的球员画像,判断“出场时间在上升”的趋势是否可信,再排除“已经被大量报道”的那部分人。没有哪一种模型能一次做完这四件事。

先由大语言模型把话“翻译”成结构化条件

大语言模型最擅长的,是处理不整齐的文字。球探的搜索条件往往含混:“能踢高位压迫”没有统一定义,“年轻”是多大,“最近”是几场。大语言模型在这里的职责,是把这句话拆成一组明确的条件:年龄上限、位置集合、时间窗口、需要参考的数据类型,并把含糊之处显式标出来,例如追问“边后卫是否包含翼卫”。

它的第二个职责,是读球探报告和赛事文字,把长文本压成可检索的要点,比如某份报告提到“出球果断,但一对一防守偏被动”,就抽取成带来源的标注,而不是直接改写成一个分数。这类抽取有一个明确的边界:模型转述的每一条,都应该能回到原文;如果回不去,就不进入后续计算。

大语言模型不适合做的事也很清楚:它不该凭语感给球员打分,也不该在没有数据的情况下“补全”一名球员的表现。文字流畅并不等于事实准确,这一点在体育数据里尤其容易出问题。

Embedding:用向量回答“和谁像”,但要先问“像在哪”

有了结构化条件,下一步是候选球员的检索。江南体育使用球员Embedding,把一名球员在比赛中的行为模式压缩成一个向量:他常出现在哪些区域,推进和出球的方式,压迫和回追的强度,与队友的配合类型。向量之间距离近,意味着打法接近。

近期的公开研究里,有把比赛事件序列当作“语言”来建模、从中学习球员表示的做法,也有基于追踪数据学习打法距离的工作。共同的经验是:学出来的向量常常能按位置和角色自然聚类,这是好现象;但向量的每一维通常没有可直接命名的含义,“很像”只是一个结论,说明不了原因。

所以在流程里,Embedding只负责缩小范围。它给出一批打法相近的候选,接着必须由能解释的指标去回答“像在哪里”,比如同样偏高的前插频率,同样偏少的防守对抗。同时,向量是在特定的数据、联赛和球队环境里学出来的,把它套到数据结构完全不同的联赛时,可信度会明显下降,这也是江南体育在跨联赛检索里会同时给出数据来源和环境提示的原因。

预测模型:只回答“趋势”,并给出区间

“出场时间在上升,技术指标在改善”是不是一个真实的成长信号,要交给预测模型。它使用几个赛季的历史数据,估计一名球员的表现如何随年龄、出场机会和环境变化,输出的不是一个确定的数字,而是一个区间,加上主要影响因素。

这里需要说的有两点。第一,预测模型学到的是过去球员群体的规律,遇到成长路径特殊的个体,比如中途换位置、长期伤病的球员,它的误差会更大。第二,对青少年球员,模型必须把成熟度和比赛机会考虑进去,否则很容易把“早熟”读成“潜力”。这类问题在青训相关文章里有专门讨论。江南体育的设计取向是让预测模型输出“发展趋势和不确定性”,不输出“会不会成功”的判断。

图模型:处理球员、球队、教练之间的关系

球员不是孤立的点。他效力过哪些球队,在哪位教练手下踢什么位置,与哪些队友长期同场,所在联赛与另一联赛之间有怎样的人员流动,这些是关系数据,用表格很难表达,用图更自然:球员、球队、教练、赛事、位置是节点,出场、执教、转会是边。

图模型在球探流程里有三个用途。一是补充上下文:同样的数据,出自一位偏好控球的教练和出自一位偏好直接打法的教练,含义不同。二是发现间接联系:一名球员虽然没被直接搜索,但与已关注对象在风格、成长路径和所处环境上有多条相近的关系路径。三是做去重和实体对齐,避免同一个人因为不同拼写被当作两个人。推荐系统中使用的知识图谱,与球探所用的图,底层节点大体共享,这也是体育球探大模型到底需要看多少种数据里提到的数据对齐工作重要的原因。

四个模型之间的交接,比每个模型本身更重要

多模型协作最常见的失败,不在某个模型内部,而在交接处。拿开头的搜索来说,整条链是这样的:

  1. 大语言模型输出结构化条件,并标明不确定的解释。
  2. 图模型与数据库按条件筛出符合年龄、位置、时间窗口的范围。
  3. Embedding在这个范围内,找出与“高位压迫边后卫”画像相近的候选。
  4. 预测模型给每名候选的发展趋势打出区间和影响因素。
  5. 大语言模型把结果整理成球探能读的说明,并附上每条结论的证据来源。
  6. 球探复核视频,决定是否进入观察名单。

每一步都在前一步的输出上工作,所以前一步的错会被放大。如果第一步把“边后卫”误解成“边锋”,后面的模型再精确,得到的也是一份认真的错答案。为此,江南体育在交接处放了三类保护:条件确认(含糊时向用户回问,而不是自行猜测);数据完整度标注(哪类数据缺失,结论相应降级);结论溯源(每条建议能回到数据或文本原文)。整套分析流程如何落到球探短名单,可以看江南体育官网的AI球员分析流程

为什么不直接用一个更大的模型

常有人问,既然大模型越来越强,为什么不让一个模型端到端完成?原因有三点。其一,可检查性:分开之后,每一步的输入输出都可以单独审视,某个环节出错时可以定位。其二,数据形态不同:事件表、追踪坐标、关系网络和文字报告,本身就适合不同的建模方式。其三,责任边界:对球员成长的判断需要不确定性和校准,这类要求由专门的预测模型承担,比让语言模型“说出一个看起来合理的判断”可靠得多。

当然这不是说多模型就没有问题。协作链越长,维护和评估成本越高,各环节的误差如何叠加也难以精确刻画,目前这仍然是需要持续验证的部分。另外,公开资料里能看到的足球类基础模型和多模态研究,大多仍在特定数据集上验证,跨赛事、跨数据源的稳定性还有待更多外部检验,江南体育大模型对这类进展的态度是跟进、评估,再决定是否接入,而不是直接宣布替换现有流程。

模拟示例说明:文中的搜索请求、筛选流程与条件均为示意,用来说明各模型如何分工,不代表真实球员、球队,也不代表江南体育当前系统的准确率或性能指标。

各司其职的清单

  • 大语言模型:理解问题与文本,整理表达;不打分,不补全缺失事实。
  • Embedding:找打法相近的候选;不解释原因,不跨联赛直接下结论。
  • 预测模型:给出发展趋势区间与影响因素;不承诺个体结果。
  • 图模型:管理关系与上下文;不替代对比赛内容的判断。
  • 人:看视频,做现场观察、医疗与合同评估,作出签约决定。

这张清单里最后一行没有被任何模型替代。多模型协作的目的是让球探把时间花在真正需要判断的地方,而不是把判断交出去。使用这些结果时,还应结合可解释球探报告里提到的证据与不确定性说明一起阅读,避免只看结论。