体育推荐不再只看点击历史:江南体育观察知识图谱和语义关系如何进入推荐系统 示意图
原创示意图,用于说明分析思路,非实拍画面

点击历史是推荐系统最容易拿到的信号,也是最容易被误读的一种。一个用户连续三天点开同一支球队的新闻,可能是长期球迷,也可能只是那一周球队恰好有转会传闻。系统只看点击序列,就只能猜测;把球队、球员、赛事、位置、战术风格和内容类型之间的关系也放进来,猜测才有了依据。江南体育近期在整理公开资料时注意到,体育推荐研究正在朝这个方向移动,这篇观察想把它讲清楚,也讲清楚它没有解决的部分。

点击序列能学到什么,学不到什么

深度学习模型擅长从行为序列里找规律:用户在什么时段看什么类型的内容、连续看了哪几类之后倾向于看什么、不同用户的偏好有多接近。这些规律在数据充足的用户身上很有效。它的弱点也很明确:一个新用户几乎没有行为,模型无从下手;一条新发布的内容没有任何点击,模型也不知道该推给谁;一个用户偶尔看了一场陌生联赛的比赛,模型无法判断这是新兴趣还是偶然。

更深一层的问题是,点击序列只记录了“看了什么”,没有记录“为什么相关”。两名球员被同一个用户先后点开,模型可以统计它们经常共现,却不知道一个是边路内切型进攻手,另一个是同类型的年轻球员。缺了这层语义,推荐就很难做到“相关但没看过”。这也是喜欢一支球队,为什么推荐系统不应该只给你看这支球队里反复强调的出发点。

公开资料里的一个方向:深度模型加语义关系

近期公开发表的体育推荐研究中,有工作提出把深度学习模型与本体相似度计算结合起来:深度部分负责从用户的历史行为中学习复杂的偏好特征,本体部分则提供语义层面的相似性,用来弥补单一深度模型在理解内容含义上的不足。另一些近期的研究把本体思路用在跑步赛事等具体场景,结合用户画像和赛事特征做带上下文的推荐。更早的综述也提到,体育推荐系统有它特有的问题,比如兴趣和用户状态会随赛季、赛程和比赛日变化。

这里需要谨慎:这类研究多数在特定数据集上做验证,报告的指标不能直接搬到别的产品和用户群体上,因此这篇文章不引用任何具体的效果数字,只讨论方向。对一个体育内容产品来说,真正有价值的是这个思路背后的几个具体收益。

变化一:冷启动有了可以依靠的结构

知识图谱把实体和关系写成一张网:球员属于某支球队,踢某个位置,风格接近某位球员,参加某项赛事;内容提到某位球员、某场比赛、某种战术。一条新内容发布时,即使还没有点击,也可以通过它提到的实体,被连接到关注这些实体或其相邻实体的用户。新用户也类似,只要选择了几个关注的球队或位置,系统就能沿着关系向外扩展,而不必等积累足够的行为。用户没点过某个球员,AI为什么仍然可能把他推荐出来就是这种机制的具体展开。

变化二:长期兴趣与比赛日兴趣分开处理

用户对体育内容的兴趣有两层。长期的一层比较稳定:喜欢某类战术分析、关注青年球员、偏好某个联赛。短期的一层被比赛日和新闻牵引:今晚有比赛,就想看赛前预览;转会窗口,就想看转会消息。只用点击序列,两层容易混在一起,一次密集的转会消息阅读,可能被误当成长期兴趣。加入语义关系后,系统可以把内容归到更稳定的主题(如“战术分析”“青年球员观察”)上,让长期兴趣挂在主题上,而不是挂在一次点击上,短期兴趣则由赛程和事件触发,两者分别衰减。

变化三:多样性可以“有依据地”做

推荐系统常见的另一个毛病,是越推越窄。要避免这一点,光靠随机加入一点别的内容效果有限,因为随机内容大多和用户毫无关系。有了图谱,系统可以有依据地探索:沿着“同一位置、相近风格、不同联赛”的方向,找到用户没看过但相关的内容,或者从熟悉的球队出发,推荐它的青训体系相关内容。这样的探索有理由、可解释,也更容易被用户接受。相关的风险与对策,在体育推荐最容易陷入什么“信息茧房”里有专门讨论。

模拟示例说明:下表是示意性的对比,用于说明“只看点击”和“点击加图谱”在几类情形下的差别,不代表任何真实用户、球队或球员,也不代表实测效果。
情形 只看点击历史 点击加语义关系
新用户只选了一支球队只能推热门内容 可延伸到该队主力位置、风格相近球员与相关赛事
新发布的战术分析没有点击,无法分发 通过提到的球队、位置与战术主题连接到相关用户
一周内密集读转会消息容易被当成长期兴趣可标记为短期事件兴趣,随时间衰减
用户想看点新的内容 随机插入,命中率低沿关系探索,同风格、不同联赛的球员

仍然要小心的几件事

知识图谱不是把问题全部解决了,它引入了自己的新问题。首先是图谱质量:实体识别错误、球员别名混淆、位置和角色标注不准,都会把错误关系传播到推荐里。其次是关系过度扩散:沿图谱向外走几步,相关性会迅速变弱,如果不设衰减和阈值,推荐会显得牵强。第三是偏差可能被放大:热门球队和球员在图谱里关系更多、更容易被走到,冷门实体反而更难被看到,需要在排序时专门校正。第四是可控性:用户应该能看到推荐理由,并能纠正,比如“不再推荐这一类”,否则语义关系越复杂,推荐越像黑箱。

另外还有一点常被忽略:图谱和深度模型的结合方式没有统一答案。把语义关系作为特征输入、作为约束条件、或作为解释来源,效果和适用场景各不相同,需要在具体产品里用线上反馈反复调整。这一部分,公开资料给出的更多是思路,而不是可以直接照搬的配方。

对江南体育智能推荐的意味

放回江南体育智能推荐的设计取向里,这些观察带来的改变比较具体。江南体育在球员、球队、赛事、位置、战术风格和内容之间维护统一的关系结构,同一套结构既服务球探与阵容分析,也服务内容推荐,这也是AI球探从“预测一个分数”转向“解释成长轨迹”里讨论的球员数据可以被多个场景复用的原因之一。推荐部分则尽量把长期兴趣、比赛日兴趣和探索性内容分开考虑,并保留让用户看到理由和调整偏好的入口。

需要说明的是,这属于设计取向,不是对效果的承诺。图谱越完整,推荐越有依据;但图谱永远有缺口,用户的兴趣也永远比任何模型想象的更杂。一个合适的期待是:推荐比“重复你点过的内容”更有解释、更有余地,而不是比你更懂你自己。