研究:按分钟采样足球监控数据,逐分钟贴伤情标签不可靠,改用固定时间点评估
arXiv预印本提出仅对整节训练或比赛做伤情关联判定,ROC-AUC介于 0.367–0.607,不确定性较大,提示现有逐分钟标注思路存在建模缺陷。
AI解读:这篇arXiv预印本解决的是运动科学数据里的一个错配问题:可穿戴设备能按分钟记录球员的负荷数据,但队医通常只告诉你这节训练或这场比赛是否有人受伤,不知道具体伤在哪一分钟。如果研究者为了用上分钟级数据,就把整节的伤情标签复制到每一分钟上,等于假装自己知道伤情发生的精确时刻,这会引入错误信号。作者的办法是放弃逐分钟标注,改为在每个固定时间点(比如开场 10、20、30 分钟)对整节会话做一次二分类判断,看累积到该时刻的数据能否区分伤情相关会话。但结果提醒读者:在 2020 年SoccerMon数据集上,最好的模型ROC-AUC只有 0.367–0.607,置信区间很宽,而且只有 22 节伤情相关会话,样本极少。所以这篇论文的价值不在给出可用模型,而在指出一个方法学陷阱并提供了一个更诚实的评估框架。对做运动损伤预测的研究者,直接相关:别再用逐分钟复制标签的做法,也注意别被小样本下的高AUC点估计误导。普通读者无需行动,这属于学术方法论进展。
arXiv预印本《Landmark-Based Discrimination of Injury-Associated Athlete-Sessions from Minute-Resolution Multimodal Football Monitoring Data》提出一种新的运动员伤情建模方式:不在每一分钟上标注伤情,而是在固定时间点评估整个训练或比赛会话是否与伤情相关。论文由Evangelos Chatzidimitriou和Konstantinos Tserpes撰写,2026 年 9 月 3 日提交至arXiv(编号 2609.03790),属于机器学习方向。
核心问题与数据集
原始问题在于:运动员监控数据可以按分钟记录,但伤情信息往往只标明整个训练或比赛是否与伤情相关,伤情发生的具体时间未知。如果给每一分钟都贴上会话级别的标签,就等于假设伤情状态在每一时刻都已知,这个假设不成立。
数据来自 2020 年SoccerMon项目,包含 48 名精英女子足球运动员的 3,743 次运动员-会话记录,其中 22 次来自 5 名运动员且与伤情相关。
方法
作者采用固定界标(landmark)的每人-每会话单一表示方法:在会话内固定时间点(如 10、20、30 分钟),利用截至该时刻观察到的信息,为每个运动员-会话构建一个表示,然后评估整个会话是否与伤情相关。
研究比较了训练前(pre-session)、累积(cumulative)、动态(dynamic)和组合(combined)四类表示,并采用运动员不相交验证、运动员聚类bootstrap不确定性、共同队列敏感性分析、不同负例运动员划分、等权运动员加权,以及逻辑回归、随机森林和XGBoost作为基准模型。
结果
主要使用累积与动态组合(CUM+DYN)的逻辑回归模型,在各时间点的ROC-AUC为 0.367–0.607,PR-AUC为 0.0080–0.0150,且不确定性区间较宽。
包含训练前信息的表示(PRE-containing)在若干时间点上得到了更高的点估计,但结果仍存在不确定性。