2026 PNPL脑机接口竞赛转向词语分类,新增LibriBrain100数据集测试跨被试泛化

竞赛设Deep与Broad两个赛道,后者将个体微调数据从约 40 分钟逐步减少至约 10 分钟,目标是让非侵入式语音解码在临床可行时间内适应新用户。

AI解读:这次竞赛的核心变化是把任务从语音检测和音素分类推进到词语分类,并首次重点考察跨被试泛化能力。原因很直接:现有模型在单个被试的大量数据上表现很好(2025 年最优F1达 95.6% 和 73.6%),但实际患者使用时不可能先录 50 小时脑磁图。为此主办方发布LibriBrain100数据集,新增 32 名被试(各约 40 分钟数据),并设计Broad赛道,要求参赛者用约 40、20、10 分钟的个体微调数据训练模型,10 分钟已达临床可接受范围。对开发非侵入式语音BCI的研究者来说,这是一次统一的基准测试:谁能用更少数据达到可用解码精度,谁就离恢复严重瘫痪患者沟通能力的目标更近。普通人不需立即行动,但关注脑机接口进展的读者可以留意Broad赛道的结果——它将检验现有模型跨人的真实表现。

arXiv论文摘要显示,2026 年PNPL(巴黎-纽约-帕多瓦-伦敦)脑机接口竞赛将任务从语音检测和音素分类推进至词语分类,并引入扩展数据集LibriBrain100,重点测试模型在少量个体数据下的跨被试泛化能力。竞赛设Deep和Broad两个赛道,Broad赛道将个体微调数据从约 40 分钟逐步减少至约 20 分钟和约 10 分钟,后者已被认为是临床可行的时间范围。

竞赛设计与数据

竞赛由 2025 年PNPL竞赛延伸而来,后者旨在启动非侵入性语音解码的多年度课程,从基础任务逐步推进到实际脑机接口所需语言复杂度。2025 年竞赛的语音检测和音素分类任务中,获胜提交分别达到 95.6% 和 73.6% 的F1-macro分数。据论文,这些成果建立在LibriBrain数据集之上,该数据集是当时最大的单被试MEG数据集,包含约 50 小时数据。

2026 年竞赛使用LibriBrain100数据集,在原有基础上新增 32 名被试(每人约 40 分钟数据),并增加单被试数据至约 80 小时。竞赛延续课程化任务设计,聚焦词语分类,提出两个互补赛道:Deep赛道针对大尺度单被试词语分类,追求最优性能;Broad赛道则针对跨被试泛化,逐步减少个体微调数据量。

  • 2025 年竞赛任务:语音检测、音素分类;最优F1-macro分别为 95.6% 和 73.6%。
  • LibriBrain100:32 名新被试,每人约 40 分钟数据;单被试数据约 80 小时。
  • Broad赛道微调数据量:约 40 分钟 → 约 20 分钟 → 约 10 分钟。

信息来源