专为新生儿呼吸疾病设计的首个多模态大模型NeoRed发布

针对成人影像训练数据导致的领域差距,研究团队提出NeoRed,可在新生儿胸部X光与临床文本联合诊断中生成报告,其临床效能F1为 65.19%。

AI解读:新生儿重症监护中,胸部X光解读高度依赖经验,而现有医疗多模态大模型几乎都用成人数据训练,面对新生儿肺部影像时容易出现误判。NeoRed的价值在于它把新生儿科医生的诊断思路显式注入模型,并约束报告文本必须与影像证据和临床逻辑一致,从而在真实新生儿数据集上把临床效能F1做到了 65.19%,显著高于其他通用模型。对临床机构而言,这意味着未来有可能用AI生成初筛报告来辅助一线医生,但前提是能通过作者申请获得数据集并完成本地验证。目前论文只报告了ROUGE-L和F1这类文本生成指标,尚未给出误诊率、漏诊率等直接关乎安全的临床前瞻性数据,因此它更接近研究验证,而非可以立即投入使用的诊断工具,医生不应据此改变现有决策流程。

一项于 2026 年 9 月 3 日提交至arXiv的研究(编号 2609.03527,9 页,10 张图)提出NeoRed,并称其为第一个针对新生儿呼吸疾病的多模态大语言模型(MLLM),用于从胸部X光与异质临床文本中联合生成新生儿诊断报告。

研究团队来自电子科技大学等机构,作者包括Liu Yinan、Xia Hongtai、Xu Haoran、Hong Jiankang、Song Jingkuan和Luo Ye。

摘要显示,模型主要基于作者自建的两个真实临床数据集NeoCXR与NeoCXR-EV训练和评估;作者称数据集可在申请后提供。

论文报告称,在NeoCXR上,NeoRed生成的诊断报告达到ROUGE-L 53.29%、临床效能(Clinical Efficacy)F1 65.19%,超过现有的多模态大语言模型。

模型设计:以三种约束对齐知识与逻辑

作者指出,现有MLLM在新生儿诊断中存在两个关键局限:一是训练数据以成人为主引起的领域差距(domain gap),二是缺少对多维临床上下文的整合以支撑精准诊断。

为解决这些问题,NeoRed采用名为知识-逻辑-对齐(Knowledge-Logic-Alignment,KLA)的框架,从三个角度约束模型行为:

第一,知识先验注入(KPI)——把新生儿科专家启发的诊断先验融入多模态表征,引导模型跨模态关注疾病相关的特征;第二,诊断逻辑约束(DLC)——让生成的报告语义与多模态诊断逻辑对齐;第三,视觉语义对齐(VSA)——建立视觉特征与影像结论之间的语义对应。

  • KPI:引入专家诊断先验,引导跨模态注意力
  • DLC:约束报告文本与多模态诊断逻辑一致

实验与基准表现

除新生儿数据集外,论文还报告模型在成人基准上保留了具竞争力的报告生成表现——涉及的基准包括MIMIC-CXR和IU-Xray。

需要明确的是,以上内容全部来自论文与摘要本身;输出中所包含的诊断报告指标(ROUGE-L 53.29%、F1 65.19%)为论文自行报告,尚未经过第三方独立验证。

  • 新数据集:NeoCXR、NeoCXR-EV(申请可用)
  • 成人基准:MIMIC-CXR、IU-Xray——NeoRed仍具竞争力

信息来源