IDRBench:首个系统评估大模型跨学科研究能力的框架发布
研究团队提出包含三项任务的基准框架,对十个主流大语言模型进行测试,以衡量其整合不同领域知识进行跨学科研究的能力。
AI解读:大模型虽在单学科推理上表现亮眼,但能否像人类一样把不同领域的知识桥接起来、产出真正的跨学科创新,此前几乎没有系统度量。IDRBench正是为了补这个空白:它把任务拆成“识别跨学科论文、整合跨学科想法、推荐相关想法”三项,并让十个主流模型跑一遍,给出可比较的分数。对研究者来说,这套基准能直观看出哪些模型更擅长跨界联想——这类能力往往指向真正的创新点;对模型开发者而言,它暴露了现有模型在学科融合上的短板,可作为调优方向。需要提醒的是,目前公开的只是框架设计与任务定义,论文尚未给出具体的评测结果数据,所以暂时无法判断哪个模型更强,读者若要据此选型还需等待后续实验结果。
来自加拿大、中国等地高校的研究者(Yuanhao Shen、Daniel Xavier de Sousa、Ricardo Marçal、Hongyu Guo、Xiaodan Zhu)在arXiv预印本平台发布论文,提出IDRBench——一个针对大语言模型跨学科研究(Interdisciplinary Research, IDR)能力的评测框架,并称这是首个对该能力进行系统调查的基准。
评测框架内容
IDRBench包含数据集和三个评测任务:(1) IDR论文识别(IDR Paper Identification);(2) IDR想法整合(IDR Idea Integration);(3) IDR想法推荐(IDR Idea Recommendation)。
- IDR论文识别:要求模型判断一篇论文是否属于跨学科研究。
- IDR想法整合:测试模型能否将来自不同领域的知识结合起来形成新的研究想法。
- IDR想法推荐:评估模型在给定研究方向下推荐跨学科相关想法的能力。
研究动机与测试范围
论文指出,随着知识体量急剧增长,跨学科知识整合日益困难,而此类整合往往是重大创新的来源。作者认为大语言模型能有效访问大量知识源并展现推理能力,为跨学科发现带来机遇,因此希望了解当前先进模型在这方面的实际水平。
- 研究对十个主流大语言模型进行了测试,以全面分析其行为并建立未来研究的基线与基准。
- 论文版本记录显示,该工作从 2025 年 7 月首次提交,历经多次修订,最新版本为v4(2026 年 9 月 3 日更新)。