研究提出CreaEval:把LLM评判拆成分析与打分两步,提升复杂创意任务评估准确率

arXiv论文提出自动创意评估器CreaEval,通过在复杂多步创意任务中分离分析与评判、引入跨步骤记忆,平均性能较次优基线提升 22.74%,论文已被EMNLP 2026接收。

AI解读:用大模型当裁判给创意任务打分,一直有个麻烦:模型容易偏爱回答长的、打分偏宽松,遇到需要多步骤、步骤之间环环相扣的复杂创意任务时更不稳定。这篇论文提出的CreaEval把传统的一体化评判拆成两步——先用一个模型把多步回答整理成结构化证据(保留跨步骤记忆),再让另一个模型只看证据打分,不直接看原始回答。这样做的效果是平均比次优基线高 22.74%,而且代码已公开。对需要批量评估创意质量的研究者或产品团队来说,这意味着不用再为每个任务单独训练模型,直接套用开源方案就能获得更一致的评分;但要注意实验结果基于论文设定的任务类型,实际业务中的创意判断差异很大,效果仍需在自己的数据上验证。

一篇被EMNLP 2026接收的arXiv论文提出CreaEval,一个面向复杂多步创意任务的自动化评估器,通过将LLM-as-a-Judge解耦为分析与评判两个阶段,在实验中平均性能较次优基线提升 22.74%。

论文由Xiangyu Wang、Jin Wu、Xiaoyu Li、Chanjin Zheng、Yifeng Zhou撰写,于 2026 年 9 月 3 日提交至arXiv(编号 2609.03432)。

问题:LLM裁判在复杂创意任务中易受偏见影响

作者指出,LLM-as-a-Judge在创意任务自动评估中仍具挑战,因为LLM容易受到冗长偏见(verbosity bias)和宽松偏见(leniency bias)的影响。这一局限在“情境扎根且程序结构化任务”(CGPST)中尤为明显——这类复杂多步创意任务具有步骤间依赖性强、高度主观、评分范围宽泛等特点,导致评判更不稳定、更易偏差。

作者认为,现有方法要么依赖针对特定任务的训练,要么直接应用LLM-as-a-Judge,两者在如此复杂度下都难以确保可靠评估。

方案:两阶段解耦评估

CreaEval将典型的LLM-as-a-Judge解耦为分析和评判两个阶段。第一阶段是“记忆增强分析”,由SoT-LLM将多步回答转换为结构化评估证据,并整合跨步骤记忆;第二阶段是“基于证据的评判”,由Judge-LLM使用提取的证据进行评分,不直接访问原始回答。

综合实验显示,CreaEval在CGPST及两个经典简单创意任务上,平均性能较次优基线提升 22.74%,作者称这表明其具有一定泛化性。研究代码已公开,可在https://github.com/Jaong/CreaEval获取。

信息来源