研究提出Conformal Relevance框架:以少量人工输入替代逐任务提示工程,提升NLP抽取任务的覆盖与简洁性
arXiv论文提出Conformal Relevance,用上下文学习示例与集成构建打分函数,在七项NLP任务上保持覆盖率的同时提升简洁度,并给出集成多样性的理论条件。
AI解读:这篇论文解决的核心问题是:在总结、抽取式问答等需要从文档中挑选内容的NLP任务里,既要保证覆盖足够的关键信息,又要尽量精简、去掉无关内容,而目前最好的打分方法依赖人工为每个任务编写LLM提示词,费时且无法通用。Conformal Relevance的思路是用少量示例和模型集成自动生成打分函数,论文声称在七项任务上试验后,覆盖率和简洁性都不输手工提示,还从理论上解释了为什么集成能提升最差情况下的句子得分。对做NLP系统的研发者来说,这项工作的直接价值是减少调提示词的重复劳动,让同一套打分方法能更快迁移到新任务;但要注意,论文尚未给出与手工提示方案的详细对比数据,实际效果有待复现验证,普通读者无需采取任何行动。
9 月 2 日提交至arXiv的一篇论文(编号 2609.03005,EMNLP 2026 Findings)提出Conformal Relevance框架,用上下文学习示例筛选与集成来构造打分函数,在保持覆盖率的同时提升内容抽取的简洁性,并称只需极少的人工输入。作者来自加拿大公司Layer 6 AI,包括Xiao Shi Huang、Chen-Yuan Lin、Bruce Kuwahara、Kin Kwan Leung和Jesse C. Cresswell。
现有打分方法的瓶颈
论文指出,摘要、抽取式问答等许多NLP任务都可归结为从文档中检索相关内容,需同时满足覆盖率(保留足够达成目标的信息)和简洁性(尽可能去掉无关信息)。
保序预测(conformal prediction)方法能保证覆盖率,其简洁性则取决于打分函数的设计。目前的先进打分函数依赖人工编写的LLM提示,要求模型对内容重要性评分,但这种人工提示工程劳动密集且针对具体任务,难以复用。
Conformal Relevance框架的做法与理论结果
Conformal Relevance框架通过上下文学习示例策展和集成(ensembling)构造打分函数,在维持覆盖率的同时改善简洁性,人工输入量很小。
论文展示了该框架在七项NLP任务上的应用,并从理论角度研究集成对保序评分多样性(diversity)的影响,提出一个互补性条件(complementarity condition),用于刻画集成在何时能改善最差情况下的句子得分,同时给出集成改进的饱和界(saturation bound)。