新方法“编译即训练”将自然语言规则转为可复用本地函数,无需调用大型远程模型
论文称该技术在FuzzyBench-Hard上达到 83.6% 语义准确率,但编译耗时约一分钟,高于现有快速编译器。
AI解读:这篇论文解决的是一个实际问题:很多文本处理任务用规则写很难,但每次调用云端大模型又慢又贵,还依赖外部服务。作者提出的“编译即训练”思路是,在编译阶段用教师模型生成任务示例,训练一个小型适配器,让它嵌入一个紧凑的解释器中,从而把一句自然语言描述变成本地可运行的函数。编译完成后,运行不再依赖教师模型,函数可以像普通软件一样存储、版本管理和组合。根据摘要,该方法在FuzzyBench-Hard数据集上达到 83.6% 的语义准确率,但代价是编译时间约一分钟,比现有快速编译器的几秒慢不少。这意味着,如果编辑、开发者或普通用户有重复的文本处理需求——比如特定格式的改写、分类或抽取——他们可能需要权衡:更准但编译要等一分钟,还是更快但效果差一些。目前这是系统演示论文,没有公开运行效果或成本对比的更多数据,因此建议读者先看演示再判断是否值得应用,不必急于修改现有工作流。
arXiv预印本论文 2609.04199(EMNLP 2026系统演示)提出“编译即训练”(compile by training)方法,将自然语言描述转化为可复用的神经网络函数。论文称,在FuzzyBench-Hard子集上该方法达到 83.6% 的语义准确率,而该子集上现有Program-as-Weights快速编译器未产生任何精确匹配。
摘要显示,编译过程需要约一分钟,而快速编译器只需数秒;运行阶段不依赖教师模型,函数可存储、版本化并能像普通软件一样组合。作者在公共交互服务中部署了该编译器,并演示了三种应用:多站点网站助手、语言控制的 3D虚拟形象,以及双向英语和Claudish翻译器。
该论文由Yuntian Deng、Pengyu Nie和Stuart Shieber撰写,于 2026 年 9 月 3 日提交至arXiv,属于计算与语言、人工智能和机器学习交叉领域。来源仅提供摘要,以下内容均依赖摘要,未引用论文全文。