新提示词优化方法ESPO:精度反超GEPA 3.76个百分点,提示词缩短47%
针对进化式提示词优化器的“提示词膨胀”问题,ESPO将优化拆解为诊断、生成、选择三阶段,在七个NLP基准上平均准确率74.67%,超过GEPA的70.91%。
AI解读:进化式提示词优化器(如GEPA)在迭代中不断追加规则和限定,导致提示词越来越长,最多膨胀3倍,却没能提升准确率。新提出的ESPO方法把优化拆成三步:先一次性把所有训练错误归类为结构模式,再用四种策略生成候选,最后用bootstrap稳定性选择筛掉不可靠的候选。关键证据是,在七个基准上ESPO平均准确率74.67%,比GEPA高3.76个百分点,提示词反而缩短47%;而在四个小模型上的测试也显示ESPO在每种模型上平均准确率都是最高的,比如在Qwen3的GSM8K上从15.00%跃升到91.40%。对使用开源模型或自行优化提示词的开发者来说,这意味着能以更短的提示词获得更好的效果,既能降低推理成本,也减少手工调试时间。不过,研究使用的是公开基准,实际业务场景能否稳定复现还需验证。
arXiv论文(编号2609.04197)提出名为ESPO(Error-Structured Prompt Optimization)的提示词优化方法,针对进化式优化器如GEPA的“提示词膨胀”问题,将优化流程分解为诊断、生成、选择三个阶段。在七个公开NLP基准上,ESPO平均准确率达到 74.67%,比GEPA的 70.91% 高 3.76 个百分点,同时提示词长度缩短 47%(平均 1,004 字符对 1,878 字符),推理速度更快。
三阶段设计:诊断、生成、选择
论文分析认为,GEPA等进化优化器的低效源于三个缺陷:错误观察不完整、搜索多样性不足、选择不可靠。ESPO据此将优化分为三阶段:Diagnose在单轮内将所有训练错误聚类为结构模式;Propose通过四种互补策略生成候选,每种策略具有独立的偏差;Select应用bootstrap稳定性选择。
实验在七个基准(Tweet、MMLU、GSM8K、HotpotQA、ScoNe、HoVer、PUPA)上进行,ESPO在每个数据集上均达到或超过GEPA。跨模型实验在四个学生模型(Gemma 3 12B、Mistral 14B、Qwen3 32B、Claude Haiku 4.5)上进行,ESPO在每个模型上都取得最佳平均准确率,其中在Qwen3的GSM8K任务上差异最大,从 15.00% 提升至 91.40%。
论文还给出了泛化界(Appendix),将每个阶段对应到测试时误差的相应项。消融实验验证了论文的一个关键预测:在加入多样性但不使用bootstrap选择时,性能反而下降 1.20%。该论文已被EMNLP 2026接收,作者包括Lihao Liu、Peng Tang、Kunwar Yashraj Singh和Shabnam Ghadar。