研究Apple Machine Learning Research·原文 2026年8月26日本站收录 2026年9月5日

苹果发布PROOF-Gen:从失败轨迹中恢复高质量数据,提升工具调用小模型蒸馏效果

在τ²-bench上,每场景优化可恢复93%的失败场景,使Qwen3-4B的Pass@1从0.132提升至0.529。

AI解读:苹果研究团队在训练工具调用模型时发现,传统蒸馏依赖教师模型生成的数据,但只保留成功样本,丢弃失败样本,这导致每个训练周期都会重复遇到同样的困难场景,因为失败没有提供任何改进信号。PROOF-Gen针对每个失败任务设置一个反射器,分析执行轨迹和评估反馈,然后生成纠正性指导,引导教师模型重新生成一条成功的轨迹。训练时,这些指导会被剥离,学生模型只看到干净的示范,不带任何辅助标记。这套方法在τ²-bench上恢复了93%的失败场景,使Qwen3-4B-Instruct的Pass@1从0.132提升到0.529,Gemma 4 E4B在BFCL v4多轮测试中提升了7.2个百分点。苹果还将在实际部署的流水线中运行,轨迹质量(任务完成率)提升了6.3个百分点,迁移到设备端模型后,任务完成率提升1.5个百分点,各语言地区(非英语地区平均提高1.48个百分点)均有正面迁移。这项研究的直接受益者是正在构建工具调用智能体的研发团队:他们不再需要每次训练周期都租用昂贵的前沿模型来重新生成数据,而是可以更高效地利用已有的失败数据;同时,学生模型在困难场景中的表现提升,意味着设备端的小模型可以更可靠地完成实际任务。值得说明的是,目前结果是基于苹果报告的基准和部署测试,没有外部独立验证,且提升幅度在不同基线和任务上差异较大,团队在应用前应结合自身数据评估。

苹果机器学习研究团队发布PROOF-Gen(Per-scenario Reflective Optimization to Overcome Failed Generation),一种从教师模型失败轨迹中恢复高质量训练数据的方法,用于改进工具调用模型的知识蒸馏。该方法先让反射器分析失败执行的轨迹和评估反馈,写出纠正性指导,再引导教师模型生成一条通过该场景的新轨迹。训练时这些场景级指导会被移除,学生模型只学习干净的示范。

在τ²-bench基准上,57%的教师尝试以失败告终,其中三分之二是近失误(大部分工具调用正确,仅因一个关键错误而失败)。苹果称,通过每场景优化可恢复93%的失败场景。

在τ²-bench上对组合数据微调后,Qwen3-4B-Instruct-2507的Pass@1从0.132提升到0.529;Gemma 4 E4B-it在BFCL v4多轮测试上获得+7.2个百分点的提升。

部署流水线中的迁移结果

苹果在已部署的流水线中测试了PROOF-Gen:轨迹质量(目标完成率)提升6.3个百分点;将微调后的模型迁移到设备端部署模型,目标完成率提升1.5个百分点,响应质量各指标提升1.7至5.0个百分点。

在所有语言地区都观察到正向迁移,非英语地区平均提升1.48个百分点。作者为Anh Ta、Junjie Zhu和Shahin Shayandeh。

查看原图 · 2880 × 840

信息来源