AIP:用有向执行图表示智能体技能,编译后Claude Sonnet任务通过率从53%升至67%
arXiv论文提出Agent Instruction Protocol,将自由文本技能编译为带类型化输入输出边的执行图,在27个SkillsBench任务上平均奖励从0.60升至0.71。
AI解读:智能体技能目前多用自由文本描述,每次运行都需要模型重新理解并推导代码和工具调用,导致复杂任务执行不稳定,且技能难以精准改进。AIP把技能改造成有向执行图——每个步骤是带确定性脚本或自然语言说明的节点,步骤间用类型化的输入输出边连接,整体由YAML规范约束;模型不再需要从零推导,而是接收经过验证、可直接运行的步骤单元,权威性来自图结构本身而非重新解释。编译后Claude Sonnet在27个真实任务上的平均奖励从0.60提升到0.71,通过率从53%升到67%,差异有统计学意义(p=0.011),并常在更短耗时内完成。对开发者而言,技能改进从重写文本变成可测量的调优循环:按节点定位失败、修正AIP规范并重新编译即可,两个手工技能故障在调整后完全恢复(一个任务从0/5变为5/5)。当前局限是效果基于Claude Sonnet和SkillsBench,其他模型和任务集未验证;对于不构建技能的普通用户,此研究无需立即行动,但对智能体应用开发者和技能库维护者,这意味着一种可测试、可治理、可强化学习的结构化替代方案。
一篇arXiv论文提出Agent Instruction Protocol(AIP),将智能体技能从自由文本提示词建模为有向执行图,并验证该方法能显著提升Claude Sonnet在真实任务上的表现。论文由Zachary Blumenfeld和Jim Webber撰写,于2026年6月3日提交初版,9月3日更新第二版。
问题与方案:从阅读文本到接收执行图
论文指出,当前的Agent Skills大多由自由形式的自然语言组成,智能体在每个会话中都需要阅读、解释并重新推导操作方式。这带来双重代价:在实现密集型任务上可靠性降低;技能创建与改进困难,因为编辑文本是脆弱的过程,人类和智能体都难以处理,尤其是模型训练数据中缺乏的领域特定程序性知识。
AIP的解决方案是将技能建模为有向执行图:离散步骤作为节点,由确定性脚本或自然语言描述支持,节点间通过显式类型化的输入输出边连接,并用经schema验证的YAML规范管理图的整体结构。论文还提出一个编译器元技能(compiler meta-skill),可将现有由人类编写的技能翻译成这种图结构形式。
实验证据:编译技能提升Claude Sonnet在SkillsBench上的表现
论文报告,将人类编写的技能编译为AIP后,Claude Sonnet在SkillsBench的27个真实智能体任务上平均任务奖励从0.60提升到0.71,通过率从53%提升到67%。这一提升具有统计显著性(Wilcoxon符号秩检验p = 0.011),模型赢得12个任务、输掉2个、13个打平,且常在更短的墙上时钟时间内完成。
论文解释,图的优势在于向智能体提供经过验证、可运行的单元,而不是要求它从自然语言中重新推导代码、命令和工具调用。
创建与改进:从迭代文本到可测量的调优循环
由于每个技能经schema验证、可功能测试、且能按节点定位,失败可以精确诊断和修复。论文报告,两个作者编写的技能故障被追踪到脚本层面;调整AIP规范并重新编译后,两者均恢复且零回归(其中一个任务从0/5成功变为5/5),将技能改进转变为可测量的调优循环,而非文本重写。
论文还指出,相同的图结构支持语料库级别的治理和技能自省,并提供强化学习对技能进行操作的天然动作空间。