新机制SMC让LLM智能体并行预执行工具调用序列,延迟最高降44.9%
该机制由论文预印本arXiv:2609.03236提出,采用双模型架构,通过预执行动作链减少串行交互延迟,在τ²-Bench电信子集上较顺序执行提速18.59%。
AI解读:使用工具的LLM智能体每一步都要等待模型推理、工具调用和结果返回,这些串行环节累积起来会拖慢整体任务。SMC机制的核心是架构调整:让一个小而快的模型(Qwen3.5-4B)在独立快照上提前预测并执行未来动作链,同时大的权威模型(Qwen3.5-27B INT4)继续按步决策;当权威模型的下一步动作恰好能与预执行的首步对上时,SMC就把整个预执行结果直接采纳进正式轨迹。论文在这种快速推理的设定下,SMC在τ²-Bench电信子集上实现了与顺序执行相同的准确率,同时延迟比顺序基线降低18.59%,比已有的单步推测基线低10.23%;在AppWorld上墙钟时间比顺序执行快44.9%,但任务完成率略降。作者用双模型和批量动作预执行换取速度,牺牲的是额外的低配模型算力,以及预执行链与权威决策可能不一致而导致的准确性损失。
arXiv预印本arXiv:2609.03236提出名为“Speculative Macro Commit”(SMC)的运行时机制,目标是对工具型LLM智能体的逐次“动作—观察”串行等待进行提速。论文署名作者为Zeyu Liu、Souvik Kundu和Peter A. Beerel,已收到MLSP2026会议录用通知。
除模型推理时间外,工具型LLM智能体的墙钟时间还来自动作—观察串行轮次:每次工具调用、环境状态变化和观察返回都可能拖延后续决策。SMC通过一个双层动作系统减少这类等待:大参数量actor模型负责生成官方轨迹,速度更快的小drafter模型在隔离的环境快照上连续预测并预执行未来动作链,并在actor的下一步动作符合drafter的第一个预测动作时,把剩余预执行步骤连同观察结果提交给官方轨迹。
作者从训练轨迹挖掘重复出现的多步动作骨架存入宏库,供drafter在运行时匹配动作链。论文在以Qwen3.5-27B INT4为actor、Qwen3.5-4B为drafter的配置下报告了下列数据:在τ²-Bench Telecom子集上与顺序执行智能体的整体准确率持平,同时延迟比Speculative Actions(SA)基线下降10.23%、比顺序执行下降18.59%;在AppWorld上,SMC相对SA基线减少7.7%的墙钟时间、相对顺序执行减少44.9%,代价是任务完成率有轻微下降。
论文代码已在公开仓库中提供。作者将SMC定位为单步推测动作之外、一种复用多步推测执行以降低智能体延迟的实用方式。