AdaptiveSpec:免训练逐层投机解码,吞吐量较EAGLE-3最高提升56%
剑桥团队提出AdaptiveSpec,在SGLang引擎上实现逐层自适应草稿树与容错验证,吞吐量较EAGLE-3最高提升56%,任务准确率恢复93%至完全无损。
AI解读:投机解码通过并行验证多个草稿token来加速大模型推理,但传统方法要么严格拒绝任何不匹配token,要么固定草稿树的形状,导致加速效果受限。AdaptiveSpec的核心创新是让每个解码步骤都能根据模型内部信号实时调整两个决策:当草稿token的概率与最高概率token接近时接受它(利用概率边际),并根据历史接受情况动态调整草稿树的深度和宽度。实际效果是,在SGLang推理引擎上,AdaptiveSpec比目前最先进的EAGLE-3方法吞吐量提高了最多56%,并且在GSM8K、MATH-500和HumanEval等基准测试中,任务准确率恢复到了93%到完全无损的水平。对运行大模型服务的团队来说,这意味着在不牺牲输出质量的前提下,用更少的GPU资源支撑更高的并发请求。值得说明的是,论文基于Llama-3.1-8B等中小规模模型验证,对更大规模模型的效果仍需测试。
剑桥大学研究团队在arXiv发表论文,提出AdaptiveSpec免训练投机解码方法,在SGLang推理引擎上实现吞吐量较EAGLE-3最高提升56%,同时任务准确率恢复93%至完全无损。论文于2026年7月3日提交,涉及跨多个基准和三个目标模型的实验。
方法设计
- 逐步骤边际规则:当目标模型在草稿token上的概率与top-1概率之比超过阈值时,接受该不匹配token,该规则不依赖草稿长度或草稿模型架构。
- 逐步骤树策略:融合草稿top-1置信度和滚动接受历史信号,动态调整草稿树的深度、宽度和节点数,允许总草稿数变化而非仅重新分配。
- 两种自适应机制正交运作,效果叠加。
实验设置与结果
- 基于SGLang生产级服务引擎实现,对比EAGLE-3等自回归投机解码方法。
- 目标模型包括DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8B。
- 性能数据:吞吐量较EAGLE-3提升最高56%;在GSM8K、MATH-500、HumanEval任务上恢复93%至完全无损准确率。