面向端侧大模型推理的LeanStream框架提出推测-细化流式方案,内存占用最高降至原有1/7.5

该论文将发表于MobiCom '26,声称与既有端侧推理系统相比,在达到此前最佳吞吐率的同时可将内存占用降低4.8倍至7.5倍,并进一步将令牌生成吞吐率提升1.6倍至2.1倍。

AI解读:手机和嵌入式设备跑大模型时,模型权重远超设备内存,现有系统常把权重挪到SSD或闪存,利用激活稀疏性减少计算。但这里有个矛盾:要准确决定跳过哪些权重(稀疏执行)需要最新上下文,而计算和I/O要高效重叠则需要提前预判,导致现有设计要么串行执行变慢,要么重复加载权重、浪费算力和缓存。LeanStream提出“推测-细化”思路,先用部分GPU结果做粗略计算和加载决策,再逐步修正加载与缓存保留的优先级,让GPU计算和存储I/O细粒度重叠。论文称在移动和嵌入式平台实现后,与之前系统相比,在达到先前最高吞吐率时内存占用低4.8到7.5倍,令牌生成吞吐率再提升1.6到2.1倍。对开发者来说,意义可能是设备上能跑的模型更大,或推理更快、更省内存,这直接影响端侧AI应用的交互速度和隐私保护效果。但需要留意,数字来自论文实验,真实场景还受设备型号、模型规格和具体工作负载影响。普通用户不必立即采取行动,这更多是研发层面供框架设计者借鉴的方法。

一篇来自学术界的论文提出面向端侧大语言模型推理的流式框架LeanStream,采用“推测与细化”(Speculate-and-Refine)机制,在移动和嵌入式平台上实现GPU计算与存储I/O的细粒度重叠。论文将于2026年9月2日发布在arXiv(编号2609.03079),并收录于第32届年度国际移动计算与网络会议(MobiCom '26)论文集。

核心方法与实现

端侧大模型推理因隐私和响应速度具有吸引力,但模型权重远超设备可用DRAM,在移动与嵌入式设备上运行困难。LeanStream采用流式推测与细化方法,利用部分GPU结果逐步修正计算、加载和缓存保留的优先级,实现GPU执行与存储I/O的细粒度重叠。

该框架在移动和嵌入式平台上实现。据论文描述,与先前端侧大模型推理系统相比,在先前工作达到的最佳吞吐率条件下,LeanStream将内存占用降低4.8倍至7.5倍,并进一步将令牌生成吞吐率提升1.6倍至2.1倍。

信息来源