Para-Pipe框架:分层调度算子并行以平衡边缘SoC推理吞吐与延迟
该框架在流水线架构内集成阶段内和阶段间算子并行,可在Amlogic SoC上实现比纯流水线策略平均11.0%的能效提升。
AI解读:Para-Pipe解决的是边缘异构芯片上深度学习推理的吞吐与延迟难以兼得的问题。传统方案要么用流水线把计算分到不同处理单元来保吞吐,要么靠算子并行同时跑多个单元来降延迟,但优化一个往往会牺牲另一个。新加坡国立大学等机构的研究者提出一个分层映射框架,在流水线内部按需调整阶段内和阶段间的并行度,先由搜索生成多个帕累托最优配置,让用户根据不同任务在吞吐和延迟之间做取舍。实测中,在配备ARM big.LITTLE CPU和GPU的Amlogic SoC上,吞吐优化配置比纯流水线能效平均提升11.0%,比非流水线并行提升23.3%。对做边缘AI部署的工程师来说,这意味着不必再手动纠结并行策略,框架会自动给出兼顾两者的方案;但要注意,这些数字来自特定两款SoC,且论文尚未正式发表,通用性还需更大范围验证。
一篇被IEEE Transactions on Computer-Aided Design of Integrated Circuits and Systems(TCAD)接收的论文提出Para-Pipe,一个面向异构系统级芯片(SoC)的分层映射框架,在流水线架构中集成阶段内与阶段间的算子并行,以平衡深度学习推理的吞吐量与延迟。
论文作者来自新加坡国立大学等机构,于2026年9月3日提交至arXiv(编号2609.04168)。
方法:在流水线中分层调节并行度
Para-Pipe将intra-stage与inter-stage算子并行整合进流水线架构,通过选择性地微调流水线阶段内和跨阶段的并行级别,来处理吞吐量与延迟间的权衡。
这一策略据称能显著降低处理器间的通信开销,并提升能效。框架会在Amlogic SoC(配ARM big.LITTLE CPU与GPU)以及黑芝麻科技SoC(含深度学习加速器和两个DSP)上生成多个帕累托最优配置。
论文发表于arXiv的日期为2026年9月3日,该版本为v1。
实测:Amlogic上能效提升11.0%与23.3%
在Amlogic SoC上,Para-Pipe的吞吐优化配置相比纯流水线策略平均能效提升11.0%,相比非流水线并行执行提升23.3%。
论文已获IEEE TCAD接收,期刊引用信息为第44卷第12期,第4472-4485页,2025年12月出版。