RACE-AIMC:用统计认证为模拟存内计算芯片选单颗可靠加速器,能耗模拟降低69%

arXiv新论文提出RACE-AIMC框架,离线从多颗物理有缺陷的模拟存内计算芯片中选出最可靠的一颗,为其错误率给出数学上严格的上界,在线仅运行该芯片并在必要时回退。模拟显示错误率上界均值7.83%,能耗较始终运行全部芯片降低69.02%。

AI解读:模拟存内计算(AIMC)芯片虽然省电,但每个物理芯片都有独特的编程误差、噪声和坏单元,导致直接信任单颗芯片时无法保证出错频率。RACE-AIMC用统计方法解决这个信任问题:离线时从一批芯片中选出在给定能耗预算下最可靠的一颗,并为它“选择回答时”的错误率计算出数学上精确的上界;在线运行时只开启这颗芯片,用轻量检查决定接受结果还是交给回退机制。模拟中所有认证的错误率上界都低于10%目标(均值7.83%),且相比始终运行全部芯片,能耗降低69.02%。对边缘设备开发者而言,这意味着不必为了安全而支付运行多个芯片的能量成本,也能获得有保障的准确率;但该结果基于带噪声权重映射的模拟,实际芯片上的效果仍需验证。

arXiv预印本论文(编号 2609.03149)提出RACE-AIMC(Risk-Aware Certified Ensemble for AIMC),一个为模拟存内计算(AIMC)加速器选择可靠单芯片并提供数学错误率上界的框架。

论文由Osama Yousuf和Martin Lueker-Boden撰写,于 2026 年 9 月 2 日提交,共 6 页,分类为Emerging Technologies、Hardware Architecture和Machine Learning。

要解决的问题

AIMC通过在存储阵列内直接执行算术来加速神经网络推理,无需在内存和处理器之间反复搬运权重,从而节省能量。但存储权重的物理器件并不完美:编程误差、电噪声、有限分辨率转换器以及完全损坏的单元都会扭曲计算,且每颗物理芯片的扭曲方式各不相同。

当设计者手中有多颗这类芯片时,面临两难选择:运行所有芯片并合并答案(安全但能耗高),或盲目信任单颗芯片(便宜但无法保证错误频率)。

RACE-AIMC的做法与模拟结果

RACE-AIMC在离线阶段研究一批物理加速器,针对给定能耗预算选出其中最佳的一颗,并计算该加速器在“选择回答”时错误频率的数学上精确的上界。在线阶段只开启这颗选中的加速器,通过轻量检查决定接受其答案还是回退到备用方案。

在采用带噪声权重映射和多次独立测试运行的模拟中,每个认证上界都保持在 10% 错误目标以内(平均上界 7.83% ± 0.89%),70.88% ± 0.98% 的输入被直接回答。系统的准确率与干净的数字化基准相当,而模拟能耗相比始终运行池中所有加速器降低了 69.02%。

信息来源