开源llama.cpp Releases·2026年9月5日

llama.cpp b10772发布:Hexagon HTP后端新增F16精度ABS支持

ggml-hexagon的HTP后端扩展F16一元运算覆盖范围,新增ABS运算,并在设备端通过 8/8 项测试。

AI解读:llama.cpp的b10772版本为高通Hexagon HTP后端添加了F16精度的ABS(绝对值)运算支持,此前F16路径几乎不处理任何一元运算。这意味着在搭载Hexagon处理器的设备(如测试用的高通QRD8850)上运行模型时,涉及绝对值的算子无需回退到CPU,可以利用HTP加速。对普通用户来说,这个改动主要影响edge设备(如手机、嵌入式AI盒子)上的推理延迟和功耗,尤其是量化模型中频繁出现的激活函数、归一化类算子。不过仅ABS一个算子范围有限,NORM系运算的F16路径仍缺少CPU参考实现,无法通过现有测试,说明F16覆盖仍在逐步推进中。如果你是本地开发者,可下载对应平台二进制包试用;普通用户无需立即更新。

llama.cpp发布b10772版本,ggml-hexagon后端为高通HTP(Hexagon Tensor Processor)添加了F16精度的ABS一元运算支持。此前该后端对F16一元运算整体禁用,本次改动针对GGML_UNARY_OP_ABS放行。

改动包括:新增hvx_abs_f16_* 内核及分发器、行级abs_f16分发函数、将ABS注册为HTP一元运算,并合并了F32/F16的execute_op_unary实现以避免代码重复。测试在QRD8850(Hexagon v81)设备上进行,test-backend-ops -o ABS结果为 8/8 通过(覆盖F16与F32,HTP0,无CPU回退);SQR/CLAMP/SQRT的F16+F32以及NORM/RMS_NORM/L2_NORM/SCALE的F32路径也通过了回归检查。

信息来源

llama.cpp Releases原始来源