llama.cpp b10757发布:Vulkan后端优化IQ3_S量化大batch矩阵-向量乘法
新版本在NUM_COLS > 4 时启用更高效的IQ3_S矩阵-向量kernel,n=8 批大小下性能提升达 5 倍。
AI解读:llama.cpp的新版本b10757主要解决了一个性能瓶颈:当使用Vulkan后端运行某些量化模型(IQ3_S类型)时,如果一次要处理多个token(batch size大于 4),计算矩阵-向量乘法的效率会很低。代码提交专门优化了这个场景,并称在batch size为 8 时速度提升到原来的 5 倍。这对Vulkan用户(比如在Linux或Android设备上通过集成显卡运行大模型的人)是直接利好,意味着可以更流畅地处理更大的并发请求,或是提高吞吐量。值得注意的是,本次只针对IQ3_S这种特定量化格式做了优化,其他格式或更小的batch不受影响;并且该优化是由AI辅助(Claude Opus 5)完成的代码,但具体效果仍建议用户在自己的硬件上实测验证。
llama.cpp发布b10757版本,针对Vulkan后端优化IQ3_S量化格式的矩阵-向量乘法在较大batch size下的性能。开发者在提交说明中称,当NUM_COLS大于 4 时,n=8 的场景性能提升 5 倍。
新版本同时将每个量化类型的两个测试用例加入 `k=16*256` 的 `all_types` mat-vec性能扫描,用于回归验证。