llama.cpp b10728发布:CUDA闪存注意力引入XOR swizzle共享内存优化
新版本在CUDA后端为Flash Attention的K/V共享内存tiles加入XOR swizzle布局,并修复DGX Spark上的共享内存竞争问题,同时提供多平台二进制。
AI解读:llama.cpp的b10728版本主要针对CUDA后端做了一次底层优化:Flash Attention在把K和V矩阵放进共享内存时,改用XOR swizzle这种数据排布方式。通俗地说,这能减少GPU线程访问共享内存时的冲突,让数据读取更顺畅,从而可能提升推理速度。对在NVIDIA显卡上跑大模型、自己编译或使用官方预编译包的用户来说,这次更新还顺手修了DGX Spark上的一个共享内存竞争问题,避免偶发的计算错误。需要注意的是,这次改动只涉及CUDA路径,CPU、Vulkan等其他后端的性能不受影响;普通用户如果只是用现成版本跑模型,没有遇到问题就不必急着升级,但如果你在DGX Spark上跑Flash Attention且怀疑结果有误,升级b10728是值得的。
llama.cpp项目发布b10728版本,核心改动为CUDA后端的Flash Attention引入XOR swizzle共享内存布局优化,并修复DGX Spark上的共享内存竞争问题,同时提供多平台预编译二进制。