研究Hugging Face Blog·原文 2026年9月1日本站收录 2026年9月7日

Hugging Face发布 207 个WebGPU内核及浏览器基准测试套件Fleet

新开源库 @huggingface/kernels支持直接从Hub加载运行优化内核,在苹果M4 GPU上对比ORT WebGPU平均快 2.57 倍。

AI解读:Hugging Face此次发布的是浏览器端AI推理的底层加速组件。网页里跑AI模型最终会变成成千上万个GPU运算(矩阵乘法、归一化等),而WebGPU虽提供了跨浏览器接口,但同样的运算在不同显卡上表现差异巨大,需要针对硬件写专门的shader才能发挥性能。此次发布的 207 个内核把每个运算都做成了带版本、测试用例和基准的可复用软件包,开发者通过 @huggingface/kernels一行代码即可从Hub加载调用。官方在苹果M4 GPU上对比ONNX Runtime Web,几何平均快 2.57 倍,但这是单个运算的耗时,且不含模型启动和编译开销,实际模型加速会因设备而异。Fleet套件允许任何人用自己浏览器跑基准测试并匿名上传结果,帮助官方收集真实设备数据来优化内核。对普通用户来说无需立即行动,但如果你是做浏览器端AI应用或想上手WebGPU的开发者,现在可以用这个库快速替换性能瓶颈的算子,并贡献自己设备的测试数据。

Hugging Face WebAI团队发布 @huggingface/kernels库及首批 207 个WebGPU内核,全部以独立仓库形式托管在huggingface.co/webgpu-kernels,采用Apache-2.0许可证。每个内核仓库都包含清单文件(manifest.json)、元数据、正确性测试、基准用例和WGSL shader模板,并带有独立版本号。

团队同时推出Fleet——一个浏览器内的GPU基准测试与验证套件,用户可在本地硬件上运行内核并自愿提交匿名数据,用于发现设备特定故障、优化内核变体和选择策略。

性能对比数据

开发团队在苹果M4 GPU上,以ONNX Runtime Web 1.30.0-dev.20260826-b1f76d586a为基准,对 207 个算子共 1756 个测试用例进行对比,保留双方输出一致且计时可靠的 809 个用例。结果显示,Hugging Face内核几何平均快 2.57 倍,中位数快 1.90 倍,其中 629 例胜出、176 例落后、4 例持平。

具体算子对比:Add快 3.52 倍(0.064 ms vs 0.227 ms)、MatMul快 1.14 倍、Softmax快 2.11 倍、LayerNormalization快 2.22 倍。个别极端案例差距巨大:一个 4096 尺寸的双线性Einsum用例(i,ij,j)0.136 ms对 1396 ms,快逾 10000 倍;行方向CumSum在 [256, 4096] 上 0.016 ms对 4.784 ms,快 301 倍。官方强调这些属于异常值而非普遍预期。

计时仅包含GPU执行时间,不含内核加载、会话创建、输入上传、shader编译和输出回读等开销;结果只代表单个算子,不代表完整模型性能。不同GPU和浏览器下的表现会有差异。

与ONNX Runtime团队合作

Hugging Face表示正与ONNX Runtime团队合作,计划将上述性能改进上游合并,使更广泛的ONNX Runtime Web生态系统受益。

信息来源

Hugging Face Blog原始来源