KernelFoundry:用进化搜索代替标准提示词,SYCL GPU内核平均提速 2.3 倍
arXiv论文提出KernelFoundry框架,通过质量多样性搜索、元提示词进化与模板参数优化自动生成GPU内核,在KernelBench上SYCL内核平均提速 2.3 倍,优于基线方法。
AI解读:GPU内核优化需要理解硬件架构和并行计算策略,但现有大模型方法通常只用标准提示词和简单的反馈循环,把硬件信息仅通过性能剖析间接传入。KernelFoundry针对这一缺口,用MAP-Elites质量多样性搜索保持探索广度,同时让提示词与内核代码共同进化(元提示词进化),并用模板参数优化适配输入和硬件。这样生成的SYCL内核在KernelBench上平均比基线快 2.3 倍,CUDA内核也优于先前工作。对实际开发者而言,其意义在于框架是分布式的,可远程访问不同硬件并快速测试,因此除了跑基准外,还能用于实际项目的内核生成。不过研究采用摘要形式发布,尚无公开的独立复现数据,具体版本、ICML 2026会议收录等信息均来自文内标注。普通读者无需立即行动,但从事跨平台GPU计算的团队可关注其方法是否适配自身硬件环境。
在arXiv发布的一项研究中,研究人员提出KernelFoundry,一个面向GPU内核的进化优化框架,旨在让大语言模型生成的内核超越标准提示方法的表现。据论文摘要,该框架在KernelBench基准上生成的SYCL内核平均提速 2.3 倍,优于基线方法,CUDA内核也优于先前工作。
研究作者为Nina Wiedemann、Quentin Leboutet、Michael Paulitsch、Diana Wofk和Benjamin Ummenhofer,论文于 2026 年 3 月首次提交,9 月更新第二版,并标注为ICML 2026会议论文。
方法与评估
论文摘要指出,GPU内核优化对LLM构成挑战,因为它要求理解硬件架构、并行计算优化策略和性能剖析输出,而现有方法通常只用标准提示与反馈循环,仅在剖析层面考虑硬件。
KernelFoundry通过三项机制应对:MAP-Elites质量多样性搜索,使用内核特有的行为维度保持探索;元提示词进化,让提示词与内核共同进化以发现任务特化策略;模板参数优化,将内核参数适配到输入和硬件。
评估在KernelBench、robust-kbench和自定义任务上进行,生成SYCL内核作为跨平台GPU编程示例,同时生成CUDA内核与先前研究比较。结果显示,该方法持续优于基线,SYCL内核平均提速 2.3 倍。
实现与可用性
论文摘要还描述,KernelFoundry已实现为分布式框架,可远程访问多种硬件,支持快速基准测试,并提供灵活的用户输入层,以支持基准测试之外的实际应用。
本报道仅依据论文摘要撰写,未涉及全文评审数据、代码或资源的可用性限制。