开源Hugging Face Blog·原文 2026年9月3日本站收录 2026年9月7日

开源复现“水彩代码模型”:用TRL与OpenEnv训练绘画智能体,全部产物公开

Hugging Face工程师在开源博客中发布了一份完整复现指南,用TRL与OpenEnv训练语言模型生成p5.brush水彩画代码,包含数据集、环境、脚本与模型。

AI解读:这条新闻讲的是,有人把一个很火的“AI画水彩画”项目完整地在开源社区里重新做了一遍。之前Surya Narreddi用语言模型写JavaScript代码画水彩的视频很火,但他只公布了窄范围的训练细节,没有开放全部代码和模型。现在Hugging Face的工程师(文章作者,因原文未署名)用TRL和OpenEnv工具把这个过程完整复现了,并把参考画作数据集、训练环境、训练脚本和训练好的模型全都放在了Hugging Face上。这意味着,任何有Hugging Face账号的人,只要照着文章里的命令跑一遍,就能训练出自己的“水彩绘画模型”,还可以替换参考画作池来改变画风。这对AI绘画研究者、艺术家和开源社区来说尤其有价值,因为他们不用再黑盒调参,而能看到每一次笔触背后的代码,并按自己的审美重新训练模型。目前这个方案对算力有一定要求(比如用了H200 GPU跑 48 小时),而且画作质量还有改进空间,但它展示了一种新的可能性:AI生成的艺术,不仅可以看结果,还能看过程和审美偏好。

Hugging Face工程师在官方博客发布了一篇技术文章,详细说明了如何用TRL(Transformer Reinforcement Learning)和OpenEnv,训练一个语言模型通过编写JavaScript代码来绘制水彩画。文章的参考对象是 8 月 23 日Surya Narreddi发布的病毒式水彩画视频和论文。

这位工程师表示,他复现了Narreddi的想法,并把完整工作开源:包括参考画作数据集、RL环境、训练脚本和训练好的模型。整个流程都跑在Hugging Face平台上。

作者强调,Narreddi的工作只展示了一个早期且狭窄阶段(特写花朵)的训练细节,且没有开放产物。这篇新文章的贡献在于,实现了“开放复现”,并新增了人工评分画作池和三种奖励混合的对比实验。

RL环境构建

在RL环境中,语言模型被限制只能使用p5.brush库的 10 种方法(scaleBrushes、noStroke、fill、noFill、fillBleed、fillTexture、beginShape、vertex、endShape和circle),以保持水彩效果。

环境还包含无人值守的Chromium渲染器,用于渲染每个草图,以及验证代码的编译和绘画行为的门控机制。

奖励由四个加权项组成:门控奖励(0.05,确保代码能编译并正常绘画)、长度奖励(0.05,鼓励生成较长代码)、对比判决器(0.60,评估风格与参考画作的接近程度)和HPSv3(0.30,评估渲染图片的美感)。

对比判决器使用Qwen3-VL-30B-A3B-Instruct模型,会同时显示候选画作和从池中随机抽取的四个参考画作(两个来自“喜欢”层,两个来自“还可以”层),并按照文字说明(如水彩晕染、透明水洗、柔和边缘)进行评分。HPSv3是开放 7B偏好模型,基于大量人类对图像对的选择训练而成。

参考画作池

作者指出,参考画作池定义了“品味”,将工作从调超参数转向了建立决定什么是美的数据集。池中包含 178 幅水彩画,分为“喜欢”和“还可以”两个等级,均由作者基于个人偏好手工标注。

所有画作都由模型生成,使用了四个开放权重模型(通过Inference Providers调用):GLM-5.2(64 幅)、Kimi-K3(57 幅)、Qwen3-Coder-Next(35 幅)和Qwen3.5-122B-A10B(22 幅)。

这些模型先根据iNaturalist上真实且开放许可的芙蓉花照片编写p5.brush草图,然后由视觉模型(根据上下文,可能是Qwen3-VL系列)提供书面反馈,并进行了三轮修改,最终由作者逐一对成品画作进行评分。

作者承认,池中没有人类绘制的画作是一个“真正的限制”,因为p5.brush是小型库,可用的人类作品数量不足以作为训练语料。

训练实验与发现

作者进行了三次训练运行,只在两个模型奖励的权重分配上有所不同。hps-only运行(HPSv3权重 0.90,对比判决器权重 0.00)跑到第 60 步停止,以验证管道有效性;judge-led运行(对比判决器 0.60,HPSv3 0.30)和hps-led运行(对比判决器 0.30,HPSv3 0.60)跑到第 110 步停止(初始计划为 200 步),因为奖励增长已趋缓。

在启动成功运行前,作者经历了多次奖励曲线平坦的失败尝试。通过排除法,最终发现了四个关键的GRPOTrainer配置调整:学习率从 2e-5提升到 5e-5、调度器从linear改为constant_with_warmup、将scale_rewards设置为group none,并将target_modules改为all-linear。

作者解释,混合专家模型Qwen/Qwen3.5-35B-A3B的命名方式与普通密集模型不同,最初使用默认target_modules列表只训练了 40 层中的 10 层,改为all-linear可以覆盖所有线性层(尽管路由专家仍是冻结的)。

三种混合奖励的训练显示,增加的对比判决器权重会降低起始奖励并增加学习噪声。例如,judge-led运行在最初的 30 步中几乎持平,才出现显著提升。

模型学习的主要表现为减少低质量输出(总奖励低于 0.3)的频率,而非提升最佳画作的质量。在hps-only运行中,最佳画作的平均奖励仅提升了 +0.034,而中位数画作的奖励提升了 +0.155;在judge-led和hps-led运行中,低质量输出的比例分别从 99% 降至 16% 和从 37% 降至 4%。

作者指出,对比判决器的加入能显著提升高质量画作的水平,使其更接近池中的风格。在judge-led和hps-led运行中,最佳画作的质量贡献了 +0.12 和 +0.16 的平均提升,绘画颜料覆盖率也几乎翻倍(从 0.11 到 0.23,和从 0.13 到 0.30),而在hps-only中几乎没有变化。

作者通过相关性分析发现,模型忽略了系统提示中关于形状数量的明确指令,这可能是正确的,因为输出质量与该指令的相关性很小(γ≈0)。

作者推测视频和项目走红的原因是,画作看起来“松散、不完美、手工制作”,这与当前图像模型生成完美但统计平均的图像形成鲜明对比,更接近 2018 年GAN艺术早期探索媒介的精神。

信息来源

Hugging Face Blog原始来源