新框架以“编码代理”生成可编辑视觉设计,结合扩散模型与HTML/CSS
论文提出Editable Visual Design范式,让VLM负责创意规划、扩散模型生成素材,最终输出可分层编辑的HTML/CSS内容。
AI解读:现有AI生图工具(如GPT-Image-2)虽然画面漂亮,但输出是单张位图,文字容易出错,后期想改某个元素几乎不可能;而纯代码生成虽有分层,但缺乏审美,复杂素材难画。这篇论文把两者结合:用视觉语言模型当“创意大脑”,负责理解需求、规划任务、判断美丑;用图像生成模型当“素材工厂”按需产出独立的视觉元素;再由编码代理写HTML/CSS并迭代优化,最终产出真正可分层的、含真实文字的可编辑文件。对设计师和运营来说,这意味着AI生成的海报或信息图不再是一次性图片,可以在图形界面里直接拖动、调整布局,沿用熟悉的编辑流程,但论文只在海报、信息图等场景做了验证,尚未公布大规模用户评测或与现有设计工具的对比数据。
一篇9月3日提交至arXiv的论文提出“Editable Visual Design”范式,由编码代理驱动,将VLM作为“创意大脑”、图像生成模型作为“视觉世界模拟器”,先想象后执行,端到端生成带真实文字和独立图层、可在图形界面拖拽编辑的设计稿。
该方法由Junyan Ye、Wei Liu等12位作者共同撰写,标注领域为计算机视觉与模式识别(cs.CV)和计算与语言(cs.CL),论文编号arXiv:2609.04034。
动机与路径
论文指出,GPT-Image-2和Nano-Banana等扩散基础模型虽然视觉表现力强,但端到端生成的是压平的位图,文字易错、无法按层后期编辑;而基于Coding Agent的代码生成虽有精确布局控制和分层解耦,但缺少全局审美直觉、难以为复杂视觉资产编码。
为兼顾两者,系统用视觉语言模型承担需求理解、任务规划和美学判断,用图像生成模型按需合成独立视觉素材。代理在“想象先行、行动在后”的闭环流程中生成孤立素材、编写原生HTML/CSS,并根据渲染反馈迭代设计。
论文还提出Agent Design Replay,可重放类似专业设计师的创意与推理轨迹。最终产物为用户提供可编辑文件,支持鼠标拖拽和布局调整。
- 论文称在海报、信息图及其他场景的验证显示该范式同时实现精细美学与生产级可编辑性。