新方法让图表生成模型只按图像可见信息训练,减少代码歧义
哈尔滨工业大学团队提出observation-aligned supervision,将隐藏变量替换为视觉可约束量,在多个视觉语言模型上提升可观测值恢复率。
AI解读:图表转代码模型通常用参考绘图脚本做监督微调,但脚本里的许多变量在图像上根本看不到,比如饼图的比例已丢失绝对数值、三维散点图经二维渲染后少了深度信息。模型被迫去猜这些隐藏量,生成结果就带歧义。哈尔滨工业大学团队提出的observation-aligned supervision不再让模型学习不可见的变量,而是用盒须图统计量、直方图区间权重、饼图扇区比例等眼睛能直接看到的量作为监督信号。实验显示,在多个视觉语言模型上,这种训练既提高了可执行代码中可观测值的恢复准确度,也大多改善端到端恢复;但在等高线图上,对齐观测和保持表示紧凑之间存在权衡。对使用者而言,如果你在用VLM做图表代码生成、经常遇到生成代码画出的图与输入图不符,可以关注这套训练思路,它直接减少了模型需要臆造信息的环节;但论文目前仍是预印本、且主要集中在五类图表,等值线和三维散点图的效果还需更大范围验证。
哈尔滨工业大学的研究者提出一种针对图表转代码(chart-to-code)生成任务的监督训练方法,名为Observation-Aligned Supervision。该方法将训练目标从参考绘图脚本中的隐藏变量,替换为图像中可直接观察的约束量,以减少模型生成代码时的目标歧义。相关论文于2026年9月3日更新至arXiv(编号2607.04726v5)。
四类“潜变量与观察不匹配”问题
论文指出,现有图表转代码模型通常用参考绘图脚本做监督微调,隐含假设“金标准代码”是完全可观察的目标。但在实践中,许多图表程序包含无法从渲染图像中唯一恢复的潜变量。作者在五类图表中识别出四种不匹配形式:聚合导致的不匹配,指原始样本被压缩为盒须图统计量或直方图区间质量;归一化导致的不匹配,指饼图中绝对尺度被移除;投影导致的不匹配,指三维信息经二维渲染丢失;水平集导致的不匹配,指标量场只能通过选定等高线观察。
替代监督与实验评估
为应对上述问题,研究者提出用视觉可约束的量替换潜变量。具体实现中,他们使用盒须图统计量、直方图区间权重和饼图扇区比例作为监督信号,并通过受控实验研究三维散点图和等高线图。实验横跨多个视觉语言模型(VLM),结果显示,与基准相比,observation-aligned supervision在“可执行评估”中普遍提升了可观测值的恢复,在“端到端恢复”中大多也有改善。不过,等高线图实验揭示出观测对齐与表示紧凑性之间存在权衡。