研究发现:合成数据在嵌入空间中的位置比数量更能影响NLP分类性能
arXiv论文基于英语单词look的语用功能分类实验,比较六种合成数据放置条件后发现,靠近真实训练数据的合成样本(NEAR)带来最大macro F提升(0.113),距离均衡混合方案取得最高准确率(0.748)。
AI解读:合成数据常用于解决NLP类别不平衡,但以往只看生成数量多少,忽略了它们在模型表示空间中的位置。这篇论文用英语单词look的四种语用功能分类做实验,比较合成样本放在决策边界附近、远处还是混合分布下的效果,发现靠近真实数据的样本(NEAR)对提升macro F作用最大,而距离均衡的混合样本准确率最高。这说明合成数据不是越多越好,放在哪里同样关键。直接启示是:做低资源语用分类的研究者,可以用Llama生成数据后按与真实样本的余弦距离筛选、控制放置位置,而不是盲目堆量。不过实验只覆盖410个实例和单一词项,AUC没有改善,说明合成数据只是移动了决策边界,没有改进模型本身的概率估计,效果有局限。
一篇arXiv预印本论文研究了合成数据增强在话语语用功能分类中的作用,发现合成样本在表示空间中的位置对模型性能影响显著,且其效果不依赖于生成数量。该论文由Sara Sorahi、Kevin Tang和Reza Kazemian撰写,于 2026 年 9 月 3 日提交至arXiv(编号 2609.03652)。
研究使用英国国家语料库中英语单词look的 410 条人工标注实例,涵盖四个语用功能:注意力信号、指令、话语标记和感叹词。研究者用Llama 3.1生成合成训练样本,并根据它们在RoBERTa嵌入空间中与真实训练数据的余弦距离进行分区。