新任务SWIM评估大模型模拟学生写作能力:提示词控制有限,监督微调与强化学习更有效
arXiv研究提出写作模拟任务SWIM,发现仅靠提示词难以控制大模型输出的语言水平,监督微调及基于能力对齐奖励的强化学习能显著提升模拟真实度,但低水平写作仍难复制。
AI解读:这项研究解决的是教育科技中的一个具体问题:想让大模型扮演不同写作水平的学生,用于自动评分系统的训练或教学练习,但模型往往写得太好、太均匀,不像真实学生那样在词汇、语法和结构上出现参差不齐的表现。作者提出了SWIM任务,把“模拟学生写作”变成按水平条件生成短文,并对比了三种方法。结果显示,即使像GPT-4这样强的专有模型,靠提示词也只能调整内容深度,很难改变语言层面的粗糙度;改用监督微调后模拟真实度明显提高,再加一个专门的强化学习奖励还能进一步改善,但低水平写作依然是最难复现的部分。对做自动作文评分或教育AI的公司,这意味着不能指望提示词工程来解决数据多样性问题,需要针对目标水平做显式训练;对普通用户来说,目前无需任何操作,这只是模型能力探索,离落地还有距离。
arXiv 9月2日发布的一项研究提出了SWIM任务,把“学生写作模拟”定义为按能力水平条件生成短文,并对比提示词、监督微调(SFT)和强化学习(RL)三种方法的模拟效果。研究由Heejin Do、Jakub Kontak和Mrinmaya Sachan完成,论文被EMNLP 2026 Findings接收。
提示词难以控制语言层面的水平差异
实验使用自动化作文评分作为能力档案对齐的衡量指标。结果显示,即使采用基于评分标准的策略,提示词方法对写作水平的控制仍然有限。论文指出,模型能调整内容相关的特征,但难以复现不同水平学生在词汇、语法和组织结构上的差异。
该结论同样适用于能力较强的专有LLM,提示词未能带来显著改善。
监督信号提升模拟效果,低水平写作仍是难点
相比之下,监督微调显著提升了水平档案的对齐程度。在此基础上,作者提出的能力对齐奖励用于强化学习,能在所有写作特征和作文提示上带来进一步提升。
研究总结称,显式监督带来的档案对齐效果明显强于仅靠提示词,但“真实低水平写作”仍然难以复现。