两阶段强化学习框架TCS:用对抗性测试用例生成提升代码LLM性能
arXiv新论文提出Test Cases Scaling(TCS),通过两阶段强化学习自动生成高质量测试用例,在TACO和LiveCodeBench基准上提升pass@1和推理时答案选择。
AI解读:代码大模型的训练依赖测试用例提供反馈,但高质量用例既要有判别性、又必须与参考解一致,往往稀缺。这篇论文把用例生成当成对抗强化学习问题:模型要针对解题者的当前失败模式生成反例。TCS分两步走,第一步生成与参考解一致的测试,第二步把数据限制在当前失败模式上学习反例。它在TACO和LiveCodeBench上都提升了pass@1,还能用生成的用例在其他LLM的输出中选出正确答案。对研究者和开发者的意义是:这提供了一种自动扩充测试、减少人工标注用例的方法,但这是EMNLP 2026的会议论文,尚属研究阶段,公开效果只限于论文报告的基准分数,未见大规模产品化或跨领域验证,实际工程落地还需更多测试。
arXiv 9月3日发布的一篇论文提出Test Cases Scaling(TCS),一个两阶段强化学习框架,用于为代码大语言模型自动生成高质量测试用例。作者来自北京大学等机构,论文被EMNLP 2026 Findings接收。
在TACO和LiveCodeBench两个基准上,TCS同时提升了生成代码的pass@1 和根据生成测试进行的推理时答案选择性能。
方法:将测试生成作为对抗性RL问题
论文指出,代码生成的反馈主要来自具体测试用例,而高质量测试用例应同时具备健全性(与参考解一致)和判别性(能区分正确与错误解),这类用例往往稀缺。研究者将测试生成视为对抗性强化学习问题:模型需要根据解题者当前的失败模式,生成作为反例的有效测试用例。
TCS采用两阶段训练,两个阶段都从滚动策略对齐缓冲区训练测试生成器:第一阶段生成与参考解一致的测试;第二阶段将缓冲区限制在当前的失败模式,学习生成反例测试。