数据高效RLVR框架DE-Venus:仅用 10% 标签即可保持或提升模型质量
来自多个机构的 14 位研究者提出DE-Venus,将RLVR监督定义为数据准备与策略优化中的演化状态,在公开基准和三个商业场景中以少量标签和数据达到同等或更优质量,并将收敛步骤减少 63%–75%。
AI解读:DE-Venus解决的是大语言模型强化学习(RLVR)中一个实际瓶颈:获取可靠标注和进行在线采样都很昂贵。它把监督过程拆成三个模块——主动数据选择、弱监督构建和训练时监督精炼——并把方法决策表达为离线数据转换或在线目标/奖励变换,从而兼容verl分布式训练框架。在公开基准和三个商业场景下,单独配置仅需 10% 标签或最少 13% 的相关数据就能保持或提升模型质量,部分商业配置还使收敛步数降低 63%–75%。这意味着对研究和商业用户,标注预算可大幅削减而不牺牲模型推理能力,RLVR的规模化门槛更低。不过论文为arXiv预印本,尚未经同行评审,且结果依赖具体配置,用户需结合自身场景验证效果。
2026 年 9 月 3 日提交至arXiv的论文(编号 2609.03324)介绍了数据高效RLVR框架DE-Venus。该框架由Shenzhi Yang、Guangcheng Zhu、Kai Tang等 14 位研究者提出,旨在解决RLVR因昂贵的在线采样和大规模可靠目标获取成本而难以实际扩展的问题。DE-Venus将监督视为跨数据准备与策略优化的演化状态,并组织为三个模块:主动数据选择(分配训练和标注预算)、弱监督构建(从无标签示例中派生学习信号)、训练时监督精炼(过滤或纠正不可靠监督)。
DE-Venus通过将方法特定决策表达为离线数据集转换或目标、奖励、批次和优势的在线变换,同时保留verl的分布式执行契约,支持七种代表性方法和一条数据选择管线。
论文基于摘要显示,在公开基准和三个商业场景下,单独配置仅用 10% 的标签或最少 13% 的相关数据,即可保持或提升模型质量;部分商业配置观察到收敛步骤减少 63%–75%。作者总结认为DE-Venus在不牺牲可扩展RL执行的前提下降低了标注和训练成本。
该论文归类于机器学习(cs.LG),版本为arXiv:2609.03324v1。本报道依据来源提供的摘要信息,未获取全文内容。