模型量子位·原文 2026年9月8日

王云鹤创业公司基元律动发布首个自研Agent-Native模型NeoHorse,含4B和9B版本

模型以Agent执行日志为训练语料,经过Agentic后训练,4B版本综合表现达到或略超同系列9B基础模型。

AI解读:基元律动把多模型调度系统(Routing Harness)在执行任务时积累的日志,包括成功路径、失败记录和模型切换决策,筛选后用作训练数据,这避免了传统问答数据只覆盖问题和答案的局限。对模型厂商和开发者的直接影响是,后训练后的4B模型在Harness Agent、工具使用等10项评测中综合表现达到或略超9B基础模型,意味着部分高频、标准明确的Agent任务可以用更小模型完成,降低推理成本。不过这套数据飞轮依赖持续的优质轨迹供给,且目前只验证了一轮“执行—评估—选择—更新”闭环,多代迭代的增益是否稳定还需更多实验;因此普通用户暂时无需行动,模型相关方可以关注其技术报告中的评测细节和后续开源生态的转化情况。

华为诺亚方舟实验室前主任、盘古大模型负责人王云鹤创办的基元律动,发布首个自研大模型NeoHorse。该消息由量子位于2026年9月8日报道。

模型版本与数据来源

NeoHorse-1包含4B和9B两个版本,重点面向Agent工作能力,包括调用工具、读取环境反馈、发现错误、调整路径并完成任务。

根据量子位报道,模型由无问芯穹提供算力支持与Infra优化,清华大学、北京大学团队参与算法和训练方法研究。核心训练语料将Routing Harness产生的Agent执行信号与公开数据结合。

  • 执行记录涵盖:输入任务、路由器能力判断、模型选择、推理与工具调用、环境反馈、错误处理与模型切换、最终完成或失败。
  • 除问答两端外,数据还包含任务所需能力、系统执行决策、环境最终反馈三层信息。

后训练方法与评测结果

基元律动采用Routing-Guided Curriculum(路由引导的课程学习)安排样本顺序,先学习低能力需求任务,逐步增加复杂轨迹,并保留基础任务覆盖。同时使用On-Policy Distillation,即学生模型先按自己的方式解题,教师再针对学生实际步骤指导,而非预先准备的标准错误。

每条轨迹先经过结构检查,确保请求、回复、工具调用和环境结果对应,再从六个维度评估执行质量:是否完成用户目标、是否遵守指令、工具使用是否合理、结论是否有证据支撑、错误后能否恢复、以及是否在合适时机终止任务。完成状态、目标满足度、环境证据和用户反馈作为不同信号分别记录。

量子位报道称,在覆盖Harness Agent、工具使用、代码和指令遵循等10项评测中,经过Agentic Post-Training后,NeoHorse-1-4B的宏平均得分从58.94提升到64.87,达到同规模SOTA,在所有可对比基准上均超越其基础模型Qwen3.5-4B,并综合领先同规模对比模型。

  • 报道举例:项目排期任务中,基础模型未读取包含最新依赖约束的邮件,按过期信息生成计划并写错位置;后训练模型则继续读取证据、更新约束、重新计算、验证并保存到正确位置。
  • 基元律动表示,4B模型提升集中在有明确流程、可观察反馈、可验证成功与失败、交付标准清晰的任务上。

商业定位与验证范围

基元律动的产品线包括:开源版OpenSquilla(降低多模型Agent门槛)、TokenRhythm API(定位接近“中国版OpenRouter”,统一接口调用多种模型)、面向企业的私有部署与服务、以及NeoHorse模型。报道称NeoHorse是首次验证Harness执行经验可转化为模型能力。

报道将验证拆为两层:商业层面,系统积累的数据进入训练并带来可测量能力提升;技术层面,完成一次面向RSI(递归自我改进)方向“执行—评估—选择—更新”的单轮工程验证。技术报告确认信号设计、奖励设计和训练流程仍由人类设定,多代迭代能否稳定增益需更多实验。

  • NeoHorse的训练语料中,失败轨迹被认为可能提供更多信息,补充“哪里容易出错”和“出错后如何调整”的知识。
  • 基元律动的核心思路是:Routing Harness连接开发者与Agent任务,TokenRhythm API连接模型供给与调用需求,执行轨迹经筛选用于训练,更新后的模型返回Harness参与适配任务。

信息来源

量子位原始来源