JIT-Agent:首个即时生成智能体执行框架的模型发布,称可将开源模型性能提升至超越GPT-5.6

研究团队提出“执行框架智能”概念,训练JIT-Agent为任意商用智能体大模型动态定制运行框架,据称可使DeepSeek-V4-Flash在DeepSearchQA和OdysseyBench上超越GPT-5.6。

AI解读:智能体的能力不止取决于底层大模型,外围的“执行框架”(如记忆管理、规划策略、操作协议和工具调用)常常影响更大,但设计框架一直靠人工、任务专属且难以规模化。为此,研究者训练了首个能够即时生成并修复执行框架的模型JIT-Agent,用户只需提供目标任务,它就能为现成的商用智能体大模型自动定制合适的框架。论文中的对照测试显示,经过JIT-Agent辅助,DeepSeek-V4-Flash在DeepSearchQA(+9.1)和OdysseyBench(+4.3)上超过GPT-5.6,原本已较强的GLM-5.2最多提升 20.2 分,且生成框架的性能可与OpenCode、Claude Code等成熟运行环境相当。这一路线若成立,意味着开发者可能无需更换底层模型,仅靠自动生成的框架就能获得接近甚至超越大厂闭源模型的智能体表现,从而降低对模型规模的依赖。但相关结果目前仅来自论文报告的实验数据,尚无独立复现或第三方应用反馈,实际跨任务部署的稳定性和成本仍待验证,建议对智能体工作流优化感兴趣的工程团队将此作为评估参考而非直接替换方案。

一篇预印本论文提出了一种新型“执行框架智能”模型JIT-Agent,声称可为任意现成智能体AI大模型即时合成任务专用的执行框架,使DeepSeek-V4-Flash在DeepSearchQA上以 +9.1 分、OdysseyBench上以 +4.3 分超越GPT-5.6,并让GLM-5.2最多提升 +20.2 分。论文作者团队包含Guibin Zhang、Leo Lu、Fangzhou Xie、Kang Zhu、Junhao Wang、Zhifei Xie等来自多家机构的研究者。该论文与后续更新版分别于 2026 年 8 月 26 日和 9 月 3 日提交至arXiv,编号为 2608.25593。

“执行框架”为何重要

论文指出,智能体的能力并非仅由模型本身决定,其所使用的执行框架(harness)——包括记忆管理、规划策略、行动协议以及工具/技能的编排——往往对整体表现起决定性作用。然而,此类框架的设计目前仍是手动的、针对特定任务的,从根本上讲难以规模化。

JIT-Agent的构建方式

研究者将智能体执行框架定义为一个可由机器生成、可组合的产物,并遵循固定的四模块协议。JIT-Agent通过在给定任务上定制框架、修复框架以保证稳定、可靠执行,以及从过往框架配置库中提取性能信号来实现自我进化,从而支持智能体的动态优化。

评估结果与限制

在受控评估中,JIT-Agent生成的执行框架与成熟智能体运行环境OpenCode和Claude Code的表现相当,并能持续改进多种规模的模型家族,包括DeepSeek V4、Mimo-V2.5和Qwen3.6。研究者称,这是首个为即时执行框架生成而专门构建的模型,将执行框架智能确立为一个可训练、可转移且能累积的智能体能力维度。上述结果均来自论文报告的数据,尚未得到独立第三方验证。

信息来源