VideoHarness-RSI:递归搜索视频上下文构造程序,在冻结视觉语言模型上提升长视频理解
研究提出以冻结VLM为中心、固定问答模型与接口的可执行上下文构造层,通过递归自改进从弱均匀采样与强AKS两种初始化出发,均能发现或推进结构化的视频上下文程序,且优势在控制视觉token数后仍保持,并可迁移到其他长视频基准。
AI解读:长视频理解的一个瓶颈往往不在模型本身,而在于模型有限的上下文窗口如何从数十分钟视频中取材。过去这靠人工设计采样、检索或智能体策略,很难系统优化。VideoHarness-RSI把"上下文怎么构造"单独当作可优化对象:冻结一个视觉语言模型,固定问答接口,用程序递归搜索哪种视频取帧、筛选和编排方式最有助于回答。实验显示,从最简单的均匀采样出发,搜索能逐步发现更结构化的构造方案;从已有较强手工方案AKS出发,搜索还能进一步提升。研究者匹配了累计视觉token数后优势仍在,并将结果直接迁移到其他长视频基准,无需重新搜索。对做长视频应用的团队,这意味着可以把"上下文构造"当独立模块替换优化,而不是重训模型;但论文目前是arXiv预印本,尚未经过同行评审,文中也没给出这些搜索出的程序具体比基线提升多少数字,所以实际收益还需看后续验证。
arXiv论文(编号2608.24302,2026年8月25日提交初版,9月3日更新第二版)介绍VideoHarness-RSI:一个在冻结视觉语言模型(VLM)周围递归搜索"可执行上下文构造程序"的受控框架。研究者的设定是长视频理解不仅取决于VLM能力,也取决于如何从其远超模型上下文窗口长度的视频中构造出有限的上下文。
作者Guoyang Xu和Hao Chen在摘要中说明,现有系统通常使用人工设计的采样、检索、记忆或智能体控制策略,这使得"上下文构造程序"本身难以作为独立的优化目标来研究。VideoHarness-RSI将回答模型和接口固定,只围绕冻结VLM进行递归搜索。
实验设置与结果
研究在互补的弱初始化和强初始化两种机制下进行。从弱均匀构造器出发,递归搜索会逐步发现结构更复杂的上下文构造程序;从更强的AKS harness出发,同一过程能进一步提升已经具备竞争力的手工前沿方案。
搜索得到的harness在匹配累计视觉token数的控制条件下仍保留其优势,并且无需进一步搜索即可直接迁移到额外长视频基准。
论文归类为人工智能(cs.AI),附带arXiv颁发的DOI(10.48550/arXiv.2608.24302)。摘要称这些结果将可执行上下文构造确立为一个独立的优化层,并为在冻结VLM周围研究harness发现、迁移和效率提供了可审计基线。