产品量子位·原文 2026年9月6日

可可矩阵押注具身ICL:把上下文学习做成机器人新Scaling路线

创业公司可可矩阵(COCO Matrix)将In-Context Learning作为具身智能底层范式,宣称已在八、九类视觉任务上验证“条件表征”技术,简单抓取任务经One-Shot适配后完成率稳定超80%。

AI解读:这条新闻的核心是:一批团队正在把大语言模型验证过的“上下文学习”(ICL)搬到机器人身上,希望让机器人看一遍示范就能学会新任务,而不是为每个任务重新采集大量数据训练。可可矩阵的创始人高宇翔的判断是,堆数据的老路已经遇到瓶颈,机器人更需要的是在部署后利用当前的视觉、语言和动作上下文快速适应。对行业来说,这意味着具身智能的竞争维度可能从“模型见过多少数据”转向“模型学一个新任务要多久”。对机器人开发者或潜在用户,真正有意义的变化是:如果One-Shot能力成熟,以后教机器人新技能可能就像给人看一遍演示一样,几小时甚至几分钟就能完成,而不是动辄数千条标注数据加数周训练。但要注意,可可矩阵目前只公开了演示和访谈,没有完整技术报告,复杂任务的评测也还没做,80%以上的成功率仅限于简单抓取类任务。所以,现在判断这条路线能否跑赢传统VLA还为时尚早,普通读者无需为这条新闻采取任何即时行动。

8月中旬,Skild AI发布机器人基础模型S1,宣称机器人看一遍任务演示视频后,可在不微调、不做额外post-training的情况下尝试完成未曾训练过的新任务,任务时长可达10分钟、包含几十个操作步骤。S1发布一周前,Generalist AI发布GEN-1.5,同样将One-Shot Learning作为核心能力,支持机器人仅看一个示范就在数秒内学习新任务,无需梯度更新或微调。两家公司均以成果发布形式展示,技术细节未完整公开。

可可矩阵的创业背景与思路

国内创业公司可可矩阵成立于2026年4月,创始人兼CEO高宇翔现年30岁,西安交大少年班出身,约翰斯·霍普金斯大学博士辍学,此前在傅利叶带队打通全尺寸人形机器人从遥操作、数据采集到模型部署的完整链路,并在2025年5至8月用一百多万成本在全尺寸双足人形上训练出具备一定泛化能力的世界模型。

可可矩阵与Generalist、Skild不同,其思路是把后训练的ICL前置到预训练阶段,核心是开发一套“条件表征”或“条件隐空间”:视觉表征不只由“看到了什么”决定,还由“现在想做什么”共同决定,模型会根据任务条件和动作意图动态提取不同层级的信息。

  • 高宇翔称,该统一模型已在深度、分割、人体姿态等八、九类视觉任务上做验证,部分任务能力接近上一代为单任务训练的模型。
  • 一个极端实验中,在同样训练设置和算力下,把动作头压到约60M参数,效果仍可超过动作头约1.1B的对照方案,因此团队倾向于“强理解、轻生成”。

One-Shot能力现状与后续指标

高宇翔称,目前可可基础模型的One-Shot能力在简单任务上比较明确:常规抓取类任务在临时改变目标做One-Shot Adaptation后,完成率可稳定在80%以上;复杂任务尚无完整评测,对应模型仍在训练。

他还表示,团队同时在做Self-Correction,将机器人自己刚经历过的失败轨迹也作为Context,让机器人在第一次失败后判断哪里需要修正并再次尝试。高宇翔提出,之后可能更关注“第一次成功平均耗时”这一指标,对应机器人的教学成本和学习效率。

  • 数据方面,高宇翔认为当前明显缺口是人机教学、实时纠偏和协同作业数据,行业对这类数据尚无成熟定义和采集体系。
  • 关于长上下文,他偏向流式机制:让机器人持续工作并利用过去经验,而不是每次重看完整历史;相关Memory方案仍在内部测试,方向包括提升模型理解能力和对长时序KV Cache做压缩。

信息来源

量子位原始来源