产品AWS Machine Learning·原文 2026年9月5日本站收录 2026年9月7日

AWS博客详述如何在SageMaker HyperPod上构建基于NVIDIA Cosmos 3的物理AI模型工厂

AWS机器学习博客发布指南,展示如何使用NVIDIA Cosmos 3(一种支持视频、图像、动作和声音的统一世界基础模型)在SageMaker HyperPod上构建持续的物理AI模型工厂。

AI解读:物理AI系统(如机器人和自动驾驶汽车)需要不断将新数据转化为改进的模型,而不是一次性训练。AWS的这篇指南展示了如何利用NVIDIA Cosmos 3——一个同时处理视频、图像、动作和声音的统一模型——在SageMaker HyperPod上构建这样的循环。其核心优势在于:Cosmos 3通过一个模型支持三种模式(生成合成数据、标注动作、部署策略),因此所有阶段可以在同一个GPU集群上运行,避免了为每个阶段单独配置GPU和迁移数据带来的成本。指南提供实际配置和代码,帮助团队衡量GPU有效吞吐率(goodput),而不仅仅是峰值性能,从而优化成本。对于开发机器人和自动驾驶技术的团队,这意味着降低基础设施开销并加速迭代;但文章没有提供效果数据,实际收益仍取决于各自负载。

AWS机器学习博客发布了一篇技术指南,介绍如何在Amazon SageMaker HyperPod上,利用NVIDIA Cosmos 3构建一个持续运行的物理AI模型工厂,涵盖合成数据生成、后训练和闭环评估。

物理AI系统(如机器人和自动驾驶汽车)的构建需要持续的数据循环:生成合成数据、后训练感知和策略模型,并在闭环模拟中评估,而不是一次性的训练作业。

Cosmos 3的架构与三种模式

Cosmos 3是一个开放的全模态(omnimodal)世界基础模型,将视频、图像、动作和声音视为单一token流。它采用Mixture-of-Transformers(MoT)设计,每个层都集成了推理器和生成器,并通过双层注意力连接。

该模型具有训练与推理的不对称性:训练运行完整去噪调度并解码视频,而机器人运行时只执行少量去噪步骤,跳过视频解码,仅解码动作token。

Cosmos 3有三种模式:前向动力学(世界模型,用于生成合成数据)、逆动力学(动作标注器)和策略(部署的机器人)。

模型分为Cosmos3-Nano(约 16B参数)和Cosmos3-Super(约 64B参数),两者基于Qwen3-VL骨干;另有Cosmos3-Edge(约 4B参数)用于设备端部署,但权重线路独立。

模型工厂的四阶段循环与集群需求

物理AI团队需运行四阶段循环:摄取真实数据、用Cosmos3-Super生成合成数据、训练可部署的Cosmos3-Nano策略、在闭环模拟中评估并反馈失败案例。

AWS文章指出,持续运行此循环的集群需求包括:单个EKS控制平面上的持久GPU池、健康检查和自动恢复、预配置的EFA用于多节点NCCL,以及可选的任务治理。

AWS建议使用SageMaker HyperPod,因为其支持Kubernetes工作负载、FSx for Lustre共享存储,以及自动重启和检查点恢复,从而减少因节点故障导致的GPU工时损失。

示例工作负载与参考集群

该文章提供了三个代表性工作的端到端示例:基于DROID数据集的机器人策略训练(Cosmos3-Nano)、视觉监督微调(Cosmos3-Nano),以及 64B模型的LoRA微调(使用上下文并行)。

所有工作均在p5en.48xlarge(8x NVIDIA H200 GPU)上运行,并使用真实的NVIDIA cosmos-framework进行训练。

AWS提供了Terraform模块和代码仓库,以复制基础设施;该帖子强调GPU goodput是关键成本指标,而非峰值吞吐量。

信息来源