AWS发布开源控制平面HyperPod InstantStart,支持AI代理驱动集群运维
HyperPod InstantStart以单一容器整合Web界面、REST API和MCP工具,让AI代理可通过对话完成集群创建、扩容、训练与推理部署,所有操作均经同一后端API并具备可重试性。
AI解读:HyperPod InstantStart解决的是SageMaker HyperPod集群运维中依赖链复杂、步骤间交接易出错的问题。此前基础设施团队需要手工编排EKS、容量、存储、监控等多个环节,每一步都有独立API、故障模式和等待时间。InstantStart把这些步骤封装成带状态、可重试的操作,并通过统一后端API暴露给Web界面和AI代理。由于MCP工具包装的是后端自身的REST API而非AWS CLI或SDK,任何校验只需添加一次即可保护两条路径,这使得代理驱动的运维具备可靠性。对基础设施团队而言,日常运维可从多步骤脚本简化为对话式命令,代理会轮询异步操作直至完成,只在你需要做决策时暂停,例如选择可用区、实例类型和容量类型。它仍需要你提前申请SageMaker服务配额和购买训练计划,且安全组默认允许公网访问,需在使用前收紧。
AWS Machine Learning博客于2026年9月4日发布文章,介绍开源项目HyperPod InstantStart。它是一个控制平面,将Amazon EKS的编排与SageMaker HyperPod的托管能力结合,通过Web界面和AI代理两种方式驱动集群创建、容量管理、训练、推理和存储等操作。两种界面调用相同的后端API,经过相同验证,读取相同持久化状态。
HyperPod InstantStart以单一管理容器形式运行在用户的AWS账户中,不位于训练任务或推理请求的数据路径上,所有创建的资源均为标准AWS或Kubernetes资源,可用AWS CLI和kubectl检查。架构中Kubernetes侧为EKS(用户管理),AWS侧为SageMaker HyperPod(AWS托管),两侧在HyperPod实例组交汇。
集群创建:两阶段流程与交互示例
InstantStart将集群创建划分为多个阶段:EKS控制面创建(约8至12分钟)、活动集群选择、依赖安装、HyperPod集群创建和存储配置。各阶段状态独立记录,后续阶段失败不会回滚已成功的早期阶段。
文章展示了一段真实使用hypd-inst-agent(Kiro CLI的代理配置)创建集群的对话记录。代理先列出已有集群,在用户同意后创建EKS集群(标签hypd-0304b),并每2分钟轮询状态直至完成;随后安装依赖,然后询问可用区、GPU实例类型、实例数量、容量类型(按需或训练计划)。用户选择us-west-2c和ml.g6.4xlarge(1节点)后,代理完成HyperPod集群创建并验证存储挂载。对话结束时返回包含EKS集群名和HyperPod集群名的摘要信息。
文章指出,代理行为中的轮询至完成、只询问决策级问题、创建前检查现有状态等规则来自编码在agent skill中的工作流规则,而非临时生成。例如,代理不会提前停止并让用户稍后再查,也不会询问子网CIDR、路由表、安全组等技术细节。
- EKS控制面创建约需8–12分钟
- HyperPod集群创建前,代理会查询当前区域可用的可用区和实例类型,再提供选项
- 对话示例中最终配置为1x ml.g6.4xlarge(按需),S3存储已挂载,节点状态为Ready/Schedulable
容量管理:实例组创建与托管Karpenter
容量管理通过实例组操作实现。创建实例组时需在创建时决定容量类型(按需、EC2 Spot或SageMaker训练计划)和网络接口模式(如EFA-only),这些设置之后不可更改。控制平面通过显式字段白名单规范化实例组更新,避免无关操作重置如OnStartDeepHealthChecks等设置。
HyperPod managed Karpenter用于节点自动扩缩,由AWS运营控制器,节点从HyperPod实例组启动而非裸EC2实例,因此继承健康监控和自动节点恢复。InstantStart预置了默认NodePool,支持缩容到零。文章强调managed Karpenter只管理HyperPod实例组,不管理通用EC2容量。
HyperPod的托管能力(如训练算子、推理算子、托管分层检查点、托管扩缩)在控制面板中以开关形式暴露。每个开关对应一个后端依赖感知操作,例如启用托管分层检查点会端到端配置IRSA(IAM角色服务账户)所需的身份链,包括服务账户、IAM角色、OIDC信任关系等,禁用时同样移除,形成闭环。
- 容量类型和网络接口模式在实例组生命周期内不可更改
- 默认情况下,每个集群由CloudFormation路径创建独立VPC,计算子网大小设为/20
- AWS建议提前申请SageMaker服务配额,对高端加速器购买Flexible Training Plan以预留容量
训练与推理:两种提交路径与配方层
文章涵盖训练和推理部分,但原文在此处截断。已提供的信息表明,训练表面将“任务如何提交和保活”与“使用哪个框架”分离,控制平面提供两种任务提交路径和一个配方(recipe)层。具体细节未在本文中完整呈现。
由于来源内容不完整,无法提供更多关于训练、推理或存储工作流细节。建议参考原始AWS博客文章获取完整信息。
- 原文标题提及“agent-driven”运维,暗示其设计初衷是让AI代理替代手工执行多步骤运维。
- HyperPod InstantStart是开源项目,旨在将集群引导、容量、训练、推理和存储转化为可控、可重试的操作。