AWS推出跨账户模型治理方案:MLflow与SageMaker AI Model Registry同步扩展至两种拓扑
AWS发布系列文章第二部分,介绍如何使用AWS RAM实现中心化治理,以及为受监管环境提供的混合拓扑,使开发账户与治理中心完全隔离。
AWS于 2025 年 4 月 24 日发布博客文章,介绍如何将MLflow与SageMaker AI Model Registry的自动同步功能扩展至跨账户模型治理场景,涵盖两种拓扑:中心辐射型(hub-and-spoke)和混合型(hybrid),并对比了与单账户设置的差异。
同步功能增强与适用前提
根据AWS机器学习的系列文章,托管MLflow与SageMaker AI Model Registry的同步已增强:注册模型时,训练指标、评估结果、推理规格和血缘关系(lineage)会自动同步至注册表,并支持通过MLflow别名(alias)推进生命周期阶段。
启用同步需在创建或更新MLflow应用时将模型注册模式设置为AutoModelRegistrationEnabled(默认关闭),并为应用的IAM服务角色配置创建模型包组、添加标签和记录血缘关系的权限。
跨账户治理拓扑的部署前提包括:已完成第一部分单账户设置、熟悉自动注册和IAM条件键门控,以及准备两个AWS账户(开发账户和治理中心账户),并在每个账户中部署配套的CloudFormation模板。
跨账户拓扑:中心辐射型与混合型
中心辐射型(Hub-and-spoke central governance)适用于拥有多个开发账户和集中治理账户的大型组织。中心账户通过AWS Resource Access Manager (RAM) 将MLflow应用共享给各开发账户(spoke),开发账户的数据科学家可在共享应用上注册模型,注册后模型组和版本自动在中心账户创建,并附有指标和血缘信息。治理官员在中心账户的统一Studio界面审批模型,批准后触发CI/CD流水线,将模型部署至开发账户的端点。
该模式要求模型工件存放在中心账户的S3存储桶中,因此需要跨账户S3权限(中心桶策略和开发账户执行角色的读取权限),且血缘数据仅记录在中心账户,不会自动共享回开发账户。
混合型(Hub-and-spoke hybrid governance)面向受监管环境,中心账户被视为生产级账户,不允许开发人员写入,即使间接写入也不行。数据科学家在开发账户内注册模型,开发账户的模型所有者审批后,通过事件触发复制工作流,将模型工件复制到中心账户拥有的存储桶,并重写推理规格,使中心副本完全自包含,无运行时依赖。治理官员在中心对副本进行复核并独立批准。该模式需要中心账户预先创建目标模型组并共享创建权限,以及配置中心拥有的工件桶策略。
- 中心辐射型:通过AWS RAM共享MLflow应用,治理官员在中心统一审批,但开发人员可直接写入中心。
- 混合型:开发账户与治理中心隔离,仅批准的副本进入中心,适用于受监管环境。
- 混合型复制流程包括复制工件、重写推理规格、注册包并记录源ARN元数据。
部署与清理注意事项
跨账户场景中,模型审批是部署的关卡:批准状态变化会触发Amazon EventBridge事件,进而驱动CI/CD流水线创建或更新端点。流水线运行位置和端点目标取决于组织选择,常见做法是在共享服务账户运行流水线并部署到专用部署账户,简单场景则可在开发账户内完成。
如果引入单独的部署账户,需注意模型血缘记录保留在同步执行的账户中,规划治理审查时应以中心或开发注册表为准。
清理资源时需按依赖顺序删除端点、模型、AWS RAM资源共享、模型包组、MLflow注册模型、跨账户桶策略,最后删除CloudFormation栈;若栈删除因Studio域停滞,需先删除域内的应用程序和空间。