NVIDIA提出跨联邦Kubernetes与AI平台传递用户身份的中央身份网关模式

该模式将控制平面认证转换为数据平面可信身份,在NVIDIA内部将重复登录事件减少了 55%。

AI解读:当用户在一个统一平台上操作多个工具时,传统SSO只验证‘前门’身份,但工具间的工作流——比如从门户打开数据集、启动笔记本、调用AI助手——可能跨越多个集群,每个工具都需要知道‘用户是谁、能做什么’。NVIDIA提出的中央身份网关模式把会话集中到一处:用户登录一次,所有区域网关通过一个共享API验证会话并注入可信身份头,应用不再自己解析令牌或对接身份提供商。这样用户不用反复登录,退出登录也能全局生效,对上层身份提供商和AI助手的负载也更小。对平台团队而言,这套模式用标准OIDC和Redis就能实现,不依赖专有中间件,可以逐个网关迁移。但需要明确的是,这要求把中央网关作为关键服务来设计,包括故障时的拒绝策略和服务间认证,否则集中化反而会引入单点风险。

NVIDIA技术博客发布了一篇架构指南,介绍一种“中央身份网关”模式,用于在跨多个Kubernetes集群的联邦式数据与AI平台中传播用户身份。该模式由NVIDIA内部开发,将用户会话集中到一个网关管理,并宣称在NVIDIA内部开发者平台上将重复登录事件减少了 55%。

模式核心:集中会话,区域网关委托验证

该模式将身份管理分为三个职责:中央身份网关负责会话创建(处理OIDC授权码流程)、按请求进行身份验证(通过 /gateway/userinfo接口回答“此用户是谁”),以及管理会话生命周期(协调令牌刷新与登出)。区域网关保留在各集群,执行本地策略并保护服务,但不再存储会话,而是将验证委托给中央网关。

会话存储在共享存储(如Redis)中,由不透明会话ID标识,并通过仅HTTP的浏览器Cookie关联到平台域。每个请求到达时,区域网关调用验证接口,获取用户ID、邮箱、组和角色等声明,然后注入标准化的身份头,转发给下游应用。应用不再需要解析令牌或直接对接身份提供商。

登出时,中央网关删除会话记录,所有区域网关在下一次请求时立即失效。令牌刷新由中央网关统一协调,状态写入共享存储后,所有区域网关都能看到一致状态。NVIDIA称,上游身份提供商的负载从此不再随用户-工具-集群组合数增长,而是更接近活跃用户数。

  • 登录流程:用户访问无有效会话时,区域网关重定向到中央网关,后者执行OIDC流程、服务端交换授权码并存储会话。
  • 验证流程:每个请求中,区域网关用Cookie调用 /gateway/userinfo,获取声明并注入身份头。
  • 安全护栏:区域网关与中央网关之间需用mTLS或签名令牌认证;应用只信任网关层添加的头,剥离客户端传入的头;平台应明确故障时“失败关闭”还是允许短暂缓存验证。

适用场景与实施建议

该模式并非对所有应用都必需,当用户在同一工作流中跨多个工具、集群或区域,且期望它们像一个平台一样工作时才更有价值。NVIDIA建议平台团队先从盘点现有会话位置开始,明确哪些网关运行OIDC流程、哪些服务直接解析令牌、哪些头被信任,然后定义中央契约,再逐网关增量迁移。

NVIDIA强调该实现不依赖专有中间件,可使用标准OIDC库、Redis或其他低延迟会话存储,以及与常见Kubernetes入口或服务网格的网关集成。具体实施可通过OAuth2 Proxy、Istio external authorization、OPA Envoy、Authorino等项目起步。

  • NVIDIA内部实现基础设施为私有,但架构模式可移植,外部团队可复用会话所有者、验证端点、无状态区域网关等组件。
  • 博客未提供 55% 减少比例的具体统计方法或时间段,也未披露除AWS和OCI外的部署细节。
  • 该模式允许AI助手通过平台会话继承用户的RBAC权限,无需持有多项服务凭据,但仅描述了能力,未给出实际运行效果数据。

信息来源