模型Google DeepMind·2026年9月5日

谷歌发布手语转文本模型SL2T,率先落地Pixel 11的Gboard与Live Transcribe

该模型支持超过50种手语的训练数据,首期开放美国手语(ASL)转英语功能,仅将身体姿态坐标发送至服务器以保护隐私。

AI解读:谷歌DeepMind与Android团队联合推出SL2T手语转文本模型,并将其首次集成到面向消费者的产品中:在Pixel 11上的Gboard键盘和Live Transcribe应用里,用户可以用美国手语(ASL)直接输入文本或进行对话回复。这项功能的直接价值在于,它让聋人和听障人士在手机上打字的情境下多了一种更自然、更快捷的输入方式。其背后依托的技术突破是模型不再依赖手势到单词的简单映射,而是通过视频识别手、臂、躯干、头、脸的全身动作,然后直接翻译成完整语句。技术上,为减小延迟和防止失真,模型只将人体姿态坐标发送到服务器处理,原始视频在设备端即时丢弃。此外,该模型在训练时覆盖了50多种手语数据,但其能力仍以ASL转英语为起点,并承认在罕见符号、快速指拼、被动语态和分类词描绘等方面仍有错误。对于面向更广泛手语社区和更多语言的支持,谷歌表示正在扩展,但尚未公布时间表。对于普通用户,这暂时不需要任何行动;对聋人社区和开发者而言,它代表了一个新的可用工具,但其准确性限制和可访问范围仍需要注意。

谷歌DeepMind与Android团队联合推出手语转文本(SL2T)翻译模型,并将其首次集成到消费者产品中:Pixel 11上的Gboard键盘和Live Transcribe应用将支持通过美国手语(ASL)进行语音转文字式输入。

该功能允许用户在需要打字的场合直接用手语表达,例如搜索网页、起草消息或文档、向Gemini提问,或是在Live Transcribe的对话中用手语回复。Google方面表示,根据测试者的反馈,用ASL表达比用英语打字更快、更自然。

模型能力与实现方式

SL2T的训练数据超过10万小时,覆盖50多种手语,其中约四分之一为ASL数据。Google表示,多种语言、方言和熟练度的联合训练使模型学习到共享的底层结构,在实验中其性能优于单语言模型。

  • 该模型在手语转文本基准FLEURS-ASL(sd-test)上取得70的BLEURT零样本得分,Google称这“显著高于此前任何已报告的得分”。
  • 为了保护用户隐私,SL2T并不处理原始视频,而是通过设备端模型(MediaPipe Holistic)跟踪并提取人体姿态关键点坐标,只将这些几何坐标发送至服务器进行翻译,原视频随即丢弃。
  • SL2T直接将姿态坐标序列翻译为文本,跳过了此前研究中常用的“注释词”(glosses)中间表示,Google认为这种方式避免了人工词汇表的限制。
  • 模型针对实际使用场景进行了优化,包括降低流式传输延迟、防止对非手语输入的幻觉输出、对约10%左撇子的公平性,以及在手持手机时常见的单手手语表现。
  • 目前SL2T开放的语言对为ASL到英语;Google表示其他语言和设备将在“未来推出”,但未提供具体时间表。

社区合作与当前局限

该模型的构思最初由聋人谷歌员工Sam Sepah提出,数据收集、评估及影响评估均与聋人合作伙伴及专家合作。Google还与全球多个聋人组织共同成立了AI手语咨询委员会(AISLAC),并在发布SL2T 1.0时发布了联合影响报告,说明技术能力与当前限制。

Google在博客中承认,当前模型仍存在一些翻译错误,例如罕见符号、快速指拼、被动语态和分类词描绘(如“claws”被忽略)以及缺乏上下文时的时态处理。模型在Pixel 11上以Gboard和Live Transcribe的形式提供,不额外收费。

  • SL2T的模型团队由来自Google DeepMind和Android的成员组成,核心开发者包括Garrett Tanzer、Benoit Brard、Elizabeth Clark、Tim Dozat等。
  • Google计划继续扩展其他手语,并研究手语生成及前沿AI能力的整合。

信息来源

Google DeepMind原始来源