Google推出Gemini 3.5 Transcribe专用语音转文本模型,支持智能清洗与毫秒级时间戳
新模型gemini-3.5-transcribe专注于高精度、低成本的转录任务,提供85+语言自动检测、自定义词汇表、说话人分离和词级时间戳,智能模式可自动去除语气词并优化格式。
AI解读:Google推出了专门的语音转文本模型Gemini 3.5 Transcribe,解决此前用Gemini通用模型做转录时“杀鸡用牛刀”的效率与成本问题——通用模型是为推理问答设计的,转录时会出现说话人混淆、时间戳不精确、容易拼错专业术语等毛病。新模型针对纯语音转写做了优化,关键功能包括智能清洗(自动去掉“嗯”“啊”等口头语并整理格式)、精确到说话人和毫秒级的逐词时间戳、以及最多1000个自定义术语的纠偏,官方称通过开发者指南中的演示,自定义词汇能将“ScaNN”这类术语的准确性从错误率极高拉到100%。开发者可以在Google AI Studio或Colab中免费测试离线音频,实时流式转录则需另走WebSocket和Live API。需要注意的是,智能模式与说话人分离、逐词时间戳互斥,需要精确逐字的场景必须选逐字模式。
Google发布Gemini 3.5 Transcribe(gemini-3.5-transcribe),一款基于Gemini音频理解核心的专用语音转文本模型,面向快速、准确、低成本的转录场景。
模型通过谷歌GenAI SDK(google-genai v2.0+)的Interactions API调用,支持从Files API上传音频文件(单文件最大2GB,项目总存储20GB,文件保留48小时,上传与存储免费,仅推理时按token计费)。
gemini-3.5-transcribe支持85+语言和地区自动检测,可用BCP-47代码指定识别语言;可在transcription_config中传入最多1000个自定义词汇,用于纠正专有名词与技术术语的拼写。
模型提供逐字模式与智能模式:智能模式自动去除口头语、合并自我修正(如“星期二,不,星期三”输出为“星期三”)并结构化排版(列表、数字、货币),但可能改写原文,且与词级时间戳和说话人分离不兼容,逐字模式则为法庭记录等场景保留毫秒级精确度。
模式与主要能力
逐字模式可开启说话人分离(diarization_mode="speaker")和词级时间戳(timestamp_granularities=["word"]),每个词返回起始与结束的毫秒偏移及说话人标签(如spk:0、spk:1)。
智能模式(mode={"type": "smart"})用于会议记录与语音备忘,输出为去除不流畅、适合阅读的文本,但官方提醒可能轻微改写、省略或重述内容,不适合逐字庭审记录、医疗转录或字幕同步。
模型提供实时流式版本gemini-3.5-transcribe-live,通过WebSocket接收原始16-bit PCM音频块(每块100ms),可返回中间假设与最终文本。
- 支持自动检测85+语言和地区
- 自定义词汇表可达1000个术语
- 逐字模式:毫秒级时间戳+说话人分离
- 智能模式:去除口头语、修正确认类自我修正、结构化排版
- 离线音频文件与实时流式接口并存