
Gemini 3.5 Transcribe 是什么?功能、价格与上手教程一文讲清
Gemini 3.5 Transcribe 是谷歌 8 月 26 日发布的最强语音转文字模型:85+ 语言、说话人区分、智能去口水词,约 $5/千分钟。本文讲清功能、价格、API 教程与同类对比。
Gemini 3.5 Transcribe 是谷歌在 2026 年 8 月 26 日发布的语音转文字(Speech-to-Text)模型,官方称其为迄今精确度最高的转写模型:支持 85+ 种语言自动识别、说话人区分、字词级时间戳,还能自动删除"嗯""呃"等口水词并把口语整理成格式化文本。按官方与第三方测算,价格约 $5/千分钟(约每分钟半美分)。本文用一篇文章讲清它的核心功能、计费方式、API 上手教程和同类工具对比,帮你在 5 分钟内判断要不要用它。
目录:它是什么 → 核心功能 → 价格说明 → 快速上手教程 → 实测表现 → 同类对比 → 适合谁用 → 常见问题
Gemini 3.5 Transcribe 是什么
它不是聊天机器人,而是专门优化"语音 → 文字"这一件事的专用模型,由 Google Gemini 音频团队打造,用来接替上一代转写模型 Chirp 3。目前通过 Gemini API 提供,在 Google AI Studio 和 Gemini Enterprise Agent Platform 上均可调用。
| 项目 | 说明 |
|---|---|
| 发布时间 | 2026 年 8 月 26 日 |
| 模型代号 | gemini-3.5-transcribe(文件转写)/ gemini-3.5-transcribe-live(实时流式) |
| 定位 | 语音转文字专用模型,Chirp 3 的继任者 |
| 语言支持 | 85+ 种语言自动检测,支持句中混说多种语言 |
| 音频时长上限 | 单次最长 1 小时(开启说话人区分或时间戳时为 30 分钟);实时流式单次会话 10 分钟 |
| 接入方式 | Gemini API(Google AI Studio / Gemini Enterprise Agent Platform) |
| 官方文档 | Google AI for Developers |
谷歌自己的产品已经先一步用上了它:Android Gboard 键盘的 Rambler 语音输入、macOS 版 Gemini 应用的语音指令,底层都是这个模型。也就是说,你在 Pixel 手机上用语音打字时自动去掉口水词的体验,就是这个模型驱动的。

核心功能:5 个能力值得关注
| 能力 | 说明 | 典型场景 |
|---|---|---|
| 智能转写(Smart mode) | 自动删除"嗯""呃"、口吃、说错后自我纠正的内容,并整理成段落、列表、日期和货币格式 | 把语音备忘录直接变成可读笔记 |
| 说话人区分 | 最多识别 8 位说话人,给每段话标注说话人标签(3 人以上为实验特性) | 会议纪要、访谈整理 |
| 字词级时间戳 | 每个词都有精确的起止时间 | 字幕制作、语音检索定位 |
| 自定义词汇 | 最多传入 1,000 个专有名词(官方建议 100 个以内效果最好),让模型认得产品名、术语、缩写 | 医疗、法律、游戏等专业领域 |
| 实时流式转写 | 基于 Live API,亚秒级延迟,支持会话中途切换语言 | 语音助手、实时字幕、同传工具 |
其中"智能转写"是它和传统转写工具拉开差距最大的地方。举个官方文档里的例子:你说"嗯,关于会议,我觉得我们应该邀请 Alice 和,等等,是 Bob 和 Carol",普通转写模型会原样输出这堆混乱口语,而 Gemini 3.5 Transcribe 的智能模式直接输出"我认为我们应该邀请 Bob 和 Carol 参加这次会议"。再比如你口述"第一项检查预算第二项确定时间表第三项发送总结",它会自动整理成编号列表。
需要注意的取舍:智能模式和字词级时间戳、说话人区分互斥——需要时间戳或说话人标注时,必须用逐字(verbatim)模式。
价格:约 $5 转写 1,000 分钟音频
官方按 token 计费,不在常规模型价目表里单列套餐:
| 计费项 | 价格 |
|---|---|
| 音频输入 | $2.00 / 百万 token |
| 文本输出 | $12.00 / 百万 token |
按 Artificial Analysis 的折算口径(每秒音频约 25 个 token),文件转写约 $5/千分钟(≈$0.005/分钟),实时流式版约 $9/千分钟。谷歌开发者生态负责人 Logan Kilpatrick 也在 X 上确认了"约每分钟半美分"这个量级。
入门成本为零:在 Google AI Studio 注册后即可免费试用,免费层对模型访问和 token 都有宽裕额度(注意免费层的内容会被用于改进 Google 产品,商业项目建议升级付费层)。
一句话换算:转写一场 1 小时的会议录音,成本大约 3 美分——比一瓶水的价格还低。
快速上手教程:三步转写你的第一段音频
第一步:获取 API Key
进入 Google AI Studio,点击"Get API key"创建密钥。国内开发者需要能正常访问 Google 服务的网络环境。
第二步:上传音频并调用模型
用官方 SDK 的 Files API 上传音频文件(支持 mp3、wav 等常见格式),然后把文件传给模型:
from google import genai
client = genai.Client()
audio_file = client.files.upload(file="path/to/meeting.mp3")
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[
{
"type": "audio",
"uri": audio_file.uri,
"mime_type": audio_file.mime_type,
}
],
)
print(interaction.output_text)
第三步:按需开启高级配置
所有配置都放在 generation_config 的 transcription_config 里,常用的四项:
interaction = client.interactions.create(
model="gemini-3.5-transcribe",
input=[{ "type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type }],
generation_config={
"transcription_config": {
"language_codes": ["cmn-Hans-CN"], # 指定简体中文,已知语言时建议指定以提高准确率
"custom_vocabulary": ["Gemini", "BigQuery"], # 自定义专有名词,最多 1,000 个
"mode": { # 逐字模式下开启说话人区分 + 字词时间戳
"type": "verbatim",
"diarization_mode": "speaker",
"timestamp_granularities": ["word"],
},
}
},
)
三条来自官方文档的实践建议:已知语言时务必指定 language_codes;自定义词汇只放领域术语和专有名词,别放日常词汇;超过几秒的音频一律走 Files API 上传,不要直接塞 base64。

实测表现:官方数据和开发者真实反馈
官方基准数据(由第三方机构 Artificial Analysis 测量):
- 平均词错率(WER):流式 4.0%,非流式 2.6%
- FLEURS 多语言基准:流式 5.50% WER,非流式 5.04% WER,均优于上一代 Chirp 3
- 最终转写耗时(time to final transcription)比 Chirp 3 快 70%
Hacker News 上开发者的一手测试反馈(讨论帖)值得冷静看:
- 延迟有竞争力:一位实时翻译工具开发者实测后表示,Gemini 3.5 Transcribe 的延迟比主打的竞品 Soniox 还略低,但 Soniox 价格更便宜;
- 嘈杂环境表现不错:有用户用便宜的麦克风录的会议录音测试,Google 的结果"还不错",而 OpenAI 的模型开始出一些明显错误;
- 小坑:有用户反馈录音开头部分会被"吃掉",对开头截断敏感的场景要注意预处理。

综合来看:它不是所有维度都第一,但"准确率 + 延迟 + 智能整理"三件事同时做到位的,目前只有这一家。如果你要做语音 Agent 或实时字幕,建议像 HN 上那位开发者一样,用自己的真实音频对两三家跑一轮 A/B 测试再定。
Gemini 3.5 Transcribe vs Whisper vs Soniox 怎么选
| 维度 | Gemini 3.5 Transcribe | OpenAI Whisper(自部署) | Soniox STT |
|---|---|---|---|
| 部署方式 | 云 API | 开源自部署 | 云 API |
| 成本 | 约 $5/千分钟 | 免费(自担算力) | 比 Gemini 更低 |
| 智能整理(去口水词/自动格式化) | 支持 | 不支持 | 不支持 |
| 说话人区分 | 最多 8 人 | 需配合额外工具 | 支持 |
| 实时流式 | 支持(亚秒级延迟) | 变通实现 | 支持 |
| 自定义词汇 | 支持(1,000 个) | 不支持 | 支持 |
| 适合谁 | 想要"开箱即用 + 高质量"的团队 | 数据不能出内网、有 GPU 的团队 | 价格敏感、大转写量的场景 |
选型结论:追求转写质量和智能整理、不想自己维护模型 → Gemini 3.5 Transcribe;数据敏感必须私有化 → Whisper 自部署;转写量大、成本敏感 → Soniox 值得进候选名单实测。
它和语音输入、AI Agent 的关系
如果你的需求是"日常打字用语音",不需要碰 API——Android 的 Gboard(Rambler 功能)和 macOS 版 Gemini 应用已经内置了这个模型。国内用户也可以参考我们此前的语音输入工具评测和 AutoGLM 语音输入上手指南,其中不少产品同样支持实时语音转文字。
对开发者来说,Gemini 3.5 Transcribe 是搭建语音交互 Agent 的关键拼图:实时流式接口负责"听",理解与执行交给通用模型。想系统了解这类架构,可以先看我们的 AI Agent 入门和 Gemini Omni Flash 介绍。
适合谁用(和不适合谁)
适合:
- 做会议纪要、访谈整理、播客字幕的团队(智能模式直接省掉人工整理)
- 开发语音助手、实时字幕、通话分析产品的开发者
- 有多语言、多说话人、专业术语识别需求的场景
不适合:
- 数据必须完全私有化的场景(它是纯云 API,无自部署选项)
- 需要转写超过 1 小时单条音频的场景(需自行切片)
- 预算极度敏感的超大规模转写(可对比 Soniox 等更便宜的方案)
总结
Gemini 3.5 Transcribe 把"转写得准"和"转写得能直接用"合并成了一个 API:2.6% 的非流式词错率属于第一梯队,智能转写模式省掉的更是人工整理时间,$5/千分钟的价格对绝大多数场景都可以忽略不计。它不是最便宜的(Soniox 更低),也不能私有化(Whisper 的领地),但如果你要的是"开箱即用的最高质量转写",它目前就是默认答案。建议先用 Google AI Studio 的免费额度拿自己的真实音频跑一轮,再决定接入方案。
参考资料:
- Google 官方公告:Intelligent transcription with Gemini 3.5 Transcribe
- Gemini API 模型文档
- 音频转写官方指南
- Hacker News 开发者实测讨论
最后更新:2026 年 8 月 28 日 · 作者:AI345 编辑部(关注 AI 工具评测与开发者教程)
常见问题
Gemini 3.5 Transcribe 是免费的吗?
不完全是。它按 token 计费:音频输入 $2/百万 token、文本输出 $12/百万 token,折算约 $5/千分钟(≈$0.005/分钟),实时流式版约 $9/千分钟。但在 Google AI Studio 有免费额度,个人测试和小规模使用可以零成本开始;免费层的内容会被用于改进 Google 产品,商业项目建议用付费层。
Gemini 3.5 Transcribe 支持中文吗?
支持。它支持 85+ 种语言,其中包括普通话(简体)`cmn-Hans-CN` 和粤语(繁体)`yue-Hant-HK`,且支持一句话里中英混说的自动切换。已知音频语言时,在 `language_codes` 里显式指定中文代码可以进一步提高准确率。
Gemini 3.5 Transcribe 和 Whisper 有什么区别?
Whisper 是 OpenAI 的开源转写模型,可以免费自部署,数据不出内网,但没有智能整理能力,转写结果是带口水词的原文。Gemini 3.5 Transcribe 是云 API,多了智能转写(自动去"嗯呃"、纠错、格式化)、自定义词汇、说话人区分和实时流式能力,按量付费。
它能实时转写吗?
能。谷歌同时提供了实时流式版本 `gemini-3.5-transcribe-live`,基于 Live API 的双向 WebSocket 传输,延迟低于 1 秒,单次会话最长 10 分钟,适合语音助手和实时字幕。注意实时版不支持字词级时间戳和说话人区分。
转写一小时音频要多少钱?
约 3 美分($0.003-0.005/分钟,取决于输出文本量)。按官方 token 单价和 Artificial Analysis 的折算口径,1,000 分钟音频约 $5。开启说话人区分或字词级时间戳后单次上限从 1 小时降到 30 分钟,长音频需要切片处理。
它会取代会议纪要工具吗?
它会成为很多会议纪要工具的底层引擎,而不是直接取代产品。开发者可以用它的智能模式 + 说话人区分快速搭建纪要应用;普通用户则可以继续用集成了该模型的成品工具(如 Gemini 应用、各类笔记软件),无需自己写代码。

京ICP备2024094994号-29