Gemini 3.5 Transcribe 是什么?功能、价格与上手教程一文讲清封面图
AI 入门约 8 分钟

Gemini 3.5 Transcribe 是什么?功能、价格与上手教程一文讲清

AI 指南··0 浏览

Gemini 3.5 Transcribe 是谷歌 8 月 26 日发布的最强语音转文字模型:85+ 语言、说话人区分、智能去口水词,约 $5/千分钟。本文讲清功能、价格、API 教程与同类对比。

Gemini 3.5 Transcribe 是谷歌在 2026 年 8 月 26 日发布的语音转文字(Speech-to-Text)模型,官方称其为迄今精确度最高的转写模型:支持 85+ 种语言自动识别、说话人区分、字词级时间戳,还能自动删除"嗯""呃"等口水词并把口语整理成格式化文本。按官方与第三方测算,价格约 $5/千分钟(约每分钟半美分)。本文用一篇文章讲清它的核心功能、计费方式、API 上手教程和同类工具对比,帮你在 5 分钟内判断要不要用它。

目录:它是什么 → 核心功能 → 价格说明 → 快速上手教程 → 实测表现 → 同类对比 → 适合谁用 → 常见问题

Gemini 3.5 Transcribe 是什么

它不是聊天机器人,而是专门优化"语音 → 文字"这一件事的专用模型,由 Google Gemini 音频团队打造,用来接替上一代转写模型 Chirp 3。目前通过 Gemini API 提供,在 Google AI Studio 和 Gemini Enterprise Agent Platform 上均可调用。

项目 说明
发布时间 2026 年 8 月 26 日
模型代号 gemini-3.5-transcribe(文件转写)/ gemini-3.5-transcribe-live(实时流式)
定位 语音转文字专用模型,Chirp 3 的继任者
语言支持 85+ 种语言自动检测,支持句中混说多种语言
音频时长上限 单次最长 1 小时(开启说话人区分或时间戳时为 30 分钟);实时流式单次会话 10 分钟
接入方式 Gemini API(Google AI Studio / Gemini Enterprise Agent Platform)
官方文档 Google AI for Developers

谷歌自己的产品已经先一步用上了它:Android Gboard 键盘的 Rambler 语音输入、macOS 版 Gemini 应用的语音指令,底层都是这个模型。也就是说,你在 Pixel 手机上用语音打字时自动去掉口水词的体验,就是这个模型驱动的。

Gemini 3.5 Transcribe 官方模型文档页

核心功能:5 个能力值得关注

能力 说明 典型场景
智能转写(Smart mode) 自动删除"嗯""呃"、口吃、说错后自我纠正的内容,并整理成段落、列表、日期和货币格式 把语音备忘录直接变成可读笔记
说话人区分 最多识别 8 位说话人,给每段话标注说话人标签(3 人以上为实验特性) 会议纪要、访谈整理
字词级时间戳 每个词都有精确的起止时间 字幕制作、语音检索定位
自定义词汇 最多传入 1,000 个专有名词(官方建议 100 个以内效果最好),让模型认得产品名、术语、缩写 医疗、法律、游戏等专业领域
实时流式转写 基于 Live API,亚秒级延迟,支持会话中途切换语言 语音助手、实时字幕、同传工具

其中"智能转写"是它和传统转写工具拉开差距最大的地方。举个官方文档里的例子:你说"嗯,关于会议,我觉得我们应该邀请 Alice 和,等等,是 Bob 和 Carol",普通转写模型会原样输出这堆混乱口语,而 Gemini 3.5 Transcribe 的智能模式直接输出"我认为我们应该邀请 Bob 和 Carol 参加这次会议"。再比如你口述"第一项检查预算第二项确定时间表第三项发送总结",它会自动整理成编号列表。

需要注意的取舍:智能模式和字词级时间戳、说话人区分互斥——需要时间戳或说话人标注时,必须用逐字(verbatim)模式。

价格:约 $5 转写 1,000 分钟音频

官方按 token 计费,不在常规模型价目表里单列套餐:

计费项 价格
音频输入 $2.00 / 百万 token
文本输出 $12.00 / 百万 token

Artificial Analysis 的折算口径(每秒音频约 25 个 token),文件转写约 $5/千分钟(≈$0.005/分钟),实时流式版约 $9/千分钟。谷歌开发者生态负责人 Logan Kilpatrick 也在 X 上确认了"约每分钟半美分"这个量级。

入门成本为零:在 Google AI Studio 注册后即可免费试用,免费层对模型访问和 token 都有宽裕额度(注意免费层的内容会被用于改进 Google 产品,商业项目建议升级付费层)。

一句话换算:转写一场 1 小时的会议录音,成本大约 3 美分——比一瓶水的价格还低。

快速上手教程:三步转写你的第一段音频

第一步:获取 API Key

进入 Google AI Studio,点击"Get API key"创建密钥。国内开发者需要能正常访问 Google 服务的网络环境。

第二步:上传音频并调用模型

用官方 SDK 的 Files API 上传音频文件(支持 mp3、wav 等常见格式),然后把文件传给模型:

from google import genai

client = genai.Client()

audio_file = client.files.upload(file="path/to/meeting.mp3")

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[
        {
            "type": "audio",
            "uri": audio_file.uri,
            "mime_type": audio_file.mime_type,
        }
    ],
)

print(interaction.output_text)

第三步:按需开启高级配置

所有配置都放在 generation_configtranscription_config 里,常用的四项:

interaction = client.interactions.create(
    model="gemini-3.5-transcribe",
    input=[{ "type": "audio", "uri": audio_file.uri, "mime_type": audio_file.mime_type }],
    generation_config={
        "transcription_config": {
            "language_codes": ["cmn-Hans-CN"],           # 指定简体中文,已知语言时建议指定以提高准确率
            "custom_vocabulary": ["Gemini", "BigQuery"], # 自定义专有名词,最多 1,000 个
            "mode": {                                    # 逐字模式下开启说话人区分 + 字词时间戳
                "type": "verbatim",
                "diarization_mode": "speaker",
                "timestamp_granularities": ["word"],
            },
        }
    },
)

三条来自官方文档的实践建议:已知语言时务必指定 language_codes;自定义词汇只放领域术语和专有名词,别放日常词汇;超过几秒的音频一律走 Files API 上传,不要直接塞 base64。

Gemini 3.5 Transcribe 音频转写官方指南

实测表现:官方数据和开发者真实反馈

官方基准数据(由第三方机构 Artificial Analysis 测量):

  • 平均词错率(WER):流式 4.0%,非流式 2.6%
  • FLEURS 多语言基准:流式 5.50% WER,非流式 5.04% WER,均优于上一代 Chirp 3
  • 最终转写耗时(time to final transcription)比 Chirp 3 快 70%

Hacker News 上开发者的一手测试反馈讨论帖)值得冷静看:

  1. 延迟有竞争力:一位实时翻译工具开发者实测后表示,Gemini 3.5 Transcribe 的延迟比主打的竞品 Soniox 还略低,但 Soniox 价格更便宜;
  2. 嘈杂环境表现不错:有用户用便宜的麦克风录的会议录音测试,Google 的结果"还不错",而 OpenAI 的模型开始出一些明显错误;
  3. 小坑:有用户反馈录音开头部分会被"吃掉",对开头截断敏感的场景要注意预处理。

Hacker News 上开发者的 Gemini 3.5 Transcribe 实测讨论

综合来看:它不是所有维度都第一,但"准确率 + 延迟 + 智能整理"三件事同时做到位的,目前只有这一家。如果你要做语音 Agent 或实时字幕,建议像 HN 上那位开发者一样,用自己的真实音频对两三家跑一轮 A/B 测试再定。

Gemini 3.5 Transcribe vs Whisper vs Soniox 怎么选

维度 Gemini 3.5 Transcribe OpenAI Whisper(自部署) Soniox STT
部署方式 云 API 开源自部署 云 API
成本 约 $5/千分钟 免费(自担算力) 比 Gemini 更低
智能整理(去口水词/自动格式化) 支持 不支持 不支持
说话人区分 最多 8 人 需配合额外工具 支持
实时流式 支持(亚秒级延迟) 变通实现 支持
自定义词汇 支持(1,000 个) 不支持 支持
适合谁 想要"开箱即用 + 高质量"的团队 数据不能出内网、有 GPU 的团队 价格敏感、大转写量的场景

选型结论:追求转写质量和智能整理、不想自己维护模型 → Gemini 3.5 Transcribe;数据敏感必须私有化 → Whisper 自部署;转写量大、成本敏感 → Soniox 值得进候选名单实测。

它和语音输入、AI Agent 的关系

如果你的需求是"日常打字用语音",不需要碰 API——Android 的 Gboard(Rambler 功能)和 macOS 版 Gemini 应用已经内置了这个模型。国内用户也可以参考我们此前的语音输入工具评测AutoGLM 语音输入上手指南,其中不少产品同样支持实时语音转文字。

对开发者来说,Gemini 3.5 Transcribe 是搭建语音交互 Agent 的关键拼图:实时流式接口负责"听",理解与执行交给通用模型。想系统了解这类架构,可以先看我们的 AI Agent 入门Gemini Omni Flash 介绍

适合谁用(和不适合谁)

适合:

  • 做会议纪要、访谈整理、播客字幕的团队(智能模式直接省掉人工整理)
  • 开发语音助手、实时字幕、通话分析产品的开发者
  • 有多语言、多说话人、专业术语识别需求的场景

不适合:

  • 数据必须完全私有化的场景(它是纯云 API,无自部署选项)
  • 需要转写超过 1 小时单条音频的场景(需自行切片)
  • 预算极度敏感的超大规模转写(可对比 Soniox 等更便宜的方案)

总结

Gemini 3.5 Transcribe 把"转写得准"和"转写得能直接用"合并成了一个 API:2.6% 的非流式词错率属于第一梯队,智能转写模式省掉的更是人工整理时间,$5/千分钟的价格对绝大多数场景都可以忽略不计。它不是最便宜的(Soniox 更低),也不能私有化(Whisper 的领地),但如果你要的是"开箱即用的最高质量转写",它目前就是默认答案。建议先用 Google AI Studio 的免费额度拿自己的真实音频跑一轮,再决定接入方案。


参考资料:

  1. Google 官方公告:Intelligent transcription with Gemini 3.5 Transcribe
  2. Gemini API 模型文档
  3. 音频转写官方指南
  4. Hacker News 开发者实测讨论

最后更新:2026 年 8 月 28 日 · 作者:AI345 编辑部(关注 AI 工具评测与开发者教程)

常见问题

Gemini 3.5 Transcribe 是免费的吗?

不完全是。它按 token 计费:音频输入 $2/百万 token、文本输出 $12/百万 token,折算约 $5/千分钟(≈$0.005/分钟),实时流式版约 $9/千分钟。但在 Google AI Studio 有免费额度,个人测试和小规模使用可以零成本开始;免费层的内容会被用于改进 Google 产品,商业项目建议用付费层。

Gemini 3.5 Transcribe 支持中文吗?

支持。它支持 85+ 种语言,其中包括普通话(简体)`cmn-Hans-CN` 和粤语(繁体)`yue-Hant-HK`,且支持一句话里中英混说的自动切换。已知音频语言时,在 `language_codes` 里显式指定中文代码可以进一步提高准确率。

Gemini 3.5 Transcribe 和 Whisper 有什么区别?

Whisper 是 OpenAI 的开源转写模型,可以免费自部署,数据不出内网,但没有智能整理能力,转写结果是带口水词的原文。Gemini 3.5 Transcribe 是云 API,多了智能转写(自动去"嗯呃"、纠错、格式化)、自定义词汇、说话人区分和实时流式能力,按量付费。

它能实时转写吗?

能。谷歌同时提供了实时流式版本 `gemini-3.5-transcribe-live`,基于 Live API 的双向 WebSocket 传输,延迟低于 1 秒,单次会话最长 10 分钟,适合语音助手和实时字幕。注意实时版不支持字词级时间戳和说话人区分。

转写一小时音频要多少钱?

约 3 美分($0.003-0.005/分钟,取决于输出文本量)。按官方 token 单价和 Artificial Analysis 的折算口径,1,000 分钟音频约 $5。开启说话人区分或字词级时间戳后单次上限从 1 小时降到 30 分钟,长音频需要切片处理。

它会取代会议纪要工具吗?

它会成为很多会议纪要工具的底层引擎,而不是直接取代产品。开发者可以用它的智能模式 + 说话人区分快速搭建纪要应用;普通用户则可以继续用集成了该模型的成品工具(如 Gemini 应用、各类笔记软件),无需自己写代码。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策