返回 AI 新闻

Google 发布 Gemini 3.5 Transcribe 实时转写模型

新模型不只把语音变成文字,还会处理背景噪声、专业术语和口语停顿,让实时会议与语音交互得到更干净的结果。

Google 发布 Gemini 3.5 Transcribe 实时转写模型

实时转写开始从“听见”走向“理解”

Google 在 8 月 26 日发布 Gemini 3.5 Transcribe,定位是面向实时语音交互的智能转写模型。与传统语音识别只追求逐字记录不同,官方介绍强调它能处理背景噪声、复杂术语以及说话过程中的停顿和口头语,并把原始语音直接整理成更易读的文本。

AI 语音转写应用示意图
AI 语音转写应用示意图

哪些场景会最先受益

会议纪要、访谈记录、客服通话和语音输入都会直接受益。对团队来说,真正有价值的变化不是转写速度更快,而是后续人工清理工作更少,专业名词和格式也更稳定。

普通用户现在能感受到什么

Google 表示,这项能力已经出现在 Gemini 与部分 Android 语音体验中。企业如果要测试,可以先选择一段带有多人对话、行业术语和环境噪声的真实录音,与现有工具对比准确率、整理时间和可读性。

判断转写工具是否好用,不只看漏了多少字,还要看结果能否直接进入会议纪要、任务清单和知识库。
想把方法用到真实业务中从一个具体问题开始
联系顾问