![]()
是一位专注于创意产业、计算和互联网文化的新闻撰稿人。 Jess 在 TechRadar 开始了她的职业生涯,负责报道新闻和硬件评论。
Google 更新了 Gemini Audio,添加了一些新的 Gemini 3.5 模型,引入了新的转录功能,可以自动检测专业术语和超过 85 种语言。 Gemini 3.5 Live、3.5 Live Experimental 和 3.5 Transcribe 旨在为 Google 的语音控制 AI 功能提供更高的精度,而不会受到背景噪音或语音中断的困扰。
Gemini 3.5 Transcribe 是 Gemini 系列的全新成员,它的推出正值我们仍在等待 Google 发布其承诺于 6 月份推出的 Gemini 3.5 Pro 型号之际。谷歌表示,3.5 Transcribe“代表了我们之前的转录模型 Chirp 3 的重大进步”,特别是在多语言性能和措辞错误率方面。
据谷歌称,转录模型允许用户“仅用你的声音自然地编辑”,并且可以自动格式化文本并删除“嗯”和“呃”等填充词。用户可以为模型提供自定义词汇表,从而使 3.5 Transcribe 自动调整转录以适应独特的拼写要求和专业术语,以防止手动编辑这些单词。它还可以在预先录制的音频中对最多三个发言者的语音进行归因,同时提供单词级时间戳。
Transcribe 与 3.5 Live 和 3.5 Live Experimental 一起推出,后者建立在为 Gemini 语音聊天模式提供支持的现有语音识别技术的基础上。 Gemini 3.5 Live 更擅长处理句子中间的中断、语言识别和实时视觉处理,而 Gemini 3.5 Live Experimental 则更进一步,实时逐步叙述其进展,同时处理更复杂任务的推理。
这些 Gemini Audio 更新从今天开始以英语向所有 macOS Gemini 应用程序用户推出,并在 Android 上以选定的国家/地区和语言推出 Rambler 听写功能。开发人员还可以通过 AI Studio 和 Antigravity 在 Gemini API 中公开预览它。谷歌表示即将支持 Chrome。
关注主题和作者 从这个故事中可以在您的个性化主页源中看到更多类似内容并接收电子邮件更新。









