重點摘要:
- Gemini 3.5 Transcribe 將即時語音辨識錯誤率從 Chirp 3 的 7.32% 降至 5.5%
- 模型可自動偵測 85 種以上語言,並自動刪除填充詞與自我修正語句
- 推出範圍涵蓋 Gboard、macOS Gemini 應用程式及 Gemini API 預覽版,Chrome 支援即將到來
重點摘要:

Google 新款語音轉文字模型會自動修正口語失誤並理解說話意圖,將轉錄從逐字捕捉轉變為以語意為基礎的輸出。
Google 於週二推出的 Gemini 3.5 Transcribe 將即時語音辨識錯誤率從 Chirp 3 的 7.32% 降至 5.5%,同時將完成最終文字所需的時間縮短 70%,讓語音輸入從逐字捕捉轉變為以意圖為基礎的編輯。
「與傳統語音辨識模型難以應對背景噪音、複雜專業術語及語言不流暢清潔的困境不同,Gemini 3.5 Transcribe 能將原始音訊直接轉換為準確、精煉、格式化的文字,」Google 在新聞稿中表示。
該模型可自動偵測 85 種以上語言,刪除「嗯」(um) 和「啊」(uh) 等填充詞,辨識句子中途的自我修正,並自動格式化標點符號。它支援自訂詞彙表以處理專業術語,且在批次模式下可區分最多三位說話者的語音,並提供逐字時間戳記。目前推出兩個版本:gemini-3.5-transcribe-live 用於亞秒級雙向串流,以及 gemini-3.5-transcribe 用於處理最長一小時的錄音檔案。
本次推出涵蓋 Pixel 11 上 Gboard 的 Rambler 語音輸入、macOS Gemini 應用程式、Antigravity 及 AI Studio,Chrome 支援也即將推出。Google 股價週四盤中下跌 1.37%,投資人正評估該模型在語音 AI 競賽中與競爭對手 OpenAI 和 Apple 的優劣。
核心轉變在於語境理解。當使用者說「星期二——不對,星期三」時,模型會辨識出這是一次修正,而非將兩者都轉錄下來。它還會清理口語中常見的不流暢語句,產出可直接用於電子郵件、訊息或 AI 提示的格式化文字。Google 表示,該模型能處理多語言混用,並自動偵測語言,無需手動選擇。
對開發者而言,Gemini API 現已開放公開預覽,第三方平台 LiveKit、Pipecat 和 Vercel 已整合該模型。Google 將此 API 定位為語音功能的高低延遲替代方案,但未揭露與 Chirp 3 錯誤率比較背後所依據的測試條件。根據 Google 發布的基準測試,批次版本在非串流音訊上的字元錯誤率為 2.6%,串流模式則為 4.0%。
此次發布緊隨 Gemini 3.5 Live Translate 之後,而 Google 承諾推出的 Gemini 3.5 Pro 至今仍未上市。Google 最初計畫於週二同步推出 3.5 Live 和 3.5 Live Experimental 配套模型,但隨後表示僅有 Transcribe 會如期發布。
商業利害關係顯而易見。語音轉文字正成為 AI 助手的主要介面,Google 正在將該模型嵌入高頻使用的產品——Chrome、Gboard、Docs、Gmail——以深化 Gemini 在日常生產力場景中的觸及範圍。此舉旨在對抗 OpenAI 的 Whisper 與 Apple 的裝置端語音技術堆疊,因為語音輸入正逐步取代鍵盤。
Google 目前的本益比約為前瞻盈餘的 22 倍。該模型的營收取決於 Gemini 下游採用情況及 API 變現能力,而 Google 尚未量化這些數據。Chrome 整合預計「很快」實現,這將決定語音輸入能否觸及瀏覽器的數十億使用者,以及 Google 能否將便捷功能轉化為相較於仍將轉錄視為原始工具的競爭對手之持久優勢。
本文僅供資訊參考,不構成投資建議。