過去的語音轉文字大家都是在追求精準度,每個字都要清楚辨識出來,但在這 AI 時代已經是基本,更重要的反而是能不能將贅詞去除、把內容整理成適合的格式等等,這樣講完之後就不用再花時間修,直接就能使用。為此,Google 稍早發表的新一代語音轉文字模型 Gemini 3.5 Transcribe,就強調有這能力,不僅辨識速度更快且更佳準確外,還支援自動去贅詞、整理格式等功能(智慧轉錄),代表說贅詞會消失,標點、大小寫跟段落也會幫你補好。你不是獲得一份逐字稿,而是一段可以直接貼出去使用的文字。
Google 推出 Gemini 3.5 Transcribe 語音轉文字模型:自動刪掉「呃」跟講錯的話、支援 85 種語言,速度比前代快 70%
Google 稍早在官方部落格宣布推出新一代語音轉文字模型 Gemini 3.5 Transcribe,這次的提升重點大致可以分成四塊:第一是「智慧轉錄」,會自動處理你講到一半的改口、清掉贅詞、補好標點跟排版;第二是準確度與速度,串流字錯率降到 4.0%、非串流 2.6%,出稿速度比 Chirp 3 快 70%;第三是語言與講者辨識,自動偵測超過 85 種語言,預錄音檔還能分辨最多三位講者並附上逐字時間戳記;第四則是自訂字彙,可以先把專有名詞、人名、公司內部術語給它。
另外價格也比 Chirp 3 便宜許多。。下面一項一項來看。
「智慧轉錄」可說是 Gemini 3.5 Transcribe 的最大特色。傳統的語音轉文字就是逐字轉,你講什麼它就輸出什麼,包含你所有的口誤、停頓和廢話。Gemini 3.5 Transcribe 多做了一層理解,像是你說「我們禮拜二見——不對,是禮拜三」,模型會判斷後面那句是修正,最後只留下「禮拜三」。同樣地,「嗯」、「呃」這種填空音也會被清掉,同時語氣自然的停頓也不會被當成句號斷掉。
Google 也引用 Artificial Analysis 的測試結果來說明 Gemini 3.5 Transcribe 的準確度。在串流模式,也就是「邊講邊出字」的情境下,平均字錯率(WER)為 4.0%;非串流模式,也就是把完整錄音檔一次交給模型處理,字錯率則進一步降到 2.6%。
多語言辨識方面,Google 採用 FLEURS 跨語言基準測試,Gemini 3.5 Transcribe 在串流與非串流模式下的字錯率分別為 5.50% 與 5.04%。除了準確度提升,速度也是這次的一大進步,Google 表示,從使用者講完話到取得最終轉錄文字的時間,相較上一代 Chirp 3 縮短約 70%:
Gemini 3.5 Transcribe 支援超過 85 種語言,而且是「自動偵測」,你不用先告訴它這段音檔講的是哪一國話,模型會自己判斷,區域口音跟方言也在支援範圍內。這對常常需要中英夾雜的使用者來說相當方便。此外,預錄音檔還支援講者辨識,可自動標示每段內容是由誰說的,目前最多支援 8 位講者,不過官方註明 3 位以上的講者辨識仍屬實驗性功能。
對於公司的產品代號、同事的名字、醫療或法律的專業術語、動漫或遊戲的專有名詞,你也能事先自訂好字彙,最多能設定 1,000 個詞。不過官方文件有提到,通常控制在 100 個詞以內效果最好,所以不是塞越多越準,建議挑真正幾個經常的關鍵詞就好。
除了單純轉錄,Google 也把 Gemini 3.5 Transcribe 用在 macOS 版 Gemini App 的語音操作中。使用者可以直接用語音下達「生成圖片」、「分析檔案」等指令,Gemini App 會再呼叫其他 Gemini 模型完成任務。不過要注意,這是 Gemini macOS App 整合的功能,Gemini 3.5 Transcribe API 本身目前並不支援 Function Calling。
價格方面,Gemini 3.5 Transcribe 也相當有競爭力。一般版本換算下來,每分鐘音訊的轉錄成本大約只要 0.005 美元;如果是即時邊講邊轉文字的 Transcribe Live,則大約是每分鐘 0.009 美元。
有興趣的人,也不一定要付費或自己串 API,目前在 Google AI Studio 可免費體驗 Gemini 3.5 Transcribe,Gemini API 本身也有提供免費額度:




