隨著 AI 技術不斷發展,現在語音轉文字模型也能做到即時了,也就是在你講話的同時,文字就跟著輸出。Meta 稍早推出全新的 Muse Voice Transcribe 即時語音轉文字模型,標榜在串流(邊講邊出字)狀態下的字錯率只有 3.1%,而且從講完到最終文字出來只要 0.16 秒,甚至還能一路分辨 20 位以上的講者是誰。目前在 Meta AI Mac 版已經能免費使用,官網上也有提供免費試用的功能。
Meta 發表 Muse Voice Transcribe 即時語音轉文字模型:串流字錯率 3.1% 登上第一、能分辨 20 位以上講者,Mac 按住 Fn 就能全域語音打字
Meta Superintelligence Labs(MSL)稍早正式發表 Muse Voice Transcribe,這是 MSL 第一款即時音訊感知模型,底層屬於 Meta 4 月推出的 Muse Spark 模型家族,是一顆自迴歸的多模態模型。
跟一般語音轉文字服務最大的不同,把過去要靠三套系統接力完成的事情,現在一個模型就能完成,包括即時串流語音辨識、講者辨識(同一段音訊裡可分辨 20 位以上的人),還有 endpointing 判斷「這個人到底講完了沒」。訓練涵蓋 70 種以上語言,其中 25 種在推出時已經完成完整驗證,並支援句子中間或句子之間換語言講,也能轉錄超過一小時、20 人以上的長音檔,而且不需要任何後處理。
即時語音轉文字有一個很大的難題在,模型如果太早把文字輸出,可能因為聽到的資訊還不夠而判斷錯誤;但如果每次都等很久才輸出,又會失去「即時」的意義。
Muse Voice Transcribe 的做法,是讓模型自己決定每個詞究竟要「聽多久」。音訊會被切成每 80 毫秒一塊,也就是每秒 12.5 塊,每收到一塊音訊,模型就會判斷目前的資訊是否已經足夠輸出文字。如果還不夠,就繼續等待下一塊音訊;如果已經能夠判斷,就開始輸出文字。
Meta 將這套機制稱為「adaptive delay(自適應延遲)」。不同詞需要等待的時間並不固定,碰到比較難判斷的詞,模型可以多聽一點再決定;比較容易辨識的詞,則能更快輸出,以兼顧辨識準確度與反應速度。
訓練方面,Meta 使用強化學習,將「字詞錯誤率(WER)的獎勵」與「延遲獎勵」以乘法方式結合,讓模型不能只追求速度或準確度其中一項,而是學會在兩者之間取得平衡。
根據 Meta 分享的 Artificial Analysis 速度對準確度散布圖中,Muse Voice Transcribe 最終轉錄字錯率只有 3.1%,而且從系統偵測到使用者講完,到最終文字產生只需約 0.16 秒,位於 Pareto frontier(速度與準確度的最佳邊界)下方。簡單來說,同樣的速度沒有其他模型比它準確,同樣的準確度也沒有其他模型比它快:
跟競爭對手相比,Soniox v5 Real-Time 雖然只要 0.05 秒左右,但字錯率是 4.5%;ElevenLabs Scribe v2 Realtime 跟 Muse 的速度差不多(約 0.15 秒),不過字錯率也有 3.6%;Google 上個月才發表的 Gemini 3.5 Transcribe Live,則是 0.41 秒和 4.0%;OpenAI 的 GPT Live Transcribe 更是耗時 0.84 秒,字錯率還有 3.9%。
下面是最終轉錄字詞錯誤率的完整排名,以這項英文測試來說,3.1% WER 可以粗略理解成每 100 個英文單字約出現 3.1 個轉錄錯誤,數字越低越好:
講者辨識部分,傳統常見做法是將語音轉文字與講者分群拆成不同處理流程,部分系統還需要在音訊完成後進行後處理。Muse Voice Transcribe 則直接把 diarization 整合進同一個串流模型裡,模型偵測到講者切換時,就會在輸出中加入 <|start_of_turn|> 和對應的 speaker tag,因此不需要另外跑一次講者分群程序。
Meta 也分享 Diarization 講者辨識錯誤率的測試數據,使用 AMI-IHM、AMI-SDM、VoxConverse 三個公開資料集的平均值,Muse Voice Transcribe 成績是 17.5%。更值得注意的是,Muse Voice Transcribe 是在即時串流的狀態完成,就已經大幅優於 AssemblyAI、ElevenLabs 跟 Deepgram 的離線成績:
不過 Meta 在這張圖中沒有和 Google 的 Gemini 3.5 Transcribe 比較,也沒有速度最快的 Soniox,感覺像是 Meta 有特別挑過。
Meta 表示訓練這模型時已涵蓋 70 種以上語言,其中 25 種在推出階段就通過完整驗證,包含中文、日文、法文、西班牙文、印地語、越南語等。不過官方沒有完整列出 25 種語言清單,我測試目前似乎還不支援繁體中文,輸出都是簡體中文。
至於哪裡可以體驗到 Muse Voice Transcribe ,目前有三種方式:
- Meta AI for Mac 使用的語音轉文字現在就是這模型,完全免費用,且支援全域。
- Muse Code
- Meta Model API 模型價格每 1,000 音訊分鐘 3 美元(每小時 0.18 美元)
打開 Meta AI for Mac 後,使用語音轉文字的功能,就能體驗到這個新模型:
目前無論我怎麼講,都是輸出簡體中文:
語音轉文字的相關設定可在 Dictation 選單中找到,如:啟用熱鍵、權限、輸入裝置等:








