微軟研究院近日開源一個 70 億參數的語音 AI 模型 VibeVoice ,它能在一次處理中轉錄長達 60 分鐘的音檔,同時完成說話者辨識、時間戳標注和文字轉錄三項任務,支援 50 種以上語言,且完全免費、可在本地端執行。對於習慣了 Whisper 等傳統 ASR 模型「切段處理」模式的開發者來說,VibeVoice 的「一次性全文處理」方案提供了一條不同的路。
微軟 VibeVoice-ASR:60 分鐘音檔一次轉錄
傳統 ASR 模型如 OpenAI Whisper 處理長音檔時,必須將音檔切成 30 秒左右的短片段再逐一辨識,最後拼接結果。這種做法的致命缺陷在於:每一段之間的上下文會丟失,說話者身分可能在段與段之間錯亂,語意連貫性也會被打斷。VibeVoice-ASR 透過連續語音 tokenizer 以 7.5 Hz 的超低幀率運作,在 64K token 的上下文窗口內一次吞入 60 分鐘的連續音檔,從頭到尾保持全局上下文。
這意味著模型在處理一段 40 分鐘的會議錄音時,第 35 分鐘的發言內容可以參考第 5 分鐘的語境來判斷指代關係,不會因為切片邊界而遺漏前文。對於多人會議、播客、訪談等長對話場景,全局上下文的保留直接影響辨識準確度。
三合一輸出:誰說了什麼、何時說
VibeVoice-ASR 的輸出格式不同於傳統 ASR 模型只給純文字。它將自動語音辨識(ASR)、說話者分離(Speaker Diarization)和時間戳標注(Timestamping)三項任務整合為單一端到端生成任務,輸出結構化的轉錄結果,包含「誰(Speaker)、何時(Timestamps)、什麼(Content)」三個維度。
在實際應用中,用戶無需額外安裝 pyannote 等獨立的說話者分離工具,也不必在 ASR 輸出後再手動對齊時間戳。VibeVoice-ASR 在一次推理中同時完成這三件事,省去後處理流程。此外,模型支援自訂關鍵詞(hotwords),用戶可以提供特定人名、技術術語或背景資訊來引導辨識過程,在專業領域的術語辨識準確度上有顯著提升。例如醫療會議錄音中常見的藥物名稱、臨床縮寫,或法律庭審中的專業用語,都可以透過 hotwords 機制預先輸入模型,減少專有名詞被誤辨識為近音詞的機率。
模型家族:不只做辨識
VibeVoice 是一個模型家族,不只有 ASR 辨識模型。除了 ASR 辨識模型(7B),還包含 TTS 文字轉語音模型(1.5B)和即時串流 TTS 模型(Realtime-0.5B)。TTS 模型能在一次生成中合成長達 90 分鐘的多人對話語音,支援最多 4 名說話者,論文已獲 ICLR 2026 Oral 接受。即時串流版本則以約 300 毫秒的延遲支援串流文字輸入。
不過,VibeVoice-TTS 的程式碼已在 2025 年 9 月被微軟從 GitHub 移除。官方說明指出,模型發布後發現有人將其用於與研究初衷不一致的用途,基於負責任 AI 原則,微軟選擇下架 TTS 程式碼。ASR 和 Realtime-0.5B 兩個模型則繼續維持開源。
GitHub 5 萬星:社群採用速度驚人
截至 2025 年 8 月首次開源以來,VibeVoice 在 GitHub 上已累積超過 5 萬顆星、5,600 多個 fork。2026 年 3 月,VibeVoice-ASR 被併入 Hugging Face Transformers 函式庫,開發者可以直接透過 transformers 庫呼叫,不再需要單獨安裝。微軟也提供了 vLLM 推理支援和微調程式碼,降低部署門檻。
社群方面,Marktechpost 發布了完整的 Google Colab 實作教學,涵蓋從環境搭建、說話者感知轉錄、關鍵詞引導辨識、批次音檔處理,到即時 TTS 合成和端到端語音對語音管線的完整流程。已有開發者基於 VibeVoice 打造了名為 Vibing 的 macOS 和 Windows 語音輸入應用。微軟也提供了 ASR Playground 線上試用環境,讓使用者無需部署即可上傳音檔測試效果。
VibeVoice GitHub 倉庫
與 Whisper 的差異:上下文是關鍵
VibeVoice-ASR 與 OpenAI Whisper 的核心差異在於上下文處理策略。Whisper 將音檔切成短片段處理,每段獨立辨識,再拼接結果。VibeVoice-ASR 則在單次推理中處理完整音檔,保留全局上下文。在多說話者場景中,Whisper 的切片方式容易導致跨段說話者身分錯亂,需要額外搭配獨立的說話者分離模型補救。VibeVoice-ASR 將說話者辨識內建於模型本身,不需外掛。
不過 VibeVoice-ASR 並非沒有挑戰。70 億參數的模型體積意味著本地部署需要足夠的 GPU 記憶體。社群測試顯示,搭配 vLLM 推理框架可以提升推理速度,但硬體門檻仍高於 Whisper 的各種輕量化版本。此外,ModelScope 最近發布的 MOSS-Transcribe-Diarize 0.9B 模型,以不到 VibeVoice 八分之一的參數量,在 AISHELL-4 和 Alimeeting 等基準測試上聲稱超越 VibeVoice-ASR,顯示長音檔轉錄領域的競爭正在加速。VibeVoice-ASR 在多語言支援和自訂關鍵詞方面仍保有優勢,但參數效率是否足以維持領先,將是後續觀察重點。
結語
VibeVoice-ASR 代表了語音辨識技術從「分段拼接」走向「全局一體」的方向轉變。60 分鐘一次處理、三合一結構化輸出、50 種以上語言支援,加上 MIT 開源授權和 Hugging Face Transformers 整合,讓它在一年內累積了 5 萬顆 GitHub 星標。隨著競爭者湧入和硬體門檻逐步降低,長音檔語音辨識的門檻正在被快速拉低。對於需要處理會議錄音、播客轉錄、訪談整理的使用者來說,免費且可本地執行的選擇越來越多。


