字節跳動旗下 AI 研究團隊 Seed 於 8 月 5 日正式推出原生音視頻全雙工大模型 SeedRealtime,並同步宣布該模型已於豆包 App 全量上線,號稱在業界率先達成音視頻全雙工技術的規模化落地。這款模型以統一架構原生融合音訊、視訊與文字,可在連續的多模態資訊流上即時交互,實現「邊看、邊聽、邊說」的自然對話體驗,用戶將豆包 App 更新至最新版本後,在對話框選擇「打電話」進入視訊通話介面即可免費體驗。
從級聯到端到端:全雙工交互的技術路線
Seed 團隊在技術部落格中指出,音視頻即時交互過去長期卡在兩種形態之間。傳統級聯系統依賴 ASR、視覺模型、TTS 等多個模組串聯,延遲層層疊加、資訊逐級損耗;端到端模型雖然更流暢,但不少方案仍依賴外置 VAD(語音活動偵測)判斷輪次,仍接近一問一答的半雙工交互。
SeedRealtime 的關鍵差異,在於把聲音、畫面、時序與表達統一放進同一個端到端模型,在連續音視頻流上讓感知、理解、決策與表達同步進行,而非先聽完、再看完、最後作答。工程面上,團隊透過連續音視頻分塊輸入與流式生成輸出縮短回應時間,並結合高效量化與推理最佳化提升服務效率。Seed 官方公布的端到端人工評測結果顯示,相比級聯模型,SeedRealtime 的音視頻對話節奏問題減少約一半,搶話、回應遲緩、以及被背景雜音與旁人閒聊誤觸發等卡殼現象都明顯下降,單次對話能順暢完整交流的機率也有顯著提升。
三大核心能力:聯合理解、主動介入、節奏掌控
SeedRealtime 對外宣稱的三項核心突破,分別對應音視頻即時交互最難的三個環節。
首先是音視頻聯合理解。模型原生支援聲音、畫面與時序資訊的深度融合,當用戶說「這個怎麼弄」時,能結合當前畫面、手勢、視線與歷史動作判斷「這個」指涉的對象;遇到同音詞或模糊語音時,也借助視覺場景完成消歧,讓所見、所聞與所說對應起來。
其次是主動的交互能力。模型具備持續的環境感知,能在察覺畫面狀態變化時主動提醒,例如用戶交代「看到某件展品就提醒我」,模型便會在鏡頭掃過目標時出聲,並能基於視覺狀態變化即時糾錯與回饋,把互動從被動回應升級為主動協作。
第三是流暢的交互節奏。輪次判斷不再交給外部 VAD 規則,而由模型基於多模態資訊持續決策:該接話時不遲疑、該沉默時不插話。官方演示中,在大興機場這類人潮密集的嘈雜環境,同伴閒聊提到無關話題時模型不會被誤觸發,正式詢問航班資訊時又能結合先前看到的畫面內容回答,並在掃到網約車指示牌時自然接話提供路線指引。
七大實景案例:認人、翻譯、盯頁、陪讀
Seed 團隊透過 7 個真實場景案例展示模型能力。在多人聚餐場景中,用戶逐一介紹在場朋友後,模型能依外形特徵把名字和長相對上,在後續交談中持續對應每個人的聲音與身分,並根據眾人的需求差異給出兼顧的旅行方案:
在川菜館,模型能直接從畫面認出菜色、用英語向外籍食客推薦,甚至解釋「魚香肉絲裡為什麼沒有魚」這類文化背景問題:
在河北博物院,模型持續觀看鏡頭畫面,掃過指定的錯金銀銅虎噬鹿屏座時主動提醒,隨後講解長信宮燈等鎮館之寶與鑄造、錯金銀等工藝:
操作類案例同樣具體:模型在用戶把整粒咖啡豆直接倒進萃取手柄時即時指出「得先磨成細粉」,萃取結束後基於杯中油脂成色與液量,主動建議「下次萃取時間縮短 2 至 3 秒」:
研讀 ResNet 論文時,模型能結合網路結構圖講解跳接如何緩解梯度消失,並在快速翻頁的過程中認出「3.4 Implementation」段落主動叫停,報出學習率、動量、權重衰減等訓練配置:
家庭場景則展示抗干擾能力:爸爸在背景講電話的同時,模型仍能跟著女孩手指的方向即時糾音、舉例造句,不被無關對話帶偏。
機場場景中人流密集,同伴閒聊時隨口提了句「老李的航班」,模型沒被觸發回覆;等使用者正式問起,模型結合剛才看到的大屏資訊回答並聯網補充行李轉盤位置。
即時多模態對話的戰場:各家都在搶進
SeedRealtime 瞄準的即時多模態對話賽道,近年已有多家廠商卡位。OpenAI 自 GPT-4o 起展示語音模式並推出 Realtime API,主打低延遲的語音對語音對話;Google 則以 Gemini Live 提供即時語音交談能力。相較之下,SeedRealtime 的差異點在於將視訊理解納入同一套全雙工決策體系,模型能持續觀看畫面並主動介入,而非僅限於語音輪流對話;字節跳動把它直接放進擁有大量用戶的豆包 App,也讓這項技術從研究展示走向消費端產品落地。
結語
字節跳動 SeedRealtime 的發表,把即時 AI 交互從「聽得懂、答得快」推進到「看得懂、會主動」的階段。官方預告的下一步包括持續壓縮端到端延遲、強化多人複雜場景下的身分辨識與回應判斷、以及打通工具調用,讓模型從「能對話」走向「能行動」,把即時多模態理解轉化為查詢、預訂、任務辦理等具體協助。對於使用者來說,最直接的變化已經發生在豆包 App 的視訊通話介面裡(使用「打電話」功能),小編也測試過了台灣地區也可用,有興趣的朋友可以自己試試。




