用手機隨手拍一段影片,就能把畫面中的人物重建為 4D 動態模型,從任何角度觀看甚至環繞運鏡,彷彿現場有多台攝影機同時在不同角度進行拍攝。Ant Research(螞蟻集團)與浙江大學、香港科技大學合作發表的 4DAnyone,已將這項技術從論文帶到公開可用的程度,該專案日前在 Hugging Face 上架後獲得大量關注。
4DAnyone 從一支手機影片到動態 4D 模型
傳統的人體 4D 重建需要多台同步相機。以業界標竿資料庫 DNA-Rendering 為例,該資料庫使用 48 台同步攝影機拍攝,這也是體積化人體捕捉(volumetric human capture)長年無法走出攝影棚的原因。4DAnyone 的做法從根本上改變了這個限制:輸入只需一支未經校正的手機影片。系統會先用影片擴散模型(video diffusion model)生成數十組多視角一致的新畫面,再將這些畫面提升為 4D Gaussian Splatting(4DGS)表示,最終產出一個可以自由旋轉角度觀看的動態模型。
AntResearch just dropped 4DAnyone on Hugging Face!
Convert a video of any person into a 4D gaussian splat for that person
▶️ https://t.co/JyRkvXVKc7 pic.twitter.com/Cc6LovWtqF
— Hugging Apps (@HuggingApps) August 21, 2026
這篇論文已被 SIGGRAPH Asia 2026 接受,程式碼與模型均已開源,採用 Apache-2.0 授權。實測上傳一段人物特寫影片後,系統能生成環繞視角,同時在不同俯仰角度下保持人物的外觀一致性。使用者可以自由選擇輸出視角的數量與布局,從 6 視角基本環繞到完整的 48 視角全方位拍攝都能一鍵完成。
擴散模型的視角瓶頸與解方
過去用影片擴散模型生成多視角畫面的主要挑戰在於容量限制。擴散變壓器(Diffusion Transformer, DiT)的單次前饋容量有限,當需要生成的目標視角數量超出處理範圍時,視角必須拆成多組分批處理。這會引發兩個連鎖問題。
第一,參考視角增長時,對每個新視角的條件化成本呈 O(N) 線性成長,稀釋跨視角的外觀引導,使得後續生成的視角愈來愈偏離原始人物的真實外觀。第二,分組後不同組之間無法直接交換資訊,導致整體結構漂移,不同批次的視角各自產生不一致的幾何形狀。這正是過去用擴散模型做 4D 重建的主要瓶頸:單視角觀看時每張畫面都沒問題,但放進 4DGS 重建時全部矛盾。4DAnyone 提出的兩個核心技術分別解決這兩個瓶頸。
Reference Context Packing(RCP)將增長的參考視角壓縮為固定長度的混合解析度上下文,把參考上下文成本從 O(N) 降至 O(1)。Target Context Routing(TCR)則在去雜訊過程中動態旋轉目標視角的分組方式:高雜訊階段頻繁交換各組內容以決定全局結構,低雜訊階段固定分組以讓相鄰視角一起穩定細節。這兩個機制合起來讓 4DAnyone 能在單次推理中處理數十個目標視角而不發生結構崩潰。
訓練規模與基準表現
4DAnyone 的訓練使用了 128 張 H20-3E GPU,搭配自建遊戲引擎資料集 MVGameHuman,以及 light-stage 與真實世界影片資料。在 DNA-Rendering 測試基準上,4DAnyone 達到 24.33 dB 的 PSNR,而最佳對比方法僅為 21.47 dB。這將近 3 dB 的差距在多視角一致性與重建品質上帶來肉眼可見的差異,尤其是在人物輪廓與服裝紋理的還原度上,4DAnyone 明顯優於現有的擴散模型方法。
論文也在 DyMVHumans 資料集的三個序列上進行驗證,重建結果為 21.03 dB。這個數字低於 DNA-Rendering 的分數,但反映了在真實非受控場景下的泛化極限。論文坦承生成的背面細節本質上是一種「與正面一致的合理推測」,因為原始影片根本沒拍到背面,系統必須根據訓練學到的人體先驗知識來補全。這也正是單視角重建與多相機拍攝之間的本質差異。
實際使用與硬體門檻
專案已在 GitHub 上提供完整的推理流程與多種相機配置,支援從 6 視角基本環繞到 48 視角三層俯仰的全方位布局。輸入影片建議至少 720p 解析度,最佳為 1080p 的 9:16 直立畫面,人物需全身或上半身入鏡,至少 121 幀,且鏡頭僅有輕微移動。使用者可以透過命令列參數自由調整視角數量、俯仰層數與涵蓋範圍,適應不同的後續應用場景。例如 6 視角配置適合快速預覽,24 視角適合標準 4DGS 重建,48 視角三層俯仰則可達到自由視角渲染的水準。
4DAnyone – GitHub
最低硬體需求為 32 GB VRAM,若要加速可選裝 FlashAttention-3 或 SageAttention。安裝方式為標準的 conda 與 pip 流程,模型權重與範例影片會在首次執行時自動下載,不需手動逐一取得。對於熟悉 PyTorch 環境的研究者來說,從下載到跑出第一組結果大約可以在半小時內完成。專案也提供了詳細的 nerfstudio 整合指南,讓使用者可將生成的影片用於 3DGS 後續重建。
不過訓練端的成本仍相當可觀,128 張 H20-3E GPU 的運算資源遠非一般學術實驗室所能負擔。但推理端已可在單張高階顯示卡上執行,代表這項技術離實際應用場景已不算太遠。對於需要快速產生人物動態 3D 模型的內容創作者或遊戲開發者來說,4DAnyone 提供了一條比傳統 multi-camera 棚拍更靈活的路徑。目前專案已累積超過 640 顆 GitHub 星數,在 Hugging Face 上也獲得社群關注,後續社群貢獻可能進一步降低使用門檻。




