NVIDIA 與 SANA Sol-Engine 研究團隊昨日(7)發表 Sol-H3,一套針對 MiniMax-H3 影片生成開源模型的端到端推理加速方案。在 8 張 NVIDIA B300 Blackwell 系統上,Sol-H3 產生 5 秒 1344×768 解析度附帶立體聲的影片,推理時間只要 1.653 秒,比影片本身的播放時間還短。團隊將此稱為「比播放更快」(faster than playback)的目標,這也為即時生成與真正互動式 AI 影片鋪平了道路。

Sol-H3:從「快」到「比播放還快」
Sol-H3 由 Enze Xie(謝恩澤)主導,融合了 NVIDIA 的 Sol Engine 影片推理優化框架與 Sol-Attn 稀疏注意力技術,加上 MiniMax 自身的四步蒸餾方案,形成一套完整的推理執行棧。團隊與 Reactor 平台合作,第一天即提供 API 服務,程式碼以 Apache 2.0 授權發布。
🚀 Sol-H3: @MiniMax_AI H3 Video Generation Faster Than Playback 🤩
Five seconds of world. 1.653 seconds to infer.
We’re releasing Sol-H3, our fastest end-to-end MiniMax-H3 inference stack yet. On one 8× NVIDIA B300 Blackwell system, it generates five seconds of 1344×768 video… pic.twitter.com/WSHHEbgIJj
— Enze Xie (@xieenze_jr) September 7, 2026
數據會說話。Base H3 原始版本生成一段 5 秒影片需要 18.250 秒,使用 50 步 DiT 前向傳播。Sol-H3 只用四步 DiT 前向傳播,同樣在 8× B300 上只需 1.653 秒,加速 11.04 倍。延長到 10 秒與 15 秒影片時,加速倍率進一步提升到 13.57 倍與 15.05 倍,時間分別為 3.732 秒與 6.612 秒。
Sol-H3 也展示在不同 GPU 規模下的擴展能力。4 張 B300 的系統產生 5 秒影片為 2.918 秒、10 秒為 6.993 秒、15 秒為 12.542 秒,加速倍率落在 12.11 到 15.54 倍之間。即使縮減到單張 B300,5 秒影片也只需 13.745 秒,加速 9.45 倍;10 秒為 37.813 秒、15 秒為 52.260 秒。所有測試均在 1344×768、24 FPS、附帶立體聲的條件下進行,取三次運行中位數,已排除模型載入與編譯暖機時間。這樣的加速幅度讓 H3 朝向即時生成邁進了一大步。
技術組成:Sol Engine × Sol-Attn 完整堆疊
Sol-H3 融合多層推理執行棧的技術,層層疊加後得出最終的加速結果。NVIDIA 的 Sol Engine 先前在 8× GB200 上已針對 MiniMax-H3 實現 3.95 倍加速,包含三根支柱:無損核心優化(融合 RMS-AdaLN、QKNorm + RoPE、QKV 合併、GEMM + GELU 等操作,減少 HBM 讀寫次數)、跨步快取(在中間去噪步驟重複使用先前步的殘差,跳過不需要重新計算的步驟,單此項就從 17.7 秒降至 6.88 秒)、以及 Sol-Attn 免訓練稀疏注意力(讓每一步只計算真正需要的注意力區塊)。
Sol-H3 在這個基礎上進一步加入四步蒸餾與 B300 平台的 INT8 QKV / FP8 輸出通訊最佳化,將加速倍率從 3.95 倍推向 11 到 15 倍的水準。團隊強調,這是一份完整的生成設定檔比較,Base H3 用 50 步、Sol-H3 用 4 步,涵蓋文字編碼、DiT 去噪與 VAE 解碼的完整流程。
關鍵優化的具體成效:
- 動態稀疏注意力(Sol-Attn):不需重新訓練,在推理時動態決定哪些注意力區塊需要計算。設定時間從 1.206 ms 降至 0.285 ms,減少 76.4%
- 平行批次 VAE 解碼:解碼時間從 7.55 秒降至 0.602 秒
- 記憶體釋放:合計每張 GPU 釋放約 24 GB,讓更大解析度或更長序列的生成成為可能
Sol-H3 使用 Dense 注意力在 1× B300 上,4× 與 8× 則啟用 Sol-Attn 搭配 INT8 QKV / FP8 輸出傳輸。時間測量包含文字編碼、DiT 去噪與視訊/音訊 VAE 解碼,模型載入、編譯暖機與最終 MP4 封裝則排除在外。
H3 加速方案的競爭格局
Sol-H3 並非 MiniMax-H3 生態系中唯一的加速方案,但它是目前 B300 硬體上加速倍率最高的一組。8 月底,fal.ai 發布了 H3 Max,能在 3 秒內生成 5 秒 768p 附帶音訊的影片,主打快速部署與廣泛可用性,已在 MiniMax Design 平台上線。
vLLM-Omni 也在 9 月初發表了 MiniMax H3 的生產級部署方案,整合 FastVideo 的四步 FastH3,同樣實現了比播放更快的生成速度。vLLM 的文章提到,從系統層面全面優化文字編碼、DiT 去噪與 VAE 解碼等完整堆疊,並強調了模組化可組合的設計理念。
從目前 AI 影片生成市場的發展來看,H3 的生態正在快速成形,從 vLLM 的生產級部署到 fal 的快速 API 方案,再到 Sol-H3 的極致加速,不同團隊在不同環節貢獻了各自的優化方案。
Sol-H3 的定位在於結合 Sol Engine 的自動化搜尋式優化流程與 B300 的硬體加速能力,以 4 步 DiT 達到 15 倍以上的加速倍率。根據 Sol Engine 的文件,其「代理原生自動優化」流程平行搜尋核心融合、稀疏注意力與快取三大技術系列的最佳參數,再透過整合器找到最佳組合,整個流程只需數小時而非數週。對於需要快速部署 H3 服務的團隊來說,這樣的效率差距非常可觀。
開源授權與後續應用
Sol-H3 以 Apache 2.0 授權發布。團隊指出,任何 MiniMax-H3 的少步驟 LoRA 模型都可以直接接入同一套引擎,不需額外調整。程式碼設計上以可部署性為目標。目前已在 Reactor 平台上提供 API,使用者可以直接透過 Reactor 使用 Sol-H3 加速的 H3 模型。
從技術路線來看,Sol-H3 與其他加速方案最大的不同在於它完整覆蓋了從核心優化、稀疏化到蒸餾的每一層。多數加速方案只著重在單一層面,例如只做蒸餾或只做注意力最佳化。Sol Engine 的「代理原生自動優化」架構平行搜尋三大技術系列的最佳參數組合,再透過整合器找到全局最優解。這個流程從模型發布到可部署的加速方案只需數小時,而非傳統的手動調校數週。對於需要快速部署 H3 服務的團隊來說,這樣的效率差距非常可觀。
結語
以 1.653 秒生成 5 秒影片,讓推理時間短於影片播完所需的時間。這個「比播放更快」的成果打開了即時影片生成的可能性,當模型能在比播放更短的時間內產出下一段內容時,連續 24 FPS 的即時生成就不再只是理論。下一步是讓這些技術整合成真正可用的互動式影片系統,Sol-H3 已經跨過了第一道門檻。從 H3 生態系這幾個月的發展速度來看,即時生成 AI 影片離實際應用比許多人預想的要近。從八月 Sol Engine 的 3.95 倍到現在 Sol-H3 的 15 倍,進步的速度相當驚人。



