自從 MiniMax H3 這個當前最強的開源 AI 影片生成模型推出之後,專業的 AI 影片生成任務終於有機會從雲端走向本地端,也因此本地端硬體的選擇也變成一門相當重要的學問。近日國外一位 YouTuber 測試在本地端用 LTX 2.5 與 MiniMax H3 兩款開源影片生成模型,分別以 Apple M5 Max(搭載 MLX 框架)、NVIDIA RTX 4090 與 RTX 5090 進行了全面的生成速度與品質對比。結果出乎許多人意料:M5 Max 在速度上被 RTX 5090 拉開將近 4 倍的差距,但在某些方面,Apple 的表現卻有自己的獨到之處。
本地端開源 AI 影片生成模型:LTX2.5 與 MiniMax H3
首先為大家簡單介紹一下這次測試的兩個本地端開源 AI 影片生成模型:Lightricks 推出的 LTX 2.5 是開源的 DiT 架構影片模型,支援原生 4K 與 50fps 輸出;而中國 AI 公司 MiniMax 在 2026 年 7 月底發表的 H3 模型,則主打 2K 解析度、最長 15 秒的影片生成,還內建立體聲音訊。這兩款模型都是可以在本地端消費級硬體上運行的開源 AI 影片生成模型,以品質、速度和討論度來說,目前是 MiniMax H3 最受歡迎。
測試平台與硬體規格
影片作者使用了三套平台進行測試。Apple 陣營是 16 吋 MacBook Pro 搭載 M5 Max 晶片,透過 Apple 自家的 MLX 機器學習框架執行模型,統一記憶體容量為 48GB。NVIDIA 陣營則分別是 RTX 4090(16GB VRAM;Aorus 17x )和 RTX 5090(24GB VRAM; Lenovo Legion 7i)的電競筆電配置。
M5 Max 是 Apple 在 2026 年推出的旗艦晶片,採用 Fusion Architecture 雙晶粒封裝設計,兩顆 3nm die 透過 TSMC SoIC-mH 2.5D 封裝技術結合,共享統一記憶體池。根據 Skorppio 的分析,M5 Max 的 GPU 首次內建了專用矩陣乘法硬體(Neural Accelerator),40 核 GPU 可提供約 70 TFLOPS 的 FP16 運算能力,記憶體頻寬達 614 GB/s。相較之下,RTX 5090 擁有約 380 TFLOPS FP16 運算力和 1,792 GB/s 的記憶體頻寬,純粹的算力優勢超過 5 倍,記憶體頻寬也有一倍以上的優勢。
硬體規格的差距在影片生成這類重運算任務上會被放大。AI 影片生成不同於 LLM 文字推理,它需要大量的張量運算來處理每一幀畫面的像素預測,記憶體頻寬和計算吞吐量直接決定了生成速度。M5 Max 的 128GB 統一記憶體在大模型推理上有優勢,但影片生成模型通常不會超過 32GB,這讓 NVIDIA 的高頻寬 VRAM 反而更佔上風。
LTX 2.5 生成速度對比
在 LTX 2.5 模型的標準測試中,差距非常明顯。以一個 5 秒影片片段為例:M5 Max 花了 164 秒,RTX 4090 花了約 90 秒,而 RTX 5090 僅需 57 秒,5090 的速度是 M5 Max 的將近 3 倍。
影片中進行了多項測試,包括方向測試(orientation test):M5 Max 耗時 215 秒,4090 耗時 168 秒,5090 僅需 65 秒。作者直言「這差距太誇張了」(That’s crazy)。
不過當影片長度拉長到 10 秒時,差距有所縮小。M5 Max 耗時 169 秒,4090 耗時 153 秒,兩者已經接近。作者解釋,這是因為較長的影片需要更多記憶體,M5 Max 的 48GB 統一記憶體在這種情境下開始發揮作用,而 4090 僅有 16GB VRAM,超出時必須將資料上傳到僅 32GB 的系統記憶體,速度會大幅下降。
解析度測試(由 512P 改為 896P)也呈現類似趨勢,較高解析度同樣需要更多記憶體,M5 Max 與 4090 之間的差距進一步縮小,但 5090 憑藉 24GB VRAM 和更高的頻寬依然大幅領先。
這些數據清楚呈現了一個規律:當模型和資料量可以完全塞進 VRAM 時,NVIDIA 的高頻寬優勢會轉化為巨大的速度差距。但當任務需要更多記憶體時,M5 Max 的統一記憶體架構就成了緩衝。這與大型語言模型推理的「VRAM 懸崖」現象類似,只不過影片生成的記憶體需求通常在 24GB 以內,M5 Max 的 128GB 統一記憶體優勢很難完全發揮。
MiniMax H3 模型與音訊品質
換到 MiniMax H3 模型後,結果更加有趣。H3 是 MiniMax 在 2026 年 7 月底推出的通用多模態生成模型,能生成最長 15 秒的 2K 影片,還支援原生立體聲音訊。影片作者指出,如果給予足夠的推理步數(steps),H3 的畫質可以勝過 LTX 2.5,但預設步數下的表現則不穩定。(編按,其實主要還是看怎麼搭配與設定)
在音訊生成測試中,M5 Max 產生的聲音品質「顯著且明顯地更好」(substantially noticeably better),RTX 平台生成的聲音則顯得「單薄」(tinny),像是需要更多處理時間。更令人意外的是,在 H3 的音訊生成速度上,M5 Max 甚至略微快過 RTX 4090,作者對此也感到驚訝。
影片還測試了口型同步(lip syncing)功能。LTX 2.5 在三平台上都能產生不錯的口型同步效果,5090 僅花 55 秒就完成一段 5 秒的口型同步影片。H3 模型的口型同步品質則不如 LTX 2.5 穩定,作者認為是步數不足所致。
在參考圖像生成測試中(使用 2 張或 4 張參考圖),三平台的輸出風格有明顯差異。M5 Max 的 MLX 模型傾向產生與 NVIDIA 平台不同的構圖,作者表示「我幾乎更喜歡 M5 的構圖」,但細節部分偶爾會出現「液化」或「模糊」的問題。
音訊品質的差異可能與 MLX 框架對 H3 音訊模組的實作有關,Apple 的統一記憶體架構在處理音訊這種較輕量的運算時或許有更好的延遲表現。而構圖風格的不同,則反映了 MLX 與 CUDA 在數值精度和運算路徑上的細微差異,即使使用相同的模型權重,浮點運算的順序和精度處理方式不同,最終生成的畫面就會有差別。
想看這三款硬體的影片生成效果的話,大家可以直接看下面的影片,我由測試那邊直接開始播放:
本地端 AI 影片生成的現實與理想
影片最後,作者表達了他的核心目標:擺脫對線上訂閱服務(如 Kling 等雲端影片生成平台)的依賴,完全在本地端完成創作。他坦言 H3 目前是最接近 Kling 品質水準的本地端方案,但「還沒有完全達到」。
從產業角度來看,本地端 AI 影片生成的門檻正在快速降低。LTX 2.5 的官方文件指出,本地執行需要 CUDA 13.2 以上和至少 32GB VRAM 的 NVIDIA GPU。而 MiniMax H3 已在 Hugging Face 上以開權重釋出,任何人都可以下載執行,目前社群甚至已經有 8GB VRAM 也能用的方案。
對於不同硬體的選擇建議,影片的數據給出了明確的訊號:如果追求速度,RTX 5090 是目前消費級硬體中速度最快的選擇;如果預算有限,RTX 4090 的 16GB VRAM 在大多數 5 秒影片生成任務上仍然夠用;而 M5 Max 則適合那些已經擁有 MacBook Pro、偶爾需要本地端生成、同時重視大模型推理能力的使用者(編按:這部影片的比較都是筆電設備,桌機版的表現理論上 NVIDIA 會比測試結果更好,而 MacBook 的這組 M5 Max 也不能代表 M5 Ultra 的表現)。
這場比較中 M5 Max 的劣勢主要來自影片生成的特殊需求,它需要極高的記憶體頻寬來處理每一幀的像素運算,而這恰好是 NVIDIA GPU 的強項。在大型語言模型推理等其他 AI 任務中,M5 Max 的統一記憶體架構反而可能是決定性的優勢,硬體選擇取決於你最常做的任務類型。









