中國 AI 新創 Moonshot AI(月之暗面) 在 7 月 27 日正式開源 Kimi K3 模型權重,也是有史以來第一個具備 OpenAI 與 Anthropic 第一梯隊 閉源 AI 能力的開源模型。也因此不管是有能力的大型企業或 AI 個人玩家都想試試這個擁有 2.8 兆參數的 MoE 模型是否能在本地端「自己來跑」的熱潮,而且也真的測試成功,但代價可能超出一般人想像。
X 知名 AI 玩家 @totheagi(Ning)率先展示了用 80 張 RTX 5090 執行 K3 的成果:單串流 20 tok/s,第一天未經調優。他強調這套系統完全不使用 HBM 高頻寬記憶體,只靠 GDDR7 遊戲顯示卡、普通乙太網路與官方 MXFP4 權重,就跑起了地球上最強的開源模型。
we got the full Kimi K3, 2.8T params, running on 80x RTX 5090s.
20 tok/s single stream, day one, untuned. Last week we took GLM-5.2 from 30 to 110 tok/s on this same fleet. This number will climb.
A first for open weights: frontier intelligence served with zero HBM, the… https://t.co/PPIuTCRsyT pic.twitter.com/ZqNEozTEXV
— Ning (@totheagi) July 27, 2026
不過,80 張 RTX 5090 對多數人來說顯然不是「一般硬體」。到底自己部署 Kimi K3 需要什麼等級的設備?光是「把權重載入記憶體」這一步就需要多少硬體?KV 快取和上下文又要吃掉多少顯存?接下來我們為大家整理各種部屬方案你可能要先準備好的「代價」。
權重到底多大?三種格式、三種數字
Kimi K3 的 2.8 兆參數會因為儲存格式不同,產生截然不同的檔案大小:
- MXFP4(原生發布格式):約 1.4 TB。注意力層、共享專家、dense 層與視覺塔保留較高精度,僅 MoE 路由專家以 4-bit 壓縮。這是最小的官方全品質版本
- MXFP8:約 2.8 TB。所有權重以 8-bit 儲存,檔案大小恰好等於參數量(兆)的數字,這也是許多社群討論中提到「2.8 TB 版本」的來源
- BF16/FP16 全精度:約 5.6 TB。若所有 2.8T 參數都以 16-bit 浮點儲存的理論大小
HuggingFace 上實際下載的官方權重為 96 個 safetensors 檔案,合計 1,561 GB(約 1.56 TB)。這是一個混合格式:注意力與 dense 層保留 BF16 精度,MoE 專家層以 MXFP4 壓縮。HuggingFace 討論區中有人實測 safetensors 檔案的 dtype 確認為 BF16,表示官方下載版並非純 MXFP4。
光載入權重就要多少顯存?
以 vLLM 官方部署為例,僅模型權重就需要約 1,561 GB 的 VRAM。但這還不夠,實際執行還需要額外空間:
- 模型權重:~1,561 GB
- KV 快取:依上下文長度與並發數而異。K3 的 KDA 架構讓 KV 增長速度比傳統全注意力模型慢約 29 倍。單一序列、百萬 token 上下文的 KV 快取約 14.5 GB(FP8),但並發場景下會快速累積
- 啟動緩衝與 CUDA graphs:每張 GPU 約 15 GB
- 通訊緩衝區(多節點):依網路拓撲而異
vLLM 官方估算的最低 VRAM 需求為 1,680 GB, 這只是「能載入權重並跑起來」的底線,還沒考慮高並發或長上下文場景。
KV 快取與上下文的顯存成本
K3 的 KDA(Kimi Delta Attention)混合注意力架構是顯存友善的設計:93 層中僅 24 層有 KV 快取(MLA 壓縮後約 13.5 KB/token@FP8),其餘 69 層使用固定大小的循環狀態(約 127 MB/序列,不隨上下文長度增長)。
以不同上下文長度估算 KV 快取需求(單一序列、FP8):
- 8K context:幾乎可忽略(< 0.2 GB)
- 32K context:約 0.5 GB
- 128K context:約 2 GB
- 1M context:約 14.5 GB(MLA 層)+ 127 MB(KDA 固定狀態)≈ 14.6 GB
但並發才是主要的壓力來源。每增加一個並發序列,KDA 層就多佔 127 MB 固定狀態。100 個並發用戶 = 12.7 GB 純 KDA 狀態,加上 MLA 層的 KV 快取隨上下文增長。官方多節點基測使用 –max-num-seqs 512 作為實測並發上限。
不同 GPU 硬體配置的完整顯存計算
配置 A:8× B300(192 GB/張)= 1,536 GB
這是 vLLM 官方推薦的最低單節點配置。每張 192 GB,8 張合計 1,536 GB。但 vLLM 最低需要 1,680 GB,等於還差 144 GB,8 卡單節點嚴格來說不夠。需要關閉部分功能(如跳過視覺編碼器、縮小 KV 快取池)才能勉強執行。
配置 B:16× H200(141 GB/張)= 2,256 GB
雙節點配置,每張 141 GB HBM3e,16 張合計 2,256 GB。扣除 1,561 GB 權重後,剩餘 695 GB 可用於 KV 快取與緩衝。以百萬 token 上下文、每序列約 14.6 GB 計算,約可同時維持 40-45 個長上下文序列。這是目前最常見的生產級部署方案。
配置 C:16× B200(192 GB/張)= 3,072 GB
雙節點 Blackwell 配置,合計 3,072 GB。扣除權重後剩餘 1,511 GB,可支援更高並發與更長上下文。Blackwell 架構支援 FP4 計算加速,Hopper 不支援。
配置 D:80× RTX 5090(32 GB/張)= 2,560 GB
這是開頭 @totheagi 的方案,扣除權重後剩餘 999 GB,空間充足。RTX 5090 使用 GDDR7 而非 HBM,單張記憶體頻寬約 1.8 TB/s(vs H200 的 4.8 TB/s),這是 20 tok/s 速度的主要瓶頸。
完整成本對照表
以下將「載入權重 + KV 快取 + 緩衝」的完整 VRAM 需求與硬體成本對照:
- 8× B300(1,536 GB):雲端租賃 42-78 美元/小時,月租約 3-5.6 萬美元(約台幣 97-181 萬)。VRAM 緊繃,需裁減功能才能執行
- 16× H200(2,256 GB):雲端租賃 42-158 美元/小時,月租約 3-7.3 萬美元(約台幣 97-236 萬)。生產級配置,有餘裕處理並發
- 16× B200(3,072 GB):雲端租賃價格與 H200 相近或略高。Blackwell 加速 FP4 推理
- 80× RTX 5090(2,560 GB):硬體成本約 20-25 萬美元(約台幣 648-810 萬),月電費超過 1 萬美元(約台幣 32 萬)。不需 HBM 但速度受限於 GDDR7 頻寬
- 自購 H100 叢集(18 張起):硬體成本 45-72 萬美元(約台幣 1,460-2,330 萬),加上機櫃、散熱、電力、場地
混合分載方案(消費級 GPU + 大容量 RAM):一張 24 GB 顯示卡加上 768 GB 伺服器 RAM,使用 IQ1_S 極端量化(1.63 bpw),可達到約 5-10 tok/s。需要 EPYC 或 Xeon 平台的多通道記憶體架構,一般桌機的雙通道 DDR5 完全無法負擔。
結論:直接用 API,正常人的最佳選擇
對於日均輸出不到 100 萬 token 的使用者,直接用 API 可能是最合理的選擇。Moonshot 官方 API 定價為輸入每百萬 token 3 美元(快取命中 0.30 美元),輸出每百萬 token 15 美元。中國阿里雲百煉平台也已上架 kimi-k3,輸入每百萬 token 人民幣 20 元(快取命中 2 元),輸出每百萬 token 人民幣 100 元(算起來與官方訂價幾乎一致)。
對比之下,16 張 H200 的月租費 3 至 7.3 萬美元,約等於每月 2,000 萬至 5,000 萬個輸出 token 的 API 費用。如果你的使用量低於這個門檻,不管是租或購買硬體自建的經濟效益不高。此外,自建方案還需承擔維運風險:硬體故障、驅動程式相容性、vLLM 版本迭代(官方 Docker 映像在 24 小時內就更新了三次),以及模型本身的持續最佳化,上述隱性成本在評估時往往被忽略。
Kimi K3 的開源確實降低了取得頂級 AI 能力的門檻,但「開源」和「一般硬體跑得動」之間仍有巨大的落差。光是載入權重就需要 1.56 TB 的 VRAM 或 RAM,加上 KV 快取與推理緩衝,vLLM 的最低門檻是 1,680 GB。@totheagi 用 80 張 RTX 5090 證明了不依賴 HBM 也能執行 K3,但這套配置的總成本仍在台幣 500 萬以上,加上每月數十萬的電費與場地成本。
對多數開發者與小型團隊而言,混合分載方案或等待社區量化方案成熟是較務實的路徑。而如果只是想體驗 K3 的能力,直接使用 API 的成本效益遠高於自建硬體。




