月之暗面(Moonshot AI)這幾天正式開源 Kimi K3 模型權重與技術報告,這款擁有 2.8 兆參數的混合專家(MoE)SOTA 開源模型立即成為 AI 領域人人想要自行安裝架設的夢幻逸品。然而,原生權重檔案高達 1.6TB,官方建議使用 64 張以上加速器組成的超節點配置進行推理,硬體門檻動輒數千萬台幣(我們也有相關分析),讓絕大多數「一般」的開發者與企業只能望而卻步。不過,去中心化基礎設施新創 Pipe Network 與知名開源量化團隊 Unsloth AI 都發布了自己的移植量化版本,透過自研的技術將模型從 1.6TB 壓縮至 350GB~594GB,讓一台配備 512GB 統一記憶體的 Mac Studio M3 Ultra 理論上可以載入並執行這款巨型模型。

Kimi K3:史上最大開源模型的技術底細
月之暗面迄今最強的 Kimi K3,參數規模約為前代 K2.5 的 3 倍。模型採用 MoE 架構,內部設有 896 個路由專家(routed experts),每次處理一個 token 時只啟動其中 16 個加上 2 個共享專家,實際運作參數約 1,000 億左右。這種設計讓模型在保持龐大知識容量的同時,將單次推理的運算量控制在合理範圍。
在基準測試方面,Kimi K3 在 Artificial Analysis Intelligence Index 上獲得 57.11 分,排名第四,落後 Claude Fable 5(59.86)與 GPT-5.6 Sol(約 59),但超越 Claude Opus 4.8 等模型。在前端程式碼競技場(Frontend Code Arena)中,K3 更擊敗了 Claude Fable 5,展現出強勁的程式碼生成能力。
Pipe Network 的作法:從 896 個專家砍到 179 個,將 1.5 TB 壓縮到 350 GB
Pipe Network 由 David Rhodus 創辦,原本是一家去中心化 CDN 基礎設施公司,這次的 Kimi K3 MLX 移植是該團隊從 CDN 轉向 AI 基礎設施的標誌性作品。他們整個移植包含三個核心技術環節。第一是串流轉換器(streaming converter):由於 K3 的 BF16 全精度表示約佔 5.6TB,遠超任何單機記憶體,轉換器以逐層方式處理模型,不需要一次將完整模型載入記憶體。第二是 REAP 剪枝(REAP expert pruning):對 K3 的 896 個路由專家進行評分,根據校準語料庫保留與目標工作負載最相關的專家,其餘刪除。第三是 MXFP4 編碼保留:K3 的路由專家已採用月之暗面的 MXFP4 編碼,MLX 可以直接保留這種編碼格式,無需再進行一次有損量化。
Pipe Network 上傳了三個剪枝版本到 Hugging Face。最小的版本保留 179 個路由專家(80% 剪枝率),壓縮後約 350GB,可載入 512GB 記憶體的 Mac Studio。另外兩個 451GB 版本分別保留 242 個專家,其中一個針對中文和程式碼場景做了校準最佳化。
速度是最大瓶頸:每 5 秒一個 token
不過能載入跟能順跑沒什麼關係,Pipe Network 在 Hugging Face 上公布的測試資料顯示,350GB 版本在 512GB M3 Ultra Mac Studio 上載入時間約 66 秒,生成速度約每秒 0.16 個 token。451GB 版本更慢,約每秒 0.14 個 token。Pipe Network 自己在 GitHub 文件中將三個剪枝版本描述為「非互動式」(non-interactive),意思是這個速度完全無法進行即時對話。Pipe Network 自己公布的測試資料顯示,最快版本的生成速度僅約每秒 0.20 個 token,相當於每 5 秒才產出一個字,加上剪枝造成的品質退化,這個移植距離實用工具還有很長距離,頂多算技術展示。
對比之下,未剪枝的 K3 模型在 64 張 H100 GPU 叢集上的推理速度可達數十個 token 每秒,而前代 K2 系列在 Mac Studio 上透過 MLX 執行時也能達到 23 tokens/sec 的生成速度。0.20 tokens/sec 意味著生成一段 200 字的回應需要將近 17 分鐘,這在任何實際應用場景中都難以接受。
不只超慢,回覆品質也不行:砍掉 80% 專家的代價
REAP 剪枝帶來的品質退化不容忽視。Pipe Network 文件中坦承,剪枝後的模型會出現清單式重複輸出、回應偏離原始提示詞(prompt)、以及整體語言能力下降等問題。雖然程式碼補全在結構上仍保持連貫,但通用語言任務的表現明顯受損。
原因是,K3 的 896 個路由專家各自負責不同領域的知識,每次推理只啟動 16 個,但路由專家的組合是根據輸入動態選擇的。當 80% 的專家被移除後,模型在許多領域的知識直接缺失,路由機制也失去了大部分選擇空間。這就像把一座擁有 896 個專科醫師的醫院砍到只剩 179 位,雖然核心科室還在,但遇到罕見疾病時就束手無策了。
此外,即使 Mac Studio 能裝下模型權重,長上下文場景下的 KV cache 需求會進一步壓縮可用記憶體。一篇分析文章指出,2,000 token 的提示詞或許能運作,但到了 32,000 token 就可能因為記憶體不足而失敗,而 K3 最大支援 100 萬 token 的上下文視窗。
Unsloth AI: 1-bit 極限量化,保留約 78.9% 原始能力
另一條路線來自知名開源量化團隊 Unsloth AI。他們採用自研的 Dynamic 量化技術,將 K3 從 1.56TB 壓縮至 594GB(減少 62%),但保留約 78.9% 的原始 top-1 準確率,perplexity 為 2.58(原始模型為 1.46)。與 Pipe Network 的剪枝方案不同,Unsloth 的做法保留了全部 896 個路由專家,只是將每個專家的權重精度壓到 1-bit。模型知識完整性遠高於剪枝版本,但代價是壓縮比不如剪枝極端,問題是 594GB 的檔案仍需要 512GB 以上的記憶體才能載入,所以單一台 512GB 的 M3 Ultra 也是無法載入,需要至少「Mac Studio + 128GB RAM device」,就是兩台以上的 Mac 跑 EXO。
Kimi K3 can now be run locally! ✨
The 1-bit model retains ~78.9% accuracy after we shrunk it from 1.56TB to 594GB (-62% size).
Run on a Mac Studio + 128GB RAM device.
Kimi K3 is the strongest open model to date.
Guide: https://t.co/1mVwOMLpDW
GGUF: https://t.co/bt1c1ADdCZ https://t.co/yFJ5TTeNz5 pic.twitter.com/rdvVlDIitX— Unsloth AI (@UnslothAI) July 29, 2026
Unsloth 同時發布了多種精度的 GGUF 版本:Dynamic 2-bit XXS 版本保留 81.2% 準確率,2-bit XL 版本達 84.1%(約 861GB),而接近無損的 Q8 版本則達 90.4%(1.56TB),而 Unsloth 實測的結果表現相當可用(主要因為 K3 本體太過優秀),此外 Unsloth 的量化品質也遠優於其他社群版本,同樣是 Hugging Face 上的社群 IQ1_M 量化,檔案 618.9GB 比 Unsloth 的 594GB 更大,perplexity 卻暴增到 54.56,品質差距達 21 倍。
Unsloth 1-bit 量化版 Kimi K3 官網
在 X 平台上,網友測試後表示 1-bit 版本「仍然可以一次完成高難度的創意任務,工具呼叫也相當可靠」。也有人測試在 4 張 NVIDIA B200 GPU 上測試 1-bit 版本達到了每秒 36 個 token 的生成速度,遠優於 Pipe Network 在 Mac Studio 上的 0.20 tokens/sec。
目前這幾種本地端部屬 Kimi K3 的方案各有明顯取捨:Pipe Network 的 REAP 剪枝把模型壓到 350GB 可以塞進 512GB Mac Studio,但犧牲 80% 專家導致品質明顯退化且速度僅 0.20 tokens/sec(應該最不推薦);Unsloth 的 1-bit 量化保留全部專家和較高準確率,但 594GB 檔案對記憶體要求更高,需要多台才能搞定(雖貴,但成本最低);一樣的 1-bit 量化在 GPU 叢集上(如 4 張 B200),Unsloth 版本 可以達到 36 tokens/sec 的實用速度,但那又回到了資料中心級別的硬體需求。無論哪種方案,在消費級硬體上跑 K3 目前都還處於「技術探索」而非「生產力工具」的階段,至少對一般人來說門檻還是高到不現實。
硬體門檻的現實:GPU 部署要價近兩千萬
回到原生 K3 的部署需求。月之暗面官方技術文件建議使用 64 張或以上加速器,原生 MXFP4 權重約 1.4TB 至 1.5TB。以 H100(80GB)計算,單純放置權重就需要約 19 張,實際執行還需額外的 KV cache 空間。64 張 H100 的硬體採購費用超過 240 萬美元(約台幣 7,800 萬),加上伺服器、網路與電力基礎設施,總成本輕鬆突破千萬美元等級。
權重放出來了,但誰能跑?
Kimi K3 的開源引發了一個根本性的討論:當一個模型大到只有資料中心級別的硬體才能執行時,「開源」的意義是什麼?DeepSeek R1 671B 的 Q4 量化版本約 350GB 至 400GB,一台 512GB Mac Studio 勉強能運作;K3 的原生權重是 DeepSeek R1 的 3 至 4 倍,直接將門檻推回資料中心級別。
不過,開源的價值不僅僅在於本地執行,開發者除了可以月之暗面的官方 API 使用 K3以外,也能透過租用 GPU、在特定硬體跑量化過的模型,對於有隱私安全考量資料不能上網的中小企業或財力雄厚的開發者而言至少是「有選擇的」。至於一般人,還是老老實實的找便宜 API 或 Coding Plan 比較實際,因為回本的難度實在太高了。



