就在前幾天 DeepSeek 在 9 月 10 日以 MIT 授權開源了旗下最新、最強大的 DeepSeek V4.1 Flash 模型,這是一顆 5,520 億參數(552B,不含 Engram模型)的混合專家模型,有效參數最少只要 8B 就能跑,官方還拿它來取代自家原本的旗艦 V4-Pro。不過這個超大規模的模型上線才一天,X 上就有開發者把這顆 552B 的模型塞進一台 16GB 記憶體的 M1 Mac mini,而且真的「跑起來了」。
不過雖然能「跑」但不保證跑的速度,作者 FP4 Brain(帳號名直接致敬 FP4 四位元浮點格式,跟這件事很搭)表示,他用原始 FP4/FP8 權重、SSD 串流加上自製的 MLX runner,的確成功在 16GB 的小電腦上載入 DeepSeek V4.1 Flash 這顆模型,不過代價是:第一次吐出 token 要等 108 秒,之後平均「每生成一個字」要 23 秒,原文還特別括號註明「別跟 tok/s (每秒產生 Token 數)搞混」。
got deepseek V4.1 flash running locally on a 16GB m1 mac mini
original FP4/FP8 weights, ssd streaming + custom mlx runner
108s ttft and about 23s/token (not to be confused with tok/s) pic.twitter.com/sOq3wB2XWM
— FP4 Brain (@thefp4brain) September 11, 2026
他附上的影片畫面把荒謬感拉到滿:Mac mini M1(8 核 CPU、8 核 GPU)、16GB RAM、1TB SSD,checkpoint 大小 475 GiB,權重快取卻只有 4 GiB。 整顆模型比記憶體大了將近 30 倍,根本裝不進去,所以只能靠 SSD 串流把權重一層一層搬進搬出,每算一層就讀一次硬碟。儀表板自己也寫得很老實:讀取量包含作業系統快取,權重端的 MLX 尖峰用量並不代表整台機器的記憶體佔用;畫面下方還標著「checkpoint bytes requested」的累計邏輯讀取量,以及「4 GiB 權重快取加編譯好的解碼」,全都是這顆模型「邊讀邊算」硬撐下來的證據。
got deepseek V4.1 flash running locally on a 16GB m1 mac mini
original FP4/FP8 weights, ssd streaming + custom mlx runner
108s ttft and about 23s/token (not to be confused with tok/s) pic.twitter.com/sOq3wB2XWM
— FP4 Brain (@thefp4brain) September 11, 2026
影片裡跑的是 prefill 階段,40 層的模型停在「Layer 00 / 40」動也不動,而它被問的問題是:「explain what is navier stokes」(解釋什麼是 Navier-Stokes 方程式)。 原速實在太折磨人,作者把影片開成 12 倍速重播。留言區馬上有人抓到重點:「我本來想說,哎,好像勉強能用,然後才發現影片是加速的」。
16 分鐘,換來一句話
實測同一台機器、同一個問題,跑了 16 分 21 秒,首字等了 127.9 秒,平均 30.7 秒/token,全程從 SSD 讀了 373.3 GiB 的資料,最後吐出 28 個 token 的答案:「The Navier-Stokes equations are a set of partial differential equations that describe how fluids (liquids and gases) move.」
為了生出一句流體力學的定義,這台機器燒掉了將近八成的 checkpoint 讀取量(373.3 GiB 對上 475 GiB),平均每吐一個字,硬碟要搬家 13.3 GiB。同樣的問題丟給 DeepSeek 官方 API,離峰時段輸入只要 0.15 美元(約新台幣 5 元)每百萬 token,輸出 0.60 美元,尖峰翻倍,回答大概幾秒內就出來。在家裡跑的本體則是:按下 Enter 之後去煮咖啡,回來剛好看到第一個字慢慢浮出來。作者自己也在留言區承認,一整句話大概要 16 分鐘。換算下來每分鐘大約 2.6 個字,要湊一篇 500 字短文得等三個多小時。有趣的是,貼文文字寫的是 108 秒首字、23 秒/字,但同一套設定的截圖實測是 127.9 秒、30.7 秒/字,連「跑得快」這件事都很隨緣。
留言區:這叫 running?比較像 crawling
這則貼文累積超過 1,200 個讚、65 則留言,社群反應大致分成兩派,兩派都很有梗。嘲諷派:「這叫 running?比較像 crawling(爬行)」「108 秒的思考,結果只說出你問題裡那個名詞的名字」、「你可以先去睡,答案早上會放在那邊等你」「而且還輸給 Qwen3.8-flash-next」。也有人認真發問:SSD 串流權重是一回事,KV 快取到底能載入多長?作者的回覆很誠實:「你願意等這個測試嗎?」
溫馨派的角度其實也通:「我還是要說這是進步,衝啊」「你終究是把它跑起來了,這很了不起」、「總比什麼都沒有強」。兩派人說的是同一件事:在 16GB 記憶體的機器上載入 475 GiB 的模型,本身就是一種用時間換空間的技術浪漫。
模型本尊:552B、MIT 授權、打七折的價格戰
笑歸笑,至少是讓這顆這顆模型在沒有量化的情況下真的在一般主機的本地端跑起來(雖然實用度近乎0)。V4.1-Flash 是 DeepSeek 目前的新架構家族裡最小的成員,552B 參數、MIT 授權、100 萬 token 上下文、原生支援影像輸入;它採用因果編碼器解碼器設計,20 層編碼器加 20 層解碼器,解碼器的全域 KV 快取直接從編碼器最後一層的隱藏狀態投影出來,不必一層一層重算。 KV 快取本身壓到 4-bit,每個 token 只佔 890 bytes,約是上一代 V4-Flash 的四分之一,SSD 持久快取更只剩八分之一。強大到官方將先前實驗性的視覺模型與 V4-Flash 都正式退役,呼叫全部導向 V4.1-Flash。
官方成績單也很嗆:Terminal-Bench 2.1 拿 90.6,贏過 Claude Opus 5 的 89.1 與 GPT-5.6 Sol 的 88.8,DeepSWE v1.1 解題率 74.2%。基礎版本 Bench 也小幅領先:MMLU-Pro 74.1、HumanEval 79.4、GSM8K 93.0,都略高於 V4-Pro-Base。 輸出定價從 3.96 美元(約新台幣 129 元)砍到 1.20 美元(約新台幣 39 元),降幅約七成。
官方 API 的 beta 時程其實很趕:9 月 8 日上線、9 月 10 日就下線,測試窗口只有兩天,接著馬上開源權重。對在本地端跑 AI 的玩家來說,權重開源的那一刻比賽才正式開始。依社群估算,這顆模型官方 4-bit 版本合計約 510 GB,連兩台 DGX Spark(256GB 記憶體)都裝不下,只能靠量化與串流硬擠。目前已經有人丟出 MixedQ2 GGUF、MLX 2-bit、MLX 4/8-bit 等極端量化版本,把門檻一點一點往下壓。
結語
雖然說這位作者展示出的結果相當荒謬,但多數人還是允以肯定,因為大家都看得出:這台 Mac mini 跑起來雖然慢到可以拍成 12 倍速影片,它確實在用原始權重、不做任何再量化,跑動一顆 552B 的開源模型。16 分鐘換一句 Navier-Stokes 定義聽起來很荒謬,這卻是本地 AI 從「跑不動」到「跑得動」之間的必經之路。下次想問它問題,記得先把咖啡煮好。




