開源界最多人使用的中國阿里巴巴 Qwen 千問模型團隊繼旗下最強 2.4T 參數規模的 Qwen3.8 Max 模型開放權重後,在台灣時間 8 月 14 日晚間,官方繼續釋出最多開發者使用的原生多模態 27B 參數密集模型 Qwen3.8-27B。幾乎同一時間,以量化與本地推理工具聞名的 Unsloth AI 也宣布推出能在本地跑的 4 位元量化版 Qwen3.8-27B,只要 17GB 記憶體的消費級顯卡就能在本地運行。
Qwen3.8-27B:原生多模態的密集模型
Qwen3.8-27B 根據官方說明,是一個原生多模態密集模型,整合視覺與文字能力,原生支援 262,144 tokens(256K)的上下文長度,並可透過 YaRN 延伸至 100 萬 tokens。在定位上,Qwen 團隊將 Qwen3.8 家族與前一代 Qwen3.5 連結:延續 Gated Delta Networks 與稀疏 MoE 的混合架構思路,但在訓練資料與強化學習規模上加大投入,並把視覺語言融合做成早期融合訓練,讓模型在編程、代理工作流與文件理解等場景更貼近實際使用。在能力部分,官方公佈的成績大幅超越體量比自己大很多的前代 Qwen 3.7-Plus,部分成績甚至超越 Opus 4.6 MAX,相當驚人:
Agent 能力表現相當優異,幾乎全面領先 Opus 4.6 MAX:
Qwen3.8 家族採用 Apache 2.0 授權,代表商業應用、二次發布與整合進產品都不需要額外申請,對於要把模型包進內部工具鏈的團隊來說,授權風險比自訂條款低得多。
硬體需求:從 11GB 到 56GB 的分級
Qwen3.8-27B 的量化版本依記憶體總量區分:
- 11 至 13GB:最低可跑的極限量化區間,適合輕量測試
- 13 至 16GB:入門可用區間,完成度與速度開始穩定
- 17 至 19GB:4 位元量化的甜蜜點,RTX 5080、RTX 4090 或 24GB Mac 均落在此帶
- 24GB、31GB、56GB:更高精度量化對應的記憶體需求,準確度與長脈絡穩定度更佳
對照 Hugging Face 上的檔案清單,Unsloth 一次提供超過 20 種 GGUF 變體,涵蓋 Q4_K_M、Q5_K_M、Q6_K、Q8_0、IQ4_XS、UD-Q4_K_XL、UD-Q8_K_XL 等,並額外提供 mmproj 視覺投影檔,代表多模態能力可直接在本地啟用。BF16 完整精度則以兩個分片提供,總計約 16.3GB,量化的 Q4_0 與 Q4_K_M 體量更小。換句話說,17GB 不是單一魔術數字,而是量化選項與快取配置共同決定的結果。
Qwen3.8-27B Hugging Face
至於家族中的巨型模型 Qwen3.8-2.4T-A95B,門檻完全不同。指南標示即使使用新 1 位元量化,仍需 397GB、508GB、657GB、2.6TB 到 4.9TB 五級,完整精度需要 4.9TB 儲存空間(本地端應該無人能部屬)。
Unsloth 的 17GB 是怎麼來的:Dynamic GGUF V3.0 與 NVFP4
而給一般人使用的 Unsloth 量化版 Qwen3.8 的 GGUF 採用 Unsloth Dynamic V3.0 預覽版,在量化後仍維持領先的準確度表現,並加入對代理工具的支援。
- Dynamic GGUF V3.0:Unsloth 針對 Qwen3.8 調校的量化格式,主打在較低位元下保留更多細節。官方同時在指南中提到,Qwen3.8-27B 的量化版本支援 Developer 角色與改良的工具呼叫解析,能更穩定處理巢狀物件,讓代理框架呼叫工具的成功率提高。
- NVFP4:與 GGUF 並列提供,面向 NVIDIA GPU 生態的 4 位元浮點量化。Unsloth 同步把兩種格式上架,讓使用者可依推理後端選擇:llama.cpp 走 GGUF,TensorRT-LLM 或 vLLM 相關堆疊走 NVFP4。
- 1 位元家族:為了讓 2.4 兆參數的巨型模型也能被討論,Unsloth 延伸了 llama.cpp 的 IQ1_S 架構,從 1.5625 bits 每權重一路壓到 1.1875 bits。官方表格列出 UD-IQ1_XXS 與 UD-IQ1_XXXS 等新型別,其中 397GB 的 Q1_0 版本被定為 2.4T 模型的推薦量化,體積比原始 4.9TB 小 91%。
Unsloth 創辦人 Daniel Han 稍早在 LocalLLaMA 社群驗證過 17GB 的估算,其計算基礎是模型權重本身約 17GB,另加約 2GB 的 KV 快取,以 4 位元、8192 脈絡為假設。這與文件標示的 17 至 19GB 區間一致,差異主要來自脈絡長度與快取設定。
Unsloth 量化版 Qwen3.8 27b
怎麼跑起來:Unsloth Desktop 與 llama.cpp 兩條路
官方把本地執行的路徑收斂成兩條,涵蓋有圖形介面與純命令列的使用者:
- Unsloth Desktop:開源的本地 AI 介面,支援 macOS、Windows 與 Linux,整合 MLX 與 llama.cpp,可在圖形介面中搜尋、下載與執行 GGUF 與 safetensors 模型,並自動處理 RAM 與 VRAM 的分流,偵測多 GPU 配置。安裝方式提供下載安裝檔與一行指令兩種,macOS 與 Linux 執行
curl -fsSL https://unsloth.ai/install.sh | sh,Windows 則以 PowerShell 執行對應腳本。這是目前最短的路徑,在介面中搜尋 Qwen3.8 即可選擇量化版本下載並推理。 - llama.cpp:適合要自行編譯與整合進後端的使用者。指南提供編譯指令,Linux 環境以 cmake 建置,並區分是否啟用 CUDA。若只使用標準 IQ1_S 等常見量化,可直接用一般版 llama.cpp 編譯;若要使用 Unsloth 延伸的 1.1875 至 1.5625 bits 新型別,則需切到
iq1-narrow分支並建置 llama-cli、llama-server 等工具。 - Hugging Face 直接取用:Qwen 官方權重位於 Qwen/Qwen3.8-27B,Unsloth 量化位於 unsloth/Qwen3.8-27B-GGUF,阿里雲用戶也可透過 ModelScope 鏡像取得。
文件也提到效能預期:在 B200 等資料中心卡上可達到約 20 tokens 每秒的生成速度與超過 120 tokens 每秒的吞吐,經驗法則是 RAM 與 VRAM 總和約等於量化檔案大小時最順暢,否則會因磁碟分頁而變慢。這與本地使用者關心的問題一致:顯卡記憶體不是唯一指標,統一記憶體與系統記憶體能否補上,同樣影響體驗。
我個人也測試過在我的 RTX-5090 Laptop 24GB 電競筆電上,加上 MTP 可以有 5X t/s 的表現,如果不掛識圖模型的話還可以開到 128K上下文流暢運行 Hermes跑複雜任務,是目前最好的本地端模型表現之一,有資料敏感考量的朋友可以自己測試看看:



