前幾日阿里巴巴最新開源模型 Qwen3.8 家族正式登場,AMD 也同步宣布提供 Day 0 全線支援,涵蓋消費端與資料中心兩大產品線。開發者可在搭載 Ryzen AI Max 處理器的系統與 Radeon AI PRO R9700 顯示卡上本地執行 27B 密集版本,也能在 Instinct MI300X、MI325X 與 MI355X GPU 上透過 ROCm 平台立即部署與評測完整 MoE 版本。
Qwen3.8 系列是通義千問團隊首次將 Qwen-Max 等級能力帶入開源發布的世代,在程式編寫、專業工作、研究與長程代理任務上均有強化,官方也提供可調節的思考控制能力,讓模型能在複雜多步驟任務中保持較高完成度。Hugging Face 上已同步上架 Qwen3.8-27B 密集模型與 Qwen3.8-2.4T-A95B 大型 MoE 模型,供開發者直接下載與整合。
本地端即時可用:Ryzen AI Max 與 Radeon AI PRO R9700 支援 Qwen3.8 27B
針對個人電腦與工作站情境,AMD 在 8 月 14 日發布的部落格文章中說明,已為 Qwen3.8 27B 提供 Day 0 支援。這個 27B 版本屬於密集架構,模型體積與記憶體需求落在適合本地開發的範圍,開發者可直接在搭載 Ryzen AI Max+ 處理器的系統或單張 Radeon AI PRO R9700 32GB 顯示卡上執行,無需依賴雲端資源。
官方指出,Qwen3.8 27B 同樣可在具備超過 24GB 可變顯示記憶體或 VRAM 的支援硬體上執行,涵蓋部分較早世代但記憶體容量足夠的 AMD 平台。相關支援在模型發布時即已上線,並相容於廣泛使用的開源工具組合。
- Ryzen AI Max+ 395:早期測試在 Windows 環境下,透過 llama.cpp 搭配 Vulkan 後端、MTP=4 設定,平均生成吞吐最高可達每秒 24.5 個 token
- 單張 Radeon AI PRO R9700:相同測試條件下採 MTP=2,最高可達每秒 51.8 個 token
- 測試條件:數據為 llama.cpp 在 Windows 上的平均 token 生成吞吐,取三次以上執行的平均值,AMD 表示隨著軟體與模型持續最佳化,效能仍有提升空間
作為密集模型,Qwen3.8 27B 對記憶體容量與運算能力的要求較高,也因此凸顯本地硬體能力的重要性。AMD 在文章中強調,愈來愈強大的 AI 模型正在加速普及到本地 PC 與工作站,能在開發者日常使用的同一台機器上完成建構、測試與實際應用,有助於縮短從模型發布到實際導入的準備時間。
一鍵啟用的本地體驗:llama.cpp、LM Studio 與 Lemonade
在工具鏈方面,AMD 為 Qwen3.8 27B 準備了多層次的本地執行路徑。對於熟悉開源推理框架的開發者,可直接透過 llama.cpp 在 Ryzen AI Max 與 Radeon 硬體上載入模型;對於希望快速體驗的進階使用者,LM Studio 提供圖形化介面,可在支援的 AMD 系統上完成模型探索、下載與對話測試,無需撰寫程式碼。
官方說明,LM Studio 已支援在 Ryzen AI Max+ 系統與 Radeon AI PRO R9700 32GB 上使用 Qwen3.8 27B,模型約需 24GB 的可變顯示記憶體或 VRAM 才能順暢執行,也可在其他受支援的 AMD 平台上運作。這個路徑被定位為從下載到推理的最短路徑,適合用於提示詞與工作流程的初步驗證。
對於要將本地 AI 整合進應用程式的開發者,AMD 提供的 Lemonade 則扮演輕量本地推理層的角色。Lemonade 可與應用程式一同封裝,讓應用程式透過熟悉的 API 形式與 Qwen3.8 27B 溝通,由 Lemonade 處理底層的 AMD 平台整合,開發者無需自行維護硬體相關的推理堆疊。官方將三者的分工描述為:Ryzen AI Max 與 Radeon 提供本地算力基礎,LM Studio 提供快速體驗入口,Lemonade 則提供通往應用程式化的整合路徑。
資料中心即時部署:Instinct MI300X、MI325X、MI355X 支援完整 Qwen 3.8 家族
在資料中心端,AMD 於 8 月 12 日發布的技術文章宣布,Instinct MI300X、MI325X 與 MI355X GPU 已提供對 Qwen 3.8 模型家族的 Day-0 支援,開發者可透過 AMD ROCm 開放軟體平台,結合 SGLang 與 vLLM 立即部署與評測。文章列出的核心特色包含跨 Instinct GPU 的 Day-0 支援、經最佳化的 ROCm 啟用,以及對 SGLang、vLLM 與 ATOM 的就緒狀態,並提供效能參考與快速啟動指引。
在部署方式上,官方提供多種精度與框架組合。vLLM 路徑提供 FP8 與 MXFP4 兩種檢查點的部署範例,包含對應的 Docker 映像檔與啟動參數;在 SGLang 路徑則區分 MI355X 與 MI300X 的建議配置,例如在 MI355X 上使用 AITER 注意力後端並啟用統一注意力與 FlyDSL,以發揮新硬體的推理能力。ATOM 路徑亦提供 MXFP4 的部署流程。
- FP8 檢查點:Qwen/Qwen3.8-2.4T-A95B-FP8,適用於 vLLM 與 SGLang 的多節點部署範例
- MXFP4 檢查點:Qwen3.8-2.4T-A95B-Quark-MXFP4,由 AMD Quark 量化工具鏈自 FP8 轉換而來,選擇性將 MoE 路由專家量化至 MXFP4,其餘層保持 BF16,採逐分片處理流程以避免一次載入完整模型
- 平行化配置:官方範例包含單節點 TP8 與雙節點 TP8、PP2 等組合,並提供對應的 serve 指令、主機與連接埠設定
Qwen 3.8 架構更新:512 個專家、92 層與混合注意力設計
根據 AMD 技術文章對 Qwen 3.8 的整理,這一代在 Qwen 3.6 與 Qwen 3.5 的架構基礎上,引進規模明顯擴大的稀疏混合專家架構,包含 512 個專家模型、92 層的深層網路,以及針對長文本工作負載最佳化的混合線性注意力與全注意力設計。
功能面向的更新包含四個重點:程式編寫、專業工作、研究與長程代理任務的整體能力提升;代理執行能力強化,包含更強的自主規劃與對環境回饋的處理;對主流開發工具與測試框架的下游相容性擴大;以及彈性的思考控制,開發者可透過 reasoning_effort 調節推理深度,並透過 preserve_thinking 保留歷史訊息中的思考脈絡。AMD 指出,Qwen 3.8 在設計上更著重於將複雜多步驟任務完整執行到結束,而非僅回答單一難題。
總結
從本次 Day 0 支援的布局來看,AMD 將 Qwen 3.8 的支援明確區分為兩個層次:以 Ryzen AI Max 與 Radeon AI PRO R9700 為核心的本地 PC 與工作站,鎖定 27B 密集模型,搭配 llama.cpp、LM Studio 與 Lemonade 提供從體驗到應用整合的路徑;以 Instinct MI300X、MI325X、MI355X 為核心的資料中心,鎖定包含 2.4T-A95B 在內的完整 MoE 家族,透過 ROCm 結合 SGLang、vLLM、ATOM 與 Quark 量化流程提供可直接部署的指引。
官方提供的兩篇部落格文章分別涵蓋效能參考數據、工具相容性與逐步部署指令,讓不同規模的開發者都能在模型公開當下選擇適合的硬體與框架開始評測。對於希望在本地系統上直接使用新模型的團隊而言,24.5 tok/s 與 51.8 tok/s 的參考數據、24GB 記憶體需求的明確說明,以及開箱可用的 LM Studio 體驗,已構成一套可立即驗證的起點;而對於需要在生產環境中處理長文本與代理工作負載的團隊,Instinct 平台上的多精度與多框架支援則提供後續擴展的基礎,對於想使用 AMD 平台研究或架設模型的個人與團隊來說相當有用,不再只限定於比較貴的 NVIDIA 平台。



