在 AI 開發領域,NVIDIA 的 CUDA 生態系長期佔據主導地位,多數大型語言模型的訓練與微調工具都以 NVIDIA GPU 為前提設計。這讓 AMD 用戶在本地 LLM 微調方面始終處於劣勢,即便 AMD 硬體在推理 CP 值上有不錯表現,訓練工作流一直是塊短板。近日,由前 NVIDIA 工程師 Daniel Han 創辦的新創公司 Unsloth 宣布旗下開源 LLM 微調工具正式支援 AMD GPU,涵蓋 Radeon、Instinct、Ryzen AI 以及資料中心級 GPU,能在 Windows、WSL 與 Linux 三大平台上運作。這項合作與 AMD 工程團隊共同完成,主打訓練速度提升最多 2 倍、VRAM 佔用減少 70%,且不犧牲準確度。

Unsloth 是什麼
Unsloth AI 成立於 2023 年,是 Y Combinator 2024 夏季批次的新創公司,總部位於舊金山,目前團隊僅 8 人,由 Daniel Han 與 Michael Han 兄弟共同創辦。Daniel Han 曾任職於 NVIDIA,擅長演算法最佳化,也曾為 Gemma、Llama、Mistral、Phi 等開源模型修復超過 20 個 bug。
Unsloth 的產品是一款開源的本地 LLM 訓練與推理工具,在 GitHub 上累積超過 68,000 顆星。YC 稱其為「開源強化學習與 LLM 微調」平台,主打透過自訂核心與記憶體最佳化技術,讓模型訓練速度提升 30 倍、記憶體用量減少 90%。它提供圖形化操作介面,整合了工具呼叫修復、程式碼執行、安全網頁搜尋、遠端 API 連線與 HTTPS 部署等功能。
在此之前,Unsloth 主要鎖定 NVIDIA CUDA 平台。此次 AMD 支援的推出,意味著使用 AMD 顯示卡的開發者也能享有 Unsloth 帶來的記憶體最佳化與訓練加速。

支援的 AMD 硬體範圍
Unsloth 對 AMD 的支援涵蓋從消費級到資料中心的完整產品線:
- RDNA 4(Radeon RX 9000 系列):完整支援 Windows、WSL、Linux
- RDNA 3.5(Ryzen AI 300 / Ryzen AI MAX,Strix Halo):完整支援所有平台
- RDNA 3(Radeon RX 7000 系列):完整支援所有平台
- CDNA 4/3/2(Instinct MI350、MI300、MI200):完整支援 Linux

也就是說,從一般玩家手上的 Radeon RX 9070,到企業級的 Instinct MI300X 資料中心加速卡,都在支援範圍內。Strix Halo 架構的 Ryzen AI Max 系統也在 Linux、WSL 與 Windows 上獲得最佳化。
技術核心:自訂 Triton 核心與記憶體最佳化
Unsloth 能在 AMD GPU 上實現如此大幅度的效能提升的背後,靠的是自訂的 Triton 核心與數學演算法。多項最佳化技術讓 VRAM 佔用大幅降低,具體表現在以下幾個方面:
- 訓練記憶體:在 Llama-3.1-8B 的 LoRA SFT 測試中,Unsloth 的峰值 VRAM 為 18.3 GB,相較 TRL + FA2 的 24.3 GB 減少了 33%。在整段訓練過程中,Unsloth 的 VRAM 佔用保持平穩,而其他方案每隔幾步就會飆升到 22.8 GB。
- 強化學習:在 GRPO 等強化學習場景中,VRAM 最多可減少 80%。Unsloth 直接使用 vLLM 的 LoRA 路徑,避免了傳統做法中合併與解合併 LoRA 權重造成的浮點數精度漂移問題。
- 推理能力:即使沒有 GPU、只能用 CPU,使用者仍可透過 Unsloth 在 AMD 平台上跑推理,支援 GGUF 與 Safetensors 格式的最佳化 ROCm 建構。
在訓練速度方面,同一組 Llama-3.1-8B 測試中,Unsloth 達到每步 2.07 秒,相較 TRL + FA2 的 2.87 秒快了約 1.39 倍,完成 25 步僅需 56 秒對比 75 秒。
低 VRAM 門檻:3 GB 就能訓練模型
此次更新中最具話題性的特點之一,是極低的 VRAM 門檻。根據官方說明,在 AMD 硬體上,使用者只需 3 GB VRAM 就能訓練 Qwen 系列模型,8 GB VRAM 即可訓練 Gemma 4。
Introducing Unsloth for AMD 🚀
You can now train & run LLMs on your AMD hardware• We collaborated with AMD to enable you to train & run 500+ models on AMD GPUs
• Works on Windows, WSL, Linux
• Train Qwen, Gemma on 3GB VRAMGitHub: https://t.co/aZWYAtakBP
Works on Radeon,… pic.twitter.com/hSSj694Upl
— Unsloth AI (@UnslothAI) July 20, 2026
這大幅降低了本地微調 LLM 的硬體門檻。過去需要高階 NVIDIA 顯示卡才能進行的 LoRA 微調工作,現在一張入門級 AMD 顯示卡就有機會勝任。對於想在本地環境嘗試模型微調但預算有限的開發者與研究者而言,這項改變意義重大。
Unsloth Studio 與 Agent 整合
除了訓練與推理的核心能力,Unsloth 也同步更新了 Unsloth Studio,帶來多項改進:
- Model Hub:全新的模型探索介面,支援熱門排行、搜尋、README 預覽與可續傳的下載管理器
- Dynamic NVFP4 量化:針對 NVIDIA Blackwell GPU 推出的動態 4-bit 量化,支援 Qwen3.6 與 Gemma 4
- 多語言支援:新增包含日文、中文、葡萄牙文、阿拉伯文等 12 種語言
- GPU 記憶體面板:可選擇使用哪些 GPU、設定 GPU 層數、控制 MoE 專家移除
在 Agent 工具整合方面,使用者可透過 unsloth start claude、unsloth start codex、unsloth start hermes 等指令,將本地模型直接接到 Claude Code、OpenAI Codex、Hermes Agent 等主流 Agent 框架。
社群反應
這項消息在 AI 開發社群獲得高度關注,多位開發者指出,AMD GPU 長期以來在 LLM 訓練工具鏈上的缺口終於被填補。過去兩天 Unsloth 倉庫就推送了 30 個 commit,開發節奏非常快,AMD 硬體在推理方面早已可行,但訓練與 LoRA 工作流一直是最大的障礙。
也有使用者開始在 AMD 硬體上實際測試,有用戶分享了在 AMD EVO X2(128 GB 統一記憶體)上以 Vulkan 後端執行 Unsloth Dynamic 2.0 GGUF 量化的經驗,解碼速度達到每秒 17 個 token,預填充速度則在每秒 110 到 230 個 token 之間。雖然距離 NVIDIA 高階卡的表現仍有差距,但對消費級硬體而言已屬可用等級。
對 AMD ROCm 生態的意義
AMD 的 ROCm 軟體平台在 2026 年已有顯著進展,但工具鏈的成熟度與 CUDA 相比仍有落差。Unsloth 的加入,等於為 ROCm 生態注入了一個高知名度的開源工具,有望加速 AMD 在 LLM 訓練領域的採用率。對 AMD 而言,這類合作至關重要。當使用者因為工具生態而選擇 NVIDIA 時,硬體規格的優勢就變得無關緊要。Unsloth 的 AMD 支援直接回應了這個痛點,讓 AMD 顯示卡用戶不再需要為了使用主流 LLM 工具而轉投 NVIDIA 陣營。
使用者只需一行指令即可完成安裝,Unsloth 會自動偵測硬體環境並安裝對應的 ROCm 建構、PyTorch、llama.cpp 預編譯版本與最佳化核心,大幅簡化了 AMD 平台的設定流程。
結語
Unsloth 正式支援 AMD GPU,是本地 LLM 訓練生態朝多平台發展的重要一步。2 倍速度提升、70% VRAM 節省、3 GB 就能訓練的低門檻,加上對 Claude Code 與 Codex 等 Agent 工具的直接整合,讓 AMD 用戶首次能在完整的 LLM 開發工作流中獲得與 NVIDIA 用戶相近的體驗。隨著 Unsloth 團隊持續投入 AMD 平台的最佳化,ROCm 生態的工具有望進一步縮小與 CUDA 的差距,對 AMD 顯卡與相關 AI 生態使用者來說更是重大突破。反觀另一個 X86 巨頭 Intel 嘴巴喊了全力投入 AI 已久,但到目前似乎還沒有拿出什麼實例,似乎也沒有積極與開源社群或 Unsloth 這類新創合作的消息,可能還要多加點油。
