說起 AI 平台,大部分的人應該直覺都是想到 NVIDIA 的 CUDA 生態,但其實 AMD 也有自家的 AI 平台 ROCm。2016 年 4 月,AMD 推出了 ROCm 1.0,一個以 C++ 編譯器和 HIP GPU 程式語言為核心的開源 GPU 運算平台,瞄準高效能運算市場。2026 年 8 月 26 日,AMD 發布了 ROCm 10.0,版本號從 7.x 直接跳到 10,對應的是建立在全新建構系統 TheRock 之上的大版本,同時也是 ROCm 首次內建原生的 AI 開發者體驗。
AMD ROCm 10 正式發布,ROCm.AI 開啟 Agentic AI 開發新時代
ROCm 10 的核心亮點是 ROCm.AI,一套由三個工具組成的 AI 原生開發工具鏈:ROCm CLI、AMD Skills 和 Hyperloom。過去的 ROCm 版本主要提供底層數學庫和框架支援,安裝、驗證、部署、最佳化這些步驟得靠開發者自己串。ROCm.AI 的目標是把這些環節整合成一條龍的工作流程,讓 AI Agent 也能直接參與開發過程。
ROCm CLI:一個指令搞定 AI 工作負載
ROCm CLI 是 ROCm.AI 的第一塊拼圖。它是一個單一二進位檔案的命令列工具,不需要預先安裝 Python、Rust 或 ROCm,適用於 Linux 和 Windows(x86_64)。rocm serve <model> 可以直接在 PyTorch 上啟動模型推理,rocm examine 能診斷環境和驅動程式問題。對於沒有網路連線的環境,CLI 支援將所有依賴項下載為自包含的離線套件。
目前 ROCm CLI 處於技術預覽階段,API 和行為可能會變動。它內建了 Lemonade 和 vLLM 的推理引擎適配器,目標是讓「從安裝到跑模型」這條路徑變得盡可能簡單。
AMD Skills:讓 AI 助理讀懂 AMD 硬體
AMD Skills 是 ROCm.AI 的第二塊拼圖。它把 AMD 驗證過的 ROCm 知識打包成標準化的 Agent Skills 格式,直接餵給開發者已經在用的 AI 程式碼助手,包括 Claude、Cursor、OpenAI Codex、Gemini CLI。官方技能目錄放在 GitHub 的 amd/skills 倉庫,採用聯邦式架構,與這些工具既有的技能目錄結構相容。
技能涵蓋 GPU 和 CPU 兩條線。GPU 端有 rocm-doctor(驅動 CLI 的環境診斷)和 serving-llms-on-instinct(在 MI300X/MI325X/MI350X/MI355X 上架設 vLLM 端點);CPU 端則透過 ZenDNN 和 zentorch 延伸到 EPYC 處理器,提供 serving-llms-on-epyc 和 quantize-for-zentorch 等技能。無論目標是 Instinct GPU 還是 EPYC CPU,安裝了 AMD Skills 的 AI 助理都能自動選擇對應的技能。
Hyperloom:全自動推理最佳化 Agent
Hyperloom 是 ROCm.AI 三件套中最激進的一個。它是一個開源的自主 Agent 系統,能自動完成端到端的推理工作負載最佳化,涵蓋效能分析、瓶頸識別、方案規劃、程式碼修改和正確性驗證,全程無需工程師手動介入。AMD 表示,Hyperloom 能把過去需要數週的手動最佳化工作縮短到數小時。
Hyperloom 的架構由五個元件組成:TraceLens 負責自動瓶頸識別,Magpie 處理核心評估和基準測試,IntelliKit 提供對話式效能分析工具,GEAK 是跨 Triton/HIP/CK/FlyDSL/TileLang 後端的多 Agent 核心最佳化器,Arbor 則透過樹狀認知層不斷自我演化、探索更多最佳化空間。整個流程遵循「分析→規劃→最佳化→驗證」的迴圈,可以反覆迭代直到效能達到目標。
Hyperloom 目前支援 MI300X、MI325X 和 MI355X,透過 pip 安裝即可使用。開發者只需要指定模型和設定,告訴 Agent「用 Hyperloom 最佳化某個模型」就能啟動一個最佳化工作階段。
TheRock 建構系統全面接管
ROCm 10 的另一個結構性變化是 TheRock 建構系統全面接管。TheRock 是自動化的開源建構和發布系統,在 ROCm 7.14 首次進入生產環境。ROCm 10 中,所有底層庫、框架 wheel 和工具都從同一條管線產出,在發布前經過全堆疊的階段性驗證。
這帶來了幾個實際變化:安裝目錄從 /opt/rocm-7.2/ 改為 /opt/rocm/core-10.0,套件名稱統一加上 amdrocm- 前綴(例如 amdrocm-blas、amdrocm-rccl),原本分散的套件被整合,hipBLAS 和 rocBLAS 合併為一個套件,hipSPARSE 和 rocSPARSE 也是如此。同時,AMD 將 GPU 軟體分發整合到重新設計的 repo.amd.com,ROCm 套件、amdgpu 驅動程式和公開 GPU 工具統一到同一個倉庫。
框架支援與硬體擴展
ROCm 10.0 更新了 AI 框架支援陣容:PyTorch 2.13.0、JAX 0.11.0、vLLM 0.27.0、SGLang 0.5.15、TensorFlow 2.21、MIGraphX 2.17、ONNX Runtime 1.27.0。硬體方面新增了 Radeon RX 9050(含 4GB 版本)的支援,虛擬化支援也擴展到 MI355X、MI350X、MI325X、MI300X 和 MI210 的多種 Passthrough 和 SR-IOV 組態。
在消費者端,ROCm 10 新增了 Ryzen AI MAX 平台上的 Unsloth 支援,讓開發者能在本地對大型語言模型進行 LoRA 和 QLoRA 微調,利用 Ryzen AI MAX 的大容量統一記憶體,在不依賴雲端基礎設施的情況下完成模型訓練。這對於需要資料隱私或離線開發的團隊特別有吸引力。ComfyUI 也獲得針對 Wan2.2、FLUX.2 KLEIN、Stable Diffusion 3.5 Medium、Stable Diffusion 2.1 和 Stable Diffusion XL Base 等熱門影像生成模型的效能調校,AMD 同時提供了注意力演算法和後端的選擇建議,讓使用者在 Radeon 和 Ryzen 平台上獲得開箱即用的最佳效能。
通訊庫大規模升級
RCCL(ROCm Collective Communications Library)在這個版本獲得了歷來最大的單次投資。上游 NCCL 合併從 2.28.3 推進到 2.30.4,新增了對稱記憶體支援、GPU 發起網路傳輸(GIN)裝置 API、單邊主機 API、以及全新的 Pythonic API。大規模啟動改進降低了跨數百 GPU 的啟動開銷,容錯增強則提升了長時間任務的穩定性。
rocSHMEM 則持續縮小與 NVIDIA NVSHMEM 3.6.5 的 API 差距,新增了主機 AMO 和 context API、reduce_on_stream 變體、波級集體運作、以及 team_split_2d 等功能。
開發者工具與 Windows 統一
ROCm Compute Profiler 的 Roofline 分析擴展到 GFX11xx(RDNA 3)架構,首次將效能天花板分析帶到 Radeon 硬體上。ROCm Optiq 1.0 進入正式發布,這是一個統一的視覺化分析環境,結合了系統級時間軸探索和核心級效能分析。
Windows 方面,HIP SDK 正式退役,由 ROCm Core SDK 取代。Windows 和 Linux 現在共用同一個 SDK 定義和發布節奏,不再各自為政。ROCm 10 在 Windows 上以 tarball 形式發布,原生安裝程式預計在 2026 年稍晚上線。
結語
ROCm 10 的版本號跳躍有其意義。TheRock 全面接管後,ROCm 長期以來「東一塊西一塊」的軟體分發問題獲得解決,ROCm.AI 三件套(CLI、Skills、Hyperloom)則把 ROCm 從「給你工具自己組裝」的平台,轉變成「Agent 能直接參與」的開發環境。對還在觀望 AMD GPU 生態的開發者來說,ROCm 10 降低的不只是技術門檻,也降低了心理門檻。ROCm 10 將持續以約每六週一次的節奏發布後續版本,AMD 也預告 Windows 端的原生安裝程式將在 2026 年稍晚上線。






