很多人都想在自己的電腦上跑免費的開源 AI 模型,只不過現在最大的門檻是:記憶體不夠,尤其是數百億參數的大模型,即使經過量化縮小,對只有 8GB、12GB RAM 或 VRAM 的一般電腦來說依舊相當吃力,只能改用更小的模型,或升級記憶體與顯示卡。
而最近開始有一些新玩法了。網路上出現一款 RAMDeck 的工具,可以做到讓多台裝置共同分攤所需的記憶體容量,就有一名網友分享實測結果,成功在只有 12GB 的舊筆電運行 Qwen3.8-27B 模型。當然,速度部分還是很慘,每秒只有 1.92 Token,因此目前比較像技術展示。

圖片來源:Wccftech
12GB 舊筆電也能啟動 Qwen3.8-27B:RAMDeck 串聯 4 台裝置分攤模型,但速度僅每秒 1.92 Token
Reddit 網友 Medicine_Blogscanner 近日在 LocalLLM 社群分享,他表示,這已經是這個系列的第三支影片,前面曾用相同概念挑戰 7B 和 13B 模型,這次把目標提高到約 27B 參數的 Qwen3.8-27B,手上的舊 Windows 筆電只有 12GB 記憶體,很明顯單靠這台電腦根本無法完整載入。
他藉由 RAMDeck 工具,把模型拆開分配到四台裝置。Windows 舊筆電擔任主要節點,另外還有 RTX 3060 迷你電腦、Mac mini 和 Android 手機,下方是各裝置分配的記憶體:
- Windows 舊筆電分配到 3.4GB
- 迷你電腦提供約 20GB 的顯示記憶體與系統記憶體
- Mac mini 負責 3.7GB
- Android 手機貢獻 1GB
將上述數字相加,四台裝置列出的分配容量合計約 28.1GB,其中提供最多資源的是搭載 RTX 3060 的迷你電腦。
RAMDeck 公開的 Core Engine 使用 llama.cpp 的 RPC 協定,能在不同裝置之間卸載模型張量。每一台參與的裝置會啟動節點程式,提供 GPU 或 CPU 資源,再由相容的協調端分派工作。
有一點要先知道的是,這名網友這次執行的 Qwen3.8-27B,不是完全未壓縮的原始模型,使用的是 4-bit 量化版本,所需記憶體約為 15GB 至 17GB。如果使用未量化版本,模型權重本身就可能需要約 55GB 至 60GB。量化可以用較少的位元保存模型權重,大幅降低容量需求,但壓縮得越激進,也越可能影響輸出品質。
雖然能成功運行,但隨後測試文字的生成速度相當慘,每秒只有 1.92 Token,latency 約 25ms:
會慢成這樣,其實也不難理解。如果是透過單一顯示卡,資料會直接透過高頻寬匯流排快速存取,而 RAMDeck 把模型分散到不同裝置後,節點之間還需要透過區域網路交換資料,同時也會增加 RPC 通訊、同步以及不同 CPU、GPU 架構之間的額外開銷,因此效能一定更差。
RAMDeck 看起來蠻不錯的,但目前也是有許多問題在,GitHub 提到「可運作但不完美」,而且這份程式庫沒有內建圖形介面或完整儀表板,安裝過程也需要建立 Python 環境、啟動節點代理程式,並使用相容的 llama.cpp 工具或自行準備協調端,對一般用戶來說門檻很高。




