試想,如果可以不用任何安裝動作就把整套本地 AI 工具裝進 USB 隨身碟,插到任何一台 Windows、Linux 或 macOS 電腦就能直接跑,那是不是會很方便?近日一個叫 Uncensored AI Studio 的開源專案號稱就能做到。這個專案把 Stable Diffusion 圖像生成、GGUF 格式的大語言模型對話、Whisper 語音轉文字、Kokoro 文字轉語音四樣東西打包成一個免安裝的桌面介面。
Uncensored AI Studio 是什麼?
Uncensored AI Studio 跟 Ollama、LM Studio 這類單一的本地 LLM 執行器不一樣。Ollama 主要負責拉模型、跑推理、提供 OpenAI 相容 API,想做圖像生成和語音功能得另外接別的工具。Uncensored AI Studio 則是把這些引擎塞進同一個網頁介面:圖片走 stable-diffusion.cpp,文字對話走 llama.cpp,語音轉文字走 whisper.cpp,文字轉語音走 Kokoro-82M 的 ONNX 模型。
使用者不用自己配環境變數、不用裝 Python 套件,第一次啟動時腳本會自動下載可攜式 Node.js runtime 和對應 GPU 後端的預編譯二進位檔,是一個功能完整的「整合包」。
硬體加速是自動偵測的
專案的設定腳本會讀取機器規格,自動載入對應的加速後端:Nvidia 卡走 CUDA,AMD Radeon 走 ROCm 或 Vulkan,Intel Arc 走 Vulkan,macOS Apple Silicon 走 Metal,Intel Core Ultra 的 NPU 則可以透過 OpenVINO 啟用。沒有獨立顯卡的機器會退回 CPU 執行,速度比較慢但能動。Linux 版本要求 glibc 2.38 以上,也就是 Ubuntu 24.04 或 Fedora 40 之後的版本;舊系統會直接報錯,需要升級作業系統或從原始碼重新編譯後端。
為了避免記憶體被同時佔滿,文字引擎和圖像引擎預設互斥。UI 裡面有兩個 workspace 可以切換:圖像 workspace 用 stable-diffusion.cpp 後端,模型放在 app/models/ 資料夾;文字 workspace 用 llama.cpp server,GGUF 權重放在 app/llm-models/。介面內建效能監控,即時顯示 CPU、RAM、GPU、VRAM 的使用率,也有一個 Model Manager 可以直接貼 Hugging Face 連結下載權重,或把本機檔案拖進去匯入。
「Uncensored」指的是什麼
專案名稱裡的 uncensored 指的是它預設推薦的模型清單裡包含 abliterated(移除拒絕行為)版本的開源模型,軟體本身沒有繞過任何審查機制。DaRk LLM 的官方頁面列出的建議模型包括 Qwen3.5-9B abliterated、DeepSeek-R1-Distill-Qwen-14B abliterated、GLM-4.7 Flash uncensored 等 GGUF 權重。abliteration 的做法是把模型殘差流中負責「拒絕回答」的那個方向向量抹掉,模型就不再對敏感請求說不了。HackerNoon 一篇分析指出,ETH Zürich、MIT、Anthropic 的研究者在 2024 年發現這個拒絕行為確實存在於模型內部的一個可識別方向,抹掉之後模型對所有請求都會直接回答,不只是邊際內容。
其實市面上已經出現把 llama.cpp 或 Ollama 加上 abliterated 小模型燒錄進二手隨身碟、以 30 美元左右販售的產品,廣告主打隱私、離線、無審查,目標客群是想要斷網也能用 AI 的人。這些付費產品賣的是便利性的包裝費,同樣的功能免費下載 Ollama 加任意開源模型就能做到,十分鐘就能組好。而 Uncensored AI Studio 本身是 MIT 授權的開源專案,不需要花錢,但它把「選哪個模型」這件事替使用者做了一半決定:Model Manager 預設列表裡擺的就是 uncensored 系列模型。
Kokoro TTS 為什麼值得單獨講
四項功能裡面,Kokoro 文字轉語音是最少被討論但實用度很高的一塊。Kokoro-82M 是一個只有 8200 萬參數的 TTS 模型,完全跑在 CPU 上就能產生聽起來相當自然的語音,支援英文、中文、印地語等多種語言,大約有 50 種音色選項。Developers Digest 的測試指出,純 CPU 推論下它的效率在本地 TTS 模型裡是突出的;如果需要語音克隆,同級別的可選方案是 Kyutai Labs 的 Pocket TTS(約 1 億參數)。Hacker News 上的討論串裡,有人拿它接 Home Assistant 做語音通知,有人用它把文章轉成音訊檔在通勤時聽,也有人把它移植到 iPhone 的 ANE 上跑,電池消耗比 GPU 方案低很多。
把 Kokoro 塞進一個已經有 LLM 和圖像生成的套件裡,意義在於整條「文字→語音」的管線全部留在本機。LLM 產出文字,Kokoro 把文字念出來,中間沒有任何雲端 API 呼叫。對於不想讓對話內容經過第三方伺服器的使用者來說,這比單純的離線聊天多了一層:連語音輸出都不外洩。
詳細的使用安裝也有人拍成影片了,有興趣嘗試的朋友可以看看:
GitHub – Uncensored AI Studio
限制與注意事項
USB 隨身碟的寫入壽命和隨機存取速度是實際瓶頸。模型權重動輒幾 GB 到十幾 GB,每次啟動都要從碟片載入記憶體,普通 USB 3.0 隨身碟的讀取速度會讓啟動時間非常慢。如果要把這個專案當日常工具用,高速 USB 4 碟片或外接 NVMe 盒會是比較合理的選擇。
另外 macOS 版本只支援 Apple Silicon(M1 及以上),Intel Mac 完全不支援。Windows 需要 64 位的 Windows 10 或 11。Linux 除了 glibc 版本要求之外,Vulkan 後端還需要 libvulkan.so.1 和正常的 GPU 驅動,ROCm 後端則要求主機端有對應的 AMD 驅動且與 ROCm 7.13 相容。
模型供應鏈安全也是一個常被忽略的問題,GGUF 檔案是從社群來源下載的二進位 blob,推論引擎會直接把它們載進記憶體。SitePoint 的指南建議優先從 Hugging Face 上經驗證的發布者下載,檢查 checksum,避免來路不明的個人倉庫或匿名分享連結。Uncensored AI Studio 的 Model Manager 雖然方便,但貼上去的 URL 指向誰的倉庫、那個倉庫有沒有被入侵過,這些風險在使用者這邊。
最後,abliterated 模型的安全訓練是被刻意移除的。如果你只是拿本地模型做日常問答、寫文件、整理筆記,標準模型就夠用,不需要 abliterated 版本。abliterated 模型的適用對象比較窄:研究 alignment 怎麼失效的研究者,或者碰到模型對無害請求過度保守的開發者。把一個沒有拒絕能力的模型預設裝給一般使用者,跟把一把沒鎖的鑰匙掛在門把手上是同一類決定,技術上可行,但後果由使用者自己承擔。






