你相信 8 美元(約新台幣 260 元)一顆只比兩杯咖啡還便宜的物聯網晶片 ESP32-S3 微控制器完全離線跑 2890 萬參數的語言模型嗎?這不是痴人說夢,而是真正實現的開源專案,它比 Raspberry Pi 和 NVIDIA Jetson 都便宜得多。這項專案名為 ESP32-AI,由開發者 slvDev 在 ESP32 社群版上分享,目前已在 GitHub 上開源。相較之下,2024 年 Dave Bennett 在同類晶片上跑的模型僅有 26 萬參數,這次的成果整整提升了超過 100 倍。
開源玩家成功用 8 美元 ESP32-S3 晶片離線跑 2890 萬參數大語言模型
ESP32-S3 是樂鑫科技(Espressif)推出的物聯網晶片,廣泛應用於智慧家居裝置、感測器節點與穿戴式設備。這顆晶片內建 512KB 快速 SRAM、8MB PSRAM 與 16MB 快閃記憶體,售價僅約 8 美元。按照傳統做法,整個模型必須塞進快速記憶體中才能運作,這也是為什麼先前同類晶片的模型上限只有 26 萬參數。
關鍵突破:Google 的 Per-Layer Embeddings 技術
slvDev 的模型總大小為 14.9MB(4-bit 量化),如果要全部載入 SRAM 根本不可能,連放進 PSRAM 都有困難。過去的做法在模型變大時會遭遇瓶頸:每次生成一個 token 都必須讀取整個模型,模型越大速度越慢,最終完全無法運作。解法來自 Google 在 Gemma 模型系列中提出的 Per-Layer Embeddings 技術。語言模型中大部分參數儲存在一個巨大的嵌入查找表(embedding table)中,模型主要從中讀取資料,而非進行密集計算。slvDev 利用這個特性,將大約 2500 萬參數的查找表存放在較慢的快閃記憶體中,並透過記憶體映射(memory-mapped XIP)的方式存取。每生成一個 token,晶片只需要從中讀取約 6 行、大約 450 位元組的資料。實際需要密集計算的核心部分僅約 560KB,留在快速 SRAM 中即可。
28.9M LLM running on an $8 esp32, writing a story on a screen! fully on the chip, nothing goes to a server.
that’s ~100x bigger than the model people ran on this chip in 2023.
it grew out of @karpathy llama2.c and google’s per-layer embeddings, which is what lets a big model live… pic.twitter.com/m9PWTYCoKL— Slava S. (@slvDev) July 23, 2026
這種設計讓龐大的嵌入表幾乎「免費」運作,它只是靜靜地待在快閃記憶體中,每次只被抽樣一小部分。slvDev 在解說影片中指出,這個想法正是 Google Gemma 模型的 Per-Layer Embeddings 技術,只不過現在跑在微控制器的記憶體架構上,而非手機或 GPU。此外,Andrej Karpathy 的 llama2.c 專案也提供了訓練微型語言模型並以純 C 語言執行的技術方向,ESP32-AI 正是建立在上述技術基礎之上。
能做什麼、不能做什麼
這個模型使用微軟的 TinyStories 資料集訓練,能夠撰寫簡短、連貫的故事。它無法回答問題、遵循指令、撰寫程式碼或提供事實知識。開發者坦承,上述限制來自模型核心推理部分的規模,記憶體技巧無法解決這個問題。
Brian Roemmele 在 X 上分享這則消息時表示,他在自家車庫實驗室進行測試,已經看到小型有線螢幕上顯示由晶片獨立生成的連貫故事,全程無需 Wi-Fi、無需 API 金鑰、無需雲端連線。他正在測試三個方向:將模型嵌入簡單節點、搭配本地語音前端、以及探索多顆晶片能否組成輕量級群集網路。
forget the $699 AI pins. this $8 chip just shattered the barrier for local AI hardware.
a developer just forced a 28.9 million-parameter LLM onto a standard ESP32-S3 microcontroller. it costs roughly 8 dollars, runs completely offline, and draws the power of a single LED.… https://t.co/ZRzlJH1NFP pic.twitter.com/SDllyZpENt
— ard (@ardchain) July 24, 2026
初代 ChatGPT 擁有 1.17 億參數,這個 ESP32 上的模型約為其四分之一。雖然推理能力遠不及 ChatGPT,但在一顆 8 美元的晶片上實現這樣的規模,代表的是架構設計上的突破,而非單純的參數堆疊。過去幾年業界一直朝著更大的模型、更多的參數前進,但更有趣的前沿可能在相反的方向:有用的智慧能變得多小、多便宜、多在地化。當一個 8 美元的晶片能生成連貫的故事,這證明了下限還在持續移動。
這個專案的意義不僅在於參數數量,而在於記憶體配置策略的革新。透過 XIP 技術將大型嵌入表放在快閃記憶體中,而非追求將所有資料塞進 RAM,這種設計思維對未來邊緣 AI 裝置的發展具有重要參考價值。
LLM (Little Language Model) running on ESP32-S3 with screen output!
byu/Complex-Indication inesp32
一旦接受語言模型可以住在 8 美元的晶片中、完全不需要雲端連線,一系列新裝置就變得可行。隱私完全由硬體保障,延遲只受限於本地運算速度,功耗低到電池供電成為合理選項。這類裝置不需要回答所有問題,只需要在特定任務上表現出色,例如故事生成、簡單文字生成或本地語音互動。
slvDev 的專案已在 GitHub 上開源,包含韌體、接線說明、燒錄步驟,以及訓練、消融實驗與量化的完整程式碼。對於有興趣在自己的硬體上嘗試的開發者,所有檔案都可以直接下載使用。
另外,slvDev 在專案說明中坦誠公開了整個開發過程的曲折歷史,包括他自己在參數計算上發現的一個錯誤,這個錯誤曾經導致早期公布的數字偏高。修正後的結果以及完整的提交歷史都記錄在倉庫中,這種透明度在硬體嵌入式 AI 專案中相當少見。
從更大的視角來看,這項專案代表了邊緣 AI 領域的一個重要信號。過去幾年,語言模型的發展方向一直是追求更大的參數量和更強的推理能力,但 ESP32-AI 提出了另一種可能性:將有限但有用的智慧能力部署到極低成本的硬體中。當一顆不到 300 元台幣的晶片就能在本地生成連貫文字,隱私敏感的應用場景、網路基礎設施不足的偏遠地區,以及對成本極度敏感的物聯網裝置,都將迎來全新的設計空間。

