Google Creative Lab 近日在 GitHub 上發布了一個讓人眼睛一亮的開源專案:Gemma Translator。這是一台完全離線的 DIY 語音翻譯裝置,核心硬體是一塊 Raspberry Pi 5(8GB RAM),搭配市售的行動電源、觸控螢幕、喇叭與迷你鍵盤,外殼則用 3D 列印而成。整套裝置的零件成本約 80 美元(約新台幣 2,500 元),不需要連網、不需要 API Key,也不會產生任何雲端費用。
不靠雲端、不用網路也能即時翻譯:Google 開源 Gemma Translator
技術架構:三個模型分工,全部跑在本地端
Gemma Translator 的 AI 技術堆疊由三個獨立的模型組成,各自負責語音翻譯流程中的一個環節,彼此串聯形成完整的處理管線。語音辨識(STT)採用 Moonshine,這是一個輕量級語音辨識引擎,官方表示其速度最高可達 Whisper Tiny 的五倍。翻譯環節則由 Gemma 4 E2B 模型負責,透過 Google 的 LiteRT-LM 推理框架在裝置端執行。文字轉語音(TTS)同樣由 Moonshine 的語音合成模組處理。
在 Raspberry Pi 5 的 8GB RAM 上,Gemma 4 E2B 模型的推理速度約為每秒 6 個 token,記憶體佔用低於 1.5GB。雖然這個速度與雲端 API 相比不算快,但對於即時對話翻譯場景已經足夠應付。這三個模型全部在裝置端執行,語音從輸入到翻譯輸出的整個過程完全不經過任何外部伺服器。
前端介面使用 React 與 Vite 建構,針對小型手持螢幕(480×320 解析度)做了最佳化,採用復古終端機風格的視覺設計。後端則以 Python 內建的 http.server 作為 API 伺服器,與 LiteRT-LM 推理引擎溝通。整套系統透過一個啟動腳本就能同時啟動 LLM 伺服器、Python API 與 React 前端。
操作方式:兩人對話模式,推桿式語言切換
Gemma Translator 的介面設計為「雙車道」模式,螢幕左右兩側各代表一位使用者,每人各自選擇語言。操作時按住按鍵說話,放開後系統自動進行語音辨識、翻譯、再用合成語音播放翻譯結果給對方。語言切換採用「左輪槍」式的旋轉介面,用方向鍵就能在不同語言之間輪替。
專案支援兩種鍵盤模式:橫向模式讓單人操作時用空白鍵切換焦點車道,直向模式則讓雙人各用獨立按鍵同時控制。使用者可以從設定面板切換,選擇會儲存在瀏覽器的 localStorage 中。此外,專案也提供了完整的快捷鍵說明,讓兩位使用者能在不觸碰螢幕的情況下完成所有操作。可以看下面的影片看系統是怎麼運作的(44秒開始 DEMO):
Meet Gemma Translator: a completely offline, DIY translation device powered by Gemma 4 and built with Antigravity. 🧵 pic.twitter.com/oZ7WDdYsqo
— Google Antigravity (@antigravity) August 5, 2026
除了 Raspberry Pi 之外,這個專案也能在筆電與 Android 裝置上執行。整個儲存庫以 Apache 2.0 授權釋出,專案也附帶了 3D 列印外殼的 STL 檔案,使用者可以自行用印表機列印,將所有零件組裝成一台手持裝置。從 Google Antigravity 貼文附帶的影片來看,完成品的體積大約與一台小型掌上遊戲機相當,攜帶方便。
Gemma Translator 開源專案
開發團隊與目前的限制
Gemma Translator 由 Google Creative Lab 的 Alan Yam、Shashwath Santosh 與 Dan Motzenbecker 三人開發,程式碼在 Google Antigravity 平台的協助下完成。專案 README 中附帶了 Google 標準的免責聲明,明確指出「這不是 Google 官方支援的產品」,算是相關研究人員的興趣使然下的產物。對於需要隱私保護或完全離線環境的翻譯需求應該很有幫助(如旅遊),有興趣的朋友可以自己動手試試,我是蠻希望直接出套件來賣比較快(懶)。


