以往一個沒學過任何 CAD 軟體的素人想要自己憑空作出 3D 模型幾乎是不可能的,但現在只要把你腦袋裡想像的零件樣式講給 AI 聽,它自己寫出 3D 模型,而且還能直接送進 3D 列印機。這個以前只在科幻片裡看到的場景,最近被一個 MIT 授權的開源專案正式端上桌。近日有一個「text-to-cad」開源專案主打「把 coding agent 變成 CAD 工程師」,就可以辦到以前想都不敢想的事情。

開源工具 text-to-cad 把 Claude Code、Codex 變成 CAD 工程師
一句 prompt 取代六個工具
以前要拼出一隻機器人,得在 CAD 軟體、URDF 匯出工具、運動學求解器、檢視器、切片軟體之間來回切檔,整條 pipeline 動輒卡關幾天;text-to-cad 把這些步驟全部吃掉,只要 agent 看懂一句英文就行。
text-to-cad 並不是單一模型,而是一組「agent skill」套件,安裝後會在 Claude Code、Codex、Cursor 等 coding agent 內掛上一整套 CAD 與機器人工具鏈:
- 直接輸出 STEP、STL、3MF、DXF、GLB 等工業標準格式,也能生成機器人描述檔 URDF / SRDF / SDF。
- 內建 G-code 切片 與 Bambu Lab 列印任務送出 能力,搭配 Bambu Lab MQTT API(拓竹 3D 列印機的 API) 可以從模型一路走到實際列印。
- 提供 CAD Viewer 本機預覽、step.parts 找現成市售零件(螺絲、軸承、馬達、連接器),甚至還有實驗性的 Implicit CAD,用 GLSL 的 signed-distance field 在瀏覽器內即時建模。
整套工具完全離線、無後端伺服器:agent 寫進 models/*.py 的 build123d 腳本,再由本地 Python skill 重新生成幾何、輸出工件,最後丟給 React/Vite 寫的 viewer 預覽。對在意智慧財產權、不能把設計稿丟上雲端的硬體團隊來說,這點很關鍵。
在 22 秒 demo 影片裡,一段 prompt 直接生出 7 自由度機械手臂的完整設計,包含運動學、客製 GUI,整個流程幾乎只用提示詞驅動(搭配 GPT-5.5)。
Vibe coding a robot with GPT 5.5!
This is a URDF of a 7dof robot arm with functional kinematics, a custom gui, and STEP parts/assembly, 100% generated in Codex (minus the gripper).
A similar result would have taken me weeks stitching half a dozen tools together. Insane stuff. pic.twitter.com/hfikjNf1J5
— Jake Fitzgerald (@earthtojake) April 23, 2026
build123d 撐起整套技術棧
text-to-cad 底層用的是 build123d,一套 Python 寫成的參數化邊界表示(BREP)建模框架,底層接到 OpenCascade 幾何核心。換句話說,agent 寫的是能被 CAD 軟體、模擬器、CAM 工具鏈讀懂的實體幾何,不是為了看起來像的 mesh。
這層技術選擇也解釋了為什麼 text-to-cad 能跨進機器人領域:URDF / SRDF / SDF 是 ROS、MoveIt 2、Gazebo 等機器人框架的原生格式,build123d 直接吐這些檔,模型就能接到運動學規劃、碰撞偵測、物理模擬上,不必再人工轉一手。
工程師的真實反應:太神奇但還不太準
Hacker News 討論串底下,留言大致分成兩派。驚艷派覺得這是 text-to-image 之後「text-to-physical-object」的第一個像樣實作。有人在 LinkedIn 與 Threads 上 已經拿它搭配 Claude Opus 4.7 來迭代設計,從霧化器電源轉接頭到 PCB 連接器,「把一堆卡尺量測值和參考照丟進去,已經能跑出堪用的骨架」。
懷疑派則抓著同一份 repo 的 benchmark 開刀。有使用者實測 L-bracket 時發現,基準題的 gusset(補強片)會與螺絲孔重疊,做出根本無法組裝的零件;另一個 7-DoF 手臂 benchmark 的關節極限則被質疑「LLM 容易在關節限制上 hallucinate,拿來控制實體手臂會很危險」。更根本的質疑是:用文字描述 CAD 本來就很彆扭,沒有視覺字典的話,使用者很難講清楚「那個斜面要再往內縮 2mm」。
作者 softservo 在 Hacker News 回應時解釋:首頁 benchmark 的 prompt 只是節錄,實際工單 prompt 是用 GPT 5.5 Pro 把一句話展開成完整規格,因此一般使用者輸入「幫我做一個夾具」這種模糊指令,harness 自己會先擴寫再餵給 agent,「不是故意誤導」。他也補充,已經把首頁 prompt 修成更完整的版本。
text-to-cad 開源專案網址
開源代理硬體設計的起點
從更大的脈絡看,text-to-cad 並不打算單獨成為「AI CAD 軟體」,它真正的角色是 coding agent 進軍硬體世界的底層技能庫。之前 AI agent 大多停留在螢幕裡:寫程式、寫文件、叫 API。text-to-cad 把這條鏈延伸到實體:prompt → build123d Python → STEP/URDF → G-code → Bambu Lab 列印出成品,等於讓一個 coding agent 具備「從零打造一個物理物件」的能力。
以目前的使用者回饋來看,短期內 text-to-cad 比較適合做 快速原型、概念驗證,離可直接出貨的工程件還有距離;benchmark 的精準度、空間座標一致性、迭代時的錯誤修正,都還要靠使用者反覆把圖丟回去讓 agent 自我檢查。但對硬體新創、機器人教育、客製化工具開發者來說,光是「一句話生出可 3D 列印的零件」這件事,就足以把原本幾天的工時壓到幾小時內。
隨著 Claude Code、Codex 這類 coding agent 持續變強,加上 build123d 與 OpenCascade 的成熟幾何核心,「AI 直接設計並列印實體零件」這個開源專案接下來幾個月的發展相當值得持續追蹤。

