真沒想到,GPT-5.6 才正式推出不到一個月的時間,OpenAI 就宣布降價。稍早 OpenAI 在官方社群中宣布調整 GPT-5.6 系列的價格與處理方案,其中 Luna 降價最多,多達 80%,Terra 也降價 20%,旗艦模型 Sol 則新增最高可達 2.5 倍速度的 Fast mode。無論你是直接使用 API,還是透過 Codex、ChatGPT Work 執行任務,這次更新都同步受惠,花更少的預算或用量,來完成更多工作。

OpenAI 大砍 GPT-5.6 API 費用:Luna 降價 80%、Sol 新增 2.5 倍高速模式
OpenAI 於 7 月 30 日起,正式調降 GPT-5.6 Luna、Terra 的 API 使用價格。Luna 是系列中速度最快、價格最低的版本,主要鎖定高頻率、大量處理的工作;Terra 則是在效能和成本之間取得平衡,適合一般日常任務。
兩款模型的費用都以每百萬 Token 計算,Luna 的輸入價格從 1 美元降至 0.2 美元,輸出價格也從 6 美元降到 1.2 美元,降幅達到 80%。Terra 的輸入價格則從 2.5 美元調降為 2 美元,輸出價格從 15 美元降至 12 美元,降幅為 20%。
| 模型 | 定位 | 原輸入價格 | 新輸入價格 | 原輸出價格 | 新輸出價格 | 降幅 |
|---|---|---|---|---|---|---|
| GPT-5.6 Luna | 高頻、大量處理 | 1 美元 | 0.2 美元 | 6 美元 | 1.2 美元 | 80% |
| GPT-5.6 Terra | 效能與成本平衡 | 2.5 美元 | 2 美元 | 15 美元 | 12 美元 | 20% |
Luna 這次的調整特別有感。假設一項工作需要處理 1 億個輸入 Token 和 1,000 萬個輸出 Token,原價計算需要 160 美元,新價格則只要 32 美元。
很多人可能會想,這只是受惠使用 API 的開發者?為此 OpenAI 表示,ChatGPT 與 Codex 的訂閱價格、配額預算都沒有改變,不過在 Codex、ChatGPT Work 使用 Terra、Luna 時,系統扣除的額度(Credit)會變少。換句話說,月費和帳面額度不變,但相同的額度可以完成更多工作。
至於最強的 GPT-5.6 Sol,這次雖然沒有調降標準 API 價格,每百萬輸入 Token 還是 5 美元,輸出 Token 也是 30 美元,但 OpenAI 提供全新的 Fast mode,讓有即時處理需求的開發者可以用更高費率換取速度:
根據 OpenAI 說明,GPT-5.6 Sol 使用 Fast mode 時,速度最高可達標準處理的 2.5 倍,模型的智能表現不變,費率則是標準模式的 2 倍。換算後相當於每百萬輸入 Token 10 美元、輸出 Token 60 美元。因此它不一定適合單純追求低成本的背景工作,而是比較適合互動式程式開發、必須快速回應的代理服務,或延遲會直接影響營運的企業應用。
Fast mode 也將取代原有的 Priority Processing,不過開發者暫時不必急著修改既有程式。原本標記為 `priority` 的 API 請求會自動改用 Fast mode,並且與 Codex 中的 `/fast` 模式銜接。也就是說,既有串接方式大致可以繼續使用,差別主要會反映在處理速度和帳單上。
在推論系統方面,OpenAI 也改善了請求路由、排程、負載平衡、快取、GPU Kernel 與模型程式的執行順序。即使模型本身很有效率,如果請求分配不平均、硬體等待資料,或記憶體不斷搬移,GPU 還是可能閒置。因此 OpenAI 會依照地理位置、可用容量和加速器類型分配全球請求,進入叢集後,再依照目前負載、上下文長度和快取狀態,把工作交給合適的模型實例。
另一項關鍵技術是投機性解碼(Speculative decoding)。它的做法是先讓較小的「草稿模型」預測接下來可能出現的多個 Token,再交給主要模型平行驗證。如果預測獲得接受,主要模型一次運算就能產生多個輸出 Token,減少原本逐步產生內容所需的昂貴運算。
有趣的是,GPT-5.6 Sol 也參與了這次最佳化工作。OpenAI 表示,Sol 透過 Codex 分析正式環境流量、尋找先前沒注意到的負載不平衡,還能測試新的路由策略。它也自行改寫、最佳化正式環境使用的 GPU Kernel,配合其他 Kernel 改善後,讓端到端模型服務成本降低 20%:
GPT-5.6 Sol 還針對自己的草稿模型設計並執行數百次實驗,測試不同規模、結構和功能,甚至負責啟動、監控訓練流程,在遇到硬體故障或訓練不穩定時介入處理。這些改善讓 Token 產生效率提升超過 15%。

