8 月 26 日晚上,在 OpenRouter 上匿名執行一週的神祕模型「Ox Alpha」的真實身分正式揭曉,它就是來自中國智譜 AI(Zhipu AI)的 GLM-5.3 Flash。這款模型擁有 320B 總參數、18B 活躍參數的 MoE 架構,支援 100 萬 token 上下文與原生多模態能力,並以 MIT 授權在 Hugging Face 開放權重。更引人注目的是,智譜官方表示 GLM-5.3 Flash 之前的整個免費預覽期間完全都在中國國產 AI 晶片上執行,每日處理量達 100 兆個 tokens。
從 Ox Alpha 到 GLM-5.3 Flash
故事要從 8 月 20 日說起。一個名為「Ox Alpha」的匿名模型突然出現在 OpenRouter 和 OpenCode 平台上,免費提供 100 萬 token 上下文的服務。這個來路不明的模型迅速在開發者社群引起轟動,因為它的表現與頂尖閉源模型不相上下。
8 月 21 日至 22 日,研究人員透過 Java stack trace 分析、錯誤碼 1214 比對,以及 tokenizer 的 30/30 完全匹配,將 Ox Alpha 鎖定為智譜 AI 的 GLM-5.3 系列模型。牛津大學研究人員的取證結果在社群中廣泛流傳。8 月 26 日上午,彭博社報導智譜 AI 確認 Ox Alpha 屬於 GLM 系列新迭代,並承諾當晚發布開放權重。同日晚間,Z.ai 官方正式宣布 Ox Alpha 就是 GLM-5.3-Flash,同步在 Hugging Face 開源上架 MIT 授權權重。
模型架構:混合注意力與稀疏啟動
GLM-5.3-Flash 採用全新的基礎模型訓練,架構和訓練配方都經過重新設計。智譜在 GLM 系列中首次引入結合稀疏注意力(sparse attention)與線性注意力(linear attention)的混合架構,搭配 IndexPool 機制處理長上下文場景。
技術亮點包括:
- Manifold-Constrained Hyper-Connections(mHC):一種新的連接機制,搭配混合注意力大幅降低長上下文推理成本
- 320B 總參數 / 18B 活躍參數:MoE 架構讓每次推理只啟動 18B 參數,兼顧效能與效率
- 100 萬 token 上下文:原生支援,非外掛式擴展
- 原生多模態:文字、圖片、影片全支援,視覺能力被整合進程式碼循環(渲染→驗證→修正)
- 30 兆 token 多模態預訓練語料
根據智譜的數據,相較於非 Flash 版本的 GLM-5.3,GLM-5.3-Flash 的注意力計算量減少 3.0 倍,KV 快取縮小 4.4 倍。
基準測試成績:逼近頂尖閉源模型
智譜公布的基準測試數據顯示,GLM-5.3-Flash 在多項關鍵指標上與 Claude Opus 4.8 和 GPT-5.6 Terra 不相上下:
- Terminal Bench 2.1:84.3 分(Claude Opus 4.8 為 85.0,GPT-5.6 Terra 為 87.4)
- DeepSWE v1.1:63.4 分(前代 GLM-5.2 為 46.2,提升 17.2 分;Claude Opus 4.8 為 58.0)
- AutomationBench v1.0.6:48.8 分(GLM-5.2 僅 26.2,提升 22.6 分;Claude Opus 4.8 為 41.0)
- GDPVal-AA v2:1773 分,超越 Claude Opus 4.8(1582)、GPT-5.6 Terra(1571)和 Gemini 3.7 Flash(1527),在企業級 Agent 工作流基準中領先
- Toolathlon Verified:78.4 分(GLM-5.2 為 59.9,Claude Opus 4.8 為 76.2)
- HLE w/ Tools:55.3 分(Claude Opus 4.8 為 57.9)
在 Z.ai 自家的 Code Bench v1.0 測試中(使用 Claude Code 2.1.207 測試框架),GLM-5.3-Flash 在最大努力等級下得分 29.0,與 Claude Opus 4.8 的 29.5 幾乎持平。
不過,GLM-5.3-Flash 並非全面領先。GPT-5.6 Terra 在 DeepSWE(69.6)和 Terminal Bench(87.4)上仍然保持優勢,Gemini 3.7 Flash 則在 AutomationBench(52.3)上居冠。
定價策略:Flash 級模型的價格戰
GLM-5.3-Flash 的定價是這波發布最具殺傷力的部分:
- 標準輸入:每百萬 tokens 0.15 美元(約 NT$4.9)
- 標準輸出:每百萬 tokens 0.50 美元(約 NT$16.3)
- 快取輸入:每百萬 tokens 0.03 美元(約 NT$0.98)
0.03 美元的快取輸入定價尤其值得關注。對於需要大量系統提示詞或重複上下文的 RAG(檢索增強生成)和 Agent 應用場景,這個價格大幅降低了營運成本。
智譜同時在 Z.ai 的 Coding Plan 中提供 GLM-5.3-Flash,訂閱用戶可獲得相當於 GLM-5.3 三倍的使用配額。
中國國產晶片全棧執行:基礎設施的新格局
智譜在發布部落格中明確表示:「這些流量全部在中國國產 AI 晶片上提供服務。」這句話的分量不容小覷。
根據官方描述,GLM-5.3-Flash 的基礎設施包含:
- 大規模中國國產加速器叢集,搭配高頻寬互連
- 客製化 SGLang 推理引擎,部分由 GLM-5.3 基礎設施 Agent 自行建構(模型最佳化自己的服務堆疊)
- EPD 解耦架構:Encode / Prefill / Decode 工作池在叢集規模分離運作
- 相同硬體上端到端服務效能提升 3 倍,每 token 成本與 NVIDIA GPU 相當
對於中國以外的開發者而言,這代表 MoE 架構的 Flash 模型可以在不依賴 H100 叢集的情況下,以 OpenRouter 規模提供服務。這對推理成本下降的預測有重要參考意義(老黃擔心的事情真的要來了嗎?)。
與 GLM-5.3 的差異
需要釐清的是,GLM-5.3-Flash 與 8 月 14 日發布的 GLM-5.3 是不同的產品。GLM-5.3 基於 743B 參數的基礎模型,主打程式碼與網路安全能力,開放權重需經過安全審查。GLM-5.3-Flash 則是 320B-A18B 的多模態 Flash 版本,MIT 授權即時發布。
結語
GLM-5.3 Flash 的發布代表了一個新階段:匿名預覽→社群解密→正式開源的「Ox Alpha 劇本」,證明了開放權重模型在 Agent 和程式碼工作流中已經具備與頂尖閉源模型競爭的實力。320B-A18B 的 MoE 架構、MIT 授權、每百萬 tokens 0.15 美元的輸入定價,加上完全在中國國產晶片上執行的基礎設施,這款模型同時在技術、商業和地緣政治三個維度上發出了明確信號。
對於開發者而言,最實際的影響是:在需要高頻、低延遲的 Agent 場景中,現在多了一個成本極低且效能接近前沿的選擇。Ox Alpha 的免費午餐已經結束,但開放權重 MoE 模型的時代才剛開始。





