中國 AI 新創公司智譜(Zhipu AI,港股代號 2513.HK)在 8 月 14 日正式發表 GLM-5.3,這款新模型沿用 GLM-5.2 的 743B MoE 基座架構,僅透過後訓練 Scaling 實現能力躍遷,編程體感較前代提升 50%,在多項公開基準測試中拿下開源模型最高分。智譜同步宣布,完整模型權重將於兩週後開放下載。這是智譜自 6 月發表 GLM-5.2 以來的第三版更新,版本跳躍節奏與 DeepSeek、Kimi 等中國競爭對手的密集發布同步。GLM-5.3 的核心意義在於「智譜沒有造更大的模型,而是在同一個基座上把訓練做到極致」,Post-training Scaling (後訓練擴展)正在成為一條獨立的技術路線。
智譜發表 GLM-5.3:基座模型不變、後訓練拉高智慧上界
GLM-5.3 的技術核心是「後訓練 Scaling」。智譜官方說明,GLM-5.3 與 GLM-5.2 使用完全相同的基座模型,兩者的差異完全來自後訓練階段。智譜基於 IndexShare、SAO 以及持續演進的新一代 Slime 非同步強化學習框架,在相同基座上高效推進強化學習,將模型的智慧上界大幅拉高(與 DeepSeek V4 Flash 正式版相同路線)。
訓練環境的規模是前代的數十倍,涵蓋更豐富的環境類型,訓練週期也大幅拉長。智譜表示,部分訓練任務相當於資深工程師連續數天的工作量,模型需要使用真實的計算叢集、儲存系統、內部文件與程式碼庫來完成任務。這種「專家工作流」層級的訓練方式,是 GLM-5.3 能力提升的關鍵因素。
智譜 X 官方帳號 @Zai_org 發文指出,GLM-5.3 的參數規格維持 743B 總參數(約 40B 啟用參數)、1M 上下文視窗、128K 最大輸出 Tokens 的配置不變。
Introducing GLM-5.3: Built to Code. Ready for Cyber Defense.
– Top-tier coding and agentic capabilities, achieved through post-training on the 743B base model
– A major leap in cybersecurity, setting a new standard among open modelsTech Blog: https://t.co/ekQkO83jCv pic.twitter.com/y3Y2AB0wxr
— Z.ai (@Zai_org) August 14, 2026
基準測試:開源模型全面領先
智譜在公告中列出多項基準成績,定位 GLM-5.3 為「編程能力最強的開源模型」。以下為主要數據:
- Terminal-Bench 3.0:從 GLM-5.2 的 4.6 躍升至 28.3,衡量模型在真實終端環境中完成複雜任務的能力
- DeepSWE v1.1:從 46.2 提升至 66.9,聚焦長程軟體工程與持續程式碼修改
- Agents’ Last Exam:從 23.8 提升至 28.5,覆蓋多類真實專業場景、強調跨工具協作
- GDPval-AA v2:得分 1,769,覆蓋 44 種職業,展現從編程向專業任務執行延伸的能力
- Z.ai Code Bench(自研):High 檔位下準確率 31.4%,超過 Claude Opus 4.8 最高檔的 29.5%,且每項任務平均輸出約 5 萬 Tokens,Opus 4.8 則需要約 12 萬 Tokens
智譜表示,GLM-5.3 的編程與智慧體能力「接近 Claude Fable 5」。在 Token 利用效率方面,GLM-5.3 以更短的執行路徑完成相同品質的任務,這意味著開發者在實際使用中能獲得更低的推理成本。
網路安全能力的意外湧現
GLM-5.3 最令外界意外的新增能力來自網路安全領域,智譜表示這項能力是在長程任務環境不斷擴展的過程中自然湧現,智譜並未刻意針對安全領域進行訓練。智譜自 2025 年 9 月開始在這個方向投入研究,聯合清華大學、南開大學,以及雲起無垠、綠盟科技、賽博崑崙、DARKNAVY、騰訊玄武等多家安全團隊,開展密集的紅隊測試與安全評估。
在白盒程式碼審查與漏洞發現任務中,GLM-5.3 的表現持平 Anthropic 的 Mythos 5。具體測試數據方面:
- CyberGym:得分 84.5%,高於 Mythos 5 的 83.8% 和 GPT-5.6 Sol 的 83.6%
- ExploitBench:從 24.4% 提升至 54.4%
智譜表示,這些安全測試覆蓋漏洞分析、驗證和利用不同階段。經過初篩、去重後,累計發現漏洞 2,436 個,其中 1,097 個為中高危,涉及系統內核、作業系統、瀏覽器引擎、開源基礎元件、網際網路應用與網際網路協定等 269 個項目。智譜在公告中列舉了幾個具體案例,包括在 Cursor、微軟郵件與辦公系統、某國民級通訊 App、DNS 協定(追溯至 1983 年)以及一家人形機器人廠商產品中發現的漏洞,均已進入 CNNVD/CNVD 披露與修復流程。
開放權重的三層安全防線
GLM-5.3 的權重設定在兩週後開放,智譜為延遲開放給出的理由是安全考量。由於 GLM-5.3 湧現了顯著的網路安全能力,智譜希望在權重開放前完成深度安全對齊。智譜設計了三層安全措施:外層是輕量分類器,標記並攔截大規模濫用請求;中間是推理監控器,在模型推理過程中即時審查任務意圖;最裡層是模型自身的安全對齊,讓模型自主識別並拒絕惡意請求。前兩層依賴伺服器端,不會隨權重一起交付,因此深度安全對齊是開放權重場景下唯一仍然有效的一層防線。
智譜在公告中坦承:「漏洞防禦和漏洞利用共用一段能力鏈。模型讀懂大型程式碼庫、安排長程任務、呼叫工具並驗證結果,可以幫維護者補洞,也可能把一次攻擊繼續往前推。」這段表述解釋了為何開放權重的時間被推後。
生態與定價
即日起,GLM-5.3 上線智譜官方編程工具 ZCode 與效率工具 AutoClaw,GLM Coding Plan 全量使用者上線並開放訂閱。今天 13:00,所有 Coding Plan 使用者的後台額度重置,使用額度回滿。在 TraeWork/TraeCode/扣子、WorkBuddy/CodeBuddy、Qoder/QwenWork、CatPaw、JoyCode、OpenCode 等編碼平台同步開放搶先體驗。
API 價格方面,智譜尚未公布 GLM-5.3 的正式定價。參考 GLM-5.2 在 OpenRouter 上的定價約在每百萬輸入 Tokens 0.40 至 0.91 美元(約新台幣 13 至 30 元)、每百萬輸出 Tokens 1.28 至 3.20 美元(約新台幣 42 至 104 元)的區間,GLM-5.3 的定價預計在同一水準或略有上浮。
結語
GLM-5.3 的發布策略與當前中國 AI 產業的密集競爭節奏高度吻合。在 Kimi K3、Qwen 3 Max 等模型相繼發表的背景下,智譜選擇在基座不變的前提下,透過極致的後訓練 Scaling 來證明「同一個基座還有大量未被開發的智慧空間」。智譜在 8 月 3 日提前洩漏的 ZCode 官網頁面和 SDK 倉庫提交記錄,已經讓市場對這次發布有所預期,當天智譜股價上漲約 8%。
網路安全能力的湧現為 GLM-5.3 增加了獨特的市場定位。智譜強調,開源安全模型能讓更多組織獲得防禦級 AI 能力,而不是被鎖定在少數閉源廠商的服務中。兩週後的權重開放將是檢驗這一願景的關鍵節點。

