這兩天一個名為 Ox Alpha 的匿名模型悄然出現在 OpenRouter 平台上,代號為 stealth/ox-alpha。這款模型沒有公司公告、沒有品牌宣傳,僅以「Stealth」匿名供應商的身份上線。中文圈因其諧音暱稱為「牛來」(Ox is Coming),該模型支援 1M 上下文、多模態推理、能力優異且可以免費使用引發大量討論。

Ox Alpha 核心規格:百萬 Token 上下文與原生多模態
根據 OpenRouter 頁面資訊,Ox Alpha 於 8 月 20 日前後上線,提供約一週的免費使用期,並承諾 Zero Data Retention(不留存使用者資料、不用於訓練)。其核心規格包括:
- 上下文視窗:1,048,576 tokens(約 100 萬),接近 Gemini 3.7 Flash 等級
- 最大輸出:131,072 tokens(約 13 萬)
- 原生多模態輸入:支援文字、圖片、影片三種格式
- 推理能力:預設啟用推理模式(reasoning effort: max),支援 Tool Calling
- 服務容量:官方描述日處理量上看 100 兆 tokens,已處理約 1.83 兆 tokens
- 速度:實測約 30-50 tokens/sec,平均約 40t/s
OpenRouter 明確表示,這款模型由匿名第三方開發和營運,OpenRouter 僅負責路由,並非模型開發者。
Tokenizer、影片編碼器、音訊行為三重驗證高度吻合 GLM 5.3
Ox Alpha 上線後,多位獨立研究者對其進行了系統性的技術指紋測試,結果高度指向智譜 AI(Z.ai)的 GLM 系列模型。
Tokenizer 指紋比對:研究者 dax 在 X 上公布了對25 組不同 Prompt 的 Token 計數測試。結果顯示,Ox Alpha 的原生 Token 數與 GLM-5.3 完全一致,僅存在固定的 +75 Token 偏移(推測為 OpenRouter 或供應商加上的系統提示詞包裝)。Tokenizer 是模型的「指紋」,兩個不同基礎模型在 25 組多樣化 Prompt 上產生完全相同的 Token 分割序列,巧合機率極低。
影片編碼器比對:同一研究者進一步測試了 4 段控制影片的 Token 消耗。Ox Alpha 的 Token 花費與智譜自家多模態模型 GLM-5V-Turbo 在三個獨立的編碼設計選擇上逐 Token 完全一致:FPS 不變幀採樣、每秒約 147 tokens 的時長縮放、以及逐幀解析度縮放。三項獨立設計選擇同時匹配,是很難用「模式匹配熱情」來解釋的硬證據。
音訊拒絕行為:Ox Alpha 拒絕音訊輸入,路由方式與 GLM-5V 完全相同(不暴露音訊端點)。而小米 MiMo v2.5 則接受並處理音訊輸入。這是一個二元行為差異,直接排除了 MiMo 理論。
此外,OpenRouter 公開的模型端點參數配置顯示,GLM-5.3 和 Ox Alpha 擁有一套相同的參數接口,而這套新配置是在 Ox Alpha 出現前兩天才上線的。兩者的知識截止範圍也一致,均延伸至 2025 年 11 月。
排除其他候選者
在指紋測試結果公布前,社群最常見的兩個猜測分別是小米 MiMo 和阿里巴巴 Qwen。然而,這兩項理論在技術驗證後均被削弱:
- 小米 MiMo:音訊端點行為直接矛盾(MiMo 接受音訊,Ox Alpha 拒絕)。此前 OpenRouter 的匿名模型 Hunter Alpha 和 Healer Alpha 最終都被確認是 MiMo 的預覽版本,但這次的指紋證據指向了不同的實驗室。
- Qwen 3.8:被納入同一輪指紋測試後,產生了與 Ox Alpha 明顯不同的 Tokenizer 和編碼器特徵。
知乎上的討論也指出,有人用 25 組完全不同的 Prompt 對比 Token 數,發現 Ox Alpha 的原始 Token 數和 GLM-5.3 幾乎一模一樣,每次只固定多出 75 個 Token,目前普遍認為 Ox Alpha 是 GLM-5.3 的多模態版本(跟 DeepSeek-V4-Flash-Vision-Exp 一樣路線)。
效能實測:DeepSWE 子集測試表現亮眼
在實際效能方面,社群對 Ox Alpha 進行了多項測試。其中最受關注的是 DeepSWE Coding 測試,這不是讓模型解一道演算法題,而是更接近真實軟體工程任務:給模型一個真實程式碼專案和具體需求,讓它自行理解程式碼、找到問題、修改並完成任務。在 10 個任務的小樣本測試中,結果如下,表先優於 O、A 兩家的 SOTA 模型:
- Ox Alpha:約 80%
- Claude Fable 5:65%
- GPT-5.6 Sol:52%
為何選擇匿名發布?
如果 Ox Alpha 確實是智譜的模型,為何要隱藏身份?答案可能在於「Stealth 發布」這種策略本身的價值。
匿名上線在中性平台上,可以在模型正式攜帶實驗室名稱和聲譽面對公眾 scrutiny 之前,以大規模真實生產流量進行壓力測試。OpenRouter 的後台數據顯示,僅 Claude Code 和 Hermes Agent 兩個工具就在幾天內通過 Ox Alpha 推送了數十億 tokens 的流量。
這種做法有前例可循:先前的 Hunter Alpha 和 Healer Alpha 兩款 OpenRouter 匿名預覽模型,最終都被確認是小米 MiMo 的發布版本。智譜創辦人唐杰此前也曾表示多模態模式即將上線,距離該表態已過了約三個月。
從 Coding Agent 到多模態 Agent 的路線演進
Ox Alpha 的意義可能不只是「GLM 又強了幾分」。目前公開的 GLM-5.3 是純文字模型,而 Ox Alpha 補上了圖片和影片輸入能力,搭配百萬 Token 上下文,意味著它的技術路線可能已經從 Coding Agent 演進為多模態 Agent。這代表 Agent 不再只能讀程式碼和操作終端機,而是可以直接「看」截圖、「看」網頁、「看」影片,再根據看到的內容調用工具、執行任務。這個方向的價值,比在某個基準測試上多漲幾分大得多。
另外,DeepSeek 也剛在近日補上了視覺能力,中國模型的多模態 Agent 路線正在加速推進。如果智譜最終確認 Ox Alpha 的身份,那麼 GLM-5.3 可能只是一個起點。
DeepSeek 首款多模態模型 DeepSeek-V4-Flash-Vision-Exp 上線,能力與Opus 4.8相當、價格不到對手2%
開發者如何體驗
Ox Alpha 目前可透過 OpenRouter API(stealth/ox-alpha)和 OpenCode Zen 免費使用。開發者可透過標準 OpenAI 相容介面快速整合至 OpenClaw、Hermes、Cursor、Aider 等工具(只要跟 Agent 說要加入這個模型即可,目前測試感覺能力不錯)。其百萬 Token 上下文允許直接輸入整個程式碼庫進行重構,無需 RAG 分塊處理;影片輸入則可用於診斷前端互動 Bug。
Notes for this stealth model:
💰 It is free
🔑 This time, the provider does not train on your prompts or completions— OpenRouter (@OpenRouter) August 20, 2026
免費預覽期約一週,之後的定價和正式身份揭曉,預計很快就會有答案。




