真沒想到,Claude Opus 5 這麼快就出來了,最近模型更新速度真的不是普通的快。稍早 Anthropic 正式推出新一代 Claude Opus 5 模型,如果要用一句話形容這次升級,就是「用一半價格,獲得接近旗艦級的智力」。
Anthropic 表示,Opus 5 的能力已經相當接近自家最頂級的 Claude Fable 5,但同樣的任務所花費的成本只有一半,特別是在程式開發、專業知識工作與 AI 代理任務上,展現出很高的成本效益。
Claude Opus 5 正式登場:半價逼近 Fable 5 智力,自我驗證、程式碼與 Agent 能力全面升級
Claude Opus 5 最明顯的進步是,不會產出一個「看起來能用」的答案後就停下來。Anthropic 形容它是一款更有想法、也更主動的模型,會自己檢查結果、找出錯誤,必要時建立測試環境,再持續修改到任務真正成功。
這差異在程式開發上特別明顯。官方分享的一項測試,讓模型修復熱門開源套件管理器中的真實 Bug。Opus 5 不只找到問題的根本原因,還抓出原本社群修補程式遺漏的邊界狀況。競爭模型在這任務中,只修掉表面症狀,然後就宣告問題已經解決。
視覺與前端產出也有明顯升級。Anthropic 就展示一些作品,包含能調整不同物體與參數的風洞氣流模擬。早期測試者也表示,Opus 5 做出的動畫、遊戲與 3D 內容,是目前 Opus 系列中表現最好的一次。
官方開發文件補充,Opus 5 在圖表、文件、示意圖理解,以及 UI、前端畫面重建上都有加強。如果搭配裁切、分析和視覺驗證工具,效果會比單純增加推理量更划算。
更特別的是,這次能力提升並沒有伴隨更高風險。
Anthropic 的自動化行為稽核會測試模型是否出現欺騙、配合濫用,或自行採取不當行動等問題,Opus 5 的整體不對齊行為分數為 2.3,是近期 Claude 模型中最低:
Anthropic 表示,它比 Opus 4.8、Sonnet 5 與 Fable 5 更遵守 Claude Constitution,欺騙性行為發生率最低,也比較不容易被誘導去做難以挽回後果的危險操作。
在 Frontier-Bench v0.1 軟體工程評測中,Opus 5 超越所有參與模型,表現是 Opus 4.8 的兩倍以上,這也意味著,每項任務成本反而更低:
科學研究部分,Opus 5 在 Anthropic 所有生命科學評測上都超過 Opus 4.8。其中,利用光譜資料推導分子結構的有機化學內部測試提高 10.2%。預測蛋白質序列變異會如何影響功能,則提高 7.7%。
金融與法律方面的效率數據來自參與早期測試客戶,一個金融建模測試中,Opus 5 平均準確率提高 9 個百分點,執行輪數與工具呼叫減少約三分之一,完成時間縮短 60%。另一項交易評測只用了 Opus 4.8 約七分之一的推理 Token,延遲也不到一半。
法律代理測試中,Opus 5 在較低推理強度下仍能維持接近 Opus 4.8 Max 的品質,平均少用 26% Token。
下方是 Anthropic 分享的測試數據,Opus 5 在 Frontier-Bench、GDPval-AA、ARC-AGI 3、BrowseComp、OSWorld 2.0 與 AutomationBench 都拿到最高成績:
雖然 Opus 5 看起來很強,但 Fable 5 依舊是目前擁有最高前沿智慧的旗艦模型,Mythos 5 則提供給少數通過審核的合作夥伴,專攻資安與生物研究。
Anthropic 也補充 Opus 5 雖然已經很會找出程式漏洞,但在把漏洞變成可實際攻擊的 Exploit 方面,仍遠遠落後 Mythos 5:
Claude Opus 5 提供 100 萬 Token 上下文,而且是預設與最大值,不需要另外選擇長上下文版本,單次最大輸出可提高到 128K Token。目前已在 Claude 各平台上線。
而 Claude Opus 5 的 API 定價維持每百萬輸入 Token 5 美元、每百萬輸出 Token 25 美元,跟 Opus 4.8 完全相同。兩者真正的差異在,同一項複雜任務所消耗的 Token、工具呼叫與執行輪數。




