隨著 Anthropic 上週推出 Claude Opus 5.5 後,不意外的,Claude 5.5 家族的第二款模型 Sonnet 5.5 稍早也正式上線。
Sonnet 5.5 延續 Claude 5.5 家族的能力升級,不僅回應速度比前一代 Sonnet 5 快 30% 以上,在同樣工作中使用的 Token 更少,每項任務最多可省 30%。此外,寫程式和操作電腦的能力也大幅進步,多項測試逼近 Opus 5.5。下面就整理給大家。
Anthropic 推出 Claude Sonnet 5.5:輸出速度快 30%、每項任務成本最多降 30%,Terminal-Bench 4.0 超越 Opus 5.5
根據 Anthropic 的介紹,Claude Sonnet 5.5 這次的改進主要有 5 個:
- 更快也更省:輸出速度比 Sonnet 5 快 30% 以上,是目前最快的 Sonnet。API 價格沒有調整,還是每百萬輸入 Token 2 美元、輸出 10 美元,但完成同一件事用掉的 Token 和工具呼叫變少,官方測試中每項任務的成本最多可以少 30%。
- 程式碼與 AI 代理能力:寫程式、理解程式碼庫,以及在命令列中執行多步驟任務的能力大幅提升,特別適合日常開發和修 bug。
- 電腦操作與圖表理解:這是跟前一代相比進步最多的地方之一,能看著螢幕自己動滑鼠鍵盤完成任務、讀懂圖表內容。它也是第一款只靠遊戲截圖就能破關《精靈寶可夢 紅》的 Sonnet 模型,同時具備更強的長時間任務能力,早期測試中也能處理持續數小時的工作。
- 寫作與設計:繼承 Opus 5.5 在自然寫作上的部分升級,做介面時也會多修一些細節,文件、簡報和試算表的完成度更高。
- 安全防護:Sonnet 5.5 的資安能力比 Sonnet 5 大幅提升,已經達到接近 Opus 5 的水準,因此成為第一款導入高階資安防護與 fallback 機制的 Sonnet 模型。
既然只要 Opus 一半的價錢,很多人一定想說,Sonnet 5.5 能不能直接拿來取代 Opus 5.5?
日常工作大多可以,但較困難的程式任務,Opus 5.5 還是首選比較穩。
也就是說,範圍明確的開發、修 bug、做文件和簡報,換成 Sonnet 5.5 效果差不多,但費用只要一半。而規劃大型架構、處理最複雜的程式問題,就還是交給 Opus 5.5 最好。Creator 的創意程式設計師 Kevin Ngo 用法就是這樣,讓 Opus 5.5 先把架構定好,再把實作交給 Sonnet 5.5 處理。
看跑分更清楚。
測試電腦操作的 OSWorld 2.1 中,Sonnet 5.5 拿到 80.1%,Opus 5.5 是 81.8%;Cursor 的 CursorBench 4.0 是 55.5% 對 57.8%;模擬職場知識工作的 GDPval-AA v2.1 是 1844 分對 1846 分,兩個模型分數都非常接近。更值得一提的是,命令列裡完成多步驟任務的 Terminal-Bench 4.0 測試中,Sonnet 5.5 還拿到 70.6%,超過 Opus 5.5 的 66.4%:
| 測試項目 | Sonnet 5.5 | Sonnet 5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0(命令列代理任務) | 70.6% | 10.3% | 66.4% | — |
| FrontierCode 1.1(程式碼) | 46.2% | 42.4% | 54.4% | 49.3% |
| CursorBench 4.0(程式碼) | 55.5% | 34.1% | 57.8% | — |
| GDPval-AA v2.1(職場知識工作) | 1844 | 1449 | 1846 | 1487 |
| AA-Briefcase v1.1(職場知識工作) | 1811 | 1359 | 1822 | 1483 |
| Humanity’s Last Exam(可用工具) | 64.5% | 54.9% | 67.7% | — |
| OSWorld 2.1(電腦操作) | 80.1% | 57.0% | 81.8% | — |
| Chartography(圖表理解,不用工具) | 61.6% | 15.6% | 64.4% | 53.6% |
最難的程式任務 FrontierCode 1.1,Sonnet 5.5 拿到 46.2%,落後 Opus 5.5 的 54.4% 有 8%,也輸給 GPT-6 Sol 的 49.3%。官方還補充,Sonnet 5.5 開 Max 的 FrontierCode 分數反而比 Xhigh 低,因為它會自己多跑程式碼審查,結果逾時或改到任務範圍以外:
安全方面,Sonnet 5.5 的資安能力比 Sonnet 5 大幅提升,因此 Anthropic 首度在 Sonnet 模型上加入跟 Opus 5.5 類似的資安防護。
這對一般修 bug 等日常開發不受影響,但比較高風險的資安請求會自動改由 Sonnet 5 回答。另外,Sonnet 5.5 也有防蒸餾分類器設計,用來防止別人抽取它的推理過程,拿去訓練自己的模型。
Claude Sonnet 5.5 目前已經全面上線,包括所有 Claude App、Claude Code、Claude Platform、AWS、Google Cloud 以及 Microsoft Azure。API 模型名稱是 claude-sonnet-5-5。
API 定價為每百萬輸入 Token 2 美元、每百萬輸出 Token 10 美元,跟 Sonnet 5 相同,只有 Opus 5.5 的一半:
| 每百萬 Token(美元) | Sonnet 5.5 | Opus 5.5 | GPT-6 Sol |
|---|---|---|---|
| 輸入 | 2 | 4 | 2 |
| 輸出 | 10 | 20 | 10 |
| 快取讀取 | 0.2 | 0.2 | 0.2 |
| 快取寫入 | 2.5 | 5 | 2.5 |
至於 Claude 5.5 家族的 Haiku 5.5 模型,官方表示會在未來幾週推出。








