Gemini 已經有好一陣子沒有推出讓人眼睛一亮的旗艦模型了。上一次 Google 拿出最高等級的模型,是今年 2 月的 Gemini 3.1 Pro Preview,5 月的 Google I/O 上,官方雖然曾預告 Gemini 3.5 Pro 會在下個月登場,結果最後沒有推出,反而是 Flash 系列輕量模型從 3.5、3.6、3.7 一路更新到 3.8。這也讓很多人想問,Gemini 是不是快不行了?
而就在稍早,Google 終於端出全新世代 Gemini 4,並率先發表旗艦模型 Gemini 4 Argon。從官方公布的測試結果來看,Argon 在 19 項跑分中拿下 13 項第一,單次輸出上限更從原本的 6.4 萬 Token,一口氣暴增到 100 萬 Token。雖然首波還沒有直接開放給一般用戶使用,但至少從 Gemini 4 Argon 的登場可以看出,沉寂一段時間的 Gemini 旗艦模型,終於開始動起來了。
Google 發表 Gemini 4 Argon:單次輸出上限 100 萬 Token,主攻寫程式、法律財務與資安防禦
稍早 Google 於官方部落格宣佈推出 Gemini 4 Argon 新一代前沿模型,也就是所有模型中最頂尖的等級。Gemini 4 Argon 主攻三個領域:真實世界的軟體工程、法律與財務這類企業知識工作,以及資安防禦。
特色大致可以分成 4 個:
- 單次輸出上限拉到 100 萬 Token
- 寫程式與企業知識工作的能力
- 看圖表、看長影片這類視覺理解
- 找出並修補資安漏洞的能力
首先是超長的輸出上限。Gemini 4 Argon 單次能輸出的內容上限,從前一代的 6.4 萬 Token 提升到 100 萬 Token,可說是目前業界最高。作為對比,目前競爭對手的輸出上限大多在 12.8 萬 Token。
Google 表示,當模型有足夠的空間深入思考、在一次執行裡產生幾十萬個 Token,就比較有機會一口氣把困難的問題解完,而不是想到一半就被截斷。
寫程式與企業知識工作部分,Google 說內部工程師已經把 Argon 用在日常工作上,從一般除錯、大型程式碼搬遷到演算法設計都有。除此之外,還特別強調 Argon 在財務、法律、稅務這類白領工作的表現,像是做多步驟的財務研究、撰寫法律文件,或是在 Zapier 這類自動化平台上把一整套業務流程從頭跑到尾。
Argon 在需要「視覺理解」的知識工作上也特別強,例如分析專業圖表、從很長的影片裡找出特定細節,或是讀完一系列文件後直接採取行動。
資安防禦是 Google 這次著墨最多的部分。
Google 提到他們刻意把 Gemini 4 Argon 訓練成擅長資安防禦的模型,能自己找出軟體漏洞、驗證漏洞是否真的存在,再自動寫出修補。早期測試中,Argon 在全球醫院使用的醫療軟體裡,找到一個會外洩敏感個資的嚴重漏洞,這是先前其他前沿模型都沒有發現的。
官方這次也公布一張 19 項測試的對照表,比較對象是 OpenAI 的 GPT-6 Astra,以及 Anthropic 的 Claude Fable 5.1 和 Claude Opus 5.5,Argon 在其中 13 項拿下第一、1 項並列第一、5 項落後。完整成績表格如下:
| 類別 | 測試項目 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|---|
| 知識工作 | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% | |
| Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% | |
| Harvey 法律代理測試 | 19.6% | 5.4% | 6.7% | 3.8% | |
| 代理式寫程式 | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% | |
| Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% | |
| Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% | |
| 機器學習工程 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 科學與數學 | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% | |
| RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% | |
| 長上下文 | GraphWalks(12.8 萬 Token 以內) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks(25.6 萬至 100 萬 Token) | 84.2% | 71.8% | 65.0% | 66.8% | |
| 電腦操作 | Agent’s Last Exam | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 | 69.2% | 72.6% | — | — | |
| 多模態理解 | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench | 91.7% | 87.5% | 79.7% | 83.7% | |
| 資安 | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
先看 Argon 領先的部分,差距最大的集中在企業知識工作。
衡量 AI 在財務、程式、法律、稅務工作上經濟價值的 Vals Index,Argon 拿到 68.9%,Claude Opus 5.5 是 67.0%、Claude Fable 5.1 是 65.8%、GPT-6 Astra 是 63.1%,領先幅度不算大:
差距較大的是 Zapier 推出的 AutomationBench,這項測試看的是模型能不能把業務流程從頭到尾自動跑完,Argon 拿到 51.3%,第二名 Claude Opus 5.5 是 42.5%、GPT-6 Astra 是 41.4%,領先將近 9%:
最誇張的是法律 AI 公司 Harvey 的法律代理測試,這項測試難度很高,四個模型的分數都很低,但 Argon 拿到 19.6%,GPT-6 Astra 只有 5.4%、Claude Opus 5.5 更只有 3.8%,Argon 的分數是對手的三倍以上:
很多人關心的寫程式方面,在 DeepSWE v1.1 測適中,Argon 拿到 77.9%,Claude Opus 5.5 是 74.2%、GPT-6 Astra 是 74.1%,Google 稱這是目前的最高紀錄。Vibe Code Bench 也以 91.9% 小勝兩款 Claude 的 90.3%:
科學與視覺理解也有不錯的表現,像是測試長影片理解的 LVBench,Argon 拿到 91.7%,GPT-6 Astra 是 87.5%、Claude Opus 5.5 是 83.7%。不過電腦操作的 Agent’s Last Exam,Argon 39.5% 只比 Claude Opus 5.5 的 38.2% 高一點。
資安則是 Argon 跟 GPT-6 Astra、Grok 4.7 在 CWE-bench v1 並列第一,兩者都是 68%,Claude Opus 5.5 以 67% 緊追在後:
當然,Argon 也不是每一項都贏,有 5 項測試落後,其中 2 項 Argon 甚至是四個模型中的最後一名。
難度更高的軟體工程測試 FrontierSWE v2,Argon 只拿到 55.0%,GPT-6 Astra 是 65.5%、Claude Opus 5.5 是 62.3%。Terminal-bench 4.0 測試 Argon 拿到 57.4%,Claude Opus 5.5 以 66.4% 大幅領先,GPT-6 Astra 也有 58.2%。
比較可惜是,Google 這次沒有放 Gemini 3.1 Pro 或 Gemini 3.8 Flash 的成績,因此沒辦法直接看出 Gemini 4 Argon 在各項測試比前代進步多少。
Gemini 4 Argon 現階段只透過 Google DeepMind 的 Fairwind 計畫開放,尚未開放給一般用戶。不過 Google 有提到,會一邊蒐集早期測試者的回饋、一邊調整防護措施,然後盡快開放給開發者、企業和一般消費者,第一批會是付費 API 客戶和 Google AI Ultra 訂閱者。
API 定價目前已經公佈,分成引入價和正式價兩階段,不過沒說引入期會維持多久:
| 模型(每百萬 Token) | 輸入 | 快取輸入 | 輸出 |
|---|---|---|---|
| Gemini 4 Argon(引入價) | 2 美元 | 0.10 美元 | 10 美元 |
| Gemini 4 Argon(正式價) | 4 美元 | 0.20 美元 | 20 美元 |
| Claude Opus 5.5 | 4 美元 | 0.20 美元 | 20 美元 |
| GPT-6 Astra | 10 美元 | 1 美元 | 50 美元 |












