就在剛剛(美東時間 8 月 13 日) Google 無預警發表最新的 Gemini 3.7 Flash 模型,距離上一版 3.6 Flash 僅僅過了三週。這款定位為「最聰明的工作馬(workhorse)模型」的更新,主打編碼、Agent 工作流與知識處理能力的顯著提升,並以半價促銷策略搶攻開發者市場。執行長 Sundar Pichai 在 X 上表示,Flash 模型的核心價值是「以實惠價格提供高效能」,團隊正加速推出更新以盡快送到開發者手中。這是 Google 今年夏天推出的第三版 Flash 模型,從 5 月的 3.5 Flash、7 月 21 日的 3.6 Flash 到現在的 3.7 Flash,更新節奏明顯加快。

Google 發表 Gemini 3.7 Flash:編碼能力追上 GPT-5.6,價格僅對手三分之一
編碼基準測試全面躍升
根據 Google DeepMind 資深總監 Tulsee Doshi 的說法,Gemini 3.7 Flash 在軟體工程任務上有「實質性進展」。與 3.6 Flash 相比的主要基準測試提升如下:
- DeepSWE v1.1:49.0% → 65.3%(軟體工程任務基準)
- FrontierCode 1.1 Main:34.4% → 43.6%(前沿編碼能力)
- WebDev Arena Elo:1,538 → 1,588(網頁開發品質評分)
- Terminal-Bench 2.1:78.0% → 85.8%(終端操作能力)
- GDP.pdf:22.0% → 34.0%(複雜文件處理能力)
- AutomationBench:17.0% → 30.4%(商業工作流自動化)
在多模態與長上下文方面也有亮眼表現:GDM-MRCR v2 長上下文檢索達 97.0%,LVBench 長影片理解達 85.4%。
與 GPT-5.6、Claude Sonnet 5 的對決
Gemini 3.7 Flash 最引人注目的不只是效能提升,而是它在與競品的正面比較中展現出的 CP 值優勢。根據開發者社群整理的詳細數據,與 GPT-5.6 和 Claude Sonnet 5 的關鍵基準比較如下:
- FrontierCode 1.1:Gemini 43.6% vs Claude 42.7% vs GPT-5.6 41.3%(Gemini 領先)
- Code Arena Elo:Gemini 1,588 vs Claude 1,541 vs GPT-5.6 1,523(Gemini 領先)
- DeepSWE v1.1:GPT-5.6 69.6% vs Gemini 65.3% vs Claude 53.8%(GPT-5.6 領先)
- Terminal-Bench 2.1:GPT-5.6 87.4% vs Gemini 85.8%(GPT-5.6 小幅領先)
- AutomationBench:Gemini 30.4% vs GPT-5.6 23.6% vs Claude 10.7%(Gemini 大幅領先)
- GDP.pdf:Gemini 34.0% vs Claude 28.0% vs GPT-5.6 24.7%(Gemini 領先)
- Long-context GDM-MRCR v2:Gemini 97.0% vs GPT-5.6 93.5% vs Claude 81.5%(Gemini 領先)
GPT-5.6 在 DeepSWE、Terminal-Bench 3.0、OSWorld 以及部分高難度推理測試上仍保持領先,Claude Sonnet 5 則在 Agent’s Last Exam(33.3% vs Gemini 26.3%)勝出。但 Gemini 3.7 Flash 的定價策略讓這場競爭變得更有意思。
半價策略:每百萬 Token 價格戰
Gemini 3.7 Flash 的促銷價為每百萬輸入 Token 0.75 美元、每百萬輸出 Token 3.75 美元,僅為 3.6 Flash 原價的一半,優惠持續到 2026 年底。與主要競品的定價比較:
- Gemini 3.7 Flash:$0.75 / $3.75(促銷價)
- GPT-5.6:$2 / $12
- Claude Sonnet 5:$2 / $10
- Muse Spark 1.2:$1.25 / $4.25
不過 OpenAI 近期也積極調降了 GPT 5.6 的價格,其 Flash 等級的 Luna 版本定價為 $0.20 / $1.20,比 Gemini 3.7 Flash 更便宜。 在 OpenRouter 平台上,Gemini 3.7 Flash 的價格進一步壓低至 $0.38 / $1.88。
Google 正在用價格換取開發者黏著度。對於需要大規模執行編碼 Agent、文件處理管線或工具呼叫系統的開發者來說,效能每美元的比值比單一基準測試的冠軍更重要。用這套價格跑一個完整的編碼任務,成本可能只有對手的三分之一甚至更低,這對需要大量 Token 消耗的 Agent 工作流來說是決定性的差距。
Google 技術長 Tulsee Doshi 表示,3.7 Flash 在遇到障礙時能更好地自我調整,在需要時主動釐清使用者意圖,並且更精確地遵循指令。模型在多步驟規劃與工具呼叫上投入了更多運算資源,減少開發者手動介入和重試的次數。在安全層面,模型更新了針對化學、生物、放射性與核子(CBRN)領域以及網路攻擊用途的防護機制。
使用管道與限制
Gemini 3.7 Flash 目前已在以下平台上線,Google 也宣布 Gemini API、AI Studio 與 Android Studio 的開發者可以立即開始使用:
- Gemini API / Google AI Studio
- Android Studio
- Google Antigravity(Agent 開發平台)
- Gemini Enterprise Agent Platform
- Gemini 應用中的 Gemini Spark(僅限 AI Pro 或 Ultra 訂閱者)
目前一般 Gemini 聊天介面仍執行 3.6 Flash,3.7 Flash 尚未全面替換,僅在 Gemini Spark Agent 中提供給 AI Pro 和 Ultra 訂閱用戶使用。
Starting today for Google AI Pro and Ultra subscribers, Gemini Spark – your 24/7 personal AI agent in the @GeminiApp – will also run on Gemini 3.7 Flash ✨
Now when you ask Gemini Spark to get things done for you, our smartest workhorse model is on the job handling multi-step… pic.twitter.com/yigA76BhRR
— Google (@Google) August 13, 2026
旗艦模型缺席的焦慮
Gemini 3.7 Flash 的快速發布節奏,也掩蓋了一個 Google 不太想面對的問題:旗艦模型 Gemini 3.5 Pro 已經延遲了三次。Sundar Pichai 在 5 月的 Google I/O 上承諾 3.5 Pro 將在 6 月推出,但至今仍未推出(業內普遍認為會直接推 Gemini 4 Pro)。
同時,Google DeepMind 面臨嚴峻的人才流失問題。Noam Shazeer(Character.AI 創辦人,被 Google 以 27 億美元收購後再次離開加入 OpenAI)、諾貝爾化學獎得主 John Jumper、David Silver(AlphaGo 之父,創辦 Ineffable Labs 募資 11 億美元)等核心研究人員先後離開。今年 7 月,Alphabet 市值因 3.5 Pro 延遲消息蒸發約 2,250 億美元。
總結
Google 用三週一款新 Flash 的節奏,試圖向市場證明自己在 AI 模型開發上的速度。從某個角度來看,這個策略確實有效:Flash 系列持續進步,價格持續下降,開發者生態系持續擴大。但核心考驗不在 Flash 系列能否持續進步,而是 Gemini 3.5 Pro 能否在最終問世時交出足以與 Fable 5、Claude Opus 5、GPT-5.6 Sol 匹敵的成績單。
Google 的 AI 戰略正面臨一個關鍵矛盾:一方面擁有業界最龐大的研究團隊和基礎設施,另一方面卻無法將這些優勢轉化為旗艦模型的及時交付。Flash 模型的快速迭代確實替 Google 爭取了寶貴的時間,但開發者和投資人的耐心不會無限持續。當 OpenAI、Anthropic、Meta 甚至新創公司都在加速推出旗艦模型的此刻,Google 需要的不只是「更快的 Flash」,而是「夠強的 Pro」。
