北京時間 9 月 10 日中午 12 點,中國深度求索(DeepSeek) 正式發布 DeepSeek-V4.1-Flash,同步調降 Flash 系列 API 價格,並把上一代的 V4 Flash 與 V4 Flash Vision Exp 直接下線。官方在公告裡另外宣布一件事:9 月 14 日中午 12 點之後、到 V4.1 Pro 上線之前,所有送往 V4 Pro 的請求將全部改由 V4.1 Flash 接手,並按 Flash 的單價計費。DeepSeek 表示 V4.1 Flash 在性能、費用、速度、總用時等指標上全面超越 V4 Pro,因此計畫有序下線 V4 Pro。
DeepSeek V4.1 Flash 官方定位:新架構家族的最小顆,原生看得懂圖
V4.1 Flash 是 DeepSeek 全新模型結構系列中尺寸最小的模型(552B MoE 架構模型),具備原生多模態視覺理解能力,設計目標寫得很直白:能力上限更高、推理速度更快、吞吐更大,並且可以擴展到更大參數規模的模型。翻成白話,這顆 Flash 是新架構的第一顆,後續更大的型號會沿著同一套結構往上堆。
🚀 Introducing DeepSeek-V4.1-Flash: smarter, faster, more efficient.
🔹 Introducing the smallest model in our new architecture family, with native visual understanding.
🔹 Designed for greater capability, faster inference, higher throughput, and scaling to larger models.1/6 pic.twitter.com/wxJGiyX56o
— DeepSeek (@deepseek_ai) September 10, 2026
生態系方面,騰訊的 WorkBuddy 與 CodeBuddy,以及 OpenCode 已宣布全量接入 V4.1 Flash。
速度實測:每秒 427 tokens,前代的 6 倍
V4.1 Flash 最直觀的升級是速度。多位技術部落客與開發者實測,深度長文本推理場景下生成速度可達每秒 420 個 token,端到端吞吐量達到 409.5 tok/s。在部分媒體的測試中,峰值甚至觸及 427 tok/s。
與前代 V4 Flash Vision-Exp 相比,各類任務的提速幅度如下:
- 49k 超長上下文檢索:5.2 倍
- SVG 程式碼生成:6.0 倍
- Manacher 回文演算法題:4.6 倍
- 大型 SQL 查詢生成與最佳化:5.0 倍
- asyncio 異步架構重構:3.9 倍
有開發者在 Hacker News 上分享,用 V4.1 Flash preview 跑大量任務時,模型的生成速度快到「比工具呼叫本身的延遲還快」。在終端機環境下執行 .metal 到 .cu 的核心轉換重構,V4.1 Flash 需要的引導比 Opus 更少,還寫出更好的程式碼註解。
至於能力部分,官方公布的評測數字如下:
- GPQA Diamond:90.9
- HLE(無工具):36.8,官方另註記 39.1 是在純文本子集上的成績
- Codeforces 評分:3471
- MathArena Apex:65.6
- Terminal-Bench 2.1:90.6;Terminal-Bench 3.0:30.0;Terminal-Bench 4.0:31.2
- DeepSWE v1.1:74.2;NL2Repo-Bench:65.4;ProgramBench:20.3
- CyberGym:88.1;SEC-Bench Pro:62.8;ExploitGym:15.3
- HLE(有工具):63.9;Agents’ Last Exam:31.8;Automation-Bench:54.8
- Chartography(有工具):78.9;BabyVision(有工具):89.6;ZeroBench-main(有工具):49.0
跟自家前代放在一起比,Terminal-Bench 2.1 是 90.6 對上 V4 Pro 的 87.9、V4 Flash Vision Exp 的 83.9、V4 Flash 的 82.7;Agent 類的 Agents’ Last Exam 從 V4 Pro 的 25.7 拉到 31.8,CyberGym 從 83.3 到 88.1,Automation-Bench 從 31.8 到 54.8,進步的幅度不小。
領先技術:非對稱的 Causal Encoder-Decoder 與 KV Cache 瘦身
技術報告與模型卡披露的架構是這次的實質改動,V4.1 Flash 採 Causal Encoder-Decoder 結構,把 40 層 Transformer 拆成 20 層 Causal Encoder 加 20 層 Decoder,Decoder 的全域 KV Cache 由 Encoder 最後的隱藏狀態投影而來,不再逐層自行產生。輸入與輸出的激活量因此不對稱:prefill 階段每個 token 只激活 8B 參數,decode 階段激活 16B,模型的骨幹是 552B 參數的混合專家架構。
KV Cache 壓縮的改進幅度更是驚人,主 KV 用 FP4 快取(E2M1 格式,每 16 個通道配一個 E4M3 scale),全域 KV 足跡降到每個 token 約 890 bytes,約為 V4-Flash 的四分之一;SWA Bounded Replay 只重放最近視窗的 token 來重建滑動視窗注意力的 KV 狀態,不用把這部分寫進 SSD,常駐 KV 足跡再降到約八分之一。官方說法是需要 HBM 的量降到四分之一、SSD 降到八分之一,相對初代模型 KV Cache 縮小了 437 倍。
價格:離峰時段輸入每百萬 tokens 約 4.72 元台幣
新價格自 9 月 10 日中午 12 點生效,維持峰谷兩段定價,離峰是高峰的一半。以官方美元定價為準(換算匯率採 1 美元兌 31.47 元台幣):
- 輸入(快取命中):離峰每百萬 tokens 0.003 美元(約 0.09 元台幣),高峰 0.006 美元(約 0.19 元台幣)
- 輸入(快取未命中):離峰 0.15 美元(約 4.72 元台幣),高峰 0.3 美元(約 9.44 元台幣)
- 輸出:離峰 0.6 美元(約 18.88 元台幣),高峰 1.2 美元(約 37.76 元台幣)
人民幣定價是輸入快取命中 0.02 元、未命中 1 元、輸出 4 元,高峰翻倍。高峰時段定義為北京時間週一到週五的 9 點到 12 點、14 點到 18 點,其餘算離峰。
第三方平台也已經上架。OpenRouter 上掛的 deepseek/deepseek-v4.1-flash 標價為每百萬 tokens 輸入 0.3 美元、輸出 1.2 美元,等於官網高峰價位。
MIT 開源協議
權重方面,DeepSeek 這次照舊走開放路線。HuggingFace 上的 deepseek-ai/DeepSeek-V4.1-Flash 在 9 月 10 日清晨上傳,採 MIT 授權,並附上技術報告 PDF,社群已經出現 GGUF 量化版本。
模型卡上的權重以 FP8 量化格式儲存,光參數總量就接近 4846 億個,落在單機或家用級顯示卡跑不動的級別,一般還是建議透過 API 調用比較合理。




