深度求索(DeepSeek)今日在官方交流群內發布通知,推出 DeepSeek V4.1 Flash 中間版本限時內測。這是 V4 系列自 2026 年 4 月發布以來最大的一次架構級更新,採用了全新模型結構,原生支援多模態輸入。,官方稱其「能力更強、速度更快、成本更低」。與之前8月21日上線的 V4-Flash-Vision-Exp(在文本模型上外掛視覺擴展包)不同,V4.1 Flash 將多模态能力直接整合進模型架構本身,文本、圖像、語音輸入一體化處理。這個版本的調用名稱為 deepseek-v4.1-flash-expires-on-0910,開發者保持原有的 API base_url 不變,僅需修改模型名稱即可直接調用,計費標準與現有 DeepSeek V4 Flash 完全一致。
這次發布的時間點選在 DeepSeek 傳出正在進行 500 億人民幣融資、創始人梁文鋒自掏腰包 200 億的背景下。V4.1 Flash 的「用 Flash 價格對標 Pro 能力」策略,顯然不只是技術迭代,更是商業化路徑的關鍵一步,如果低價模型能承接高價模型的大部分任務,DeepSeek 在企業級市場的定價競爭力將大幅提升。
速度實測:比 Pro 快 5.7 倍
內測消息一出,中文技術社群迅速展開實測。X 使用者 @riba2534 公佈了詳細的基準測試資料:
- 首字延遲(TTFT):178ms,短問答穩定在160ms左右
- 持續吐字速率:穩定 355 tok/s,峰值突破 365 tok/s
- 長程式碼生成:1,500 tokens 的完整雙向鏈表 LRU 實現僅耗時 4.40 秒
- 思考鏈:內建 Thinking 階段約1.1秒推理完畢,無縫切換正文
與 DeepSeek V4 Pro 相比,持續吞吐速度提升了 5.7 倍(355 tok/s 對比 63 tok/s),首字延遲缩短 77%(178ms 對比 766ms),生成1,500 字內容從 24.7 秒壓縮到 4.4 秒,節省 82% 的等待時間。
其他社群使用者的實測也印證了這個速度水準,稱其為「目前最快的 AI」。其他內測用戶反饋「最低也有 300 tok/s,最高能到 600 tok/s」,但推測這是單獨部署版本的速度,正式上線後可能不會如此誇張。
DeepSeek v4.1 Flash via API is almost TOO fast 🤯 pic.twitter.com/u8nzcJoa02
— Mia (@MiaAI_lab) September 8, 2026
Flash 的價格,Pro 的野心
這次內測最引人注目的焦點在 DeepSeek 官方在同步發放的反饋問卷中提出的問題:「DeepSeek V4.1 Flash 中間版本能否全面替換線上的 DeepSeek V4 Pro?」
DeepSeek V4.1 Flash is already live on the DeepSeek API.
but weirdly… DeepSeek hasn’t even announced it on X yet.
it’s currently running as a limited intermediate test until Sep 10.
and from the early results I’m seeing, this looks surprisingly better than the previous V4…
— Sahil Panhotra | Indie Builder (@SahilPanhotra) September 8, 2026
這個問題的意圖非常明確,DeepSeek 希望驗證新一代 Flash 架構能否以 Flash 的價格和速度,承接 Pro 等級的任務。按官方價目表,V4 Flash 在低谷時段的輸出價格為每百萬 tokens 約 NT$21(0.66 美元),而 V4 Pro 的輸出價格約為 NT$63(1.98 美元)。如果 V4.1 Flash 真的能在能力上逼近 Pro,開發者的呼叫成本將直接降至原來的三分之一。
對開發者而言,這意味著選型邏輯可能發生根本性的變化。過去「要快選 Flash、要強選 Pro」的二分法,可能被「先用 Flash 試試夠不夠用」取代。
內測限制與注意事項
作為限時中間版本,V4.1 Flash 有幾項明確的限制:
- 自動過期:模型名稱中的「expires-on-0910」表示該版本將在 9 月 10 日自動下線,測試視窗僅約兩天
- 并發限制:每帳號限流 20 路並發,遠低於正式版的 2,500 路,不適合大規模生產環境
- 無獨立基準成績:官方尚未公佈技術規格、獨立價格表或基準測試成績
- 計費不變:內測期間計費與 V4 Flash 完全一致,不產生額外費用
從社群反應來看,V4.1 Flash 最大的吸引力在於打破了「便宜但弱」或「強但貴」的二選一困境。如果正式版能維持目前的速度和能力水準,同時將並發限制從內測的 20 路恢復到正式版的 2,500 路,對高頻呼叫場景(如 Agent 工作流、批次程式碼生成、即時對話系統)的吸引力將非常顯著。對於想要在9月10日截止前體驗的開發者,只需在 API 請求中將模型名稱改為 deepseek-v4.1-flash-expires-on-0910 即可,無需額外申請內測資格。




