DeepSeek 在今天(8 月 21 日)傍晚正式推出旗下第一款具備視覺能力的模型 DeepSeek-V4-Flash-Vision-Exp,官方在 X(原 Twitter)宣布「Multimodality unlocks more agent use cases」,模型已同步開放於 DeepSeek API 平台,開發者可以直接透過 API 傳入圖片,讓模型描述圖片、辨識截圖文字、分析圖表。這是 DeepSeek 成立以來第一次把「看得懂圖」的能力放進自家模型,補齊了這家以純文字推理模型聞名的中國 AI 公司在多模態版圖上的缺口。
DeepSeek-V4-Flash-Vision-Exp is now live on the DeepSeek API Platform! 🚀
🔹 This experimental multimodal model matches DeepSeek-V4-Flash on text capabilities—including agents, reasoning, and world knowledge.
🔹 On multimodal agent benchmarks, V4-Flash-Vision-Exp makes a major… pic.twitter.com/t2ELUZAagW— DeepSeek (@deepseek_ai) August 21, 2026
DeepSeek-V4-Flash-Vision-Exp 官方跑分:多模態 Agent 能力與 Opus 4.8 打成 2 比 2
DeepSeek 同時公布了新模型的首批 Agent 跑分,在 4 項多模態 Agent 評測中,V4-Flash-Vision-Exp 與 Anthropic 的 Opus 4.8 各拿下兩勝:Agents’ Last Exam 以 27.3 對 25.7 勝出,ZeroBench 以 35.0 對 34.0 勝出;ApexBench 以 36.5 對 39.4 落後,Chartography 以 64.3 對 65.0 些微差距落敗。
對比上個月底的純文字版本 V4-Flash-0731,視覺版的進步幅度明顯:ApexBench 從 26.2 升至 36.5,Agents’ Last Exam 從 25.2 升至 27.3,顯示多出來的圖片輸入能力直接轉化為 Agent 任務的成績。官方同時強調,加上視覺能力後,文字 Agent 能力並未縮水,7 項文字評測中有 6 項高於 V4-Flash-0731,其中 DeepSWE 從 54.4 升至 59.3,甚至超過 Opus 4.8 的 58.0,Toolathlon 的 75.9 也幾乎追平 Opus 4.8 的 76.2。需要留意的是,這份結果來自 DeepSeek 官方自測,並非第三方獨立榜單,推理檔位設定為 max。
DeepSeek 第一款視覺模型:文字能力不縮水,圖片按 Token 計費
根據最新官方 API 文件,新模型以模型 ID「deepseek-v4-flash-vision-exp」上線,與現有的 deepseek-v4-flash、deepseek-v4-pro 並列在可用模型清單中。支援文本與圖片輸入、輸出仍為文字,圖片透過 OpenAI 相容的 image_url 資料結構傳送。規格上,模型提供 100 萬 Token 的上下文視窗、最大輸出 38.4 萬 Token,並支援 JSON Output、Tool Calls、Responses API 以及 Anthropic API 相容介面。
推理能力分成 off、low、high、max 四個檔位,預設為 high,使用者可以依任務複雜度自行調整。早在 8 月 19 日,DeepSeek 官方 GitHub 上的 deepseek-harness 專案就以「feat(llm-deepseek): publish the vision model」提交公開了這條視覺路由,宣告輸入模態為 text 與 image;兩天後正式在 API 平台全面上線。
收費方式是目前市場上少見的「不按圖片張數計價」,根據 DeepSeek 官方說明,圖片會依照尺寸換算成 Token(最高 384 Token),再與文字 Token 一起計算,圖片本身不另外收費。以中國區的人民幣定價來看,每百萬 Token 輸入在高峰時段為人民幣 3 元(約新台幣 14 元)、離峰 1.5 元(約新台幣 7 元),快取命中時只要人民幣 0.1 元與 0.05 元;每百萬 Token 輸出高峰為人民幣 9 元(約新台幣 43 元)、離峰 4.5 元(約新台幣 21 元)。高峰時段為台北時間 9:00 至 12:00、14:00 至 18:00,其餘時段價格減半。國際版則與 V4-Flash 相同,約每百萬 Token 輸入 0.14 美元(約新台幣 4.5 元)、輸出 0.28 美元(約新台幣 9 元)。
等了很久的視覺能力,DeepSeek 的多模態補課
對 DeepSeek 而言,這款模型等了很久。從 V3、R1 到今年(2026 年)的 V4 系列,DeepSeek 的模型一直以純文字推理見長,官方從未提供過視覺能力,使用者要處理圖片,只能先靠其他工具把圖片轉成文字再丟給模型。8 月 19 日 deepseek-harness 專案的那次提交,刪掉了「在模型端點就緒前不公布視覺模型」的舊說明,把這條路由正式稱為「官方 DeepSeek 視覺路由」,等於提前兩天預告了這次發布。
應用場景上,官方主打三件事:描述圖片內容、辨識截圖中的文字、分析圖表數據。對 Agent 開發者來說,視覺輸入與工具呼叫的組合才是重點,例如讀取介面截圖後直接操作系統、看著圖表回答問題、從文件掃描檔中抽取資料再寫入資料庫。官方在 X 上表示,模型在主流 Agent 框架中運作流暢,視覺理解可以與各式工具串接,解鎖更多實用工作流程。
Multimodality unlocks more agent use cases. 👀
V4-Flash-Vision-Exp works smoothly across agent frameworks, combining visual understanding with a wide range of tools to unlock more practical workflows.
2/n pic.twitter.com/pZFf8Yqw3D
— DeepSeek (@deepseek_ai) August 21, 2026
價格只有同級對手的零頭,DeepSeek 用 Flash 打法搶攻多模態
DeepSeek 這款視覺模型的定價與 V4-Flash-0731 完全相同,一樣走「夠用就好、便宜到底」的路線。V4-Flash 本身就是市場上成本最低的百萬級上下文推理模型之一,7 月底更新的 V4-Flash-0731 版本把 Agent 能力與編寫程式能力再往上推一截,如今視覺版本直接沿用同一套價格,等於把多模態 Agent 的入門成本壓到同級對手的零頭。
對照組是 Anthropic 的 Opus 4.8,這款 2026 年中的旗艦模型在代理式編碼(agentic coding)領域被認為是當前領先者,DeepSeek 官方跑分也直接拿它當基準。第三方分析估算,V4-Flash-Vision-Exp 以約 Opus 同類能力五十分之一到一百七十分之一的成本,做到 90% 至 95% 的視覺任務準確度。在中國市場,阿里的 Qwen-VL、月之暗面 Kimi 與 MiniMax 也都已布局多模態模型,DeepSeek 是這幾家一線玩家中最後一個補上視覺能力的(GLM 最近也傳言 5.3 版會加入多模態能力)。
對開發者來說,這款模型的吸引力在於遷移成本低,現有的 Agent 流程可以直接切換(只要直接切換模型代號就能直接使用);官方也說明模型在主流 Agent 框架中運作流暢,視覺理解可以與各類工具串接。
結語
DeepSeek-V4-Flash-Vision-Exp 目前仍是實驗版本,模型名稱中的「Exp」意味著規格與價格都還有調整空間,且權重尚未開源,官方先以 API 形式提供。對照 DeepSeek 過去把 V3、R1 等模型開源的慣例,視覺模型未來是否跟進開放權重,會是開源社群接下來關注的焦點。短期內,這款模型讓 DeepSeek 第一次站上多模態牌桌,也終於讓它成為幾乎沒有短版的模型,未來的調用量只可能會更大。



