DeepSeek上線視覺實驗版,單張圖封頂384token

8月21日,DeepSeek在API平台放出deepseek-v4-flash-vision-exp,開發者把model參數改成這個名稱就能呼叫。這是V4系列第一個帶視覺功能的型號,官方替它掛上Exp標籤,明白表示屬於實驗預覽版本,不建議直接接進正式環境。

文字端的能力與V4-Flash標準版對齊。官方更新頁給出的成績是Terminal Bench 2.1拿到83.9,NL2Repo 57.7,DeepSWE 59.3,Chartography 64.3。視覺相關的代理基準測試上,DeepSeek表示ApexBench、Agents' Last Exam和Chartography都有明顯提升,多模態代理表現接近Opus-4.8。對標對象選得很直白,Anthropic的旗艦模型在螢幕操作類任務上一直是那把量尺。

一張圖0.000384元

定價是這次更有看頭的部分。視覺版沿用V4-Flash的價目表:輸入每百萬token 1元,快取命中低至0.02元,輸出每百萬token 2元。圖片不單獨計價,折算成token計入輸入,單張圖最多算384token

粗略算一下,一張圖的視覺輸入成本是0.000384元,2600張圖才花掉一塊錢。GUI代理跑一個稍微複雜的任務,連續截圖幾十上百次是常態,按100次截圖估算,圖像那部分開銷約0.038元。放進整筆帳單裡幾乎可以當零處理,成本重心會重新落回文字推理和輸出長度。

按張收費的視覺介面走的是另一條路。按張計價好在可預期,壞在代理類應用一旦把截圖當感測器高頻呼叫,帳單會跟著呼叫次數線性膨脹;折算token再設上限,則把單幀成本釘死在一個很小的數字上。

封頂的另一面

384token是個不高的數字。圖像進模型前要切成patch再編碼,token預算直接決定模型看得多細。封在384以內,大圖會被壓成相當粗略的表徵,讀網頁截圖的整體版面大概夠用,讀密集表格裡的小字級、讀手機截圖上的狀態列細節,就未必穩定。

DeepSeek官方也沒把話說滿,只提到會根據實際回饋繼續調整穩定性和輸出品質。對開發者來說,先拿自己場景裡最雜亂的那類圖去試:滿螢幕小字的後台管理介面、掃描件、帶浮水印的圖表,比看基準分數更能判斷這一版能不能用。上下文視窗仍是100萬token,思考強度沿用high和max兩檔。

四個月補完的最後一塊

把時間軸拉直,DeepSeek今年的節奏會更清楚。4月24日V4上線,deepseek-chat和deepseek-reasoner兩個舊名稱同時進入廢棄倒數;7月31日V4-Flash單獨放出;8月13日V4-Pro補上Responses API原生支援和Codex適配,思考強度拆成low/high/max三檔,尖峰離峰計價從8月17日起生效;到8月21日,視覺這塊拼圖補上

四個月四次迭代,排得相當緊湊。每次的落點都不在參數量或跑分排行榜首,反而集中在呼叫方式和帳單結構上——Responses API、思考強度分檔、尖峰離峰電價、單張圖token封頂,全是給開發者算成本用的旋鈕。視覺版掛著Exp後綴先放出來,也順著同一條路徑:先讓人用起來跑出回饋,再談穩定版。

參考來源:DeepSeek API官方更新頁、CocoLoop、快科技;模型跑分與計費口徑以DeepSeek官方文件為準,單張圖token上限、輸入輸出與快取命中單價經兩家來源核對。