Ngày 21 tháng 8, DeepSeek phát hành deepseek-v4-flash-vision-exp trên nền tảng API, nhà phát triển chỉ cần đổi tham số model sang tên này là gọi được. Đây là mẫu đầu tiên trong dòng V4 có khả năng thị giác, được gắn nhãn Exp, tức phiên bản xem trước thử nghiệm, DeepSeek khuyến cáo không nên đưa thẳng vào production.
Năng lực phía văn bản ngang bằng bản tiêu chuẩn V4-Flash. Trang cập nhật chính thức công bố điểm số Terminal Bench 2.1 đạt 83.9, NL2Repo 57.7, DeepSWE 59.3, Chartography 64.3. Trên các benchmark agent liên quan đến thị giác, DeepSeek cho biết ApexBench, Agents' Last Exam và Chartography đều cải thiện rõ rệt, hiệu năng agent đa phương thức tiệm cận Opus-4.8. Đối tượng so sánh được chọn khá thẳng thắn — mẫu hạm của Anthropic vẫn luôn là thước đo cho các tác vụ thao tác trên màn hình.
Một tấm ảnh giá 0,000384 CNY
Giá cả là phần đáng bàn hơn trong lần ra mắt này. Bản có thị giác dùng chung bảng giá với V4-Flash: đầu vào 1 CNY mỗi triệu token, cache hit thấp nhất 0,02 CNY, đầu ra 2 CNY mỗi triệu token. Ảnh không tính giá riêng mà quy đổi thành token rồi cộng vào đầu vào, mỗi ảnh tính tối đa 384 token.
Nhẩm tính, chi phí đầu vào thị giác cho một ảnh là 0,000384 CNY, phải 2.600 ảnh mới tiêu hết 1 CNY. Một GUI agent chạy tác vụ hơi phức tạp thường chụp màn hình liên tục vài chục đến cả trăm lần; ước tính theo 100 lần chụp, phần chi phí hình ảnh vào khoảng 0,038 CNY. Đưa vào tổng hóa đơn thì gần như có thể coi bằng không, trọng tâm chi phí lại quay về suy luận văn bản và độ dài đầu ra.
Các giao diện thị giác tính phí theo từng ảnh đi theo hướng khác. Tính theo ảnh có cái lợi là dễ dự đoán, nhưng nhược điểm là một khi ứng dụng agent coi ảnh chụp màn hình như cảm biến gọi tần suất cao, hóa đơn sẽ phình tuyến tính theo số lần gọi; còn quy đổi ra token rồi đặt trần thì chốt cứng chi phí mỗi khung hình ở một con số rất nhỏ.
Mặt trái của cái trần
384 token không phải con số cao. Ảnh trước khi vào mô hình phải được cắt thành patch rồi mã hóa, ngân sách token quyết định trực tiếp mức độ chi tiết mô hình nhìn thấy. Bị nén trong 384 token, ảnh lớn sẽ bị ép thành biểu diễn khá thô; đọc bố cục tổng thể của ảnh chụp trang web thì tạm ổn, nhưng đọc chữ nhỏ trong bảng dày đặc hay chi tiết thanh trạng thái trên ảnh chụp điện thoại thì chưa chắc ổn định.
DeepSeek cũng không nói chắc, chỉ cho biết sẽ tiếp tục điều chỉnh độ ổn định và chất lượng đầu ra dựa trên phản hồi thực tế. Với nhà phát triển, nên lấy đúng loại ảnh bẩn nhất trong tình huống của mình để thử trước: giao diện quản trị chữ nhỏ chi chít, bản scan, biểu đồ có watermark — những thứ này nói lên khả năng dùng được của phiên bản này hơn là nhìn điểm benchmark. Cửa sổ ngữ cảnh vẫn là 1 triệu token, cường độ suy luận vẫn giữ hai mức high và max.
Mảnh ghép cuối cùng sau bốn tháng
Kéo thẳng trục thời gian ra, nhịp độ năm nay của DeepSeek sẽ rõ hơn. Ngày 24 tháng 4, V4 ra mắt, hai cái tên cũ deepseek-chat và deepseek-reasoner cùng bước vào đếm ngược ngừng hỗ trợ; ngày 31 tháng 7, V4-Flash được phát hành riêng; ngày 13 tháng 8, V4-Pro bổ sung hỗ trợ gốc cho Responses API và khả năng tương thích Codex, cường độ suy luận tách thành ba mức low/high/max, giá theo giờ cao điểm/thấp điểm có hiệu lực từ 17 tháng 8; đến ngày 21 tháng 8, mảnh ghép thị giác được lắp vào.
Bốn tháng bốn lần cập nhật, nhịp khá dày. Mỗi lần điểm rơi không nằm ở số tham số hay vị trí đầu bảng xếp hạng, mà tập trung vào cách gọi API và cấu trúc hóa đơn — Responses API, phân cấp cường độ suy luận, giá điện cao điểm/thấp điểm, trần token cho mỗi ảnh, tất cả đều là những núm vặn để nhà phát triển tính toán chi phí. Bản thị giác gắn hậu tố Exp rồi phát hành trước cũng đi theo đúng hướng đó: để người dùng thử trước, lấy phản hồi thực tế rồi mới bàn đến bản ổn định.
Nguồn tham khảo: trang cập nhật chính thức của DeepSeek API, CocoLoop, Kuaikeji; điểm benchmark và cách tính phí theo tài liệu chính thức của DeepSeek, mức trần token mỗi ảnh cùng đơn giá đầu vào/đầu ra/cache hit đã được đối chiếu qua hai nguồn.