Ngày 8/9, OpenAI ra mắt ChatGPT Images 2.5, đồng thời tung ra hai mô hình mới trên API. Hãng định vị đây là mô hình tạo ảnh tốt nhất hiện có, với cải tiến tập trung vào ba điểm: bám sát chỉ dẫn hơn khi chỉnh sửa nhiều lượt, người và vật trong ảnh tham chiếu ít bị biến dạng hơn, và tốc độ tạo ảnh nhanh hơn. Độ trễ giảm tối đa 50% so với Images 2.0.
Bản cập nhật được triển khai trên toàn bộ các gói của ChatGPT, ChatGPT Work và Codex, đồng loạt trên desktop, di động và web.
Sunburst và Flare
Hai mô hình phía API có ID là gpt-image-2.5-sunburst và gpt-image-2.5-flare. Khuyến nghị lựa chọn từ OpenAI chỉ gói gọn trong một câu: dùng Sunburst cho các quy trình đòi hỏi độ chính xác khi chỉnh sửa, dùng Flare để tạo ảnh nhanh hàng ngày. Theo phản hồi từ các khách hàng thử nghiệm sớm, tốc độ tạo ảnh của Flare nhanh hơn GPT-Image-2 từ hai đến bốn lần.
Cách tách dòng này khá hiếm gặp trong các mô hình tạo ảnh. Trước đây, mỗi thế hệ thường chỉ có một mô hình duy nhất, còn chênh lệch nhanh - chậm được điều chỉnh qua độ phân giải và số bước lấy mẫu. Việc cố định thành hai ID riêng biệt đồng nghĩa với việc thừa nhận hai nhóm nhu cầu này đã đủ lớn để việc tách thành hai bộ trọng số riêng trở nên hợp lý hơn.
Một phép tính
Giá tính theo token, không tính theo tấm ảnh: đầu vào hình ảnh 8 USD/triệu token, nếu trúng cache là 2 USD; đầu ra hình ảnh 30 USD/triệu token; đầu vào văn bản 5 USD/triệu token, trúng cache 1,25 USD.
Với người dùng, hệ quả thực tế là chi phí biến động theo độ phân giải và độ phức tạp của ảnh, chứ không cố định theo từng tấm. Tính nhẩm sơ bộ: một ảnh đầu ra 1024×1024 quy đổi thường rơi vào khoảng hơn một nghìn token, so với mức giá 30 USD/triệu token thì chi phí mỗi tấm chỉ vài xu USD, không đắt. Thứ đẩy hóa đơn lên cao là số lượt chỉnh sửa — chỉnh sửa nhiều lượt đòi hỏi đưa ảnh kết quả của lượt trước quay lại làm đầu vào hình ảnh, và mức 8 USD/triệu ở đầu vào bắt đầu cộng dồn theo số lần. Mức giá cache 2 USD nhắm đúng vào tình huống này: cùng một ảnh gốc được chỉnh đi chỉnh lại, từ lượt thứ hai trở đi phần đầu vào lẽ ra đều có thể trúng cache.
Vì vậy, cách định giá này đối xử khác nhau với hai kiểu sử dụng. Tạo ảnh hàng loạt, mỗi lần tạo xong là giao ngay, chi phí dễ kiểm soát; còn quy trình dùng mô hình như một công cụ chỉnh sửa ảnh, một tấm sửa đi sửa lại cả chục lượt, thì hóa đơn chủ yếu phình ra ở phần đầu vào, gần như không liên quan đến số lượng ảnh tạo ra.
Vẽ một nét để làm tham chiếu
Về sản phẩm, có thêm vài tính năng mới: Sketch cho phép vẽ tay trực tiếp trong ChatGPT, gọi ra bằng cách nhập @Sketch, nét vẽ được dùng làm tham chiếu; Templates cung cấp điểm khởi đầu cho các bố cục thường gặp như poster, đồ lưu niệm, ảnh sản phẩm; ảnh đã tạo có thể được chú thích trực tiếp để chỉnh sửa đúng vị trí; prompt có thể được chia sẻ ra ngoài để người khác thay ảnh của họ vào và chạy lại.
Các tính năng này đều hướng về một điều: biến quy trình 'mô tả — tạo ảnh — làm lại' thành 'tạo ảnh — chỉ vào chỗ cần sửa'. Cả vẽ tay lẫn chú thích đều là cách giao thông tin vị trí cho mô hình, mà vị trí lại chính là điều khó diễn đạt nhất bằng prompt văn bản. Muốn dịch một chi tiết sang trái vài centimet, hay làm vùng sáng nào đó tối đi một chút, diễn tả bằng lời phải vòng vo mấy câu, còn vẽ một nét hoặc chấm một cái là xong.
Chia sẻ prompt là một hướng khác. Nó biến prompt từ tài sản cá nhân thành mẫu có thể tái sử dụng, người khác lấy về, thay bằng chất liệu của mình rồi chạy lại. Cơ chế này vốn đã có trong cộng đồng tạo ảnh, các trang chia sẻ prompt và cộng đồng mô hình vẫn luôn làm việc này, khác biệt duy nhất là lần này chính nền tảng tích hợp sẵn, không cần qua tay các trang bên thứ ba nữa.
Một con số không khớp
Thông báo chính thức nhắc tới con số 3 tỷ ảnh, tính trên cả ChatGPT Images lẫn dòng GPT-Image trên API. Các bản thuật lại con số này không thống nhất với nhau, có nơi ghi là lũy kế, có nơi ghi là mỗi tuần, chênh nhau tới hai bậc độ lớn. Trang chính thức hiện chưa mở được để đối chiếu từng chữ, nên con số này tạm thời chỉ nên hiểu là 'quy mô rất lớn', không nên dùng để suy luận thêm.
Thế hệ trước, Images 2.0, giải quyết bài toán hiển thị chữ, ví dụ tiêu biểu là chữ trên thực đơn và poster cuối cùng đã đọc được. Thế hệ này động vào khâu chỉnh sửa, năng lực tiêu biểu là sửa mười lần vẫn nhận ra đúng là người đó. Điểm chung giữa hai thế hệ là cuộc đua không còn nằm ở chỗ 'có vẽ ra được hay không', mà ở chỗ 'vẽ xong rồi còn sửa được không'.
Nguồn tham khảo: thông báo chính thức của OpenAI, CocoLoop, blog cá nhân của Simon Willison, Unite.AI, 9to5Mac; ID mô hình, giá và độ trễ lấy theo thông báo chính thức và các bản thuật lại, chi phí mỗi tấm ảnh là ước tính sơ bộ theo bảng giá công khai.