Ngày 20/8, SenseTime gắn nhãn phiên bản chính thức cho SenseNova-U1.5-8B-MoT trên GitHub, giấy phép Apache 2.0, trọng số mô hình đồng thời được đưa lên Hugging Face và ModelScope. Chỉ ba tuần sau bản Preview ngày 31/7, và chưa đầy bốn tháng kể từ lần đầu tiên dòng sản phẩm này mở mã nguồn (U1-8B-MoT ngày 27/4 năm nay).
Phiên bản mới tập trung vào hai điểm chính: tạo ảnh 4K gốc, và đưa chỉnh sửa ảnh cùng kiểm soát chính xác vào chung một mô hình.
Một mô hình, ba cách tính tham số
Trước tiên là một điểm dễ gây rối mắt. Tên mô hình ghi 8B; phần README của kho lưu trữ bổ sung chú thích rằng 8B-MoT chỉ khoảng 8 tỷ tham số hiểu cộng khoảng 8 tỷ tham số sinh; còn thẻ mô hình trên Hugging Face lại liệt kê quy mô tensor là 18 tỷ, độ chính xác F32 và BF16.
Cả ba con số đều đúng, chỉ là đang đếm những thứ khác nhau. MoT là viết tắt của Mixture of Transformers, kiến trúc này của SenseTime cho phép tháp hiểu và tháp sinh đi theo hai nhánh riêng, luân phiên hoạt động trên cùng một chuỗi. Việc có nên gộp tháp hiểu và tháp sinh để tính chung, chỉ báo cáo quy mô kích hoạt, hay tách riêng hoàn toàn, hiện chưa có thông lệ chung trong ngành, mỗi hãng viết một kiểu trên trang phát hành mô hình đa phương thức thống nhất của mình.
Tác động thực tế với nhà phát triển là: giá trị tham khảo của việc so sánh các mô hình này theo số lượng tham số đang giảm dần. Muốn so sánh thật sự, phải xem một card GPU có chứa nổi không, tạo một ảnh 4K mất bao lâu, đỉnh bộ nhớ GPU là bao nhiêu. Những mục này SenseTime lần này chưa đưa ra khẩu kính thống nhất trên trang phát hành.
Tạo 4K trực tiếp, không phải phóng to sau
Cách nói 4K gốc cần được bóc tách. Hiện có hai hướng phổ biến để đưa ảnh lên 4K: một là mô hình tạo ảnh độ phân giải thấp hơn trước, rồi giao cho mô hình phóng to tái tạo chi tiết; hai là để mô hình sinh ảnh làm việc trực tiếp ở độ phân giải mục tiêu.
Khác biệt giữa hai hướng không nằm ở số điểm ảnh cuối cùng, mà ở tính nhất quán cấu trúc. Theo hướng phóng to, bố cục tổng thể đã bị chốt ở giai đoạn độ phân giải thấp, khâu phóng to chỉ có thể bổ sung chi tiết, khi gặp văn bản dày đặc, bố cục phức tạp, quan hệ nhiều chủ thể thì dễ bị lệch khi phóng to. Lần này SenseTime đưa 4K vào chính quá trình sinh ảnh, cách diễn đạt chính thức là “vừa giữ được bố cục tổng thể vừa có kết cấu cực kỳ tinh xảo, chi tiết vi mô”, đồng thời nhấn mạnh hiệu suất tạo ảnh 4K của phiên bản này đã được cải thiện.
Trong sáu cải tiến mà người dùng có thể thấy được liệt kê trên trang phát hành, ngoài 4K, năm mục còn lại đều xoay quanh khả năng kiểm soát: bố cục, chất liệu, ánh sáng của ảnh tạo ra gần với ảnh chụp thực tế hơn; chỉnh sửa ảnh gốc giữ được danh tính chủ thể và cấu trúc không gian tốt hơn; khả năng đọc của việc hiển thị văn bản tiếng Trung và tiếng Anh cùng các bố cục phức tạp như đồ họa thông tin, áp phích được cải thiện; bám sát các chỉ dẫn phức tạp như số lượng vật thể, quan hệ không gian ổn định hơn; có thể dùng khung nhận diện, đánh dấu thị giác và tham chiếu nhiều ảnh để kiểm soát chính xác.
Mục cuối cùng này khá thực tế với các đội làm công cụ thiết kế. Dùng khung và đánh dấu để chỉ định “sửa chỗ này” tiện hơn nhiều so với việc liên tục chỉnh prompt để mô tả vị trí, và cũng dễ tích hợp vào giao diện trình chỉnh sửa sẵn có hơn.
Đưa cả hạn chế đã biết vào trang phát hành
Nửa sau của thẻ mô hình có một mục liệt kê năm vấn đề chưa giải quyết: chi tiết dễ bị tăng cường quá mức, văn bản dày đặc vẫn có thể sai, bố cục bị giới hạn thì hiệu năng chưa ổn định, chi tiết nhân vật chưa ổn định, chỉnh sửa phức tạp có thể gây trôi dạt.
Trong tài liệu phát hành của các mô hình mã nguồn mở nội địa Trung Quốc, không nhiều hãng chủ động nêu ra mục này. Tác dụng của nó không chỉ là tỏ ra trung thực. Năm vấn đề này về cơ bản là những khó khăn chung hiện tại của loại mô hình này, việc nêu ra giúp các bên hạ nguồn tiết kiệm một vòng thử sai, đồng thời để lại đường cơ sở để đối chiếu cho các phiên bản sau.
Cùng đợt còn phát hành SenseNova-U1.5-8B-MoT-LoRA-8step, bản chưng cất 8 bước quy mô 0,4B, hướng đến các tình huống nhạy cảm với độ trễ. Cộng thêm giấy phép Apache 2.0 — cho phép dùng thương mại, không có điều khoản lan truyền — và ba nơi lưu trữ GitHub, Hugging Face, ModelScope, lần phát hành này gần như đã hạ hết những rào cản tiếp cận có thể hạ.
Vấn đề còn lại vẫn quay về chỗ cũ: trọng số mã nguồn mở giải quyết được việc “có lấy được hay không”, chứ không giải quyết được việc “chạy nổi hay không chạy nổi”. Cấu trúc hai tháp 8B cộng 8B tạo 4K trực tiếp sẽ không tiết kiệm bộ nhớ GPU, quyết định việc bao nhiêu đội dùng được nó vẫn là chiếc card GPU đó có đủ hay không.
Nguồn tham khảo: kho GitHub OpenSenseNova/SenseNova-U1, CocoLoop, thẻ mô hình Hugging Face, IT Home