WeChat mã nguồn mở mô hình embedding đa phương thức, dẫn đầu MMEB-v2
Đội ngũ Thị giác WeChat của Tencent mở mã WeMM-Embedding: bản 2B vượt qua Qwen3-VL-Embedding-8B lớn gấp bốn lần trên bảng xếp hạng MMEB-v2.
12 bài đã kiểm chứng về AI đa phương thức, sản phẩm và diễn biến ngành.
Đội ngũ Thị giác WeChat của Tencent mở mã WeMM-Embedding: bản 2B vượt qua Qwen3-VL-Embedding-8B lớn gấp bốn lần trên bảng xếp hạng MMEB-v2.
DeepSeek ra mắt deepseek-v4-flash-vision-exp, mẫu V4 đầu tiên có thị giác, giới hạn 384 token mỗi ảnh, giá giữ nguyên như V4-Flash.
SenseTime phát hành chính thức SenseNova-U1.5-8B-MoT theo giấy phép Apache 2.0, tạo ảnh 4K gốc và gộp chỉnh sửa ảnh, kiểm soát chính xác vào cùng một mô hình.
SeedRealtime của ByteDance đã vào luồng gọi của Doubao, đưa AI nghe-nhìn full-duplex vào một ứng dụng tiêu dùng.
Thinking Machines công bố Inkling-Small dạng open weights, với 276B tham số tổng, 12B tham số kích hoạt và nhiều điểm reasoning/coding gần mẫu Inkling 975B.
MiniMax H3 kết hợp video 2K 15 giây, âm thanh stereo gốc, giá 0,8 nhân dân tệ mỗi giây và kế hoạch mở trọng số.
ByteDance nhắm vào quy trình thiết kế với Seedream 5.0 Pro được viết lại cho độc giả công nghệ Việt Nam, giữ nguyên các con số, tuyên bố sản phẩm và điểm cần kiểm chứng.
Bản đa phương thức của Qwen3.7-Max đọc được ảnh và video, nhưng Alibaba nhấn mạnh tự lặp, dùng công cụ và tự kiểm thử.
Alibaba ra mắt Qwen3.7-Plus ngày 2/6, nhấn mạnh đầu vào đa phương thức, gọi công cụ, viết mã và tự chạy kiểm thử.
Alibaba Qwen Team đã phát hành Qwen3.5-Omni, mô hình toàn diện đầu tiên của họ có khả năng xử lý văn bản, hình ảnh, âm thanh và video trong một kiến trúc duy nhất, với tính năng nhân giọng nói thời gian thực.
Alibaba phát hành Qwen3.5 với 397 tỷ tham số, mở rộng hỗ trợ ngôn ngữ từ 82 lên 201, tích hợp đa phương thức gốc và đánh dấu bước chuyển từ chatbot sang AI Agent.
Moonshot AI ra mắt Kimi K2.5 với khả năng đa phương thức gốc và Agent Swarm, cho phép chia nhỏ tác vụ phức tạp thành nhiều tác vụ con để các agent thực thi song song.