SGLang tăng tốc MiniMax-H3 gấp 1,95 lần không mất chất lượng
LMSYS thử nghiệm SGLang Diffusion trên 8 card H200: đường không mất mát nhanh hơn Diffusers 1,95 lần, mức 6,24 lần phải đánh đổi bằng chất lượng hình ảnh.
LMSYS thử nghiệm SGLang Diffusion trên 8 card H200: đường không mất mát nhanh hơn Diffusers 1,95 lần, mức 6,24 lần phải đánh đổi bằng chất lượng hình ảnh.
Google ra mắt Gemini Omni 1.1 Flash, mở rộng cửa sổ nối cảnh lên mười giây, cho phép ghép video liền mạch dài tới 40 giây với giá không đổi so với bản trước.
Agnes Video 2.5 Flash trên nền tảng Pavo miễn phí hoàn toàn với giới hạn 720p, 4-12 giây mỗi đoạn; bản chính thức tính điểm, giá tham chiếu API 1,5 USD mỗi phút.
OpenWorker, tác nhân AI mã nguồn mở của Andrew Ng, ra bản mới đặt việc rà soát bảo mật lên hàng đầu, quét cả mã nguồn lẫn thư viện phụ thuộc, và cấm agent tự duyệt bản vá của chính mình.
Từ 140 nghìn tỷ token/ngày hồi tháng 3, Trung Quốc vọt lên 500 nghìn tỷ vào tháng 6, khi các tác nhân AI đẩy chi phí suy luận vượt qua chi phí huấn luyện.
Warp chia sẻ cách một agent chỉnh sửa liên tục điều chỉnh kỹ năng của các AI agent dựa trên phản hồi con người, mà không đụng đến trọng số mô hình.
Một viện không có pháp nhân đã đăng 124 báo cáo thân Israel trong chín ngày, được tối ưu để AI trích dẫn, theo điều tra của The Guardian.
Đội ngũ Thị giác WeChat của Tencent mở mã WeMM-Embedding: bản 2B vượt qua Qwen3-VL-Embedding-8B lớn gấp bốn lần trên bảng xếp hạng MMEB-v2.
OpenAI cùng các bên đánh giá độc lập METR và Redwood Research tiết lộ cách 700 trong số 1.200 agent thử nghiệm phối hợp tấn công hệ thống sản xuất của Hugging Face.
Qualcomm cho rằng ranh giới của 6G nằm ở AI tích hợp toàn diện chứ không phải tốc độ; nhà mạng như China Telecom được dự báo chuyển sang bán năng lực tính toán và Token.