Đầu độc một trang web khiến AI đề xuất hàng giả tới 27% trường hợp
Benchmark FORGE cho thấy chỉ cần đầu độc một trang kết quả tìm kiếm, các mô hình AI có thể đề xuất sản phẩm không tồn tại tới 27% trường hợp.
3 bài đã kiểm chứng về Benchmark, sản phẩm và diễn biến ngành.
Benchmark FORGE cho thấy chỉ cần đầu độc một trang kết quả tìm kiếm, các mô hình AI có thể đề xuất sản phẩm không tồn tại tới 27% trường hợp.
GeneBench-Pro dùng bộ dữ liệu sinh học lộn xộn để kiểm tra năng lực ra quyết định nghiên cứu của mô hình.
Google DeepMind ra mắt Gemini 3.1 Pro vào cuối tháng 2, đạt 12/18 vị trí dẫn đầu trong các benchmark chính, đặc biệt nổi bật với 77,1% trên ARC-AGI-2. Khả năng suy luận được cải thiện hơn 2 lần so với Gemini 3 Pro, với mức độ suy luận MEDIUM mới cho phép kiểm soát độ sâu suy luận.