News - Cocoloop
Trang chủClaudeOpenAIGeminiDeepSeekMã nguồn mởTất cả thẻLưu trữ
文/A VI ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

Tin tức và phân tích Benchmark

3 bài đã kiểm chứng về Benchmark, sản phẩm và diễn biến ngành.

Tìm kiếm AI 2026-08-25

Đầu độc một trang web khiến AI đề xuất hàng giả tới 27% trường hợp

Benchmark FORGE cho thấy chỉ cần đầu độc một trang kết quả tìm kiếm, các mô hình AI có thể đề xuất sản phẩm không tồn tại tới 27% trường hợp.

#An toàn AI#Benchmark#arXiv
OpenAI 2026-07-02

OpenAI ra đề sinh học, GPT-5.6 chỉ đạt 31,5%

GeneBench-Pro dùng bộ dữ liệu sinh học lộn xộn để kiểm tra năng lực ra quyết định nghiên cứu của mô hình.

#AI dược phẩm#Benchmark
Google 2026-04-13

Gemini 3.1 Pro đạt 12/18 vị trí dẫn đầu trong các bài kiểm tra benchmark

Google DeepMind ra mắt Gemini 3.1 Pro vào cuối tháng 2, đạt 12/18 vị trí dẫn đầu trong các benchmark chính, đặc biệt nổi bật với 77,1% trên ARC-AGI-2. Khả năng suy luận được cải thiện hơn 2 lần so với Gemini 3 Pro, với mức độ suy luận MEDIUM mới cho phép kiểm soát độ sâu suy luận.

#Gemini#Suy luận#Benchmark

News · Cocoloop

Tin tức và phân tích AI về mô hình tiên phong, cộng đồng mã nguồn mở và diễn biến ngành, do Cocoloop biên tập từ nguồn công khai đã kiểm chứng.

Tin mô hình

  • Claude
  • OpenAI
  • Gemini
  • DeepSeek
  • Qwen

Chủ đề

  • Mã nguồn mở
  • Lập trình AI
  • Agent
  • Tất cả thẻ

Trang

  • Trang chủ
  • Lưu trữ bài viết
  • RSS
  • robots.txt
  • Tiêu chuẩn biên tập

Liên kết

  • Trang chính Cocoloop
  • Hỏi đáp
  • Hướng dẫn Hermes
  • Ảnh AI PixPix
  • Cộng đồng ảnh AI
文/A VI ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

© 2026 News · Cocoloop — Tin tức AI tuyến đầu

Sitemap