News - Cocoloop
首页ClaudeOpenAIGeminiDeepSeek开源全部标签归档
文/A 简中 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

benchmark 资讯与深度分析

收录 benchmark 相关 AI 新闻、产品动态和产业观察。 本页收录 3 篇已发布文章。

AI搜索 2026-08-25

投毒一个网页,大模型 27% 推荐假货

编辑精选 FORGE 只改检索结果里的一个页面,12 个模型全部中招。开了推理的那些被骗得更狠——它会自己编出"很多人在用"这类社会证据,替一个不存在的产品圆场。 搜索增强的大模型正在接管一件很日常的事:帮人挑东西买。你问"两千块以内的降噪

#AI安全#benchmark#arXiv
OpenAI 2026-07-02

OpenAI 出生物题,GPT-5.6 仅得 31.5 分

OpenAI 6 月 30 日放出一套新测试,叫 GeneBench Pro,专门考 AI 能不能顶替计算生物学家干活。第一批成绩出来,最能打的是它自家的 GPT 5.6 Sol Pro——129 道题,过了 31.5%。 这套题刁钻在数据

#AI制药#benchmark
Google 2026-04-13

Gemini 3.1 Pro 18 项测试拿 12 项第一

二月底,Google DeepMind发布了Gemini 3.1 Pro。发布后有一个数字在开发者社区传得比较广: 在目前追踪的18个主要benchmark里,3.1 Pro拿了12个第一 。 更值得关注的是ARC AGI 2——这个测试专

#Gemini#推理#benchmark

News · Cocoloop

AI前沿资讯与深度分析,覆盖大模型、开源社区、产业动态。文章由 Cocoloop 编辑部基于公开来源核验整理。

模型资讯

  • Claude
  • OpenAI
  • Gemini
  • DeepSeek
  • Qwen

主题

  • 开源
  • AI编程
  • Agent
  • 全部标签

站点

  • 首页
  • 文章归档
  • RSS 订阅
  • robots.txt
  • 编辑标准

友情链接

  • Cocoloop 主站
  • 问答站
  • Hermes 指南
  • PixPix AI生图
  • AI图片社区
文/A 简中 ▾
简体中文 Simplified Chinese English English 日本語 Japanese 한국어 Korean 繁體中文 Traditional Chinese Bahasa Indonesia Indonesian Tiếng Việt Vietnamese Deutsch German Português Portuguese Español Spanish Français French

© 2026 News · Cocoloop — AI前沿资讯

Sitemap