Anthropic 把 25 万条对话交给外部研究者
编辑精选 模型公司自己发的使用报告总带着立场,Anthropic 这回把 25 万条对话的分析权交给斯坦福、牛津和 METR,还请帝国理工做了独立隐私审计。结论里最扎眼的一条:超过一半的对话涉及有后果的任务委托。 8 月 26 日,Anth
收录 AI研究 相关 AI 新闻、产品动态和产业观察。 本页收录 16 篇已发布文章。
编辑精选 模型公司自己发的使用报告总带着立场,Anthropic 这回把 25 万条对话的分析权交给斯坦福、牛津和 METR,还请帝国理工做了独立隐私审计。结论里最扎眼的一条:超过一半的对话涉及有后果的任务委托。 8 月 26 日,Anth
编辑精选 把 LibriSpeech 音频里的数字消音,多个高分模型仍有三到四成概率照念不误。它们学到的是数据集的书写习惯,拿 WER 排名去挑生产环境的语音方案,选中的可能恰好是最会应付考题的那一个。 Hume AI 的七名研究员贴出一组
编辑精选 Opus 5 和 Kimi K3 之间只差 10 步,放进 690 步的总差距里几乎等于噪声,开源模型在这类长周期实验上已经不落下风。卡住所有人的地方在别处:153 次跑下来,没有一个模型拿出新方法。 Prime Intellec
编辑精选 1320 个设计送进湿实验,354 个被验证为有效结合体,命中率把行业对照组的 10% 到 15% 抬到了 26.7%。跑这套流程的并非专用蛋白模型,只是一个通用对话模型加一段三万 token 的初始提示。 Anthropic 在
编辑精选 BigBang V1 把合成数据从“模型答题”推进到“模型出题、解题、验题”。35B A3B 模型跑出多项科研与代码评测优势,更该盯住的是训练数据生产方式变了。 大模型的下一轮竞争,可能不先发生在参数表里,而发生在题库里。 8 月
编辑精选 Google ATLAS 用 1465 万次 Gemini 交互给自动化叙事踩了刹车:AI 已进到多数职业,但典型岗位只碰到约五分之一任务。 Google 刚把一张 AI 使用地图摊开,结论没有发布会口号那么猛烈。 7 月 23
一套模型在棋盘上跑得慢,未必更像人。MIT、剑桥和普林斯顿等团队新发在 Nature 的研究,把问题换成 121 个陌生棋类规则后,结论反倒指向一条很轻的路线:人第一次看见新游戏时,靠的多半是少量、浅层、带目标感的心理模拟。 这件事放到 A
当大模型公司还在给数据中心找电,Richard Sutton 把新公司的目标写成了另一个尺度: 1 万亿参数、实时学习、实时规划、功耗 20 瓦 。 20 瓦约等于人脑日常耗能。这个数字放在 2026 年的 AI 语境里很刺眼。行业一边谈万
ICML 2026 在首尔开幕当天公布年度奖项,两个 Outstanding Paper Award 都落在扩散模型相关研究上。其中一篇来自 Zanlin Ni、Shenzhi Wang、Yang Yue 等人与清华大学黄高团队,讨论扩散语
先看一组数字。 给 GPT 4o 一张 5 个词的单子,让它说出每个词是什么颜色,它能做对 91%。单子加到 10 个词,掉到 57%。加到 40 个词——15%。 考的不是什么硬核难题。就是个幼儿园小朋友都会的颜色识别。 6 月 10 日
去年十月,OpenAI 撂下一句狠话:到 2028 年 3 月,要造出一个能自己搞科研的「全自动 AI 研究员」。 这周二,它把这句话往回收了一半。 Sam Altman 和首席科学家 Jakub Pachocki 一起发了篇新文,标题叫《
强化学习之父 Richard Sutton,最近给整个大模型行业泼了盆冷水。 他的话很冲:一个只会预测下一个词的 AI,永远做不出真正的科学。 6 月 1 日,这个观点被翻出来又火了一轮。说话的人分量不轻——Sutton 是 2024 年图
先说清楚这10道题是什么。 不是数学竞赛题,不是经典难题。是 未发表的研究级数学问题 ,来自FirstProof挑战赛——参赛选手包括职业数学家和数学博士。这些题目的要求是:答案得对,还必须附带严格的数学证明,能经受同行评审。 Alethe
在 AI 行业一遍遍卷 benchmark 分数、卷上下文长度的时候,李飞飞在做一件看起来不那么迫切、但可能更根本的事——让 AI 理解三维空间。 World Labs 完成了 10 亿美元融资,其中 Autodesk 一家就投了 2 亿。
4月8日,Google宣布在Gemini里上线了Notebooks功能,把NotebookLM直接接入了Gemini的主工作流。 表面是个产品更新,背后有Google的一个重要判断:未来的AI助手竞争,不是谁的模型答题更准,而是谁能更好地管
Yann LeCun 从 Meta 离开之后,干了一件让所有人都在等待的事。 他创办了 AMI Labs,完成了 10.3 亿美元种子轮融资,估值 35 亿美元,欧洲有史以来最大的种子轮。然后他说:我要造一个不靠预测下一个词来工作的 AI。