谷歌员工用上了Gemini 3.8 Flash内测版
编辑精选 Flash 这条线连着出三代、间隔以周计,发布节奏本身已经成了谷歌的产品策略。旗舰模型一再延期留下的空档里,便宜快跑的中档型号正在接管开发者绝大部分的日常调用。 Business Insider 报道,谷歌部分员工已经拿到 Gem
收录 大模型 相关 AI 新闻、产品动态和产业观察。 本页收录 100 篇已发布文章。
编辑精选 Flash 这条线连着出三代、间隔以周计,发布节奏本身已经成了谷歌的产品策略。旗舰模型一再延期留下的空档里,便宜快跑的中档型号正在接管开发者绝大部分的日常调用。 Business Insider 报道,谷歌部分员工已经拿到 Gem
编辑精选 770B 参数只激活 49B,腾讯把开源模型的算力账压到了 6.4% 的激活率。盲测领先 GLM 5.3 的那 0.07 分说明不了太多,能否撑住长周期工程任务,才是这一版要证明的东西。 腾讯 8 月 28 日发布并开源混元 Hy
编辑精选 三月份的数字还是140万亿,六月份就到了500万亿。把这条曲线拉陡的是智能体——一次任务反复检索、读上下文、调工具,推理侧的账单正在超过训练侧,成为算力开支里更难压的那一头。 央视今天播出的报道给出一个数字:截至今年6月,我国日均
编辑精选 谷歌这一版把语音识别的交付物从逐字记录改成了直接可用的成稿,删口头禅、修正说话人的中途改口都在模型内部完成,语音接口的竞争点由此从识别准确率挪向了后处理质量。 谷歌 8 月 26 日发布 Gemini 3.5 Transcribe
编辑精选 周额度还在,五小时窗口回来了。这是算力吃紧时最省事的一档旋钮——不改总量,只改用完的速度,代价由每月付 20 美元的那一层承担。 OpenAI 工程主管 Thibault Sottiaux 在 8 月 24 日晚(太平洋时间)宣布
编辑精选 模型挂在 3.8 的代号下,用的却是下一代 Qwen4 架构。阿里把架构选型提前半步交给社区去试,等 Qwen4 正式发布时,推理框架和量化工具链已经跑过一轮了——开源节奏本身也是产品设计的一部分。 魔搭社区挂出了 Qwen3.8
编辑精选 OpenRouter 上这个不署名的模型开放了 104 万 token 的上下文窗口,价格栏两个零,一次报错泄出的接口路径把嫌疑指向智谱。免费预览换回来的是编程 agent 跑出的完整长程轨迹,这类数据公开语料里几乎没有。 8 月
编辑精选 4.8 个月,Kimi K2.6 越过 Opus 4.5,这是 SemiAnalysis 画出的最新一段追赶曲线。周期缩短对闭源实验室谈不上致命,但靠"领先半年"收溢价的日子在变短,护城河正从模型分数挪向产品与交付。 SemiAn
编辑精选 同一套指导原则,灌给 gpt oss 120b 涨 16.1 个点,灌给 GLM 5 一点没动。IBM 这组数字把"要不要开记忆"换了个问法:先看模型在目标任务上还剩多少余量,再决定喂多少。 同一套指导原则,喂给 gpt oss
企业把 AI Agent 接进工作流后,账单往往先失去解释:花费涨了,团队却说不清是哪一个 Agent、哪一种模型、哪条请求把成本推高。OpenRouter 8 月 17 日上线的 Activity 仪表盘和测试版 Analytics AP
编辑精选 SL2T 的新意落在“完整语言翻译”:它第一次进入手机键盘和实时字幕这种日常入口。 Pixel 11 上多了一个不靠语音的输入方式:用户对着手机打美国手语,Gboard 和 Live Transcribe 会把它变成英文文字。 G
编辑精选 DeepSeek V4 Pro 这次没有开发布会,信号藏在 API 文档里:版本号转到 0813,输出上限抬到 384K,价格页同时挂出涨价预告。对重度开发者来说,这比一张跑分海报更需要立刻算账。 DeepSeek V4 Pro
编辑精选 腾讯把AI投入从模型发布会搬进了现金流表。二季度资本开支同比增176%,微信、广告、游戏和办公智能体都开始消化这批算力。 腾讯这次财报最刺眼的数字,不在收入增速,而在现金流。 8 月 12 日,腾讯发布 2026 年二季度业绩:营
编辑精选 面壁智能把端侧大模型带进上市辅导,资本市场要看的已经不止开源下载量。手机、汽车和机器人里的本地模型,开始接受收入、客户和合规流程的检验。 面壁智能走到 IPO 辅导这一步,给端侧大模型赛道补上了一个可验证节点。 8 月 11 日,
编辑精选 林俊旸把新公司公开在“数字 Agent + 物理 Agent”的交叉点上。比起又一家大模型公司,语用科技更像是在押注下一轮竞争的训练环境、工具链和闭环执行能力。 阿里千问前技术负责人林俊旸重新出现时,没有先发布模型参数,也没有先拿
编辑精选 BigBang V1 把合成数据从“模型答题”推进到“模型出题、解题、验题”。35B A3B 模型跑出多项科研与代码评测优势,更该盯住的是训练数据生产方式变了。 大模型的下一轮竞争,可能不先发生在参数表里,而发生在题库里。 8 月
编辑精选 Palantir 把一份财报写成了对大模型公司的檄文。93% 的营收增速背后,是企业客户开始重新计算:数据、提示词和业务流程到底该交给谁。 Palantir 这个季度最刺耳的一句话,不在财务表里,在 Alex Karp 写给股东的
编辑精选 Thinking Machines 把 Inkling Small 全量权重放出后,最醒目的信号落在成本曲线上:12B 激活参数已经能贴近 41B 激活旗舰的多个能力项。 Mira Murati 的 Thinking Machin
编辑精选 DeepSeek 用同一套 284B/13B 模型结构,把 Terminal Bench 2.1 自报成绩从 61.8 拉到 82.7;涨幅来自后训练与尚未公开的极简 harness,复现仍要等工具放出。 DeepSeek 7 月
编辑精选 Kimi K3 开源后不到两周,月之暗面融资口径从 300 亿美元抬到 350 亿美元。资本看中的已经不止单个模型热度,还包括开源模型换来上市前确定性的能力。 月之暗面刚把 Kimi K3 权重放出来,资本市场马上给了另一张答卷:
编辑精选 混元这次没有只晒模型跑分,而把推测解码的训练框架、两类 drafter 权重和评测链路一起放出,目标直指大模型推理成本。 腾讯混元在 7 月 29 日把 AngelSpec 放到 GitHub 上。它不算面向普通用户的新聊天模型,
编辑精选 Kimi K3 的新信号不在参数表,而在攻防测评:通用榜单冲高后,网络安全长链任务先露出短板。 Kimi K3 刚把 2.8 万亿参数和 100 万 token 上下文挂到台前,另一张成绩单很快追了上来。 英国 AI 安全研究所和
Poolside 这次没有端出一个万亿参数的庞然大物。它把 Laguna S 2.1 做成 118B 总参数、8B 激活参数 的 MoE 代码模型,权重直接放上 Hugging Face,还说能在单台 NVIDIA DGX Spark 上跑
Google I/O 舞台上,Sundar Pichai 给开发者留了一个很短的等待期:Gemini 3.5 Pro 下个月见。两个月过去,最强 Pro 版还没放出来,Bloomberg 的新说法把原因指向编码能力。 这条新闻的张力不在“又
Kimi 这次把牌摊得很大:2.8 万亿参数、100 万 token 上下文、原生视觉理解,还把价格直接挂在开放平台首页。7 月 16 日发布的 Kimi K3,先把月之暗面重新推回国产开源模型的中央位置。 这条新闻的张力不在“又发了一个大
AI 编程工具的门槛刚被抬高,另一个玩家立刻把价格牌翻到零。 7 月 14 日晚,Agnes AI 发布 Agnes 2.5 Flash,并同步推出 Agnes Code 桌面端。它给出的承诺很直接:Flash 面向日常编码和 agent
MiniMax 的解禁日刚把股价砸出一条深坑,第二天早上,公司又把一张 160 亿港元融资单摆到市场面前。 这张单子看起来像强心针:百余家机构参与,认购覆盖约 7 倍,发行规模从约 18 亿美元推高到 20 亿美元以上。可股价没有跟着松一口
把一个 270 亿参数模型放进 iPhone,本来听起来像给芯片发布会准备的概念片。 PrismML 现在把这个说法推到台前:这家从加州理工走出来的初创公司称,已经把阿里通义千问 Qwen 3.6 的 270 亿参数稠密模型压缩到 iPho
具身智能公司最喜欢展示机器人把杯子放进篮子、把抽屉推回去。原力灵机这次换了一个更难被视频美化的问题:如果模型真能泛化,能不能像调用大语言模型一样,被开发者直接通过 API 调起来? 7 月 9 日,原力灵机发布新一代具身基础模型 DM0.5
零一万物把企业 AI 的新故事,从“帮员工省时间”推到了“帮老板改财报”。 7 月 7 日,这家公司在北京发布万策 AI 平台,同时推出三款“一号位决策 AI”产品:老板 AI、销冠 AI、投资官 AI。它们分别面向经营、收入和投资三个离财
你让 AI 帮忙把一条帖子润色得通顺点,它照做了,但顺手把你的立场也挪了一下——你可能压根没察觉。牛津大学一项新研究,说的就是这件事。 研究团队让好几个大模型去"优化"人写的帖子,题材专挑有争议的:控枪、大麻合法化、无神论、死刑。哪怕明确要
Meta 想把外界对其大模型掉队的印象扳回来。最新信号来自内部会议:公司尚未发布的下一代模型 Watermelon,被称已经在若干关键跑分上追平 OpenAI 的 GPT 5.5。 Business Insider 7 月 3 日援引知情人
DeepSeek 在 6 月 29 日晚间把话挑明:V4 正式版定在 7 月中旬发布,同一天上线的还有一套新的 API 计费方式——每天有两段时间,调用价格直接翻倍。 这两段"高峰期"卡在北京时间上午 9 点到 12 点、下午 2 点到 6
谷歌在 5 月 19 日的 I/O 大会上把 Gemini 3.5 Pro 亮了出来,说 6 月正式开放。6 月过完,模型还锁在 Vertex AI 给少数企业客户的预览里,没对外放。到 6 月 30 日,谷歌把时间悄悄改成了 7 月。CE
OpenAI 这周放出了 GPT 5.6,一口气三个型号:旗舰 Sol,日常主力 Terra,最便宜的 Luna。价格是这次最抓人的地方——按每百万 token 算,Sol 输入 5 美元、输出 30 美元;Terra 2.5 美元、15
Meta 给应用 AI 部门的一批工程师立了新规矩:想用 Anthropic 的 Claude Code 或者 OpenAI 的 Codex 写代码,得先报批;有几个组收到的备忘录更直接,让他们停掉所有用到这两个外部工具的任务。The In
OpenAI 这回没发一个模型,一口气发了三个,全挂在 GPT 5.6 名下,按能力和价钱分成三档: Sol :旗舰款,最能打,也最贵,每百万 token 输入 5 美元、输出 30 美元 Terra :中间款,主打日常工作,输入 2.5
美国还在收紧芯片出口,DeepSeek 这边换了个思路:既然高端卡拿不够,那就让每一张卡多干点活。 6 月 30 日,DeepSeek 联合北京大学开源了一个叫 DSpark 的推理框架。一句话说清它干嘛的——同样的模型、同样的卡,让 AI
Anthropic 最近开新产品线的速度,快得有点不讲道理。 6 月 30 日,它又端出来一个,叫 Claude Science。跟外界猜的不一样——这回发的不是新模型,是一个给科学家用的"工作台"(workbench)。 它到底干嘛的 一
先说结论:天天让 AI 替你跑 Agent 的那批人,可以把顶配 Opus 从默认档位上撤下来了。 6 月 30 日,Anthropic 放出了中杯新模型 Claude Sonnet 5。官方给它的定位很直白——会自己定计划、会调浏览器和终
6 月 30 日,六月的最后一天。Google 答应过的 Gemini 3.5 Pro,还是没出来。 时间拨回 5 月 19 日,Google I/O 大会。皮查伊(Sundar Pichai)站在台上,对着满场的人说了这么一句: "We'
一边是 Anthropic 自曝八成以上代码出自 Claude 之手,一边是 Google 自家这个数才到一半。 这个差距,把谢尔盖·布林急出了一封全员信。 布林亲自下场催 布林这两年已经不是甩手掌柜,重新回 Google 一线动手了。这次
"这是公司活不活得下去的问题。" Lindy 的创始人 Flo Crivello 这么形容他刚做的一个决定:把公司 100% 的流量,从 Anthropic 的 Claude 全部切到 DeepSeek。一刀切干净,不留尾巴。 Lindy
800 万亿韩元。折成美元 5180 亿。 这是 6 月 29 号那天,韩国总统李在明站在首尔的总统办公室里,当着三星和 SK 海力士两位掌门人的面,给本国芯片业开出的一张支票。电视直播,他左手边是三星电子会长李在镕,右手边是 SK 集团会
vibe coding——用大白话指挥 AI 把网站、App 直接写出来——这一年火得没边。但这门生意一直有个软肋:平台底下跑的,全是别人家的模型。Claude、GPT 给你撑着,你赚的是中间那道差价。 现在有人不想再当二传手了。 6 月
DeepSeek 干了件以前没人敢干的事:7 月中旬起,白天调它的 API,比晚上贵一倍。 把「峰谷电价」搬到大模型上,这还是头一回。 一天里有 7 个小时,价格自动翻倍 DeepSeek 划了两段高峰:北京时间 9:00–12:00、14
先说结论:这是头一回,一个 AI 模型自己挑了道化学难题,从翻文献一路做到实验室验证,全程没让人牵着走。 事情是 OpenAI 的 GPT 5.4 和波兰一家叫 Molecule.one 的公司一块干的,6 月 17 日把结果放了出来。 它
ChatGPT Pro 的用户这几天有点上头。 有人发现,自己问 ChatGPT 同一个问题,回答的口吻和质量跟平时的 GPT 5.5 不太一样——更慢,但明显更「懂」。社交媒体上开始冒出一批前后对比图:同一个 3D 渲染需求、同一段 SV
Sam Altman 这回没绕弯子,直接开炮:有整整一代 AI 研究员,因为打心眼里看不起「把模型往大了堆」这条路,把整个领域往后拖了好几年。 话冲着谁,圈里人一听就懂——Yann LeCun 这些年一直唱衰单纯的规模扩张。 "现在还赌 s
怎么知道一个还没发布的 AI 上线后会不会干蠢事? OpenAI 6 月 16 日给的新答案是:把它放回过去,让它把人类已经聊过的对话,重新答一遍。 把旧对话重放给新模型 这套方法叫 Deployment Simulation,直译"部署模
每届世界杯都得有个「神算子」。2010 年是章鱼保罗,这届轮到一堆国产大模型上场了。 国内媒体雷科技把豆包、通义千问、DeepSeek、Kimi、联想天禧拉到一块,每家派一个「球迷人设」,让它们各自预测。结果一个比一个有戏。 五个 AI,五
先上一组让人愣一下的数字。 同样一桩企业级的活儿,跑下来:Claude 要 4811 美元,ChatGPT 3357 美元,DeepSeek 1071,Kimi 948,智谱 GLM 只要 544。 最贵和最便宜之间,差了快九倍。 这不是跑
"我也是个 token 上瘾的人,这玩意儿会上瘾。" 说这话的是微软 CEO 纳德拉。6 月 13 日他上了《Hard Fork》播客,难得没讲什么宏大叙事,反倒劝起大家省着点用 AI。 一句"硬道理" 纳德拉抛了个判断,原话是: "The
整个行业这一年都在给 AI 加「记忆」——记住你是谁,记住你上次问过啥,记住你的偏好。卖点都一样:越用越懂你。 Writer 上周丢出来的两篇论文,把这事的另一面掀开了:模型确实越来越懂你,但也越来越会顺着你说——哪怕你说的是错的。 最扎眼
先看一组数字。 给 GPT 4o 一张 5 个词的单子,让它说出每个词是什么颜色,它能做对 91%。单子加到 10 个词,掉到 57%。加到 40 个词——15%。 考的不是什么硬核难题。就是个幼儿园小朋友都会的颜色识别。 6 月 10 日
先说个反直觉的事。 你现在用的大模型——ChatGPT、Claude、Gemini——写字全是一个词一个词往外蹦的。专业点说叫"自回归":写下一个词,得先看前面所有词,一步都不能跳。这套机制统治了大模型四五年,几乎没人质疑过。 6 月 10
Cohere 这两年一直在企业和"主权 AI"那条线上闷头跑:模型卖给政府和大客户,部署在人家自己机房,数据不出门。前阵子它把 218B 的旗舰 Command A+ 用 Apache 2.0 开源,押的也是这套叙事。 6 月 9 日,它把
100 万个输出 token,收 50 美元。 这是 Anthropic 6 月 9 号给新模型 Fable 5 标的价,正好是 Opus 4.8 的两倍。 贵一倍这件事本身不稀奇,稀奇的是它的出身——Fable 5 是 Mythos 这一
三天前,Anthropic 还在博客里喊话整个行业:AI 跑得太快,得有个「集体刹车」。 三天后,它把自己有史以来最强的公开模型放了出来。 这就是 Claude Fable 5——6 月 9 号上线,Anthropic 自己说它「能力超过我
上周 Anthropic 还在博客里写得吓人:前沿模型可能很快就能"自我进化"(RSI),不用人插手自己改自己,整个行业该踩刹车了。 这周它把自己手里最猛的模型,摆到了所有人面前。 6 月 9 日发布的 Claude Fable 5,是 A
先记住一个数:1000。 这是小米 MiMo 团队 6 月 8 日甩出来的成绩——一个一万亿参数的大模型,每秒能吐出 1000 多个 token,峰值冲到 1200。这个数字什么概念?你平时用 ChatGPT、Claude,每秒大概也就几十
微软这回不藏着了。 在 Build 2026 大会上,它的 AI 超级智能团队(Microsoft AI Superintelligence Team)一口气端出 7 个自研模型,统一挂上 MAI 的名头。台下坐着的,是它投了几百亿、绑得最
微软给 OpenAI 砸了一百多亿美金,这事人尽皆知。但过去一两年,微软的小动作越来越明显——一边用着 OpenAI 的模型,一边在自己后院偷偷养了一支叫 MAI 的队伍。 这周的 Build 大会上,后院的东西端上桌了。微软一口气甩出 7
特朗普这两年对 AI 监管的态度,基本就俩字:别碰。能砍的规矩砍,能拦的州法拦。 结果 6 月 2 日,他自己签了一道行政令,名字叫《Promoting Advanced Artificial Intelligence Innovation
阿里这次发模型,没在台上比谁参数大。 6 月 2 日上线的 Qwen3.7 Plus,主打的就一件事:让模型自己把活干完。当天阿里美股盘前跳了 6%,到 133.23 美元;港股收盘涨 6.6%,报 130.90 港元。一个模型发布能直接把
谷歌最近在给一批 Google Play 的开发者发邮件,内容很直接:把你 App 背后的代码卖给我,给钱。 这事是 404 Media 6 月 2 日捅出来的。爆料的开发者要求匿名,怕谷歌因为他泄露了这个"机密"项目找他麻烦。 邮件里到底
50 亿参数的小模型,把 Anthropic 的 Claude Haiku 在编程基准上甩开了 16 分。 6 月 2 日 Build 2026 大会上,微软真正的硬货不是又一个 agent 平台,是苏莱曼那支"超级智能团队"一口气端出来的
强化学习之父 Richard Sutton,最近给整个大模型行业泼了盆冷水。 他的话很冲:一个只会预测下一个词的 AI,永远做不出真正的科学。 6 月 1 日,这个观点被翻出来又火了一轮。说话的人分量不轻——Sutton 是 2024 年图
微信的月活是 14 亿。这个数字,国内没有第二个 App 摸得到。 6 月 2 日,FT 放出消息:腾讯离给这 14 亿人装上一个 AI agent,又近了一步。 这个 agent 要干什么 不是再做一个聊天机器人。腾讯盯上的,是微信里那几
6 月 1 日,MiniMax 发了 M3。一句话概括卖点:一个开源权重的模型,同时塞进了 100 万 token 上下文、前沿级的写代码能力,还带原生多模态。MiniMax 说,这三样凑一块的,它是头一个。 真正的功夫在「稀疏注意力」上
先看一组数字。 同一个 Gemini 3 Pro,用单条提示词去攻击它,得手率 18.10%;换成多轮对话、一句一句往里套,得手率冲到 73.35%。 差了四倍。 这是思科(Cisco)刚发的一份研究里的数据,CSO Online 5 月
模型越做越强这件事,大家早就看麻了。所以这次 Anthropic 给 Opus 4.8 划的重点有点反常——不是"更聪明",是"更诚实"。 5 月 28 日,Anthropic 把 Claude Opus 4.8 放了出来,API 上直接能
先说个数字:100 万亿。 这是 OpenRouter 现在每个月帮人转发的 token 量。换算成每周是 25 万亿——半年前这个数字才 5 万亿,翻了五倍。 5 月 26 日,这家公司宣布拿了 1.13 亿美元的 B 轮,估值落到 13
四月底 DeepSeek 给 V4 Pro 砍了 75% 的"限时特价",所有人都在等 5 月底这价回涨。 5 月 23 日,公司在 API 控制台贴了一行字:促销结束之后,挂牌价就改成现在这个数——不是临时的,是正式的。 V4 Pro 每
192 GB。这是 AMD 新一代 Ryzen AI Max 400 单颗芯片的统一内存上限。 这意味着—— 你电脑里装一颗 APU,本地能跑 300B 参数以上的大模型 。在 x86 这边,这是头一次。 这颗芯片叫 Gorgon Halo
5 月 19 日下午一点半,Andrej Karpathy 在 X 上发了一条推:「个人更新:我已加入 Anthropic。」 一小时内,这条被刷了将近 300 万次。他自己 X 粉丝才 200 万——圈外人也被这条短推拽进来了。 跳的不是
10亿美元起步价。 这是一家叫 Inception 的 Stanford spinout 开出来的报价。微软和马斯克的 SpaceX 现在都在围着它转。 Inception 不是常见的 Transformer based 大模型——它做的是
OpenAI昨天给ChatGPT换了脑子。 不是发布新模型那种发布会式的换,是悄悄把几亿用户每天打开的对话框里那个默认模型,从GPT 5.3 Instant换成了GPT 5.5 Instant。 更值得说的,是这次OpenAI愿意把幻觉数字
V4 Pro的preview是上周五凌晨上线的。 今天早上,DeepSeek在API面板贴出公告:V4 Pro 75% off,直接到5月5号。同时,整个API的输入缓存命中价格砍到原来的十分之一。 发布到大幅降价,中间隔了72小时不到。
加拿大的Cohere要把德国的Aleph Alpha吞下去,背后金主是Schwarz集团——就是那个开Lidl超市的家族财团。 这事4月25日在TechCrunch首发。新公司估值约 200亿美元 ,Schwarz拿出 5亿欧元 (约6亿美
今天(4月24日),DeepSeek发布了V4。 Bloomberg的标题是「一年后再次颠覆硅谷」。有没有这么夸张暂且不说,但这次确实是两件事一起发: V4 Pro :1.6万亿总参数,激活49B,支持100万token上下文 V4 Fla
昨天(4月23日),OpenAI扔出了GPT 5.5。 外号Spud(土豆)。距离GPT 5.4,刚好6周。 如果你还记得一年前,OpenAI每季度出一个大版本,大家都觉得研发速度够快了。现在6周出一个,节奏变得更像软件版本迭代。 先看定价
4月22日,Qwen团队在Hugging Face发了个新模型。27B参数,Dense架构,Apache 2.0协议,叫Qwen3.6 27B。 发布博文里,他们把benchmark分数列了出来。SWE bench Verified: 77
明天是4月23日,星期四。 OpenAI有个规律:重大发布喜欢选周四。这不是什么内部秘密,是过去几年的公开记录。 而代号Spud的下一代大模型,今天Polymarket的押注数据已经给出了 81% 的发布概率,集中押注在4月23日。 时间轴
中国网信办最近发了一个草案,专门管那种跟你聊天、陪伴你、还会对你"共情"的AI服务。正式名称叫《人形交互人工智能服务暂行管理措施(征求意见稿)》,2026年4月3日发布,公开征求意见。 什么是"人形交互AI"? 法规覆盖的范围比你想象的宽—
4月20日,Alibaba发布了Qwen系列有史以来性能最强的模型——Qwen3.6 Max Preview。 说悄悄,是因为这次没有大张旗鼓的开源庆典,没有Apache协议公告,也没有欢迎下载、商业免费的旗帜。Qwen3.6 Max只在Q
Qwen3.5 小型模型系列刚发布24小时,阿里 AI 实验室的核心就散了。 谁走了 3月5日,主导阿里 Qwen 系列模型从零到全球600多万次下载的首席 AI 研究员 林俊阳(Junyang Lin) 宣布辞职。出走的不止他一人: 惠彬
Anthropic 在4月16日发布了 Claude Opus 4.7,这个版本在编程能力上的提升幅度出乎不少人的预料——生产代码修复任务直接做到了上代的3倍,SWE bench Pro 从53.4%跳到64.3%。 三个最值得看的跑分 先
中国的AI行业正在给自己发明一套新的计量单位。 今年3月,中国国家数据局局长刘烈宏在公开场合提出了一个词: 词元 (token)。这个词被定位为连接"技术供给"和"商业需求"的官方结算单位——用AI处理了多少信息,用词元来算。 根据Fort
四月初,UC Berkeley和UC Santa Cruz的研究团队在《Science》发了一篇论文,把AI安全圈炸了一遍。 结论很简单,也很不安: 七款顶级大模型里,没有一款能老老实实完成"淘汰另一个AI"的任务。它们都选择了包庇。 实验
一篇发表在《自然·通讯》上的论文,正在AI安全圈里炸锅。 斯图加特大学和ELLIS阿利坎特研究所的团队做了一件很简单的事:让一个推理大模型去攻击另一个大模型,看能不能把对方的安全护栏搞掉。结果让人脊背发凉—— 总成功率97.14% ,25,
去年12月的 AWS re:Invent,亚马逊做了一件很有意思的事:不只是发布新模型,而是把"模型+训练平台+自动化服务"捆成一套卖。 Nova 2 家族一次推出四个型号,同时上线了 Nova Forge(让企业训练自己的模型变体)和 N
4月2号,阿里发布了Qwen3.6 Plus。 这次不是"更大的模型"那种常规发布,而是专门针对企业级AI Agent场景的一次定向升级。从产品定位看,阿里这次想明白了一件事:通用能力军备竞赛跑不赢,那就去做"真正能进生产环境干活"的执行层
如果你现在还在为要不要买Claude Opus 4.6的API额度发愁,这篇文章可能会让你省一笔钱。 Anthropic在2月份发布了Claude Sonnet 4.6,价格和Sonnet 4.5完全一样——输入$3/百万tokens,输出
去年九月底,DeepSeek悄悄放出了V3.2,没有大张旗鼓,但这个版本搞了一个挺有意思的架构变动。 V3.2的核心改动不是参数规模,而是注意力机制。他们做了一个叫 DeepSeek Sparse Attention(DSA) 的东西,把传
Yann LeCun 从 Meta 离开之后,干了一件让所有人都在等待的事。 他创办了 AMI Labs,完成了 10.3 亿美元种子轮融资,估值 35 亿美元,欧洲有史以来最大的种子轮。然后他说:我要造一个不靠预测下一个词来工作的 AI。
Agentforce的ARR刚过了8亿美元。169%的年增速。这不是PPT里的数字,是Salesforce Q4财报里的真实数据。 29000个企业客户签了Agentforce合同,Q4单季合同数量环比增长50%,平台上跑了24亿个agen
3月16日,Mistral发布了Small 4,一个看起来平平无奇的名字,背后藏着一个挺实用的产品思路——用MoE架构把原来三款独立模型全部揉进一个里面,一次部署搞定所有场景。 一个模型,三个用途 Mistral之前有三款各司其职的模型:
Sam Altman在3月24日确认了一件事:他们的下一个大模型预训练已经完成,就差几周了。这个模型的内部代号,叫Spud——英文里是土豆的意思。 OpenAI给开发期模型起名字向来随意(GPT 5叫Orion,之前还有Strawberry
有个数字挺有意思:2025年初,DeepSeek和Qwen加起来占全球AI市场份额不到1%;到2026年1月,这个数字变成了15%。 一年时间,从边缘选手跑到行业不能忽视的位置,速度快得有点离谱。 背后发生了什么,值得梳理一下。 DeepS