Hugging Face 用 178 张图训模型画水彩
奖励函数里没有单元测试,只有一池 178 张手工评分的参考图。这条路子把强化学习从数学题、代码题挪到了说不清对错的地方,也顺带把训练一个有审美的模型的账单压到几百美元量级。
关注开源模型、Hugging Face、模型许可、社区生态和本地部署。 本页收录 117 篇已发布文章。 第 1 / 2 页,每页最多 100 篇。
奖励函数里没有单元测试,只有一池 178 张手工评分的参考图。这条路子把强化学习从数学题、代码题挪到了说不清对错的地方,也顺带把训练一个有审美的模型的账单压到几百美元量级。
月之暗面正与微软、亚马逊、谷歌谈 Kimi K3 的收入分成,初期开价最高 30%,而此前业内默认的上限是 20%。开放权重模型不收授权费,云上托管的调用收入就成了唯一能摆上桌的那笔钱。
一篇工程文档比发布会更能看出方向:多智能体编排被明确排在了单体加技能之后,理由是交接过程会丢状态。这是从线上跑出来的结论。
207 个算子、809 组对照测试、几何平均快 2.57 倍。Hugging Face 把浏览器里的 GPU 算子当模型一样版本化托管进 Hub,让它们可以被单独下载、单独测、单独换。浏览器端推理卡了好几年的位置,一直在算子这一层。
6500 台订单压在 24 小时里,峰值每四秒出一台。Pollen 把运行时、强化学习代码和仿真环境一并挂上 GitHub,这只鸭子更像整套开源栈的入场券,硬件只是承载它的壳。
933 名贡献者、1.6 万个合并请求压进同一个版本号,OpenClaw 把两天一发的开源节奏换成了七周一次的整体翻修。安装、浏览器、多人协作三条线同时改版,攒版本的赌注下得不小。
770B 参数只激活 49B,腾讯把开源模型的算力账压到了 6.4% 的激活率。盲测领先 GLM 5.3 的那 0.07 分说明不了太多,能否撑住长周期工程任务,才是这一版要证明的东西。
去年英伟达想按 70 亿估值花 5 亿入股被回绝,这次直接把整家端走,价签 129 亿。开源模型的分发入口从社区手里换到卖卡的人手里,前提是这份还没落笔的协议真能签下去。
同样的去噪步数、同样的 8 卡 H200,换个推理运行时就快近一倍,这部分提速一分画质都没掉。再往上的 6.24 倍要拿 SSIM 换,0.76 已经是肉眼能看出差别的区间,那一档更适合筛构图而非出成片。
OpenWorker 七月才开源,卖点是在自己的笔记本上把活干完。新版把安全审查提到首位,扫代码也扫依赖,权限设计里还写死了一条硬规矩:出修复的那个智能体,不能同时当验收的那个。
腾讯微信视觉团队把 2B 规格的多模态嵌入模型做到 77.9 分,越过了参数量四倍的 Qwen3 VL Embedding 8B。在检索这条线上,堆参数换分数的性价比正在肉眼可见地变薄。
把激活参数从 320 亿压到 180 亿、层数减半,AA 指数还顶到 57 分,智谱这一版给国产开源模型划了条新的成本线:前沿档位的能力,开始按 Flash 档位的价格卖。
六天匿名跑到 OpenRouter 用量榜首,才由智谱出面认领。免费预览把调用量做到 DeepSeek 的两倍,权重紧随其后,国产模型争夺开发者的顺序,正从先办发布会改成先让人用上。
模型挂在 3.8 的代号下,用的却是下一代 Qwen4 架构。阿里把架构选型提前半步交给社区去试,等 Qwen4 正式发布时,推理框架和量化工具链已经跑过一轮了——开源节奏本身也是产品设计的一部分。
把拥塞和重传的判断从交换机挪回网卡,Meta 换来的是不用 PFC 也能跑 RDMA。这笔取舍对十万卡集群成立,对几百卡的机房未必划算——规范 10 月在 OCP 放出来,那时候才好算账。
三年前投后 45 亿美元、还回绝过英伟达报价的 Hugging Face,如今把探买家的活儿交给了银行。一家长期把自己摆在公共设施位置上的公司开始谈退出,价签背后的身份变化比数字更扎眼。
4.8 个月,Kimi K2.6 越过 Opus 4.5,这是 SemiAnalysis 画出的最新一段追赶曲线。周期缩短对闭源实验室谈不上致命,但靠"领先半年"收溢价的日子在变短,护城河正从模型分数挪向产品与交付。
并发为 1 的时候,卡住模型的常常是 CPU 那一侧的等待,显卡反倒闲着。SGLang 与蚂蚁把这些等待逐个拆掉,单请求每个 token 的耗时从 3.33 毫秒压到 0.78 毫秒。
蚂蚁与 SGLang 团队把量化后的权重常驻显存、让新进程零拷贝映射过去,省掉每次重启都要重做一遍的读盘和量化。模型越大,推理侧的成本账就越往运维那头挪。
Anthropic 这轮调整的着力点在访问方式:Mythos 5 跑在合作伙伴产品的后台,用户拿得到补丁建议,碰不到模型本身。攻防能力的分发从发账号改成了发结果。
MathForm 8B 在最难的 FATE X 上拿到 37% 一致性通过率,压过多款 32B 专用形式化模型。把数学题翻成 Lean 4 这件事上,检索 Mathlib 加编译器反馈迭代,比继续堆参数划算。
同一个模型在名字、仓库说明和模型卡上给出了三种参数口径,这不算失误,它暴露的是统一多模态架构还没有公认的数法:理解塔和生成塔要不要合并计数,各家没谈拢。
三档接入里 app server 最能说明 OpenAI 的算盘:把模型外面那层执行系统整个摊开做成通用接口,计费口子仍然留在模型侧。Cisco 和一家报税服务商已经照这个路子把 agent 塞进了自家产品。
一套六月底才在国内开源的投机解码方法,两个月后被一家美国端侧模型公司做成了默认加速件,连推理框架里的算法开关都直接沿用了它的名字。开源代码的扩散速度,比论文引用数诚实得多。
Opus 5 和 Kimi K3 之间只差 10 步,放进 690 步的总差距里几乎等于噪声,开源模型在这类长周期实验上已经不落下风。卡住所有人的地方在别处:153 次跑下来,没有一个模型拿出新方法。
Q4 0 是 llama.cpp 里最老的四比特格式,精度差到社区基本弃用,Liquid AI 却用蒸馏把分数拉回 BF16 的九成七。拿训练侧的一次性成本,换 Arm 手机上那几毫秒。
GLM 5.3 在 Artificial Analysis 智能指数拿到 60 分、182 个模型里排第 8,API 定价 1.4/4.4 美元;分数已经贴近开放权重第一梯队,但每个任务吞掉 4.1 万输出 token,账单未必比对手便宜。
编译器和工具链的代码全部进了 modular/modular 主仓库,许可证是 Apache 2.0 叠加 LLVM 例外,连二进制分发的口子一起放开。做这个决定的是刚完成收购的高通,而三年前许下开源承诺的那家创业公司已经并入其中。
DeepSeek V4 Pro 这次没有开发布会,信号藏在 API 文档里:版本号转到 0813,输出上限抬到 384K,价格页同时挂出涨价预告。对重度开发者来说,这比一张跑分海报更需要立刻算账。
Qwen3.8 的新变化不在参数更大,而在阿里第一次把 Max 级模型权重放到开发者面前。此前写在预告里的“开源承诺”,现在变成了可下载、可部署、可核验的模型卡。
Ling 3.0 tiny 的看点不只是 7.9B 总参数。每个 token 只激活 1.3B 参数、同时给出 BF16/FP8/INT4 权重和 SGLang/vLLM 部署路径,说明国产开源模型正在把智能体能力往本地设备压。
Meta 这次放出的 Muse Glimmer,不是把最大模型搬给开发者。它把 30B、24GB 显存、Apache 2.0 和 Agent 工具链捆在一起,重新回答一个老问题:开源权重还能不能在本地工作流里有存在感。
BigBang V1 把合成数据从“模型答题”推进到“模型出题、解题、验题”。35B A3B 模型跑出多项科研与代码评测优势,更该盯住的是训练数据生产方式变了。
WeatherNext Cyclones 把台风、飓风预报里最难合并的路径、强度和风场结构放进同一个 AI 模型。多争取 24 小时预警,重点不在替换气象员,重点在让撤离、物资和停航决策早一天进入准备状态。
ForgeStencil 的看点不在“AI 写代码”,在它把工业软件调优拆成可复验流程:100 个应用、2.05 倍几何平均端到端加速,开始碰到 HPC 专家的腹地。
Thinking Machines 把 Inkling Small 全量权重放出后,最醒目的信号落在成本曲线上:12B 激活参数已经能贴近 41B 激活旗舰的多个能力项。
MiniMax H3 把 2K、15 秒、原生立体声和开源权重放在同一张发布牌上;0.8 元/秒的价格很醒目,但开放权重仍要等后续文件落地。
Kimi K3 开源后不到两周,月之暗面融资口径从 300 亿美元抬到 350 亿美元。资本看中的已经不止单个模型热度,还包括开源模型换来上市前确定性的能力。
混元这次没有只晒模型跑分,而把推测解码的训练框架、两类 drafter 权重和评测链路一起放出,目标直指大模型推理成本。
NeoteAI 与复旦把 3 万小时触觉交互数据、三条模型路线同时亮出,机器人学习的焦点从摄像头移到手指接触瞬间。
Kimi K3 的新信号不在参数表,而在攻防测评:通用榜单冲高后,网络安全长链任务先露出短板。
Poolside 这次没有端出一个万亿参数的庞然大物。它把 Laguna S 2.1 做成 118B 总参数、8B 激活参数 的 MoE 代码模型,权重直接放上 Hugging Face,还说能在单台 NVIDIA DGX Spark 上跑
机器人这轮模型竞赛,面壁智能没有把参数表拉到最大,先把模型压到了能贴近机器本体的位置。 7月19日,OpenBMB在GitHub公开MiniCPM Robot系列。两套首发模型分工很清楚: 1.5B的MiniCPM RobotManip管机
Hugging Face碰到的,并非普通撞库或一次脚本扫描。它在7月16日公开承认,一组攻击者把恶意数据集塞进平台的数据处理链路,靠自动化智能体完成横向移动;平台这边也用AI把攻击日志拆回来。 这条新闻最扎人的地方,是攻防两边都在机器速度上
Kimi 这次把牌摊得很大:2.8 万亿参数、100 万 token 上下文、原生视觉理解,还把价格直接挂在开放平台首页。7 月 16 日发布的 Kimi K3,先把月之暗面重新推回国产开源模型的中央位置。 这条新闻的张力不在“又发了一个大
AI Agent 的安全焦点,正在从“说了什么”挪到“做了什么”。 这句话放在半年前还像一句行业判断,放到 7 月 13 日就很具体了。
Bun 用 Claude 把一套大型 JavaScript 运行时从 Zig 迁到 Rust,刚被包装成 AI 编程的标杆案例,Zig 创始人 Andrew Kelley 就把桌子掀了。
智谱刚从资本市场拿到一轮高光,创始人唐杰却在内部信里把话题拉回了模型能力上限。 这封题为《巨浪已来》的内部信在 7 月 11 日发出。它没有把重点放在股价、融资或销售捷报上,反倒把公司未来两年的重心压到三个难题上:长程任务、自治智能体、自我
桌上的冰球朝机器人飞过来,难点不是看见球,而是在球还没到之前判断它会去哪里。 7 月 10 日,蚂蚁灵波发布 LingBot VA 2.0,把这个问题摆到机器人“大脑”正中间:让模型一边预测世界下一步的变化,一边生成自己的动作。它延续了灵波
一个把大模型塞进个人电脑的开源工具,刚拿到 6500 万美元 B 轮融资。Ollama 团队只有 14 人,却称每月有 890 万开发者在用,覆盖 85% 的《财富》500 强企业。 这组数字看着像典型的 AI 融资新闻,但 Ollama
蚂蚁集团旗下具身智能公司灵波科技,把机器人视觉这块短板又往前推了一步。 7 月 7 日,灵波科技发布空间感知模型 LingBot Depth 2.0,并同步开源视觉基座模型 LingBot Vision。前者面向机器人深度补全,后者更像底层
一个开源项目最近抛出个有点反直觉的结论:与其用一个最强的模型,不如把四个国产模型凑到一块投票。 这个项目叫OpenSquilla,7月6日放出0.5.0预览版,背后是家刚成立不久、估值1亿美元的公司基元律动。
7 月 1 日起,GitHub Copilot 的模型列表里多了个新名字:Kimi K2.7 Code。这是月之暗面(Moonshot AI)的开源模型,也是 Copilot 上线以来接进来的头一个开源权重模型。在这之前,能在这个框里选的,
Palantir 和英伟达 6 月 29 日联手推出了一套系统,专治政府机构一个老矛盾:既想用上强大的 AI,又不敢把敏感数据送出自己的机房。 它们的做法,是把英伟达的 Nemotron 开源模型整个搬进"气隙"(air gapped)环境
沙特阿美的风投部门 Aramco Ventures 领投,Together AI 拿到 8 亿美元 C 轮,投后估值定在 83 亿美元。
美国还在收紧芯片出口,DeepSeek 这边换了个思路:既然高端卡拿不够,那就让每一张卡多干点活。 6 月 30 日,DeepSeek 联合北京大学开源了一个叫 DSpark 的推理框架。一句话说清它干嘛的——同样的模型、同样的卡,让 AI
先说个挺多人没注意到的事。 过去两个月,OpenRouter(开发者调模型的那个中转站)上有个代号 Owl Alpha 的神秘模型,悄没声地爬到了调用量第一。免费、限额,每天给你五百万到一千万 token 随便用,结果硬是被人用出了一个月十
一个在 OpenBSD 内核里躺了 23 年的内存漏洞,被一个 AI 翻了出来。 这是 OpenAI 周一(6 月 22 日)甩出来的成绩单里最扎眼的一条。
开源世界有个老毛病,这两年被 AI 放大了:真正在维护那些底层项目的,常常就那么几个人。 OpenAI 自己引的数据挺扎心——被广泛使用的开源项目里,九成多的代码更新,是不到十个开发者扛下来的。平时就忙不过来,现在 AI 还能成批往他们邮箱
每月 1.5 亿美元。 这是一家成立两年、至今没发布过一款正经产品、几乎没有收入的 AI 公司,刚跟马斯克签下的算力账单。签到 2029 年,加起来 63 亿美元。 这家公司叫 Reflection AI。卖它算力的,是马斯克的 Space
先扔个数字。 跑长周期编程任务的 FrontierSWE 榜单上,智谱(现在改叫 Z.ai)的开源模型 GLM 5.2 拿了 74.4 分 。同台的 GPT 5.5 是 73 分上下,Claude Opus 4.8 是 75 分多一点。
一个开源模型,在某个跑分上把 Claude Opus 4.8 摁了下去。 这事本身不算稀奇。稀奇的是——卷子是它自己出的,分也是它自己打的。 发生了什么 6 月 12 日,月之暗面(Moonshot AI)放出了 Kimi K2.7 Cod
一份 200 美元的 ChatGPT Pro 套餐,要是真按它给的额度用到顶,OpenAI 得为你倒贴 14000 美元。 这个数字不是吐槽,是 SemiAnalysis 实测算出来的。
AI 生成的视频有个老毛病:镜头往前推一段、再转回来,原先那把椅子可能就换了个样,墙上的画也飘没了。模型不记得"刚才这儿长啥样"。 6 月 14 日,微软研究院联合几所高校放出一个叫 Mirage 的视频世界模型,专治这个健忘症——而且代码
6 月 12 号晚上,白宫一纸命令,Anthropic 把最强的 Claude Fable 5 和 Mythos 5 对所有外国人关停。隔了不到 24 小时,智谱 Z.ai 那边上线了 GLM 5.2——而且把话挑明了:下周连权重一起开源,
先看一组价格。 同样跑一百万个输出 token,GPT 5.5 收你 30 美元,Claude Opus 4.8 收 25 美元,Anthropic 那个更强的 Fable 5 直接 50 美元。月之暗面这周扔出来的 Kimi K2.7 C
先说个反直觉的事。 你现在用的所有大模型,写字的方式跟打字机其实没本质区别——一个词一个词往外蹦,前一个字没定下来,后一个字不敢动。这叫自回归(autoregressive),从 GPT 到 Gemini 全是这套。 Google 这周开源
又一个 1 万亿参数的开源模型,六月十二号悄悄挂上了 Hugging Face。 这次是月之暗面,模型叫 Kimi K2.7 Code。一句话概括:专门干编程的开源大模型,免费下载,Modified MIT 协议——商用基本没门槛。 但比"
先说个反直觉的事。 你现在用的大模型——ChatGPT、Claude、Gemini——写字全是一个词一个词往外蹦的。专业点说叫"自回归":写下一个词,得先看前面所有词,一步都不能跳。这套机制统治了大模型四五年,几乎没人质疑过。
Cohere 这两年一直在企业和"主权 AI"那条线上闷头跑:模型卖给政府和大客户,部署在人家自己机房,数据不出门。前阵子它把 218B 的旗舰 Command A+ 用 Apache 2.0 开源,押的也是这套叙事。 6 月 9 日,它把
先说个拧巴的画面:美国企业的 IT 负责人,一边在合规群里转发「别用中国模型」的警告,一边把公司信用卡绑到了 DeepSeek 的 API 上。 这不是段子。6 月 7 日 The Decoder 援引 Ramp 的数据,把这事摆到了台面上
200 亿美金那轮,钱还没全部打进账上。 做 Kimi 的那家公司——Moonshot AI(月之暗面),转头又开始张罗下一轮了。这次开的价是 300 亿。 彭博 6 月 8 号的消息:这轮它想拿最多 20 亿美金,把估值顶到 300 亿美
让 AI 画一张海报,十有八九栽在同一个地方:画面是好看,但文字摆得乱七八糟,该在左上角的标题跑到了中间,logo 怼在人脸上。 6 月 3 日,两家公司同一天出手,冲着的正是这个老毛病——Reve 和 Ideogram 各自甩出新版本,卖
做文生图的公司大多把最好的模型锁在 API 后面收钱。Ideogram 这回反着来——6 月 3 日,它把当家旗舰 Ideogram 4.0 的权重直接放到了 GitHub 上,让你下回家自己跑。 这不是一个缩水的开源小号,是它能拿出手的最
英伟达这次没发新芯片,发了个模型——而且是开源的。 Cosmos 3,黄仁勋给它的定位是「物理 AI 的开源前沿基础模型」。说人话:以前大模型只会读文字、看图、生成视频,Cosmos 3 想让机器人和自动驾驶车真正「脑补」出物理世界接下来会
6 月 1 日,MiniMax 发了 M3。一句话概括卖点:一个开源权重的模型,同时塞进了 100 万 token 上下文、前沿级的写代码能力,还带原生多模态。MiniMax 说,这三样凑一块的,它是头一个。
黄仁勋这次端出来的是美国最强的开源大模型。结果跑分一对比,还是输给了中国。 6 月 1 日 Computex 台北的主题演讲上,英伟达发布了 Nemotron 3 Ultra,一个 5500 亿参数 的开源模型。
5月20号,英伟达Nemotron Labs甩了篇论文加权重。 这次发的不是一个"再大一点的模型",是一个 新的解码方式 ——叫Nemotron Labs Diffusion。3B、8B、14B三个规格,base、instruct、visi
Cohere这次的牌打得不小。 5月20号,他们把旗舰模型Command A+开源了—— Apache 2.0协议 ,权重全放Hugging Face,218B参数的MoE架构。这是Cohere第一个走Apache 2.0完全开源的旗舰模型
2240亿对1860亿。这不是融资额对比,是这周OpenRouter上跑得最猛的两个AI Agent,一天烧掉的token数。 先说结论:OpenClaw的第一终于丢了。
200亿美元。 这是Kimi背后的Moonshot AI在5月7日刚刚敲定的最新估值。领投方是个让人没想到的名字——美团旗下的Long Z Investment。 这一轮融到了20亿美元,参与方还包括清华控股、中国移动、CPE远峰资本。算上
1.07亿美金,B轮,5月4日官宣。 钱不算最大的——但这轮投资人名单挺有信息量: 500 Global领投 ,跟投里出现了 英伟达 (Nvidia Corp.)、Samsung Next、Supermicro、A.Capital、Feli
四月二十八号,Mistral扔出来一个不那么性感的产品:Workflows,公开预览。 这玩意儿不是模型,不是聊天机器人,甚至不能直接给你写代码。它是个 企业AI的编排层 ——专门解决一个被忽略很久的问题:模型再聪明,跑不进生产就是个dem
Hugging Face 的开源机器人框架 LeRobot 被发现一个严重远程代码执行漏洞, 任何能连到服务端口的攻击者都能直接接管你的机器 ——不用用户名、不用密码、不用证书。 CVE 编号是 CVE 2026 25874 。
雷军前两年挖罗福莉,外界都说他在做表面功夫——一家造手机和电动车的公司,凑什么 AI 的热闹。 周一晚上,小米把 MiMo V2.5 Pro 扔了出来,1.02 万亿参数 MoE,开源。这次没人再笑了。
去年这个时候,DeepSeek 一发模型,全球科技股集体跳水,被叫做"黑天鹅"。 今年V4又来了。 市场反应:还行 。 1.6万亿参数的开源新王,没人觉得稀奇了 4月24日,DeepSeek 把 V4 系列丢上了 Hugging Face。
V4 Pro的preview是上周五凌晨上线的。 今天早上,DeepSeek在API面板贴出公告:V4 Pro 75% off,直接到5月5号。同时,整个API的输入缓存命中价格砍到原来的十分之一。 发布到大幅降价,中间隔了72小时不到。
先上这个数字: SWE bench Pro 53.5 vs 50.9 。 前者是Qwen3.6 27B,27B参数,4月22日刚开源,Apache 2.0协议。后者是Qwen3.5 397B,397B参数,混合专家架构(MoE),阿里之前的
今天(4月24日),DeepSeek发布了V4。 Bloomberg的标题是「一年后再次颠覆硅谷」。有没有这么夸张暂且不说,但这次确实是两件事一起发: V4 Pro :1.6万亿总参数,激活49B,支持100万token上下文 V4 Fla
4月22日,Qwen团队在Hugging Face发了个新模型。27B参数,Dense架构,Apache 2.0协议,叫Qwen3.6 27B。 发布博文里,他们把benchmark分数列了出来。SWE bench Verified: 77
月之暗面上周把Kimi K2.6完整版推出来了,这不是什么"代码预览"测试版,是完整的生产级模型。之前Code Preview已经引发了一波关注,但完整版的技术规格和跑分结果出来以后,事情比很多人预期的更有意思。
4月20日,Alibaba发布了Qwen系列有史以来性能最强的模型——Qwen3.6 Max Preview。 说悄悄,是因为这次没有大张旗鼓的开源庆典,没有Apache协议公告,也没有欢迎下载、商业免费的旗帜。
4月16日,阿里Qwen团队把Qwen3.6 35B A3B开源了,Apache 2.0协议,没有任何商用限制。 这个模型有点意思:总参数35B,但推理时只激活3B。用了混合专家(MoE)架构,12:1的计算稀疏比——在效果上接近35B大模
"AI自我进化"这个词被说烂了,但MiniMax在M2.7上做的事稍微不一样。 不是科幻意义上的自我意识,而是:M2.7在自己的训练过程里,用一套agent框架自动跑实验、读日志、分析指标、调代码、再跑实验,循环100多轮—— 没有人工干预
黄仁勋要在开源模型市场上插一面旗 大家以为NVIDIA只管卖GPU的时候,英伟达悄悄发布了Nemotron 3全系列——不只是模型权重, 连3万亿token的预训练数据集、强化学习流程和评估工具全部开源了 。 这个动作的信号很清晰:NVID
4月7日,Z.ai(原智谱AI)发布了GLM 5.1,754B参数,MoE架构,MIT协议开源。 跑分结果:SWE Bench Pro 58.4%,全球第一。GPT 5.4是57.7%,Claude Opus 4.6是57.3%。 光这个数
量子计算机有个让工程师头疼的老问题:校准。一台量子处理器(QPU)每跑一段时间,量子比特之间的相干性就会漂移,需要重新校准。人工校准少则几天,多则一周,这还是在有丰富经验的团队情况下。
4月13日,月之暗面(Moonshot AI)向所有Kimi Code订阅用户全量推送了K2.6代码预览版。这个版本在闭测了大约一周之后正式铺开,时间点卡在GPT 5.4 Cyber和Anthropic Mythos刚发布后不到两周。 Mo
Arcee AI是家只有26个人的小公司,但他们刚做了一件让圈子里很多人吃惊的事:花了公司大约一半的风险投资,2000万美元,用2048块英伟达B300 GPU跑了33天,训出了一个400亿参数的开源推理模型——Trinity Large
去年九月底,DeepSeek悄悄放出了V3.2,没有大张旗鼓,但这个版本搞了一个挺有意思的架构变动。 V3.2的核心改动不是参数规模,而是注意力机制。他们做了一个叫 DeepSeek Sparse Attention(DSA) 的东西,把传