DeepSeek发布数学证明模型Prover-V2
DeepSeek在数学定理证明领域搞了个专用模型 Prover V2 ,目标是用AI在Lean 4形式化验证系统里自动证明数学定理。 这个方向为什么重要? 数学定理证明是AI能力的一个极端测试场。因为数学不接受"差不多对"——证明要么完全正
DeepSeek在数学定理证明领域搞了个专用模型 Prover V2 ,目标是用AI在Lean 4形式化验证系统里自动证明数学定理。 这个方向为什么重要? 数学定理证明是AI能力的一个极端测试场。因为数学不接受"差不多对"——证明要么完全正
2026年的GitHub Copilot和两年前已经不是同一个产品了。 从补全到Agent 最初Copilot就是个代码补全工具——你写一行,它补下一行。现在它能: 接收GitHub issue作为输入, 自主完成整个开发流程 在VS Co
智谱AI最近有两件大事:发布了新一代的 GLM 5 模型,同时传出了 赴港交所上市 的消息。 GLM 5的升级 GLM 5相比4.7系列的提升主要在: 推理能力进一步加强,数学和代码benchmark有明显提升 多模态能力扩展,支持图文理解
AI安全研究组织METR做了一个实验,结论让不少人大跌眼镜: 有经验的开发者使用AI编程工具后,完成任务的速度反而下降了19%。 实验设计 METR找了一批有经验的软件开发者,让他们在两种条件下完成相同的编程任务: 实验组 :可以自由使用A
Codex在OpenAI产品线里的定位一直在变。最早是代码补全工具,后来变成独立的编程模型(GPT 5.3 Codex),现在又并入了GPT 5.4的统一架构。 Codex CLI 值得一提的是OpenAI后来开源的 Codex CLI —
马斯克旗下的xAI最近两件事叠在一起引发了大量讨论: Grok 4发布 + SpaceX可能以2500亿美元收购xAI的传闻 。 Grok 4的表现 Grok 4在多项benchmark上的成绩确实不错: 编程和推理任务上逼近GPT 5.x
OpenAI宣布关停Sora视频生成服务的消息在圈内引发了不小的震动——毕竟这是当初发布时最轰动的产品之一。 为什么关了 核心原因很现实: 每天亏损约100万美元 。 视频生成的计算成本远高于文本生成。每次生成一段视频需要的GPU算力是文本
在AI编程工具普遍涨价的2026年,GitHub Copilot的 $10/月 定价显得格外亲民。但便宜归便宜,它到底能提供多少价值? 核心能力 Copilot目前提供三层能力: 第一层:代码补全 最基础也是最成熟的功能。在你写代码的过程中
一般来说,AI行业会有几个月的爆发期,然后是相对平静的消化期。但2026年4月,感觉几条爆发线全叠在一起了。 Anthropic、OpenAI、Google、Meta、xAI——这几家公司不约而同地把重磅产品都堆在了这个月前后。有研究者调侃
OpenAI最近悄悄改了Codex的定价逻辑,幅度不大,但方向挺有意思。 以前在ChatGPT Business和Enterprise里用Codex,基本是按座位包月。现在多了一个选项: Codex专属席位按量计费 ,团队可以按实际用量付钱