三家模型商 90 分钟内接连报错,谷歌正常

三家模型商 90 分钟内接连报错,谷歌正常

北京时间 9 月 3 日晚,Anthropic、xAI、OpenAI 的模型服务在一个半小时内先后进入故障状态。Anthropic 的状态页 21 时 26 分挂出第一条公告,xAI 的 Grok 全系在 21 时 41 分被下游平台标为服务降级,OpenAI 在 22 时 56 分前后开始报 ChatGPT 与 Codex 错误率升高。到 23 时 15 分,三家的事件都还处于”调查中”或”修复中”,没有一家宣布恢复。

同一时段,谷歌的 Gemini 与 Vertex AI 没有事件记录,第三方状态聚合板上谷歌那一格是绿色的”All services operational”。

时间线:三家先后进场

Anthropic 最早。 21 时 26 分,状态页写”正在调查 Claude Mythos 5.1、Fable 5.1、Opus 5 的请求错误率升高”,15 分钟后改为”已定位原因,正在修复”。21 时 50 分补了完整清单:Mythos 与 Fable 的 5.1 和 5 两代、Opus 5、Opus 4.8、Opus 4.6 全部受影响,Haiku 与 Sonnet 不在列表里。22 时 49 分的更新只有一句”仍在修复”。

xAI 紧随其后。 xAI 自己的状态页访问时返回 403,无法直接查看。能确认的是 Cursor 在 21 时 41 分发布”调查服务降级”,写明受影响的是”全部 Grok 模型、Automations、Cloud Agents、Grok Bot 和 Review Agents”。聚合板上 xAI 是四家里唯一的红色”Down”。

OpenAI 最晚,用户感知最强。 22 时 56 分前后,状态页出现”Elevated errors across ChatGPT and Codex”,说明只有一句”正在调查”。部分用户此时打开 chatgpt.com 拿到的是 HTTP 404,这个错误码通常来自边缘节点找不到路由,跟模型侧的 5xx 报错是两种性质。

OpenAI 状态页:ChatGPT 与 Codex 错误率升高,事件持续 5 分钟时的截图

部分用户访问 chatgpt.com 时拿到 HTTP 404

下游先感知到

Cursor 的状态页在这一晚同时挂着两条事件。一条是 21 时 41 分的 Grok 降级,一条是 22 时 17 分的”Anthropic 模型错误率升高”,后者写明是”上游 Anthropic 问题”导致 Fable 5.1、Fable 5、Opus 5、Opus 4.8、Opus 4.6 的请求出错,“部分用户会遇到错误或 Agent 回合失败”。

Cursor 状态页同时挂着 Grok 全系降级和 Anthropic 上游错误两条事件

这份清单跟 Anthropic 自己给的一致,只少了 Cursor 本来就不接的 Mythos。对 AI 编程工具来说,一晚上两家上游同时出问题,“多模型冗余”这个卖点的兜底能力一次被考掉一半。

国内开发者更被动一些。多数人走中转 API 或聚合平台,故障信息要经一层转述才到手,中转商通常只显示”上游异常”,不区分哪家、哪个型号。今晚 Claude 的 Haiku 与 Sonnet 没在受影响清单里,Gemini 全程可用,知道这一点的人可以直接切模型,不知道的人只能刷新等待。

谷歌没事,是线索还是巧合

中文技术社区里最先冒出来的猜测是”上游线路或 DNS 出了问题”。这个猜测目前无法核实。反面证据有两条:谷歌云的事件列表当天没有任何新增,Gemini 全天正常;Anthropic 的措辞是”已定位原因”,指向自家内部,共享基础设施故障通常会写成”上游供应商”。

正面证据也有。Anthropic 受影响的全是大模型,小模型幸免;xAI 被标的是”全部 Grok 模型”;OpenAI 只列了 ChatGPT 和 Codex,API 那一栏是绿的。三家的受灾范围都集中在推理侧的大型模型,这跟算力供应商某个区域出问题比较像,跟 DNS 那种”全部打不开”不像。

另一处可以对照的数据来自第三方可用性监控。截至 23 时 37 分,它标记了 9 个故障服务,除 Cursor、Claude、OpenAI 之外,Cloudflare、Supabase、GitHub、Notion、SendGrid、Twilio 也各有部分降级。这份名单看起来支持”上游出事”的猜测,但 Cloudflare 官方状态页当晚没有新增事件,挂着的是 8 月底遗留的 R2 与 WARP 两条,其余几家的降级是否与本次相关也没有依据。同一页面上 Grok 在 23 时 37 分已显示正常运行。

第三方可用性监控页北京时间 23 时 37 分的快照:9 个服务处于故障状态,Cursor 为重大故障
截图来自 ip.net.coffee 服务状态页,北京时间 23 时 37 分

能从这些线索得出的只是”三家各自的大模型推理在同一时段出了问题”,再往前一步就是推测。三家都没有发布事故报告,公开更新里也没有提到任何第三方。哪种解释成立,要等各家的事后复盘,通常是三到五个工作日。

参考来源:Anthropic 状态页、OpenAI 状态页、Cursor 状态页、Cloudflare 状态页、谷歌云事件列表、第三方可用性监控页、CocoLoop 社区用户截图;各家受影响模型清单与事件阶段按状态页原文核对,xAI 状态页无法访问(返回 403),其受影响范围以 Cursor 状态页与第三方聚合板为准。