4月20日、ChatGPTで大規模なグローバル障害が発生しました。
米国東部時間の午前10時過ぎ、Down Detectorへの障害報告が急増し始めました。英国での報告ピークは8,700件超、米国では1,900件超に達しました。ChatGPTのメインインターフェースに加え、Codex、APIプラットフォーム、Projects機能も影響を受けました。一部のユーザーは、サービス中断により進行中の作業タスクが削除されたと報告しています。
午後1時までにOpenAIは修正プログラムを適用し、午後1時30分頃までにほぼ復旧しました。ダウンタイムは合計で約3時間でした。
OpenAIの対応
障害発生中、OpenAIのステータスページには次のように記載されていました:
「リストされているサービスの問題を引き続き調査しています。」
そして:
「緩和策を実施し、復旧を監視しています。」
根本原因の説明、技術的詳細、事後レビュー報告は一切ありませんでした。
これは初めてのことではありません。過去のChatGPTの大規模障害でも、OpenAIはAWSやGoogle Cloudが通常提供するような詳細な事後障害分析を提供していません。そうした分析では、どのコンポーネントに問題があったのか、なぜこれほど多くのユーザーに影響が及んだのか、次回はどう防ぐのかが明確にされます。OpenAIは毎回、最小限の情報しか提供していません。
この3時間が企業にとって意味すること
3時間は長く聞こえないかもしれませんが、AIをワークフローに組み込んでいるチームにとって、その影響は具体的です:
- 実行中のCodexタスクが中断され、進捗が失われた
- OpenAI APIと連携した製品の機能が完全に停止した
- リアルタイムの顧客対応にChatGPTを使用しているチームが完全に業務停止した
- 一部のユーザーの作業内容が障害によりシステムから削除された
企業がAIインフラの信頼性を真剣に考慮するまでは、このようなインシデントのコストは過小評価され続けるでしょう。
AIサービスが従来のSaaSよりも問題を起こしやすい理由
いくつかの構造的な理由があります:
トラフィックの集中度が高い: ChatGPTは世界で最もアクセスされているAI製品の一つであり、単一障害点の影響範囲が極めて広くなります。
推論チェーンが複雑: 大規模モデルの推論は、従来のAPIのような単純なリクエスト・レスポンスとは異なります。負荷分散とフォールトトレランスのメカニズムを設計するのが難しく、問題が発生しても迅速に特定することが困難です。
イテレーション速度が速い: モデルの更新と機能のイテレーションが頻繁に行われ、デプロイのたびに新たな不安定要因が持ち込まれる可能性があります。AWSやGoogle Cloudには数十年にわたる信頼性エンジニアリングの蓄積がありますが、AIサービスプロバイダーのエンジニアリング体制はまだ追いついていません。
SLAの問題:AI業界はまだ真剣に取り組んでいない
ほとんどの成熟したSaaSプロバイダーは、99.9%のSLA(サービスレベル契約)を提供しており、これは年間ダウンタイムが8.7時間以内であることを意味します。より厳格な99.99%のSLAでは、年間ダウンタイムは52分に抑えられます。
OpenAIは現在、公開されたエンタープライズSLAを提供していません。Anthropicも同様です。
これはつまり、多くの企業が明確な信頼性の約束がないサービスに中核的な業務プロセスを委ねており、契約にはダウンタイムに対する補償条項もないということです。これは小さな問題ではありません。特にAIが本番環境のクリティカルパスに組み込まれている場合にはなおさらです。
ビジネスがAIに依存している場合に考慮すべきこと
マルチベンダー戦略: 重要な業務をOpenAIとAnthropicなど、2つのAPIに接続します。一方がダウンしても、もう一方が稼働できます。実装コストは高くありませんが、事前にルーティングロジックを準備しておく必要があります。
ローカルモデルのバックアップ: リアルタイムを要しないタスクは、ローカルにデプロイしたオープンソースモデルをフォールバックとして使用できます。レイテンシーを許容できるシナリオでは、まずリクエストをキャッシュし、サービス復旧後に処理します。
契約条項: AIベンダーとエンタープライズ契約を結ぶ際には、信頼性に関する要件を盛り込みます。ベンダーが現在標準的なSLAを提供していなくても、障害通知と補償メカニズムに関する明確な取り決めを設けるべきです。
コードレベルの回復力設計: タイムアウト処理、リトライロジック、フォールバックパスはオプションではなく、外部AI APIを統合する際の基本的なエンジニアリング要件です。
今回の障害はOpenAIにとって初めてではなく、最後でもないでしょう。AIインフラが成熟に向かう過程で、このようなインシデントは引き続き発生します。唯一の疑問は、本番環境でAIを既に使用しているチームが、真剣に緊急時対応計画を設計しているかどうかです。
出典:CocoLoop、ChatGPT was down — Live updates on the massive AI outage(Tom's Guide);ChatGPT was down for many — as OpenAI says it's 'monitoring the recovery'(TechRadar);OpenAI's ChatGPT Down for Thousands of Users(GV Wire);ChatGPT Down: Thousands of Users Hit by Major Outage on April 20(TechGenyz)