ChatGPT ngừng hoạt động 3 giờ, nguyên nhân chưa rõ

Ngày 20/4, ChatGPT đã gặp sự cố ngừng hoạt động trên diện rộng trên toàn cầu.

Vào khoảng hơn 10 giờ sáng theo giờ miền Đông Hoa Kỳ, các báo cáo sự cố trên Down Detector bắt đầu tăng vọt. Số lượng báo cáo tại Anh đạt đỉnh hơn 8.700, tại Mỹ là hơn 1.900. Ngoài giao diện chính của ChatGPT, các chức năng Codex, nền tảng API và Projects cũng ngừng hoạt động. Một số người dùng phản ánh rằng các tác vụ đang thực hiện đã bị xóa do sự cố gián đoạn dịch vụ.

Đến 1 giờ chiều, OpenAI đã triển khai bản sửa lỗi; đến khoảng 1 giờ 30 phút chiều, dịch vụ cơ bản đã trở lại bình thường. Toàn bộ thời gian gián đoạn kéo dài khoảng 3 giờ.

Phản hồi của OpenAI

Trong suốt quá trình, trang trạng thái của OpenAI chỉ hiển thị các nội dung sau:

"Chúng tôi tiếp tục điều tra các vấn đề với các dịch vụ được liệt kê."

Và:

"Chúng tôi đã triển khai các biện pháp giảm thiểu và đang theo dõi quá trình phục hồi."

Không có giải thích nguyên nhân gốc rễ, không có chi tiết kỹ thuật, không có báo cáo tổng kết.

Đây không phải là lần đầu tiên. Trong lịch sử các lần ngừng hoạt động quy mô lớn của ChatGPT, OpenAI đều không cung cấp các phân tích sự cố chi tiết như AWS hay Google Cloud thường làm – những báo cáo đó sẽ nói rõ: thành phần nào gặp sự cố, tại sao lại ảnh hưởng đến nhiều người dùng như vậy, và cách phòng tránh trong tương lai. Mỗi lần, OpenAI chỉ cung cấp thông tin tối thiểu.

3 giờ ngừng hoạt động có ý nghĩa gì đối với doanh nghiệp

3 giờ nghe có vẻ không dài, nhưng đối với các nhóm đã tích hợp AI vào quy trình làm việc, tác động là cụ thể:

  • Các tác vụ Codex đang chạy bị gián đoạn, mất tiến độ
  • Các chức năng sản phẩm kết nối với API OpenAI đều bị vô hiệu
  • Các nhóm sử dụng ChatGPT để xử lý yêu cầu khách hàng theo thời gian thực phải ngừng hoàn toàn
  • Một số người dùng bị mất nội dung công việc do hệ thống xóa vì sự cố

Trước khi doanh nghiệp thực sự coi trọng độ tin cậy của hạ tầng AI, chi phí của những sự cố như thế này vẫn sẽ bị đánh giá thấp.

Tại sao dịch vụ AI dễ gặp vấn đề hơn SaaS truyền thống

Một số nguyên nhân cấu trúc:

Lưu lượng tập trung cao độ: ChatGPT là một trong những sản phẩm AI có lượng truy cập lớn nhất toàn cầu, bất kỳ sự cố điểm đơn lẻ nào cũng có phạm vi ảnh hưởng rất rộng.

Chuỗi suy luận phức tạp: Suy luận mô hình lớn không giống như yêu cầu-phản hồi đơn giản của API truyền thống, việc thiết kế cơ chế cân bằng tải và dung sai lỗi khó khăn hơn nhiều, và khi có sự cố cũng khó xác định vị trí nhanh chóng.

Tốc độ lặp quá nhanh: Việc cập nhật mô hình và lặp tính năng diễn ra thường xuyên, mỗi lần triển khai đều có thể đưa vào các yếu tố không ổn định mới. AWS và Google Cloud đã có hàng chục năm tích lũy về kỹ thuật độ tin cậy, trong khi hệ thống kỹ thuật của các nhà cung cấp dịch vụ AI vẫn đang trong quá trình bắt kịp.

Vấn đề SLA: Ngành AI chưa trả lời một cách nghiêm túc

Hầu hết các SaaS trưởng thành đều cung cấp SLA (Thỏa thuận cấp độ dịch vụ) 99,9%, tương ứng với thời gian ngừng hoạt động hàng năm không quá 8,7 giờ; mức chặt chẽ hơn 99,99% giảm thời gian ngừng hoạt động hàng năm xuống còn 52 phút.

OpenAI hiện không có cam kết SLA doanh nghiệp công khai. Anthropic cũng vậy.

Điều này có nghĩa là: Một lượng lớn doanh nghiệp đang đặt các quy trình kinh doanh cốt lõi của mình vào một dịch vụ không có cam kết độ tin cậy rõ ràng, và hợp đồng cũng không có điều khoản bồi thường do ngừng hoạt động. Đây không phải là một vấn đề nhỏ, đặc biệt là khi AI đã đi vào lõi của môi trường sản xuất.

Nếu doanh nghiệp của bạn phụ thuộc vào AI, cần suy nghĩ rõ những điều sau

Chiến lược đa nhà cung cấp: Các quy trình kinh doanh quan trọng nên kết nối đồng thời hai bộ API, ví dụ OpenAI và Anthropic. Một bên ngừng hoạt động thì bên kia vẫn chạy được. Chi phí triển khai không cao, nhưng cần chuẩn bị trước logic định tuyến.

Sao lưu mô hình cục bộ: Các tác vụ không theo thời gian thực có thể sử dụng các mô hình mã nguồn mở triển khai cục bộ làm phương án dự phòng, các tình huống có độ trễ chấp nhận cao thì lưu trữ yêu cầu trước và xử lý sau khi dịch vụ phục hồi.

Điều khoản hợp đồng: Ký hợp đồng doanh nghiệp với các nhà cung cấp AI, hãy đưa các yêu cầu về độ tin cậy vào hợp đồng – ngay cả khi nhà cung cấp hiện chưa có SLA tiêu chuẩn, cũng phải có thỏa thuận rõ ràng về cơ chế thông báo sự cố và bồi thường.

Thiết kế khả năng chịu lỗi ở cấp độ mã: Xử lý thời gian chờ, logic thử lại, đường dẫn dự phòng – đây không phải là tùy chọn, mà là yêu cầu kỹ thuật cơ bản khi kết nối API AI bên ngoài.

Lần ngừng hoạt động này không phải là lần đầu tiên của OpenAI, và cũng sẽ không phải là lần cuối cùng. Trên con đường trưởng thành của hạ tầng AI, những sự cố như thế này sẽ tiếp tục xảy ra. Chỉ có một câu hỏi: Các nhóm đã sử dụng AI trong môi trường sản xuất, liệu họ đã thiết kế nghiêm túc các kế hoạch ứng phó hay chưa.

Nguồn tham khảo: CocoLoop, ChatGPT was down — Live updates on the massive AI outage (Tom's Guide); ChatGPT was down for many — as OpenAI says it's 'monitoring the recovery' (TechRadar); OpenAI's ChatGPT Down for Thousands of Users (GV Wire); ChatGPT Down: Thousands of Users Hit by Major Outage on April 20 (TechGenyz)