Anthropic đã giao ca trực tuyến đầu của CI/CD nội bộ cho Claude Tag. Trong tài liệu công bố ngày 18/8, hai con số đáng chú ý nhất là: sau khi một sự cố được mở, Claude đưa ra bản phân tích đầu tiên kèm bằng chứng với thời gian trung vị 14 phút; khi thuận lợi, chỉ 4 phút là đã chỉ ra nguyên nhân gốc ngay trong báo cáo ban đầu.
Bối cảnh dẫn đến việc này được nêu khá thẳng thắn — sản lượng code mỗi kỹ sư giao mỗi quý đã tăng lên gấp 8 lần so với trước. Khi sản lượng tăng vọt, số lượng tuyệt đối các sự cố build lỗi, test chập chờn, rollback triển khai cũng tăng theo, trong khi mỗi lần dò lỗi thường chiếm hơn một giờ đồng hồ và hay rơi vào ngoài giờ làm việc.
Claude nắm những chìa khóa nào
Hệ thống này vận hành được là nhờ cấu hình quyền truy cập chứ không phải bản thân mô hình. Claude có được một loạt quyền truy cập thông qua các connector MCP: Grafana và kho log để xem chỉ số và stack trace, Datadog bổ sung giám sát, GitHub để lật lịch sử commit, xem thay đổi, mở PR, Kubernetes để đưa ra khuyến nghị xử lý ở cấp cluster, PagerDuty và một số nhóm Slack để nhận cảnh báo và gửi kết luận. Claude có tài khoản dịch vụ riêng, mọi hành vi đều có thể kiểm toán.
Việc có nên đánh thức người trực hay không được viết thẳng thành quy tắc bằng ngôn ngữ tự nhiên. Ví dụ được nêu trong bài: tỷ lệ lỗi vượt 2% và kéo dài hơn 5 phút, đồng thời không nằm trong cửa sổ triển khai đã biết, thì gọi người trực. Trước đây các ngưỡng kiểu này nằm trong file cấu hình hệ thống giám sát, mỗi lần sửa phải qua quy trình phát hành; sau khi viết thành quy tắc mà Claude đọc được, chi phí điều chỉnh giảm xuống chỉ còn sửa một dòng chữ. Ngoài cảnh báo tự động, thành viên nhóm và trang sự cố nội bộ cũng có thể kích hoạt thủ công.
Giai đoạn phân loại chạy song song
Khi sự cố xảy đến, Claude khởi tạo một agent điều phối, agent này lại cử nhiều sub-agent đi kiểm tra song song các thành phần phụ thuộc khác nhau: một agent lật log, một agent so sánh các commit gần nhất, một agent xem biểu đồ chỉ số. Sản phẩm của “quy trình động” này chính là bản phân tích 14 phút nói trên.
Có hai loại tài liệu hỗ trợ phán đoán. Một là các file kỹ năng (skill file), viết thành sổ tay điều tra theo từng loại sự cố, trong đó có một file chuyên nói về cách dò một loại bug khó chịu, dài tới 617 dòng. Hai là lessons.md, được chính Claude bổ sung sau mỗi lần xử lý sự cố, để lần sau gặp mô thức tương tự sẽ tra trước. Cả hai loại tài liệu này đều nằm trên GitHub, đi qua cùng một quy trình review như code.
Khâu sửa lỗi vẫn dành chỗ cho con người. Sản phẩm phổ biến nhất là một PR, chờ kỹ sư review rồi mới quyết định có triển khai hay không; việc rollout dần dựa vào feature flag để kiểm soát lưu lượng; với những việc liên quan đến cluster, Claude đưa ra khuyến nghị drain, cô lập hoặc mở rộng, còn việc thực thi do con người quyết định. Sau khi sửa xong, Claude dùng đúng bộ công cụ đó để xác minh lại bản sửa.
Phần việc còn lại thuộc về ai
Anthropic nêu rõ vẫn giữ lại một số việc cho con người: cải tiến kiến trúc trung và dài hạn; cùng Claude bổ sung giả thuyết trong chế độ chia sẻ, vì Claude không phải lúc nào cũng phán đoán đúng ngay từ lần đầu, cần trực giác con người kéo lại; cửa ải review PR; và cách diễn đạt khi giao tiếp — định dạng báo cáo tình trạng đã phải sửa đi sửa lại nhiều vòng mới hợp khẩu vị của đội, phần này chưa tự động hóa được.
Việc bàn giao cũng được sản phẩm hóa. Hằng tuần có báo cáo tổng hợp, hằng ngày có bản tóm tắt, còn một agent khác tên ci-weather thì gộp nhiều sự cố lại thành một bản tường trình tình trạng công khai ra bên ngoài.
Một phép tính dễ bị bỏ qua
Con số gấp 8 lần, đặt ở hai đầu “vì sao phải làm” và “làm xong thì thế nào”, mang ý nghĩa không giống nhau. Trước tiên nó là nguồn áp lực: với cùng quy mô đội ngũ, sản lượng giao tăng gấp 8 lần thì số phiếu sự cố không thể đứng yên. Đồng thời nó cũng là tiền đề để hệ thống trực này có lý do tồn tại — nếu code vẫn do con người gõ từng dòng, thì hình thái, tần suất và khả năng giải thích của sự cố sẽ gần với trực giác của kỹ sư hơn, lợi ích biên của việc để AI phân loại sẽ không rõ rệt đến vậy. Sau khi AI tham gia viết code với khối lượng lớn, để AI đảm nhận lớp dò lỗi đầu tiên là điều hợp lý về mặt logic.
Ngưỡng để triển khai cũng được nêu rõ: cần gói Team hoặc Enterprise của Claude, việc kết nối công cụ và cấu hình quyền ban đầu tốn vài giờ đồng hồ. Với phần lớn đội ngũ, điểm khó nhiều khả năng không nằm ở việc đấu nối, mà ở chỗ có dám giao ra một tài khoản dịch vụ có thể mở PR, điều khiển cluster hay không.
Nguồn tham khảo: blog chính thức của Anthropic, CocoLoop; số liệu trung vị 14 phút phân loại, 4 phút xác định nguyên nhân nhanh nhất, sản lượng giao hàng quý gấp 8 lần và độ dài 617 dòng của file kỹ năng đều được đối chiếu theo thông báo công khai của công ty.