Anthropic mở mã nguồn tác nhân AI thương mại điện tử tham chiếu

Anthropic vừa công bố một hướng dẫn kiến trúc cho tác nhân thương mại điện tử, đồng thời mở mã nguồn phần triển khai tham chiếu anthropics/commerce-agents trên GitHub, bao gồm tác nhân mua sắm, tác nhân cho người bán, cùng khung và bộ công cụ đánh giá cho bốn kịch bản: bán lẻ, du lịch, viễn thông và vé sự kiện. Bài viết do Ali Shazal và Matthew Koen thực hiện.

Khuyến nghị mở đầu có phần đơn giản đến mức trái trực giác: một mô hình, một vòng lặp tác nhân chuẩn, các năng lực đuôi dài giao cho skills, còn công cụ thì gọi thẳng vào hệ thống backend sẵn có.

Skills tốt hơn tác nhân con

Tài liệu đặt nguyên tắc "dùng skills, không dùng tác nhân con" lên hàng đầu trong các nguyên tắc kiến trúc. Lý do là quá trình bàn giao trong kiến trúc đa tác nhân làm mất trạng thái, khiến chất lượng giảm. Anthropic cho biết trong các so sánh của họ, tổ hợp một tác nhân duy nhất cộng skills luôn cho chất lượng ổn định hơn hai phương án thay thế — một prompt vạn năng làm tất cả, và chia nhỏ thành nhiều tác nhân con.

Về cách phân chia giữa system prompt và skills, tài liệu đưa ra một quy tắc theo tần suất: chỉ dẫn nào được dùng trong hơn một phần ba số yêu cầu thì đưa vào system prompt, phần còn lại đưa vào skills. Trong mua sắm, tìm kiếm sản phẩm gần như xuất hiện ở mọi phiên, nên được giữ lại trong prompt.

Các thành phần giao diện cũng được xử lý như công cụ, thay vì để mô hình tự sinh ra các thẻ tùy chỉnh. Cách làm sau này vốn kém tin cậy trong môi trường sản xuất vì định dạng thẻ do mô hình sinh ra không có ràng buộc chặt.

Tỷ lệ cache hit quyết định hóa đơn độ trễ

Phần hiệu năng tập trung chủ yếu vào cache. Tài liệu cho biết tỷ lệ cache hit trong môi trường sản xuất có thể đạt 90% đến 99%, trong khi giá đọc cache chỉ bằng một phần mười giá token mới. Cách làm là chia yêu cầu thành ba đoạn theo thứ tự cố định: đoạn toàn cục chứa system prompt và định nghĩa công cụ, đoạn phiên chứa ngữ cảnh người dùng, đoạn dễ biến động chứa trạng thái hiện tại.

Có một cái bẫy được nêu rất thẳng: đặt dấu thời gian hoặc trang hiện tại lên đầu system prompt sẽ làm cache mất hiệu lực ở mỗi yêu cầu. Lỗi này rất phổ biến trong thương mại điện tử vì nhà phát triển có thói quen nhét "giỏ hàng hiện tại" lên đầu. Tài liệu cũng đưa ra một mức tham chiếu: phản hồi trong thương mại điện tử thường nằm trong khoảng 500 đến 700 token đầu ra.

Phương pháp chọn mô hình là chạy toàn bộ bộ đánh giá trên tất cả các mô hình ứng viên và các mức suy luận, xem chỉ số chất lượng cùng với ngân sách chi phí độ trễ, không tách riêng hai yếu tố này.

An toàn không thể chỉ dựa vào prompt

Lập trường ở phần triển khai sản xuất rất cứng rắn: prompt là điểm khởi đầu cho hành vi an toàn, nhưng trong thương mại điện tử thì không thể là điểm thực thi. Các hành động như thanh toán, hoàn tiền, đổi giá đều phải qua tạm giữ và phê duyệt phía server. Cơ chế được mô tả trong tài liệu gọi là kiểm soát truy cập theo cấp ID — harness ghi lại cho mỗi phiên từng ID mà server đã giao cho mô hình, và chỉ những ID nằm trong bản ghi đó mới được phép ghi hoặc hiển thị. ID sản phẩm do mô hình tự bịa ra sẽ bị chặn ngay.

Bộ nhớ cũng được đẩy ra ngoài mô hình: bộ nhớ dài hạn được lưu trong cơ sở dữ liệu riêng, dưới dạng bản ghi có kiểu (khóa, giá trị, danh mục, phiên nguồn), được một luồng hoặc tiến trình khác đọc phiên một cách bất đồng bộ để thêm, xóa, sửa sự kiện. Việc trích xuất bất đồng bộ đã giúp tỷ lệ nhớ lại sự kiện tăng thêm 13%.

Việc đánh giá từ bỏ cách mô phỏng hội thoại nhiều lượt, chuyển sang phương pháp chụp nhanh (snapshot): dựng trạng thái kiểm thử, thêm vào một tin nhắn người dùng, rồi chấm điểm kết quả. Quy mô khởi điểm được khuyến nghị là 50 đến 100 ca kiểm thử cho mỗi luồng người dùng, có cặp ví dụ đúng/sai đi kèm, và bao phủ cả các yêu cầu phụ thuộc ngữ cảnh lẫn các yêu cầu trải rộng nhiều năng lực.

Anthropic cho biết các tác nhân này đã chạy thực tế, và khách hàng doanh nghiệp ghi nhận giá trị đơn hàng trung bình cao hơn. Tên khách hàng cụ thể không được công bố.

Nguồn tham khảo: blog chính thức của Anthropic, CocoLoop, kho GitHub anthropics/commerce-agents; các số liệu về tỷ lệ cache hit, mức tăng 13% khả năng nhớ lại và 500-700 token đầu ra đều trích từ tài liệu này.