Pinterest đưa MCP vào sản xuất, tiết kiệm 7.000 giờ mỗi tháng

Đã có nhiều bài viết về MCP, nhưng hầu hết chỉ dừng lại ở giới thiệu giao thức hoặc số lượng máy chủ được kết nối.

Nhóm kỹ thuật của Pinterest gần đây đã chia sẻ kiến trúc MCP thực tế đang chạy trong môi trường sản xuất của họ, với dữ liệu cụ thể và chi tiết đầy đủ, đáng để xem xét kỹ lưỡng.

Lựa chọn kiến trúc: Nhiều máy chủ chuyên dụng, không gộp chung

Pinterest không xây dựng một máy chủ MCP khổng lồ xử lý mọi thứ. Hướng đi của họ là: mỗi hệ thống dữ liệu cốt lõi tương ứng với một máy chủ MCP độc lập.

Các máy chủ chính hiện đang chạy:

  • Máy chủ Presto: Truy vấn dữ liệu
  • Máy chủ Spark: Gỡ lỗi tác vụ và phân tích nhật ký
  • Máy chủ Airflow: Quản lý quy trình làm việc
  • Máy chủ Knowledge: Tài liệu nội bộ và cơ sở tri thức

Tại sao không làm một máy chủ thống nhất?

Lý do của họ là: nhiều máy chủ có thể thực hiện kiểm soát truy cập độc lập, các nhóm khác nhau chỉ có thể truy cập vào miền công cụ tương ứng của họ, tránh việc một máy chủ có quá nhiều quyền. Đồng thời, bộ công cụ của mỗi máy chủ được giữ gọn nhẹ, không khiến mô hình phải lựa chọn giữa một loạt công cụ không liên quan.

Trung tâm đăng ký: Cho agent biết có thể sử dụng gì

Pinterest đã xây dựng một trung tâm đăng ký tập trung, đóng vai trò là nguồn thẩm quyền về máy chủ nào đã được phê duyệt.

Trước khi gọi công cụ, AI client kiểm tra trung tâm đăng ký: máy chủ này có tồn tại không? Tôi có quyền sử dụng nó không?

Điều này giải quyết một vấn đề thực tế: không phải tất cả công cụ dữ liệu đều nên mở cho mọi nhân viên. Ví dụ, Presto (truy vấn dữ liệu quy mô lớn) chỉ có thành viên của các nhóm kinh doanh cụ thể mới có thể gọi qua công cụ AI.

Chi tiết thiết kế bảo mật

Xác thực hai lớp:

  1. JWT token của người dùng: Xác minh ai đang thao tác (trong kịch bản có sự tham gia của con người)
  2. Danh tính Service Mesh: Xác thực giữa các dịch vụ bằng danh tính lưới

Họ không áp dụng quy trình OAuth tiêu chuẩn của MCP, mà tích hợp dựa trên hệ thống xác thực nội bộ hiện có — lý do là giảm ma sát khi mỗi máy chủ cần được ủy quyền riêng.

Ngoài ra còn có một thiết kế gọi là elicitation: trước khi thực hiện các thao tác có rủi ro cao hoặc chi phí cao, agent phải yêu cầu xác nhận từ người dùng, nếu không được phê duyệt thì không thực thi. Điều này tạo ra sự cân bằng giữa tự động hóa và bảo mật.

Số liệu thực tế

Tính đến tháng 1 năm 2025:

Chỉ sốSố liệu
Số lần gọi hàng tháng66.000 lần
Số người dùng hoạt động844 người
Thời gian tiết kiệm ước tính hàng tháng~7.000 giờ kỹ sư

7.000 giờ/tháng — tính theo một kỹ sư làm việc khoảng 160 giờ mỗi tháng, tương đương tiết kiệm khoảng 44 người. Con số này dựa trên ước tính thời gian tiết kiệm cho mỗi lần gọi công cụ, không phải số chính xác, nhưng quy mô có giá trị tham khảo.

Điều đáng chú ý

Trong bài viết của Pinterest có một câu: Hệ thống này được tích hợp vào IDE mà kỹ sư sử dụng hàng ngày, nền tảng trò chuyện nội bộ và quy trình làm việc AI — không phải tạo ra một cổng AI riêng để kỹ sư cố tình sử dụng.

Đây mới là chìa khóa cho sự thành công của AI cấp doanh nghiệp: công cụ phải xuất hiện ở nơi người lao động làm việc, không phải yêu cầu họ chuyển sang một nơi khác.

Nguồn tham khảo: Pinterest Deploys Production-Scale Model Context Protocol Ecosystem for AI Agent Workflows (InfoQ); CocoLoop, Building an MCP Ecosystem at Pinterest (Pinterest Engineering Blog / Medium)