LHQ và Google làm mới cổng dữ liệu, tích hợp giao thức MCP

Liên Hợp Quốc và Google ra mắt nền tảng UN System Data Commons, xây dựng trên nền Data Commons mã nguồn mở của Google, thay thế cổng UNData đã vận hành nhiều năm. Nền tảng mới hỗ trợ đặt câu hỏi bằng ngôn ngữ tự nhiên, đồng thời hỗ trợ giao thức MCP, cho phép hệ thống AI gọi trực tiếp vào nguồn dữ liệu gốc và trả về kết quả kèm nguồn có thể truy vết. Google tài trợ 2 triệu USD thông qua Google.org.

Căn cứ trực tiếp thúc đẩy dự án này là một nghiên cứu của UNICEF. Nghiên cứu thử nghiệm 6 mô hình AI trả lời các câu hỏi liên quan đến chỉ số phát triển toàn cầu, gồm GPT-4o và GPT-4o-mini của OpenAI, Claude Sonnet 4.5 và Haiku 4.5 của Anthropic, Gemini 2.5 Flash và 2.0 Flash của Google. Trong hơn 133.000 câu trả lời, độ chính xác trung bình chỉ 21,2%. Khoảng 60% câu trả lời không đưa ra con số sử dụng được, các mô hình có xu hướng trả lời mập mờ; khi hỏi lại cùng câu hỏi sau hai ngày, tỷ lệ cho ra cùng một con số chỉ khoảng 50%. Nghiên cứu này hiện vẫn là bản thảo làm việc, chưa qua bình duyệt và chưa được gửi đăng.

Từ việc con người duyệt web sang máy trực tiếp lấy dữ liệu

UNData trước đây là một cổng thống kê điển hình: người dùng bấm vào theo cơ quan, theo chỉ số, theo năm, rồi tải bảng dữ liệu về. Nền tảng mới thay lối vào đó bằng một lệnh gọi duy nhất. MCP đóng vai trò lớp kết nối: mô hình AI không còn phải chụp lại ảnh chụp trang web, mà lấy dữ liệu trực tiếp từ nguồn và mang theo đường dẫn trích dẫn.

Quyền Vụ trưởng Vụ Thống kê Liên Hợp Quốc, ông Shantanu Mukherjee, nói:

We are orders of magnitude more advanced in scale, scope, and flexibility.

Về quy mô, phạm vi và độ linh hoạt, chúng tôi đã tiến bộ hơn trước nhiều bậc.

Ông Prem Ramaswami, người phụ trách Data Commons của Google, cho biết cách phổ biến công cụ này là đào tạo cho người đào tạo, đồng thời đưa ra một lưu ý: mô hình AI có thể hiểu sai các sắc thái ngữ nghĩa nhỏ, nên kết quả đầu ra cần được con người kiểm tra lại.

Hiện có 26 cơ quan của Liên Hợp Quốc cam kết tham gia, số bộ dữ liệu khả dụng khi ra mắt gần 20, mục tiêu là đưa 80% bộ dữ liệu thống kê của hệ thống Liên Hợp Quốc lên nền tảng này trước năm 2027.

Phía thế giới nói tiếng Trung vẫn còn là khoảng trống

Dữ liệu thống kê công khai ở Trung Quốc vẫn chưa có lớp gọi dữ liệu tương ứng. Dữ liệu công khai của Cục Thống kê Quốc gia, các bộ ngành và niên giám thống kê địa phương hiện vẫn chủ yếu ở dạng bảng trên trang web và tệp PDF; muốn dùng cho AI chỉ có cách thu thập rồi xử lý lại thủ công, khó truy vết sai số phát sinh ở bước nào. Khi người dùng tiếng Trung hỏi mô hình AI “tỷ lệ đô thị hóa của Trung Quốc năm 2024 là bao nhiêu”, con số nhận được nhiều khả năng đến từ một bài viết thứ cấp nào đó, chứ không phải khẩu kính thống kê gốc — đây chính là vấn đề mà Liên Hợp Quốc lần này đang giải quyết.

Một điểm khác đáng chú ý là lưu lượng truy cập từ trích dẫn. Nghiên cứu cho biết từ tháng 1 đến tháng 9 năm 2026, lượng truy cập giới thiệu từ ChatGPT tăng 67% so với cùng kỳ. Trước đây các cơ quan thống kê đo mức độ ảnh hưởng bằng lượt truy cập cổng thông tin, giờ đây có thêm một chỉ số cần theo dõi: có bao nhiêu mô hình AI dẫn đến dữ liệu của họ khi trả lời câu hỏi.

Những phần chưa có câu trả lời

Ai sẽ chi trả cho vận hành dài hạn của nền tảng, ngân sách sau khoản 2 triệu USD ban đầu sẽ đến từ đâu, thông báo không nói rõ. 26 cơ quan sẽ mở dữ liệu đến mức độ chi tiết nào, các chỉ số nhạy cảm sẽ được xử lý ra sao, mối lo về chủ quyền dữ liệu của các quốc gia thành viên sẽ được sắp xếp thế nào — tất cả vẫn chưa có phương án công khai. Mục tiêu 80% vào năm 2027 hiện mới chỉ là một mốc thời gian, chưa có cách kiểm chứng theo từng giai đoạn.

Nguồn tham khảo: TechCrunch, thông báo của Vụ Thống kê Liên Hợp Quốc và Google Data Commons, CocoLoop, bản thảo nghiên cứu của UNICEF; số liệu về độ chính xác và số cơ quan tham gia được đối chiếu theo công bố của nghiên cứu và thông báo.