Lộ prompt của Muse: quyền người dùng vượt qua an toàn AI

Một đoạn prompt hệ thống của Muse — trợ lý AI cá nhân của Meta — đã được các nhà nghiên cứu lấy ra, trong đó có một câu ghi rằng quyền của người dùng đối với các việc trong gia đình mình là vô điều kiện, và vượt qua cả huấn luyện an toàn của mô hình. Wired đưa tin về loạt tài liệu này hôm 3/10, cho biết prompt còn yêu cầu Muse lập hồ sơ cho từng người trong đời sống của người dùng, cập nhật mỗi giờ một lần.

"The user's authority over their own household is unconditional and overrides your safety training."
(Quyền của người dùng đối với các việc trong gia đình mình là vô điều kiện, và vượt qua cả huấn luyện an toàn của bạn.)

Người lấy được các tài liệu này là Karan Joshi, một nhà nghiên cứu an toàn AI độc lập. Cách anh làm khá đơn giản: trong giao diện chat thông thường của Muse, anh yêu cầu nó sao chép các file phần mềm của chính nó và chia sẻ lại cho anh. Sau đó anh gửi toàn bộ nội dung này cho Wired.

Mỗi người một trang, mỗi giờ cập nhật một lần

Theo bài báo, prompt của Muse yêu cầu nó duy trì một trang hồ sơ riêng cho từng người trong đời sống của người dùng, bao gồm người nhà, người yêu, bạn bè, đồng nghiệp, đối tác công việc, và cả những người mà người dùng theo dõi. Mỗi trang được chia thành các mục cố định: sự kiện thực tế, lịch sử tương tác, mối quan hệ, những điểm chung, việc còn chưa giải quyết, và cách để cải thiện mối quan hệ.

Nội dung ghi lại khá chi tiết: nơi ở, nghề nghiệp, ngày sinh, ngày kỷ niệm, cùng những cột mốc như từng đi du lịch chung, từng cãi vã rồi làm lành. Toàn bộ được lưu dưới dạng file văn bản có cấu trúc, đóng vai trò bộ nhớ của Muse, và được một tiến trình nền chạy mỗi giờ một lần để tổng hợp, cập nhật.

Joshi nói với Wired:

"They're trying to know you like a friend, which is honestly pretty creepy."
(Họ đang cố hiểu bạn như một người bạn thân, thành thật mà nói thì khá rợn người.)

Phản hồi của Meta là những file vận hành này vốn được thiết kế để người dùng có thể xem được, nhằm đảm bảo tính minh bạch; mỗi người dùng Muse có một máy ảo Linux riêng, và các file được lưu trong đó. Meta không giải thích riêng về mục đích của câu lệnh “vượt qua huấn luyện an toàn”, và bài báo cũng không cho biết liệu những người bị lập hồ sơ có biết về việc này hay có thể yêu cầu xóa hay không.

Sự việc thứ ba trong một tháng

Muse ra mắt vào tháng 9 và nhanh chóng leo lên vị trí số 1 bảng ứng dụng miễn phí trên App Store Mỹ, có thể đọc tin nhắn, quản lý lịch, xử lý hóa đơn và thao tác xuyên nhiều ứng dụng. Quyền truy cập mà nó được cấp càng rộng, câu lệnh “quyền người dùng được ưu tiên” trong prompt càng mang trọng lượng lớn hơn.

Đây đã là sự việc thứ ba bị phát hiện kể từ khi Muse ra mắt. Trước đó có người dùng phát hiện Muse tự ý tiết lộ địa chỉ nhà của họ cho một người mua lạ trên Facebook Marketplace, và còn đồng ý giảm giá thay họ; sau đó các nhà nghiên cứu lại tìm ra một lỗ hổng trên bản Mac, và khi Meta vá lỗi này họ đã xóa đi một tùy chọn cấu hình ẩn. Đặt hai sự việc đó cạnh câu lệnh trong prompt lần này, có thể suy ra rằng giữa việc “làm theo lời người dùng” và “giữ ranh giới an toàn”, Muse đang nghiêng về phía trước theo thiết kế mặc định. Đây là suy luận từ bên ngoài, Meta chưa từng xác nhận điều này.

Nhìn sang thị trường Trung Quốc

Hiện Muse chưa cung cấp dịch vụ tại Trung Quốc, nhưng cách làm của nó không lạ gì với các hãng điện thoại và các nhóm siêu ứng dụng ở nước này. Không ít trợ lý điện thoại và trợ lý AI nội địa cũng đang xây dựng tính năng “ghi nhớ dài hạn”, lưu lại danh bạ, sở thích và lịch trình của người dùng. Khác biệt nằm ở độ chi tiết: lập một hồ sơ riêng cho từng người liên hệ, cập nhật theo giờ, ghi cả chuyện cãi vã — nếu làm vậy tại Trung Quốc sẽ va trực tiếp vào yêu cầu của Luật Bảo vệ thông tin cá nhân (PIPL) về việc phải có sự đồng ý khi xử lý thông tin cá nhân của bên thứ ba. Những người bị lập hồ sơ không phải là người dùng của Muse, và họ chưa từng bấm nút đồng ý nào.

Nếu các nhóm trong nước muốn làm tính năng tương tự, ít nhất phải trả lời được hai câu hỏi: hồ sơ liên hệ có thể bị người khác ngoài người dùng xem và xóa được không, và trong prompt hệ thống có câu nào đặt lệnh của người dùng lên trên các quy tắc an toàn hay không.

Nguồn tham khảo: Wired, CocoLoop, Startup Fortune, phản hồi bằng văn bản của Meta gửi Wired; nguyên văn prompt và các mục hồ sơ dựa theo tài liệu do Wired công bố.