Nói một điều có thể bạn chưa nghĩ tới.
Meta gần đây đã công bố một việc, nhưng không ồn ào: họ sẽ bắt đầu ghi lại mỗi lần gõ phím, mỗi cú nhấp chuột của nhân viên — để huấn luyện AI Agent có thể tự động điều khiển máy tính.
Không phải người dùng bên ngoài, mà là nhân viên. Là những người làm việc hàng ngày tại văn phòng của Meta.
Họ thực sự sẽ thu thập những gì?
Theo Meta, dữ liệu họ thu thập bao gồm:
- Quỹ đạo di chuyển chuột
- Nút nào đã được nhấn
- Đã chọn gì trong menu thả xuống
- Đường dẫn điều hướng trong các ứng dụng khác nhau
Nói cách khác: cách bạn sử dụng máy tính, tất cả đều sẽ được ghi lại.
Meta giải thích rằng dữ liệu này sẽ được dùng để huấn luyện AI Agent giúp con người hoàn thành các tác vụ máy tính hàng ngày.
Mục đích nghe có vẻ hợp lý — để tạo ra một AI thực sự có thể sử dụng máy tính, cách tốt nhất là xem con người sử dụng nó như thế nào. Nhưng vấn đề nằm ở chỗ, họ chọn nguồn dữ liệu là chính nhân viên của mình, chứ không phải một quy trình thu thập dữ liệu được thiết kế đặc biệt.
Tại sao vấn đề này tinh tế hơn bạn nghĩ
Trước hết là bối cảnh ngành.
Trong hai năm qua, các công ty AI đang ngày càng đặt cược vào thế hệ Agent tiếp theo theo hướng điều khiển máy tính — không chỉ biết trò chuyện, mà còn có thể mở ứng dụng, điền biểu mẫu, nhấp nút, giúp bạn hoàn thành công việc. Khả năng này được gọi là computer use hoặc computer-use agent.
Vấn đề là, huấn luyện Agent như vậy cần một lượng lớn dữ liệu tương tác người-máy thực tế. Các bộ dữ liệu công khai có chất lượng không đồng đều, tự thu thập thì vừa đắt vừa chậm.
Nguồn dữ liệu tiện lợi nhất ở đâu? Ngay tại chính nhân viên trong công ty.
Đây không phải ý tưởng riêng của Meta. Một bài báo của Reuters đề cập rằng đây đang trở thành xu hướng của ngành: lịch sử trò chuyện Slack, ticket Jira, nhật ký thao tác của nhân viên đều đang được các công ty âm thầm đưa vào xem xét cho việc huấn luyện AI.
Meta chỉ là công ty đầu tiên công khai nói ra điều này.
Có hợp lý không?
Meta đưa ra một câu trả lời tiêu chuẩn: dữ liệu thu thập có biện pháp bảo vệ và sẽ không được sử dụng cho mục đích khác.
Nhưng câu trả lời này né tránh một số vấn đề thực sự:
Những ứng dụng nào đang bị giám sát? Nếu bạn sử dụng máy tính công ty để đăng nhập tài khoản cá nhân, kiểm tra email cá nhân, những thao tác này có bị ghi lại không?
Nhân viên có quyền từ chối không? Hay điều này đã nằm trong phạm vi được ủy quyền trong hợp đồng lao động, không có sự lựa chọn?
Dữ liệu có thể thực sự được cách ly? Cam kết không sử dụng cho mục đích khác thì dễ nói, nhưng trong chuỗi huấn luyện AI, luồng dữ liệu vốn rất khó theo dõi.
Những câu hỏi này, tuyên bố của Meta đều không trả lời.
Điều thực sự đáng chú ý
Việc Meta muốn tạo ra computer-use Agent không có gì đáng ngạc nhiên. OpenAI có Codex, Anthropic có Claude Computer Use, Google đang thử nghiệm điều khiển trình duyệt tự động. Cuộc đua này ai cũng đang tham gia.
Điều thực sự cần theo dõi là một vấn đề lớn hơn: ranh giới của dữ liệu huấn luyện AI đang được vẽ lại.
Trước đây mọi người thảo luận về việc có thể sử dụng dữ liệu công khai trên internet để huấn luyện hay không, bây giờ bắt đầu có người hỏi liệu có thể sử dụng dữ liệu hành vi của nhân viên để huấn luyện, tiếp theo sẽ là gì? Nhật ký thao tác của người dùng trong sản phẩm? Lịch sử trò chuyện giữa người dùng và AI?
Những dữ liệu này có thể đã được ủy quyền trong điều khoản sử dụng, nhưng người dùng (hoặc nhân viên) khi ký hợp đồng có lẽ không nghĩ rằng mình đang làm công việc gắn nhãn dữ liệu cho AI.
Một AI có thể thay thế con người điều khiển máy tính cần dữ liệu thao tác của con người để học — ban đầu đây là một vấn đề kỹ thuật, nhưng bây giờ đang trở thành một vấn đề đạo đức phức tạp hơn.
Thông tin này từ Meta là sự khởi đầu của cuộc thảo luận, không phải là kết thúc.
Nguồn tham khảo: CocoLoop, Meta will record employees's keystrokes and use it to train its AI models (TechCrunch)