Alibaba ra mắt Qwen-UI-Agent, huấn luyện trên hơn 100 thiết bị thật

Ngày 20/8, đội ngũ Qwen của Alibaba ra mắt Qwen-UI-Agent, mô hình nền tảng tác nhân GUI hướng tới thiết bị thật. Nhiệm vụ của nó nghe khá đơn giản: giúp mô hình hiểu được màn hình, rồi chạm, vuốt, nhập liệu như con người để hoàn thành một việc từ đầu đến cuối. Phạm vi bao phủ gồm điện thoại, máy tính, trang web, cùng môi trường DeepSearch có tìm kiếm trực tuyến.

Bảng thành tích do hãng công bố khá dày đặc. Về phía điện thoại, MobileWorld đạt 82,1%, phiên bản thiết bị thật MobileWorld-Real đạt 92,2%, AndroidDaily đạt 97,5%; về phía máy tính, OSWorld-Verified đạt 79,5%, tác vụ trình duyệt WebArena đạt 73,6%, bài kiểm tra tìm kiếm tiếng Trung BrowseComp-ZH đạt 75,0%; ở hạng mục định vị phần tử giao diện, ScreenSpot-Pro đạt 81,5%. Với một số tác vụ trên OSWorld-v2, hãng cho biết tỷ lệ hoàn thành đạt 40,0% trong khi số bước thực thi giảm khoảng 58%. Các đối tượng được đưa ra so sánh gồm GPT-5.6 Sol, Claude Opus 4.8 và Gemini 3.1 Pro.

Trường huấn luyện dựng từ hơn 100 điện thoại

Điều thể hiện rõ hướng đầu tư hơn cả điểm số chính là hệ thống môi trường phía sau. Alibaba đã xây dựng một trung tâm dữ liệu gồm hơn 100 điện thoại thật, bao phủ hơn 150 ứng dụng, kèm bộ benchmark thiết bị thật với hơn 400 tác vụ, có thể chạy đồng thời một vạn môi trường, và độ dài quỹ đạo học tăng cường hỗ trợ trên 100 bước.

Đây là hướng đi nặng về tài sản vật chất. Vài năm qua, phần lớn tác nhân GUI được huấn luyện trong môi trường mô phỏng hoặc sandbox trên web, chi phí thấp và dễ tái lập, nhưng đánh đổi là luôn có một lớp cách biệt giữa mô phỏng và thiết bị thật: thiết bị thật sẽ bật quảng cáo, bật hộp thoại xin quyền, hay bị kẹt ở trang tải do mạng chập chờn — đây chính là những điểm dễ khiến tác vụ dài bị lỗi. Việc dựng cả trung tâm dữ liệu tương đương với việc dùng chi phí phần cứng để đổi lấy sự tương đồng về phân bố dữ liệu.

Khoảng cách giữa độ chính xác từng bước và tỷ lệ thành công của tác vụ dài cũng nằm ở đây. Tính sơ bộ, nếu tỷ lệ thành công mỗi bước là 81,5%, xác suất để một tác vụ 100 bước hoàn thành trọn vẹn ngay lần đầu gần như không đáng kể. Điều giữ cho quy trình dài không đổ vỡ là khả năng tự phát hiện lỗi, lùi lại và đổi hướng khác sau khi sai — và môi trường thiết bị thật lại chính là nơi cung cấp những mẫu lỗi kiểu này, thứ rất khó tự nhiên xuất hiện trong môi trường mô phỏng.

Máy tính để bàn: kết hợp cả dòng lệnh

Ở mảng máy tính có một chi tiết đáng chú ý: hãng cho biết giải pháp này hỗ trợ kết hợp thao tác giao diện với dòng lệnh, khoảng một nửa số tác vụ trên máy tính có gọi đến CLI.

Về mặt kỹ thuật, đây có thể xem là một sự thừa nhận. Nếu chỉ dựa vào click chuột để hoàn thành tác vụ kiểu “phân loại lô tệp này theo ngày rồi nén lại”, số bước thao tác sẽ tăng đến mức mất kiểm soát; một tác nhân biết gõ dòng lệnh có thể bỏ qua hàng chục lần click. Cái giá phải trả là ranh giới quyền hạn trở nên nhạy cảm hơn, vì bán kính phá hoại của một câu lệnh lớn hơn nhiều so với một lần click nhầm. Việc chuyển tiếp giữa các thiết bị được giao cho khung Harness đảm nhiệm — việc chưa làm xong trên điện thoại có thể chuyển sang máy tính để tiếp tục.

Ranh giới an toàn được vạch ở đâu

Hãng mô tả chính sách từ chối của mô hình như sau: “Trước yêu cầu bất hợp pháp hoặc rủi ro cao, mô hình sẽ không thực hiện bất kỳ thao tác giao diện nào, mà từ chối và dừng tác vụ ngay lập tức.” Các thao tác nhạy cảm như thanh toán, xóa dữ liệu, thay đổi quyền ủy quyền đều yêu cầu người dùng xác nhận trước.

Đối với người dùng tại Trung Quốc, hiệu lực ràng buộc thực tế của cơ chế này chỉ có thể thấy rõ sau khi được đẩy lên thiết bị thật. Các thao tác rủi ro cao trên điện thoại thường không có hình dạng rõ ràng — trang xác nhận thanh toán miễn mật khẩu và một nút “Tiếp theo” thông thường khác biệt không nhiều về mặt điểm ảnh, trong khi phán đoán của mô hình lại dựa vào ngữ cảnh chứ không phải hình dạng của control.

Ai sẽ là bên tiếp nhận công nghệ này

Báo cáo kỹ thuật đã được đăng lên arXiv, kho mã nguồn đặt tại Tongyi-MAI/MAI-UI trên GitHub. Kho này trước đó từng mã nguồn mở dòng MAI-UI với 4 kích thước từ 2B đến 235B, theo giấy phép Apache 2.0. Phạm vi công khai trọng số của Qwen-UI-Agent hiện chưa có thông tin rõ ràng.

Xét theo thứ tự triển khai, nhóm hưởng lợi đầu tiên nhiều khả năng là các hãng điện thoại và PC — họ đang nắm quyền cấp hệ thống, đồng thời có sẵn lối vào để nhét tác nhân vào trợ lý giọng nói. Với ứng dụng bên thứ ba, muốn tích hợp thì không thể tránh khỏi rào cản quyền trợ năng (accessibility), và rào cản này ở Trung Quốc luôn bị siết khá chặt về mặt tuân thủ.

Nguồn tham khảo: Tài khoản công khai chính thức Tongyi Qianwen, ITHome, CocoLoop, Kuaikeji; báo cáo kỹ thuật và trang dự án Qwen-UI-Agent đã được đối chiếu để xác minh các chuẩn benchmark và quy mô môi trường thiết bị thật.