Runway ra mắt Solaris, giao diện được mô hình vẽ theo từng khung hình

Runway vừa công bố Solaris, được công ty gọi là "mô hình thế giới giao diện" đầu tiên của mình. Khác với các công cụ hỗ trợ viết mã front-end, Solaris không tạo ra mã mà tạo ra hình ảnh trực tiếp: mỗi khung hình giao diện mà người dùng nhìn thấy đều do mô hình sinh ra ngay tại chỗ, các thao tác như nhấp chuột, kéo thả được đưa trở lại làm điều kiện sinh, và khung hình tiếp theo thay đổi theo đó.

Runway đưa ra hai chỉ số vận hành: độ trễ tương tác dưới nửa giây, chất lượng hình ảnh giữ ở mức 720p. Hai con số này quyết định Solaris hiện làm được gì và chưa làm được gì.

Cú nhấp chuột được coi là tín hiệu điều kiện

Solaris có cấu trúc gồm mô hình thế giới cộng với mô hình ngôn ngữ. Mô hình ngôn ngữ đảm nhận việc hiểu yêu cầu của người dùng và phán đoán thao tác này nên thay đổi trong bối cảnh hiện tại hay chuyển sang một bối cảnh mới; mô hình thế giới đảm nhận việc vẽ ra kết quả phán đoán đó. Toàn bộ quy trình tiến triển theo từng khung hình, mô hình tự học từ dữ liệu huấn luyện "nhấp vào vị trí này sẽ xảy ra điều gì", không ai viết sẵn hàm callback cho nút bấm.

Điều này tách hẳn khỏi hướng đi chủ đạo của giao diện do AI tạo ra. Trong hai năm qua, cách các mô hình lớn làm UI là sinh mã HTML, React rồi giao cho trình duyệt render, hành vi giao diện vẫn do mã quyết định. Solaris nuốt trọn cả lớp render này, hình ảnh trên màn hình chính là ứng dụng.

61% phiếu ưu tiên

Runway công bố một bộ kết quả tự đánh giá: trong nhiệm vụ tái dựng giao diện, Solaris vượt qua các mô hình lớn hàng đầu ở hai chỉ số độ tương đồng cấu trúc và mức độ giữ lại thông tin; ngoài ra còn có một nghiên cứu người dùng với 250 người tham gia, trong phần so sánh khả năng tuân theo chỉ dẫn, Solaris được người tham gia ưu tiên chọn với tỷ lệ 61%.

Toàn bộ những con số này đều đến từ chính Runway, hiện chưa có đánh giá độc lập từ bên thứ ba nào. Tỷ lệ 61% bản thân nó cũng không chênh lệch quá lớn, tính sơ bộ thì cứ 10 lần so sánh có khoảng 6 lần chọn nó, 4 lần chọn đối chứng. Với một nguyên mẫu nghiên cứu vừa ra mắt, kết quả này tạm ổn, nhưng còn cách rất xa để "có thể thay thế phần mềm hiện có".

720p là trần cứng

Runway tự liệt kê bốn hạn chế: hiển thị chữ chưa ổn định, độ mạch lạc giảm trong các phiên hội thoại dài, độ chính xác thông tin chưa đủ để dùng thương mại, API hỗ trợ tiếp cận (accessibility) chưa được tích hợp.

Hạn chế thứ nhất và thứ tư là nghiêm trọng nhất. Hiển thị chữ không ổn định nghĩa là các giao diện dày đặc thông tin như bảng biểu, biểu mẫu, trình soạn thảo mã tạm thời chưa khả thi, một con số vẽ sai người dùng cũng không nhận ra. API hỗ trợ tiếp cận chưa được tích hợp thì trình đọc màn hình không đọc được gì cả — trên màn hình vốn không có cấu trúc DOM để phân tích, chỉ có pixel.

Giới hạn độ phân giải 720p cũng vạch ra một ranh giới tương tự. Ứng dụng di động, game nhỏ, tương tác kiểu trình diễn thì đủ dùng ở độ phân giải này; nhưng phần mềm năng suất trên máy tính để bàn, bảng điều khiển dữ liệu mà đặt vào 720p thì cỡ chữ thu nhỏ lại sẽ bị mờ.

Từ mô hình video tiến tới hệ điều hành

Trọng tâm của Runway trong hai năm qua liên tục dịch chuyển về phía mô hình thế giới, mức định giá đã được đẩy lên khoảng 5,3 tỷ USD, câu chuyện kinh doanh đổi từ "công cụ video AI" thành "mô phỏng thế giới". Solaris là sản phẩm đầu tiên trên hướng đi này nhắm thẳng vào chính phần mềm — mô hình video mô phỏng thế giới vật lý, còn mô hình thế giới giao diện mô phỏng lớp tương tác người-máy.

Hiện Solaris đang ở giai đoạn truy cập sớm, trang web chính thức có một biểu mẫu đăng ký, Runway cho biết sẽ hợp tác với một số đối tác then chốt trước khi đưa ra công khai rộng rãi. Đối với các đội nhóm trong nước, rào cản của hướng đi này nằm ở dữ liệu tương tác: để mô hình học được "nhấp vào đây sẽ xảy ra điều gì" thì cần một lượng lớn quỹ đạo thao tác giao diện thực tế, và chu kỳ tích lũy loại dữ liệu này dài hơn nhiều so với video.

Nguồn tham khảo: Trang nghiên cứu chính thức của Runway, CocoLoop, AlphaSignal; độ trễ tương tác, giới hạn độ phân giải và tỷ lệ ưu tiên trong nghiên cứu người dùng 250 người đã được đối chiếu từng mục.