Một đoạn video demo dài ba đến mười hai giây, cùng dữ liệu chuyển động được ghi đồng bộ, được đưa thẳng vào cửa sổ ngữ cảnh của mô hình — sau đó robot thực hiện một công việc mà nó chưa từng luyện tập: không cập nhật gradient, không tinh chỉnh, không thay đổi bất kỳ trọng số nào. Generalist AI gọi cách làm này là "physical prompting", công bố cùng lúc với mô hình mới GEN-1.5.
GEN-1.5 là mô hình đa phương thức quy mô lớn, xử lý bốn loại đầu vào gồm video, dữ liệu cảm biến, chỉ dẫn ngôn ngữ và cảm nhận bản thể (proprioception), duy trì cửa sổ ghi nhớ 30 giây và xuất ra quỹ đạo chuyển động ở tần suất 100 Hz. Theo nhóm phát triển, hệ thống đã được huấn luyện liên tục hơn tám tháng trên bộ máy dữ liệu riêng.
Ba con số vẽ nên khoảng dao động
Hãng đã thử nghiệm chính thức trên 10 tác vụ thao tác — như mở lọ thủy tinh, kéo khóa hộp bút, lấy tiền ra khỏi ví. Khi dùng một lần demo duy nhất làm prompt ngữ cảnh, tỷ lệ thành công trung bình là 59% (độ lệch chuẩn ±10 điểm). Khi chuyển sang thu thập 5 phút dữ liệu cho mỗi tác vụ — khoảng 50 lần demo — rồi chạy 10 bước cập nhật gradient, kết quả tăng lên 83% (±9 điểm). Với tác vụ được giữ riêng để kiểm định, chỉ thích ứng một bước, tỷ lệ là 66,5%.
Khoảng cách 24 điểm phần trăm này đổi lấy năm phút thu thập dữ liệu cộng một vòng xếp hàng huấn luyện. Với một dây chuyền phải đổi hàng chục loại chi tiết, bài toán không khó tính: hướng tinh chỉnh buộc phải chạy lại toàn bộ quy trình thu thập và huấn luyện mỗi lần đổi mã sản phẩm (SKU), còn prompting theo ngữ cảnh chỉ mất vài giây. Chỉ có điều mức 59% vẫn còn cách xa vận hành không giám sát; hiện tại nó giống một cách bỏ bớt bước lập trình lại trong các kịch bản người-robot phối hợp hơn.
Đặt cạnh cách làm của các đối thủ Trung Quốc, sự khác biệt khá rõ. Các công ty như Alibaba, AgiBot (Zhiyuan), Unitree trong năm qua vẫn tập trung mở rộng quy mô dữ liệu và hoàn thiện phần cứng, dựa vào lượng mẫu điều khiển từ xa khổng lồ để đẩy tỷ lệ thành công của từng tác vụ lên cao, nhưng đổi tác vụ là phải làm lại từ đầu. GEN-1.5 chọn hướng khác: chấp nhận hy sinh điểm số đỉnh cao ở một tác vụ đơn lẻ, đổi lấy khả năng chuyển tác vụ mà không cần đụng đến trọng số. Ước tính sơ bộ, nếu một nhà máy mỗi tuần cần đưa vào vận hành ba đến năm trạm làm việc mới, chi phí nhân lực triển khai giữa hai hướng có thể chênh nhau cả một bậc độ lớn.
Ngay cả nhóm phát triển cũng bất ngờ
"Inserting a single demonstration in the context buffer... yields any measurable competence at all was unexpected."
Tạm dịch: việc chỉ chèn một lần demo vào bộ đệm ngữ cảnh mà vẫn tạo ra năng lực có thể đo lường được là điều không ai ngờ tới. Câu nói này cho thấy sức nặng của phát hiện. Khả năng học trong ngữ cảnh của các mô hình ngôn ngữ trước đây cũng từng "xuất hiện" bất ngờ ở GPT-3 mà không ai chủ đích huấn luyện cho nó; điều Generalist đang báo cáo là cùng một dạng năng lực nổi lên như vậy, nhưng lần này ở phía cảm biến và góc khớp. Công ty được thành lập năm 2024 bởi các cựu nhà nghiên cứu từ DeepMind và Boston Dynamics, trước đó đã huy động được 400 triệu USD.
Giới hạn do chính hãng vạch ra
Thông báo không né tránh một số điểm yếu: các tác vụ thử nghiệm đều ngắn và đơn giản nên tỷ lệ thành công chưa thực sự nổi bật; kỹ năng học được qua ngữ cảnh dễ vỡ hơn nhiều so với mô hình đã tinh chỉnh; physical prompting còn tạo ra những bước nhảy trên trục thời gian chưa từng xuất hiện lúc huấn luyện, khiến đoạn demo và quá trình thực thi thực tế có khoảng đứt gãy.
Cộng lại, những giới hạn này chỉ về cùng một nhận định: hướng học kỹ năng mới chỉ từ một lần demo mới vừa hé lộ. Nó có trụ được ở các tác vụ dài hơi, có giữ vững trong môi trường lộn xộn hay không, còn tùy các phiên bản tiếp theo đẩy con số 59% lên được đến đâu.
Nguồn tham khảo: thông báo chính thức về GEN-1.5 trên blog Generalist AI, IoT Tech News, CocoLoop; các số liệu 59% với một lần demo, 83% sau tinh chỉnh, 66,5% ở tác vụ giữ riêng, cùng cửa sổ ghi nhớ 30 giây và tần suất chuyển động 100 Hz đều theo thông báo chính thức.