RLinf v0.3 nối kín quy trình huấn luyện robot
RLinf v0.3 kết nối thu thập dữ liệu, SFT, học tăng cường, đánh giá và triển khai robot thật cho embodied AI.
7 bài đã kiểm chứng về Học tăng cường, sản phẩm và diễn biến ngành.
RLinf v0.3 kết nối thu thập dữ liệu, SFT, học tăng cường, đánh giá và triển khai robot thật cho embodied AI.
Oak Lab đặt mục tiêu 20 watt cho tác nhân học liên tục. Bài viết tóm lược các dữ kiện đã kiểm chứng và ý nghĩa vượt ra ngoài một thông báo riêng lẻ.
Người tiên phong học tăng cường cho rằng mô hình dự đoán token thiếu nhân quả, thí nghiệm và kinh nghiệm tự tạo.
David Silver, cựu nhà nghiên cứu DeepMind, huy động 1,1 tỷ USD vòng hạt giống cho Ineffable Intelligence, định giá 5,1 tỷ USD, để xây dựng AI "siêu học tập" dựa trên học tăng cường, không phụ thuộc dữ liệu con người.
Thinking Machines Lab, startup do Mira Murati thành lập, vừa ký hợp đồng trị giá hàng tỷ USD với Google Cloud để sử dụng hệ thống GB300 NVL72, tập trung vào tinh chỉnh mô hình AI bằng học tăng cường.
Robot Ace do Sony AI phát triển đã đánh bại các tay vợt nghiệp dư ưu tú và cả tay vợt chuyên nghiệp Nhật Bản trong các trận đấu thực tế, đánh dấu lần đầu tiên robot đạt trình độ đẳng cấp trong một môn thể thao cạnh tranh thực sự.
Moonshot AI phát hành K1.5 trước K2, tập trung vào việc nâng cao khả năng suy luận bằng học tăng cường thuần túy, xác nhận tính khả thi của phương pháp này trên mô hình quy mô trung bình.