RLinf v0.3 menyambung alur pelatihan robot
RLinf v0.3 menghubungkan pengumpulan data, SFT, reinforcement learning, evaluasi, dan deployment robot nyata untuk embodied AI.
7 artikel terverifikasi tentang Pembelajaran penguatan, produk, dan perkembangan industri.
RLinf v0.3 menghubungkan pengumpulan data, SFT, reinforcement learning, evaluasi, dan deployment robot nyata untuk embodied AI.
Oak Lab menetapkan target 20 watt untuk agen yang terus belajar. Artikel ini merangkum fakta yang terverifikasi dan sinyal yang lebih luas dari satu pengumuman.
Pelopor reinforcement learning itu menilai model prediksi token kurang memiliki kausalitas, eksperimen, dan pengalaman sendiri.
Perusahaan baru David Silver, Ineffable Intelligence, mengumpulkan $1,1 miliar dalam putaran pendanaan awal dengan valuasi $5,1 miliar, menjadikannya putaran awal terbesar dalam sejarah Eropa. Mantan peneliti DeepMind ini berencana membangun AI "superlearner" melalui pembelajaran penguatan, berbeda dari pendekatan model bahasa besar yang dominan saat ini.
Thinking Machines Lab, yang didirikan oleh mantan CTO OpenAI Mira Murati, mengamankan kontrak bernilai miliaran dolar dengan Google Cloud untuk sistem GB300 dan mencapai valuasi $12 miliar hanya 14 bulan setelah diluncurkan.
Robot Ace dari Sony AI telah mengalahkan pemain tenis meja amatir elit dan profesional dalam pertandingan nyata, menandai pertama kalinya sebuah robot mencapai performa tingkat elit dalam olahraga kompetitif.
K1.5 dari Moonshot AI, yang dirilis sebelum K2, menunjukkan bahwa pembelajaran penguatan murni dapat meningkatkan kemampuan penalaran, memvalidasi pendekatan ini untuk penskalaan ke model yang lebih besar.