RLinf v0.3、ロボット訓練を一本化
RLinf v0.3 は、データ収集から SFT、強化学習、評価、実機配備までをつなぐ具身 AI 向け訓練基盤の更新だ。
強化学習に関する製品動向と業界分析を全7件掲載しています。
RLinf v0.3 は、データ収集から SFT、強化学習、評価、実機配備までをつなぐ具身 AI 向け訓練基盤の更新だ。
Oak Labは継続学習するエージェントに20ワット目標を掲げた。この記事は確認済みの事実と、単発の発表を超えた意味を整理する。
強化学習の先駆者は、次単語予測モデルには因果、実験、自己経験が足りないと見る。
David Silver氏の新会社Ineffable Intelligenceがシードラウンドで11億ドル、評価額51億ドルを達成。欧州史上最大のシード調達となった。元DeepMind研究者は、大規模言語モデルとは異なる強化学習による「スーパーラーナー」AIの構築を目指す。
元OpenAI CTOのMira Murati氏が設立したThinking Machines Labが、Google Cloudと数十億ドル規模のGB300契約を締結。設立からわずか14カ月で評価額120億ドルに達した。
ソニーAIの卓球ロボット「Ace」が、エリートアマチュア選手やプロリーグ選手との実戦で勝利。ロボットが実際の競技スポーツでエリートレベルのパフォーマンスを達成した初めての事例となった。
Moonshot AIがK2の前にリリースしたK1.5は、純粋な強化学習で推論能力を高める手法を実証し、大規模モデルへの拡張の基盤を築いた。