RLinf v0.3打通機器人訓練閉環
RLinf v0.3 把資料採集、SFT、強化學習、評測與真機部署接成更完整的具身 AI 訓練流程。
收錄 強化學習 相關產品動態與產業觀察,共 7 篇文章。
RLinf v0.3 把資料採集、SFT、強化學習、評測與真機部署接成更完整的具身 AI 訓練流程。
Oak Lab為持續學習智能體提出20瓦目標。本文整理已核驗事實,以及它為何不只是單一發布消息。
這位強化學習先驅認為,下一詞預測模型缺少因果、實驗與自我經驗。
David Silver 的新公司 Ineffable Intelligence 在種子輪融資 11 億美元,估值達 51 億美元,創下歐洲創投史上最大種子輪紀錄。這位前 DeepMind 研究員計劃透過強化學習打造「超級學習者」AI,與當前主流的大型語言模型路線截然不同。
前 OpenAI 技術總監 Mira Murati 創立的 Thinking Machines Lab,與 Google Cloud 簽訂數十億美元 GB300 合約,成立僅 14 個月估值已達 120 億美元。
Sony AI 的 Ace 機器人在真實比賽中擊敗業餘菁英與職業聯賽選手,這是機器人首次在真實競技運動中達到菁英級表現。
月之暗面在 K2 之前發佈的 K1.5,核心在於用純強化學習來提升推理能力,驗證了該方法在中規模模型上的可行性,為後續更大規模模型奠定技術基礎。