RLinf v0.3, 로봇 훈련 흐름을 잇다
RLinf v0.3는 데이터 수집, SFT, 강화학습, 평가, 실제 로봇 배포를 하나의 훈련 파이프라인으로 묶는 업데이트다.
강화학습 관련 제품 동향과 산업 분석 7건을 모았습니다.
RLinf v0.3는 데이터 수집, SFT, 강화학습, 평가, 실제 로봇 배포를 하나의 훈련 파이프라인으로 묶는 업데이트다.
Oak Lab은 지속 학습 에이전트를 위해 20와트 목표를 제시했다. 이 글은 확인된 사실과 단일 발표를 넘어서는 의미를 정리한다.
강화학습 선구자는 다음 단어 예측 모델에 인과, 실험, 자기 경험이 부족하다고 지적한다.
데이비드 실버의 새 회사 Ineffable Intelligence가 시드 라운드에서 11억 달러, 기업가치 51억 달러를 달성했다. 이는 유럽 역사상 가장 큰 시드 라운드다. 전 DeepMind 연구원은 대규모 언어 모델과 다른 강화학습 기반 '슈퍼러너' AI 구축을 목표로 한다.
전 OpenAI CTO Mira Murati가 설립한 Thinking Machines Lab이 Google Cloud와 수십억 달러 규모의 GB300 계약을 체결하고, 창립 14개월 만에 120억 달러의 가치를 인정받았다.
소니 AI의 에이스 로봇이 엘리트 아마추어 및 프로 탁구 선수와의 실제 경기에서 승리하며, 로봇이 실제 경쟁 스포츠에서 엘리트 수준의 성과를 달성한 최초의 사례가 되었다.
Moonshot AI가 K2 이전에 출시한 K1.5는 순수 강화학습으로 추론 능력을 향상시키는 접근법을 검증했으며, 대규모 모델로의 확장을 위한 토대를 마련했다.