RLinf v0.3 fecha o ciclo de treino de robôs
RLinf v0.3 conecta coleta de dados, SFT, aprendizado por reforço, avaliação e implantação em robôs reais para embodied AI.
7 artigos verificados sobre Aprendizado por reforço, produtos e movimentos do setor.
RLinf v0.3 conecta coleta de dados, SFT, aprendizado por reforço, avaliação e implantação em robôs reais para embodied AI.
Oak Lab define meta de 20 watts para agentes que aprendem continuamente. O texto resume os fatos verificados e o sinal que vai além de um anúncio isolado.
O pioneiro do aprendizado por reforço argumenta que modelos de próximo token não têm causalidade, experimento e experiência própria.
David Silver, ex-pesquisador do DeepMind, levanta US$ 1,1 bilhão em rodada semente para a Ineffable Intelligence, avaliada em US$ 5,1 bilhões, para construir uma IA "superaprendiz" baseada em aprendizado por reforço, sem depender de dados humanos.
Thinking Machines Lab, startup de Mira Murati, fechou um contrato de bilhões de dólares com o Google Cloud para usar sistemas GB300 NVL72, focando no ajuste fino de modelos de IA por aprendizado por reforço.
O robô Ace, desenvolvido pela Sony AI, derrotou jogadores amadores de elite e um jogador profissional japonês em mesas de nível olímpico na sede da Sony em Tóquio, marcando a primeira vez que um robô atinge nível de elite em um esporte competitivo real.
A Moonshot AI lançou o K1.5 antes do K2, com o foco central em aprimorar a capacidade de raciocínio por meio de aprendizado por reforço puro, confirmando a viabilidade dessa abordagem em modelos de escala média.