RLinf v0.3 cierra el ciclo de entrenamiento robótico
RLinf v0.3 conecta recopilación de datos, SFT, aprendizaje por refuerzo, evaluación y despliegue en robots reales para embodied AI.
7 artículos verificados sobre Aprendizaje por refuerzo, productos y movimientos del sector.
RLinf v0.3 conecta recopilación de datos, SFT, aprendizaje por refuerzo, evaluación y despliegue en robots reales para embodied AI.
Oak Lab plantea una meta de 20 vatios para agentes de aprendizaje continuo. El artículo resume los hechos verificados y la señal que va más allá de un anuncio aislado.
El pionero del aprendizaje por refuerzo sostiene que los modelos de próximo token carecen de causalidad, experimentación y experiencia propia.
David Silver, exinvestigador de DeepMind, recauda 1.100 millones de dólares en una ronda semilla para Ineffable Intelligence, valorada en 5.100 millones, para construir una IA "superaprendiz" basada en aprendizaje por refuerzo, sin depender de datos humanos.
Thinking Machines Lab, la startup de Mira Murati, ha firmado un contrato multimillonario con Google Cloud para utilizar sistemas GB300 NVL72, centrándose en el ajuste fino de modelos de IA mediante aprendizaje por refuerzo.
El robot Ace, desarrollado por Sony AI, derrotó a jugadores amateurs de élite y a un jugador profesional japonés en mesas de nivel olímpico en la sede de Sony en Tokio, marcando la primera vez que un robot alcanza nivel de élite en un deporte competitivo real.
Moonshot AI lanzó K1.5 antes de K2, con el enfoque central de mejorar la capacidad de razonamiento mediante aprendizaje por refuerzo puro, confirmando la viabilidad de este enfoque en modelos de escala media.