RLinf v0.3 boucle l'entraînement des robots
RLinf v0.3 relie collecte de données, SFT, apprentissage par renforcement, évaluation et déploiement sur robots réels pour l'embodied AI.
7 articles vérifiés sur Apprentissage par renforcement, les produits et le secteur.
RLinf v0.3 relie collecte de données, SFT, apprentissage par renforcement, évaluation et déploiement sur robots réels pour l'embodied AI.
Oak Lab fixe un objectif de 20 watts pour des agents apprenants en continu. L’article résume les faits vérifiés et le signal au-delà d’une annonce isolée.
Le pionnier de l’apprentissage par renforcement estime que les modèles de prochain token manquent de causalité, d’expérience et d’expérimentation.
David Silver, ancien chercheur de DeepMind, lève 1,1 milliard de dollars en amorçage pour Ineffable Intelligence, valorisée 5,1 milliards, afin de construire une IA « super-apprenante » basée sur l'apprentissage par renforcement, sans dépendre des données humaines.
Thinking Machines Lab, la startup de Mira Murati, a signé un contrat de plusieurs milliards de dollars avec Google Cloud pour utiliser des systèmes GB300 NVL72, en se concentrant sur le réglage fin de modèles d'IA par apprentissage par renforcement.
Le robot Ace, développé par Sony AI, a battu des joueurs amateurs d'élite et un joueur professionnel japonais sur des tables de niveau olympique au siège de Sony à Tokyo, marquant la première fois qu'un robot atteint un niveau d'élite dans un sport de compétition réel.
Moonshot AI a publié K1.5 avant K2, avec pour objectif central d'améliorer les capacités de raisonnement via l'apprentissage par renforcement pur, confirmant la faisabilité de cette approche sur des modèles de taille moyenne.