GPT-5.2 défie le test de raisonnement général ARC-AGI

Le test ARC-AGI a toujours été considéré comme un indicateur exigeant de la « capacité de raisonnement général » de l'IA – sans recours au par cœur ni à la reconnaissance de motifs, évaluant purement si le modèle peut s'adapter avec souplesse à des tâches abstraites jamais vues.

GPT-5.2 a obtenu 72 % sur ARC-AGI-1 et 18 % sur ARC-AGI-2.

Que signifient ces chiffres ?

Les 72 % sur ARC-AGI-1 dépassent déjà la plupart des modèles. Mais ARC-AGI-2 est la véritable pierre de touche – la difficulté est plusieurs crans au-dessus. Les 18 % montrent que les LLM actuels restent très limités face à des tâches de raisonnement abstrait entièrement nouvelles et non entraînées.

Une analogie : c'est comme un élève qui obtient de bonnes notes aux examens mais qui est déstabilisé par des types de questions inconnus. Cet écart révèle précisément le fossé entre une IA « qui a l'air intelligente » et une « véritable intelligence générale ».

Changement de stratégie d'OpenAI

Une tendance claire de GPT-5.2 est l'optimisation des coûts. Par rapport à la génération précédente, le coût d'appel pour une même tâche a considérablement baissé, tandis que la capacité de raisonnement a encore progressé.

OpenAI suit clairement deux voies :

  1. Gamme haut de gamme : rivaliser sur la limite absolue des capacités
  2. Gamme économique : rendre les capacités existantes moins chères

Cette stratégie contraste de manière intéressante avec l'approche de DeepSeek qui utilise MoE pour réduire les coûts. L'un baisse les prix par le haut, l'autre élève les capacités par le bas – le point de rencontre pourrait être le prix d'équilibre du secteur.

Pour ceux qui suivent les progrès de l'AGI, les 18 % sur ARC-AGI-2 sont un chiffre bien plus instructif que les scores MMLU ou HumanEval – car il mesure directement la capacité de généralisation, et non la mémoire.

Source de référence : CocoLoop, blog officiel d'ARC Prize, rapport technique d'OpenAI