Au début de l'année dernière, certains prédisaient : « Le RAG est mort, les modèles à long contexte remplaceront tout. » Et qu'en est-il ? Non seulement le RAG n'est pas mort, mais il a évolué.
Du RAG au Context Engine
La définition originale du RAG était « génération augmentée par récupération » – extraire des informations de bases de données externes et les fournir au modèle pour une utilisation conjointe. Mais fin 2025, ce concept s'était élargi en une « ingénierie contextuelle » plus générale.
La logique centrale n'a pas changé : aider le modèle à obtenir dynamiquement les informations contextuelles dont il a besoin. Mais l'approche a évolué d'une « simple récupération vectorielle + concaténation » à un système intelligent complet d'assemblage contextuel.
Pourquoi le long contexte n'a-t-il pas remplacé le RAG ?
En théorie, une fenêtre de contexte d'un million de tokens peut contenir beaucoup de choses. Mais la réalité est :
- Coût : Chaque appel avec un million de tokens rend les coûts d'API insoutenables
- Précision : Plus le contexte est long, plus la précision de récupération est faible (Opus 4.6 à un million de tokens n'atteint que 76 %)
- Latence : Un contexte saturé signifie des temps de traitement plus longs
L'avantage central du RAG est la récupération à la demande – ne prendre que les informations les plus pertinentes, sans ajouter de superflu. Cet avantage ne disparaît pas simplement parce que la fenêtre de contexte s'agrandit.
Progrès techniques en 2025
Récupération hybride : Combinaison de recherche sémantique + recherche par mots-clés + graphe de connaissances, avec des résultats systématiquement supérieurs à toute méthode unique.
GraphRAG : Extraction des connaissances en structure de graphe, organisation hiérarchique, amélioration de la capacité de raisonnement.
RAG multimodal : Inclusion des embeddings d'images, d'audio, de tableaux et de vidéos dans le périmètre de récupération.
Adoption approfondie par les entreprises
En 2025, les entreprises de taille moyenne et grande construisaient déjà systématiquement une infrastructure RAG. Le concept « RAG en tant qu'infrastructure » s'est concrétisé – non pas comme un composant d'une application spécifique, mais comme une capacité sous-jacente partagée par toutes les applications d'IA.
Pour les agents d'IA, le RAG est encore plus indispensable. Les agents ont besoin d'extraire avec précision des informations de données privées pour exécuter des tâches – exactement ce que le RAG fait de mieux.
« Facile à commencer, difficile à maîtriser » est le plus grand défi du RAG. Monter un système RAG de démonstration est rapide, mais atteindre une précision et une stabilité de niveau production nécessite un travail d'optimisation considérable.
Source de référence : CocoLoop, Bilan annuel de RAGFlow