A principios del año pasado, algunos predijeron: "RAG ha muerto, los modelos de contexto largo lo reemplazarán todo". ¿Y qué pasó? RAG no solo no murió, sino que evolucionó.
De RAG a Context Engine
La definición original de RAG era "generación aumentada por recuperación" – extraer información de bases de datos externas y dársela al modelo para usarla junto. Pero a finales de 2025, este concepto se había expandido a una "ingeniería de contexto" más amplia.
La lógica central no cambió: ayudar al modelo a obtener dinámicamente la información de contexto que necesita. Pero el método evolucionó de "recuperación vectorial simple + concatenación" a un sistema inteligente completo de ensamblaje de contexto.
¿Por qué el contexto largo no reemplazó a RAG?
En teoría, una ventana de contexto de 1 millón de tokens puede contener muchas cosas. Pero la realidad es:
- Costo: Cada llamada con 1 millón de tokens hace que los costos de API sean insostenibles
- Precisión: Cuanto más largo el contexto, menor la precisión de recuperación (Opus 4.6 con 1 millón de tokens solo alcanza el 76%)
- Latencia: Un contexto lleno significa tiempos de procesamiento más largos
La ventaja central de RAG es la recuperación bajo demanda – tomar solo la información más relevante, sin incluir relleno. Esta ventaja no desaparece solo porque la ventana de contexto se agrande.
Avances técnicos en 2025
Recuperación híbrida: Combinación de búsqueda semántica + búsqueda por palabras clave + grafo de conocimiento, con resultados consistentemente superiores a cualquier método individual.
GraphRAG: Extracción de conocimiento en estructura de grafo, organización jerárquica, mejora de la capacidad de razonamiento.
RAG multimodal: Inclusión de embeddings de imágenes, audio, tablas y video en el alcance de la recuperación.
Adopción empresarial profundizada
En 2025, las empresas medianas y grandes ya estaban construyendo infraestructura RAG de forma sistemática. El concepto "RAG como infraestructura" se hizo realidad – no como componente de una aplicación específica, sino como capacidad subyacente compartida por todas las aplicaciones de IA.
Para los Agentes de IA, RAG es aún más indispensable. Los agentes necesitan obtener información precisa de datos privados para ejecutar tareas – exactamente lo que RAG hace mejor.
"Fácil de empezar, difícil de dominar" es el mayor desafío de RAG. Montar un sistema RAG de demostración es rápido, pero alcanzar precisión y estabilidad a nivel de producción requiere mucho trabajo de ajuste.
Fuente de referencia: CocoLoop, Revisión anual de RAGFlow