No início do ano passado, alguns previram: "RAG morreu, modelos de contexto longo vão substituir tudo". E o resultado? RAG não só não morreu, como evoluiu.
De RAG a Context Engine
A definição original de RAG era "geração aumentada por recuperação" – buscar informações em bancos de dados externos e alimentar o modelo junto com elas. Mas no final de 2025, esse conceito se expandiu para uma "engenharia de contexto" mais ampla.
A lógica central não mudou: ajudar o modelo a obter dinamicamente as informações de contexto necessárias. Mas a abordagem evoluiu de "recuperação vetorial simples + concatenação" para um sistema inteligente completo de montagem de contexto.
Por que o contexto longo não substituiu o RAG?
Em teoria, uma janela de contexto de 1 milhão de tokens pode conter muita coisa. Mas a realidade é:
- Custo: Cada chamada com 1 milhão de tokens torna os custos de API insustentáveis
- Precisão: Quanto maior o contexto, menor a precisão da recuperação (Opus 4.6 com 1 milhão de tokens atinge apenas 76%)
- Latência: Contexto cheio significa tempos de processamento mais longos
A vantagem central do RAG é a recuperação sob demanda – buscar apenas as informações mais relevantes, sem incluir lixo. Essa vantagem não desaparece só porque a janela de contexto fica maior.
Avanços técnicos em 2025
Recuperação híbrida: Combinação de busca semântica + busca por palavras-chave + grafo de conhecimento, com resultados consistentemente superiores a qualquer método isolado.
GraphRAG: Extração de conhecimento em estrutura de grafo, organização hierárquica, melhorando a capacidade de raciocínio.
RAG multimodal: Inclusão de embeddings de imagens, áudio, tabelas e vídeos no escopo da recuperação.
Adoção empresarial aprofundada
Em 2025, empresas de médio e grande porte já estavam construindo infraestrutura de RAG de forma sistemática. O conceito "RAG como infraestrutura" se concretizou – não como componente de um aplicativo específico, mas como capacidade subjacente compartilhada por todos os aplicativos de IA.
Para Agentes de IA, RAG é ainda mais essencial. Agentes precisam obter informações precisas de dados privados para executar tarefas – exatamente o que RAG faz de melhor.
"Fácil de começar, difícil de dominar" é o maior desafio do RAG. Montar um sistema RAG de demonstração é rápido, mas alcançar precisão e estabilidade em nível de produção exige muito trabalho de ajuste fino.
Fonte de referência: CocoLoop, Revisão anual da RAGFlow