작년 초, "RAG는 죽었다. 긴 컨텍스트 모델이 모든 것을 대체할 것"이라는 예측이 있었습니다. 결과는 어땠을까요? RAG는 죽지 않았을 뿐만 아니라 진화했습니다.
RAG에서 컨텍스트 엔진으로
RAG는 원래 "검색 증강 생성"을 의미하며, 외부 데이터베이스에서 정보를 가져와 모델에 함께 제공하는 방식이었습니다. 하지만 2025년 말까지 이 개념은 더 광범위한 "컨텍스트 엔지니어링"으로 확장되었습니다.
핵심 로직은 변하지 않았습니다. 모델이 필요한 컨텍스트 정보를 동적으로 획득하도록 돕는 것입니다. 그러나 방식은 단순한 "벡터 검색 + 결합"에서 지능형 컨텍스트 조립 시스템으로 진화했습니다.
긴 컨텍스트가 RAG를 대체하지 못한 이유
이론적으로 100만 토큰의 컨텍스트 윈도우에는 많은 정보를 담을 수 있습니다. 하지만 현실은 다릅니다.
- 비용: 호출할 때마다 100만 토큰을 전송하면 API 비용을 감당하기 어렵습니다
- 정확도: 컨텍스트가 길수록 검색 정확도는 낮아집니다(Opus 4.6은 100만 토큰에서 76%에 불과)
- 지연 시간: 컨텍스트를 가득 채우면 처리 시간이 길어집니다
RAG의 핵심 장점은 온디맨드 검색, 즉 가장 관련성 높은 정보만 가져오고 불필요한 내용은 넣지 않는다는 점입니다. 이 장점은 컨텍스트 윈도우가 커져도 사라지지 않습니다.
2025년 기술 발전
하이브리드 검색: 의미 검색, 키워드 검색, 지식 그래프를 결합하면 어떤 단일 방법보다 안정적으로 우수한 결과를 얻을 수 있습니다.
GraphRAG: 지식을 그래프 구조로 추출하고 계층적으로 구성하여 추론 능력을 향상시킵니다.
멀티모달 RAG: 이미지, 오디오, 표, 비디오의 임베딩도 검색 범위에 포함시킵니다.
기업 도입 심화
2025년까지 중대형 기업들은 체계적으로 RAG 인프라를 구축하고 있었습니다. "RAG를 인프라로"라는 개념이 현실화되어, 특정 애플리케이션의 구성 요소가 아닌 모든 AI 애플리케이션이 공유하는 기반 역량이 되었습니다.
AI 에이전트에게 RAG는 더욱 필수적입니다. 에이전트는 작업을 수행하기 위해 비공개 데이터에서 정확하게 정보를 검색해야 하며, 이것이 바로 RAG가 가장 잘하는 분야입니다.
"시작은 쉽지만 숙달은 어렵다"는 것이 RAG의 가장 큰 과제입니다. 데모용 RAG 시스템은 빠르게 구축할 수 있지만, 프로덕션 수준의 정확도와 안정성을 달성하려면 상당한 튜닝 작업이 필요합니다.
출처: CocoLoop, RAGFlow 연간 리뷰