구글 클라우드가 AlloyDB의 ScaNN 인덱스를 업데이트하면서 공식 확장 한계를 100억 개 이상 벡터로 제시했다. 이 규모에서 벤치마크 수치는 P95 지연시간 51밀리초 이내, 재현율 95%다. AlloyDB는 구글 클라우드의 관리형 데이터베이스 서비스로, PostgreSQL 인터페이스와 호환된다.
이번 변경은 인덱스 구조 자체에 있다. 기존 ScaNN은 2단 또는 3단 트리로 벡터를 정리했는데, 이번에 4단으로 늘렸다.
트리 한 단 더, 탐색 대상은 두 자릿수 줄어
근사 최근접 이웃 검색은 벡터를 유사도 기준으로 계층별 클러스터로 묶은 뒤, 쿼리 시점에 최상위 계층부터 아래로 내려가며 각 단계에서 가장 가까운 분기만 펼쳐보는 방식이다. 계층 수가 탐색 복잡도를 결정한다. 2단 트리는 대략 O(N^1/2), 3단이면 O(N^1/3)으로 낮아지고, 4단은 O(N^1/4)까지 더 압축된다.
100억 개 규모에서는 이 지수 차이가 크게 벌어진다. 대략 계산하면 N이 100억일 때 제곱근은 약 10만, 세제곱근은 약 2150, 네제곱근은 약 316이다. 쿼리 한 번이 건드려야 하는 후보 수가 십만 단위에서 300 안팎으로 떨어진다. 51밀리초라는 수치는 여기서 나온다.
구글이 제시한 구체적 기법으로는 Top-K 분기 전략, SOAR 알고리즘, 중심점 조정, 균형 트리 구성이 있고, 여기에 메모리 제약을 우회하는 동적 샘플링도 더해졌다. 구글이 지목한 기존 구조의 병목은 두 가지다. 트리가 커질수록 인덱스 구축과 쿼리 탐색에 드는 연산량이 함께 늘어난다는 점, 그리고 100억 개 규모에서 샘플링을 하면 가용 메모리를 금방 소진한다는 점이다.
데이터량을 끌어올린 건 에이전트다
구글 측 설명에 따르면 기업용 에이전트 애플리케이션 수요가 사용 사례를 수십억 개 벡터 규모로 밀어붙이고 있고, 기반이 되는 벡터 데이터베이스는 종종 이를 따라가지 못한다.
이 대목이 이번 확장이 어디서 비롯됐는지를 보여준다. 전통적인 검색 증강 생성 환경에서는 기업이 내부 문서를 전부 조각내도 규모가 보통 수천만에서 수억 개 사이에 머문다. 에이전트는 다르다. 한 단계를 수행할 때마다 이력을 다시 훑고, 도구 설명을 확인하고, 사용자 선호를 조회해야 하며, 작업 하나에서 10여 차례 검색이 발생할 수 있다. 데이터 출처도 문서를 넘어 세션 기록, 작업 로그, 중간 산출물로 확장됐고, 이는 매일 증분으로 쌓인다.
계산을 한 번 더 해보자. P95 51밀리초를 기준으로, 에이전트 작업 하나가 검색을 15회 수행한다면 벡터 데이터베이스에서만 약 0.77초가 소요된다. 이는 데이터베이스 구간만 따진 것이고, 모델 추론과 도구 호출, 네트워크 왕복은 별도다. 검색 지연은 단일 상호작용에서는 눈에 띄지 않지만 다단계 체인에 들어가면 체감의 일부가 된다.
범용 데이터베이스가 전용 제품을 흡수하는 중
100억 개 규모 벡터 검색을 PostgreSQL 호환 관리형 서비스에 집어넣은 건 같은 방향을 가리킨다. 벡터가 더는 독립된 전용 인프라를 필요로 하지 않는다는 방향이다.
기업 고객 입장에서 이 계산은 간단하다. 업무 데이터는 원래 관계형 데이터베이스에 있고, 사용자 테이블, 주문 테이블, 권한 규칙도 마찬가지다. 벡터만 별도 전용 데이터베이스에 두면 백업 체계도, 권한 체계도, 일관성 보장도 두 벌이 되고, 데이터베이스를 넘나드는 트랜잭션 경계까지 직접 처리해야 한다. 기존 데이터베이스에 인덱스만 추가해 해결할 수 있다면 운영 복잡도는 곧바로 절반 가까이 줄어든다.
지난 2년 사이 전용 벡터 데이터베이스의 입지도 함께 바뀌었다. 극한의 성능과 검색 알고리즘 개선 속도에서는 여전히 우위를 지키고 있지만, 범용 데이터베이스는 '충분히 쓸 만한' 기준을 수백만에서 수억, 이제는 수백억까지 계속 끌어올리고 있다. 전용 제품에 남은 공간은 지연시간과 처리량 요구가 가장 까다로운 좁은 영역으로 밀려나는 중이다.
이번에 AlloyDB는 파티션 수, 벡터 차원, 인덱스 구축 시간, QPS 상한은 공개하지 않았다. 이런 수치는 실제 도입 검토에서 최고 규모보다 참고 가치가 큰 경우가 많고, 특히 인덱스 구축 시간이 중요하다. 100억 개 규모에서 인덱스를 재구축하는 비용은 상당히 클 수 있다.
참고 출처: 구글 클라우드 공식 블로그, AlloyDB ScaNN 인덱스 문서, CocoLoop. 벡터 규모, P95 지연시간, 재현율 수치는 공식 발표 기준이며 복잡도 환산은 편집 부문의 대략적 계산입니다.