구글 리서치 소속 연구자 7명이 9월 30일 arXiv에 논문을 제출하고, 연구 수준의 수학적 증명을 찾기 위한 멀티 에이전트 시스템 'Cogentic'을 공개했다. 논문에 따르면 Gemini를 기반 모델로 삼은 이 시스템은 온라인 학습, 경매 이론, 메커니즘 설계 세 분야에서 미해결 문제 5개를 진전시켰다. 모든 증명은 이후 해당 분야 전문가가 독립적으로 검증했고, 전문가를 공동 저자로 포함한 완성된 논문으로 확장됐다.
저자 명단에는 예일대학교를 겸임하는 Yang Cai, 구글 딥마인드를 겸임하는 Vineet Gupta를 비롯해 Aranyak Mehta, Christopher Liaw, Di Wang 등이 이름을 올렸다. 논문은 cs.AI와 cs.GT(게임 이론) 두 분야로 분류돼 있다.
한 번의 생성으로 부족해 파이프라인으로 쪼갰다
논문의 출발점은 단순하다. 언어 모델은 이미 괜찮은 수학적 아이디어를 내놓을 수 있지만, 여러 추측을 동시에 시도하며 며칠에 걸쳐 끈질기게 밀어붙여야 하는 난제 앞에서는 한 번의 생성만으로는 버티지 못한다.
Cogentic은 증명 찾기를 서로 다른 역할로 나눈다.
- 오케스트레이터가 전체 상태를 파악해 어느 방향에 몇 명의 증명자를 배치할지 결정한다
- 증명자들이 후보 증명을 병렬로 작성한다
- 검증자는 서로 다른 관점에서 적대적으로 오류를 찾아낸다
- 문헌 검색자가 배경 자료를 보충한다
- 장부는 검증을 통과한 중간 결론만 기록하며, 라운드를 넘어 유지돼 이후 증명이 바로 인용할 수 있게 한다
- 이 외에 '어드바이저' 역할이 전체 과정의 패턴을 지켜보며 수시로 파라미터를 조정한다
증명, 검증, 다시 증명 — 이 순환이 계속된다. 장부는 장기 과제에서 흔히 나타나는 고질적인 문제를 해결한다. 모델이 이전 라운드에서 이끌어낸 보조정리를 다음 라운드에서 잊어버리거나 다르게 바꿔 말하는 일이 잦은데, 이제는 검증만 통과하면 그대로 고정된다.
다섯 문제는 각각 어디까지 진전됐나
논문이 제시한 결과는 다음과 같다:
- 온라인 역선형 최적화: 시간 지평 T와 무관한, 효율적인 O(d) 리그렛 한계를 처음으로 달성했으며 라운드당 계산량은 O(d²).
- 양면 시장의 경쟁 복잡도: 더 작은 쪽에 판매자 2명만 추가하면 거래 수익이 최적 배분을 따라잡을 수 있음을 증명.
- 전문가 n명에 대한 애니타임 리그렛: 고정 기간 버전과 동일한 상수항을 갖는 애니타임 알고리즘을 제시.
- 단순 메커니즘과 최적 수익: 단일 가산적 구매자의 수익 근사 비율을 5.2에서 3.52로 개선.
- 자동 입찰의 무정부 비용: 입찰자 2명일 때 최적값인 1.5, n명일 때 2−1/(4n+1)을 달성.
비용 면에서 논문은 대부분의 문제가 Gemini 호출 수백 회 규모, 가장 어려운 문제는 수천 회 규모였다고 밝혔다. 어떤 버전의 Gemini를 사용했는지는 명시하지 않았다.
OpenAI의 증명 결과들과 나란히 놓고 보면
올해 하반기 AI가 수학 문제를 풀었다는 소식이 잇따르는 가운데, 나란히 놓고 보면 차이는 검증 방식에 있다.
OpenAI는 8월 Astra로 수학·이론 전산학 분야의 결과 10건을 내놓으며 249쪽 분량의 논문과 Lean 형식 증명서를 첨부했다. 9월 공개한 나비에–스토크스 방정식 증명에서는 약 1만 개의 에이전트를 88시간 가동했고, 역시 Lean 파일을 함께 내놓았다. 기계가 검증 가능한 형식 증명서는 OpenAI가 이 노선에서 거듭 강조해 온 강점이다.
Cogentic 논문이 무게를 두는 지점은 다르다. 시스템 내부에서는 적대적 검증자가 한 차례 걸러내고, 시스템 밖으로 나온 뒤에는 해당 분야에 밝은 사람이 하나하나 읽은 뒤 전문가와 함께 정식 논문으로 써낸다. 다루는 문제 범위도 더 좁아서, 다섯 문제 모두 저자 자신의 연구 분야에서 나왔고 동료들이 지켜보며 판단할 수 있는 문제들이다.
이런 선택은 결과에 대한 신뢰를 얻기 쉽게 하지만, 그 대가로 일반화 가능성을 치른다. 논문 스스로도 문제들이 '저자들이 익숙한 분야에서 고른 것'이라고 인정하며, 저자들이 낯선 방향에서는 어떤 효과를 낼지에 대해서는 답하지 않는다.
읽는 속도가 쓰는 속도를 따라가지 못한다
논문 속 한 문장은 테렌스 타오가 8월 글에서 우려했던 것과 거의 같은 이야기를 한다.
"A system like this can produce candidate results faster than they can be read."
이런 시스템은 사람이 다 읽기도 전에 후보 결과를 쏟아낼 수 있다.
Cogentic의 다섯 문제는 각각 전문가의 검증을 거쳤기에 '검증됐다'고 말할 수 있다. 하지만 이 체계가 더 많은 사람과 더 넓은 문제로 열리는 순간, 병목은 심사자 쪽으로 옮겨간다. 논문은 전문가가 증명 한 건을 검증하는 데 얼마나 시간이 걸렸는지는 밝히지 않았는데, 바로 그 수치가 이 방식이 어디까지 확장될 수 있는지를 가늠하는 잣대다.
참고 출처: arXiv 논문 2609.40324, CocoLoop, Google Research; 다섯 가지 결과의 한계값·근사 비율·호출 횟수 규모는 모두 논문 본문 기준이다.