DeepMind의 AI, 연구 수준 수학 문제 6개 해결

먼저 이 10개의 문제가 무엇인지 명확히 하겠습니다.

이것들은 수학 경시대회 문제나 고전적인 난제가 아닙니다. FirstProof 챌린지의 미발표 연구 수준의 수학 문제이며, 참가자에는 직업 수학자와 수학 박사가 포함됩니다. 요구 사항은 답이 정확해야 하고, 동료 검토를 견딜 수 있는 엄격한 수학적 증명이 함께 제공되어야 한다는 것입니다.

DeepMind의 최신 수학 AI인 Aletheia는 그중 6개를 해결했습니다.

5개는 외부 전문가에 의해 "약간의 수정만 하면 바로 출판 가능"하다고 평가되었습니다. 이것이 무엇을 의미할까요? 이 해결책들의 품질이 실제 학술 논문의 기준에 도달했음을 의미합니다.

Aletheia의 작동 방식

Aletheia의 기반 모델은 Gemini 3 Deep Think로, 테스트 시간 계산을 연장하여 성능을 향상시킵니다. 하지만 단일 대규모 모델을 실행하는 것이 아니라 다중 에이전트 프레임워크입니다:

  • Generator: 초기 해결 아이디어 생성
  • Verifier: 증명 단계의 논리적 허점 검증
  • Reviser: 검증 피드백에 따라 증명 수정
  • Google Search를 통합하여 최신 수학 문헌에 접근

이 아키텍처의 기본 아이디어는 증명의 검증이 생성보다 더 쉽다는 것입니다. 수학 증명에서 추론의 각 단계는 옳거나 그르거나 둘 중 하나입니다. 이는 콘텐츠를 생성하는 것보다 훨씬 쉬운 비교적 객관적인 판단입니다. 따라서 Verifier가 게이트키퍼 역할을 하도록 함으로써 "겉보기에는 맞는 것 같지만 실제로는 결함이 있는" 해결책의 발생을 어느 정도 줄일 수 있습니다.

Aletheia가 수행하는 또 한 가지 주목할 점은, 실제로 풀 수 없는 문제를 만나면 잘못된 답을 강제로 생성하는 대신 "해결책을 찾을 수 없음"을 명시적으로 출력하거나 시간 초과되는 것입니다. "자신이 모르는 것을 안다"는 설계는 강제적인 환각보다 수학 시나리오에서 훨씬 중요합니다.

OpenAI와의 비교

FirstProof 챌린지에는 OpenAI도 내부 모델을 참가시켰습니다.

초기 보고에 따르면 OpenAI의 모델도 6개를 해결했다고 합니다. 이후 재검토 결과, 2번 문제에서 논리적 결함이 발견되어 5개로 감소했습니다.

동일한 조건에서 Aletheia: 6개 해결, 외부 전문가 검토를 통해 5개가 출판 가능으로 평가됨.

시스템해결 수전문가 검토 결과
Aletheia (DeepMind)65개 "출판 가능"
OpenAI 내부 모델5 (검토 후 1개 하향)세부 사항 미공개

격차는 작지만 방향은 분명합니다: 수학 AI가 최고 연구자들과 대화할 수 있는 영역에 진입하고 있습니다.

IMO-ProofBench에서 91.9%

FirstProof 외에도 Aletheia는 국제 수학 올림피아드 문제를 기반으로 한 증명 벤치마크인 IMO-ProofBench에서 91.9%의 정확도를 기록했습니다.

참고로, 일반 대학 수학 전공생의 IMO 문제 통과율은 기본적으로 20% 미만입니다. 최상위 수학 박사 과정 대학원생은 40-60%입니다. IMO 은메달리스트 이상이 되어야 안정적으로 70%를 넘을 수 있습니다.

91.9%는 이미 IMO에 출전할 수 있는 인간 참가자의 대다수를 능가합니다.

솔직히 말하면, 연구팀 스스로도 지나치게 과장하지 않았습니다. 논문에는 직접 인용할 가치가 있는 문장이 있습니다:

"Verifier 메커니즘이 있음에도 불구하고 Aletheia의 오류율은 여전히 인간 전문가보다 높다."

이는 흔치 않은 솔직함입니다: 벤치마크 점수는 훌륭하지만, "수학자를 대체하는" 것과는 아직 거리가 멀다는 것입니다.

그 선은 어디로 움직이고 있는가

몇 년 전, 대규모 언어 모델의 수학 성능은 이랬습니다: 쉬운 문제는 맞추고, 어려운 문제는 틀리며, 증명은 하지 못했습니다.

지금 상황은 이렇습니다: 연구 수준 문제의 60%를 해결할 수 있고, 그 증명의 대부분은 출판 가능한 품질입니다.

이것은 "인간보다 낫다"는 의미가 아니라 "인간 전문가와 문제를 논의할 수 있는 영역에 들어가기 시작했다"는 의미입니다. 수학 커뮤니티의 반응은 AI 커뮤니티보다 더 미묘합니다. 어떤 이들은 이것을 도구로 보는 반면, 다른 이들은 이것이 무엇을 의미하는지 진지하게 고민하기 시작했습니다.

수학의 흥미로운 점은 정확성의 기준이 객관적이라는 것입니다. 증명했거나 증명하지 못했거나 둘 중 하나입니다. 코드의 품질은 논쟁의 여지가 있지만, 수학 증명의 논리적 허점은 기계가 감지할 수 있습니다.

따라서 수학은 "AI가 진정으로 이해하는 것인지, 아니면 단지 통계적 상관관계인지"라는 질문에 가장 먼저 명확한 답이 나올 수 있는 분야 중 하나일 가능성이 높습니다. 이번 Aletheia의 6/10은 그 답을 찾아가는 과정의 한 이정표입니다. 종착점은 아닙니다.

출처: DeepMind's Aletheia Solves 6 Out of 10 Unpublished Research-Level Math Problems (InfoQ, CocoLoop, 2026년 4월 19일)