메타, 뮤즈 스파크 공동 수학 논문 6편 공개

메타는 10월 2일 연구 블로그에서 수학 논문 6편을 공개했다. 모두 수학자와 뮤즈 스파크 1.1, 1.2의 사고 모드가 협업해 완성한 것으로, 이 중 5편은 이전에 공개적으로 제기됐지만 아직 답이 없던 문제를 풀었다.

블로그는 모델의 역할을 비교적 조심스럽게 설명했다. 원문은 다음과 같다.

Proof strategies were developed and revised with help from Muse Spark

6편이 각각 풀어낸 것

6편의 논문은 확률론, 미분방정식, 군론, 최적화, 산술물리학, 비결합대수까지 서로 다른 여섯 분야에 걸쳐 있다.

분야논문내용
확률론가우스 타원체 피팅의 엄밀한 임계값고차원 가우스 점을 타원체로 피팅할 수 있는 정확한 임계값을 제시
미분방정식방사형 음에너지 해의 유한시간 폭발질량 임계 이중조화 비선형 슈뢰딩거 방정식의 해가 유한 시간 내에 폭발함을 증명
군론반아벨군이 반드시 단항군은 아님384차 군을 이용해 M. 키다(M. Kida)가 2024년 제기한 추측을 반증
최적화환 기반 완화가 타이트함델 피아(Del Pia)와 카자비라드(Khajavirad)가 올해 제기한 문제에 답함
산술물리학현의 2점 함수가 곡선 위의 높이 함수와 같음p진 현이론과 수론을 연결해 마닌(Manin)이 1980년대에 제시한 구상을 발전시킴
비결합대수가해 진화 대수3차원 예시로 가르시아마르티네스(García-Martínez)와 페레스로드리게스(Pérez-Rodríguez)의 분류 추측을 반증

논문에 이름을 올린 수학자로는 아이쿠트 아르슬란(Aykut Arslan, 2편), 레너드 딘(Leonard Dinh), 조셉 필립 브레넌(Joseph Phillip Brennan)과 밀라나 골리치(Milana Golich), 안드레스 바레이(Andres Barei)가 있다. 산술물리학 논문은 아닌디아 데이(Anindya Dey) 등 5인으로 구성된 팀이 완성했다.

프로세스는 어떻게 정했나

메타는 네 가지 방식을 제시했다. 수학자 팀이 연구 방향을 주도하고, 별도의 수학자 그룹이 독립적으로 심사하며, 논문에서는 각 단락을 연구자와 AI 중 누가 작성했는지 표시하고, 선행 연구는 모두 명시한다는 것이다.

마지막 방식은 확률론 논문에서 실제로 적용됐다. 가우스 타원체 피팅 임계값 문제는 올해 8월 세 팀이 거의 동시에 독립적으로 풀었고, 메타의 논문도 이 동시기 연구를 인정했다. 이는 당시 이 문제가 이미 인간 수학자의 사정권 안에 있었다는 뜻으로, 모델의 기여는 새로운 길을 연 것보다는 '가속'에 가까웠다고 볼 수 있다.

블로그는 이런 작업의 취지도 밝혔다. "Our goal here wasn't to mass-produce papers, but to empower researchers"(논문을 대량 생산하는 것이 아니라 연구자에게 힘을 더해주는 것이 목표라는 뜻이다).

같은 주 구글 논문과 나란히 보면

같은 주 구글 리서치는 여러 에이전트가 협업해 수학적 증명을 탐색하는 '코젠틱(Cogentic)'을 공개했다. 두 회사를 나란히 놓고 보면 접근 방식의 차이가 뚜렷하게 드러난다.

구글 쪽 문제는 온라인 학습, 경매 이론, 메커니즘 설계에 집중돼 있다. 다섯 문제 중 대부분에서 제미나이(Gemini)를 약 100번 호출했고, 가장 어려운 문제는 약 1000번까지 호출했다. 단일 가산적 구매자 수익의 근사비는 5.2에서 3.52로 줄었고, 각 증명은 해당 분야 전문가가 검증했다. 구글이 강조하는 것은 시스템, 즉 여러 에이전트가 어떻게 역할을 나누고 서로 검증하는가다.

반면 메타 쪽 문제는 서로 무관한 여섯 분야에 흩어져 있다. 호출 횟수는 공개하지 않았고 에이전트 구조에 대한 설명도 없다. 메타가 강조하는 것은 사람, 즉 누가 주도하고 누가 심사하고 어느 단락을 누가 썼는가다. 두 서사는 각기 다른 검증 방식과 맞닿아 있다. 구글 쪽은 호출량으로 비용을 추산할 수 있고, 메타 쪽은 서명으로 책임을 추적할 수 있다.

두 자료 모두 공통적으로 빠진 것이 있다. 실패 사례다. 모델이 시도했지만 끝내 풀지 못한 문제가 얼마나 되는지 양측 모두 언급하지 않았다. 이 분모가 빠진 상태에서는 성공한 5편의 논문이 보여줄 수 있는 범위가 제한적이고, 외부에서 뮤즈 스파크의 실제 수학 성공률을 판단하기도 어렵다.

참고 출처: 메타 AI 리서치 블로그, 구글 리서치 블로그, CocoLoop; 6편의 논문 제목, 저자, 반례 규모, 모델 버전은 메타 블로그 게시물로 확인했다.