Ai2, 연구 리포트용 8B 모델 오픈소스 공개

앨런인공지능연구소(Ai2)는 10월 2일 연구 질문과 검색된 문헌 조각을 인용이 달린 연구 리포트로 작성하는 데 특화된 모델 'AstaBrief 8B'를 오픈소스로 공개했다. 알리바바의 Qwen3-8B를 파인튜닝한 모델로, 가중치와 학습 데이터는 모두 Hugging Face에 올라와 있다. Ai2는 GitHub에도 자체 PDF를 활용해 리포트 생성 파이프라인을 변형하는 예시를 함께 제공했다.

AstaBrief는 현재 Ai2의 연구 에이전트 플랫폼 Asta의 'Fast 모드' 기반 모델로 쓰이고 있다. 기존 Thinking 모드는 Claude 기반으로 리포트 한 건당 평균 178.5초가 걸렸는데, AstaBrief로 바꾼 뒤 평균 51.1초로 줄어 약 3.5배 빨라졌다. Ai2는 블로그에서 이런 동기를 다음과 같이 설명했다.

"We wanted to help scientists generate cited reports faster, with a model they could download and run themselves."

(연구자들이 직접 다운로드해 실행할 수 있는 모델로 인용이 달린 리포트를 더 빠르게 만들 수 있도록 돕고 싶었다는 설명이다.)

강화학습은 건너뛰고, 데이터 작업은 두 단계로만

학습은 두 단계로 진행됐다. 지도 파인튜닝(SFT) 단계에서는 Asta의 실제 사용자 질문 중 9만 건을 추려 Claude 3.5/3.7 Sonnet, o3, o4-mini, GPT-4.1로 목표 답안을 생성했고, 최종적으로 쓸 수 있는 샘플은 약 4만 7000건이었다. 선호 최적화(DPO) 단계에서는 다른 질문 세트를 사용했다. 한쪽은 Claude 기반 ScholarQA 파이프라인이 작성한 리포트, 다른 쪽은 o3, o4-mini, DeepSeek-V3 또는 DeepSeek-R1이 작성한 버전이었고, GPT-4.1과 DeepSeek-R1 두 심판 모델이 비교해 두 심판의 의견이 일치한 경우만 남겨 최종적으로 약 6000건이 됐다. Ai2에 따르면 두 심판 모델은 사람의 판단과 95%의 비율로 일치했다.

팀은 불안정하고 비용이 많이 든다는 이유로 강화학습을 쓰지 않았다. 파이프라인도 단순화해, 절 단위로 생성하지 않고 리포트 전체를 한 번에 작성하도록 해 연산 비용이 큰 조각 요약과 클러스터링 단계를 없앴다.

여러 데이터 필터링 방법 중 가장 효과가 뚜렷했던 것은 단순한 방법이었다. 인용 밀도가 낮은 합성 샘플을 걸러내는 것이다. Ai2는 '출력에 근거가 있는가'라는 직접적인 신호가 복잡하게 설계된 필터링보다 더 효과적이라고 정리했다.

폐쇄형 파이프라인과 비교

주요 평가에는 컴퓨터공학 문제 200개로 구성된 SQABench-CS2를 사용했으며, 내용 커버리지, 단락 관련성, 인용이 주장을 뒷받침하는지, 모든 주장에 인용이 달려 있는지 네 가지를 살폈다. 대형 모델을 심판으로 쓴 비교에서는 AstaBrief가 Claude 기반 파이프라인, 그리고 Ai2가 앞서 공개한 연구 모델 DR Tulu와 우열을 주고받았다. 사람이 직접 평가한 규모는 작아서, 연구자 3명이 각각 14~15개 문제를 검토했고, 그중 2명이 AstaBrief의 인용 정확도를 1위로 꼽았다. 또 다른 기준인 DeepScholarBench는 최근 arXiv 논문에서 가져온 63개 문제로 구성됐다.

실사용 데이터는 Asta 사용자 374명에게서 나왔다. 29.1%가 이틀 이상 Fast 모드를 사용했고, 1인당 평균 3.67건의 리포트 대화를 생성했다. 23%는 이후 Fast 모드만 사용했고, 18%는 두 모드를 번갈아 사용했다.

비슷한 도구 중 OpenAI와 구글의 딥리서치 기능은 모두 폐쇄형 대형 모델 위에서 동작해, 사용자가 가중치를 받을 수 없고 파이프라인을 자신의 문헌 라이브러리에 접목할 수도 없다. AstaBrief의 선택은 모델 규모를 8B까지 줄이는 대신 다운로드와 변형이 가능하게 만드는 것이었다. 대략 계산하면 반정밀도 가중치는 약 16GB로, 24GB급 VRAM을 가진 GPU 한 장으로도 로드할 수 있어 대학 연구실이 도입하는 데 필요한 진입 장벽이 꽤 낮아졌다. 기반 모델은 Qwen3이지만 학습에 쓰인 질문은 주로 영어 컴퓨터공학 분야였고, 중국어 문헌을 다룰 때의 성능에 대해서는 Ai2가 데이터를 제시하지 않았다.

평가는 2025년에 멈춰 있다

Ai2는 스스로 한계를 밝혔다. 이 평가들은 2025년에 이뤄졌고 당시의 최전선 모델과 비교한 것으로, 오늘날의 모델로 다시 돌린 것은 아니다. 따라서 'Claude 파이프라인과 맞먹는다'는 결과는 Claude 3.7 세대를 상대로 한 것이며, Anthropic은 이미 Opus 5.5까지 내놓았다.

Ai2는 인용 지표가 잡아내지 못하는 문제도 지적했다. 모델이 올바른 문헌을 인용하더라도 내용을 원문보다 과장되게 말할 수 있다는 것이다. 예를 들어 특정 샘플에서 나온 발견을 일반적인 법칙처럼 쓰거나, 서술적인 결과를 실행 권고로 바꿔 쓰는 식이다. 기존 네 가지 지표로는 이런 왜곡을 측정할 수 없어서, Ai2는 다음 단계로 모델이 원래 주장의 범위와 근거의 강도를 지키는지를 전문적으로 검증할 계획이라고 밝혔다.

참고 출처: Ai2 공식 블로그, CocoLoop; 생성 시간, 학습 샘플 규모, 사용 비율은 Ai2가 공개한 수치를 기준으로 하며, VRAM 요구 사항은 편집부의 추정치다.