대형 모델의 다음 경쟁은 파라미터 표가 아니라 문제집에서 시작될 수 있다.
QbitAI는 8월 9일 The Endless Frontier 팀의 BigBang-V1 공개를 보도했다. 이 모델은 Qwen3.6-35B-A3B를 후훈련한 모델로, 총 35B 파라미터, 추론 시 약 3B 활성 파라미터, 기본 262,144 토큰 컨텍스트를 갖는다. 모델, 코드, 기술 보고서는 공개됐다.
문제 생성기가 훈련의 일부가 됐다
모델 카드에 따르면 BigBang은 적대적 자기진화 합성 데이터 프레임워크를 사용한다. Generator agent는 더 어려운 과학·기술 문제를 제안하고 해결한다. Critic agent는 정답성, 난도, 확장성, 다양성을 검사한다.
보고된 규모는 약 10,000개의 고난도 후훈련 예시다. 중요한 점은 양이 아니다. 데이터 파이프라인이 모델의 변화에 따라 분야, 추론 길이, 도구 사용, 필터링 전략을 조정한다.
“AI advancing science, and science advancing AI.”
이 문장이 작동하려면 과제가 검증 가능해야 한다. BigBang은 코드 실행, 수치 계산, 시뮬레이션, 형식 기법, 도메인 도구로 확인할 수 있는 문제에 기대고 있다.
점수는 프로토콜과 함께 읽어야 한다
BigBang-V1은 선택된 35B 모델 중 8개 대표 벤치마크에서 최고 보고 점수를 냈다고 밝힌다. FrontierScience Research, Humanity's Last Exam, PaperBench(Code-Dev), BioMysteryBench-HD에서는 DeepSeek V4 Pro Preview를 넘었다.
구체적으로 BrowseComp 76.5, SWE-Bench Pro 54.2, FrontierScience Research 46.2, PaperBench(Code-Dev) 53.6이다. 다만 비교에는 조건이 붙는다. BrowseComp, xbench, FrontierScience Research, HLE는 저장소의 general-agent runner를 쓰고, SWE-Bench Pro와 SciCode-Verified는 각 공식 harness를 쓴다.
검증 체인이 더 중요하다
GitHub 저장소는 평가 시 오염 방지 정책을 공개한다. Hugging Face 페이지를 검색에서 거르고, 해당 도메인 직접 방문을 막으며, 참조 정답을 에이전트에게 노출하지 않는다. 일반 에이전트 루프는 search, visit, code_exec를 사용하고 한 궤적은 최대 500번의 도구 호출로 제한된다.
다음 검증은 외부 재현이다. 공개 모델을 실제로 돌리고, 262K 컨텍스트 설정을 확인하고, 같은 데이터 생산 아이디어가 연구·코딩·검색 밖에서도 통하는지 봐야 한다. 중국 모델 생태계에는 데이터 생산이 가격과 파라미터 못지않은 기반 능력이 되고 있다는 신호다.
출처: QbitAI, Hugging Face 모델 카드, GitHub 저장소, Endless Frontier 기술 보고서, CocoLoop; BigBang-V1 파라미터 규모, 3B 활성 파라미터, 262K 컨텍스트, 약 10,000개 후훈련 예시, 벤치마크 점수, 평가 harness, 오염 방지 정책을 확인.