Poolside가 내놓은 것은 조 단위 파라미터 모델이 아니다. Laguna S 2.1은 118B 전체 / 8B 활성 MoE 코드 모델이며, 가중치는 Hugging Face에 공개됐고 단일 NVIDIA DGX Spark에서도 운용할 수 있다고 설명된다.
핵심은 최강 주장보다 배포 방식이다. 서구 기업이 자체 호스팅 가능한 오픈 웨이트 코딩 모델을 내놓았지만, Terminal-Bench 2.1 점수는 70.2%로 폐쇄형 선두권과 격차가 있다. Poolside는 기업이 데이터를 내부에 두기 위해 그 격차를 감수할지에 베팅한다.
배포 가능한 크기
공식 블로그에 따르면 Laguna S 2.1은 최대 1M 토큰 컨텍스트를 지원하고, 훈련 시작부터 출시까지 9주가 걸리지 않았다. 주요 점수는 Terminal-Bench 2.1 70.2%, SWE-Bench Multilingual 78.5%, SWE-Bench Pro 공개 데이터 59.4%, DeepSWE 40.4%다.
다만 지표는 조심해서 읽어야 한다. 70.2%는 Poolside의 자체 agent harness 결과이고, DeepSWE 40.4%는 thinking mode 결과다. 일부 비교값은 벤더 보고나 리더보드 최고값을 함께 쓴다.
인용문은 작업 습관을 말한다
What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent.
Pengming Wang의 말은 지능을 단순히 더한 것이 아니라 검증, 끈기, 조기 종료 방지를 강화했다는 뜻이다.
Poolside는 50분 181단계 동안 HTML/CSS 렌더링 엔진을 만든 사례와 내부 harness 속도를 5.2% 높이고 메모리 할당을 약 70% 줄인 사례를 제시했다.
오픈 웨이트 공백
최근 오픈 웨이트 코드 모델의 주도권은 Kimi, Qwen, DeepSeek, MiniMax 같은 중국 팀에 있었다. Laguna S 2.1은 30B급보다 장기 작업에 유리하고, 조 단위 모델보다 운용하기 쉬운 중간 지대를 노린다.
Hugging Face 모델 카드는 NVFP4 변형의 OpenMDW-1.1 라이선스를 확인한다. vLLM Recipes는 BF16 가중치가 약 235GB라며, 실제 운용에서는 양자화 체크포인트가 현실적이라고 설명한다.
제한도 봐야 한다
Poolside는 제약을 공개했다. 타사 harness에서 자체 도구 형식에 과적합될 수 있고, 중첩 tool call에서 JSON이 깨질 수 있으며, thinking mode가 예상보다 오래 이어질 수 있다.
OpenRouter는 256K 무료 엔드포인트와 1M 컨텍스트 전용 엔드포인트를 제공한다. 가격은 100만 토큰당 입력 0.10달러, 출력 0.20달러, cache read 0.01달러다. 싸 보이지만 장기 agent 작업은 한 번에 많은 출력 토큰을 쓴다.
검증은 저장소에서 일어난다
다음 확인 지점은 Hugging Face 재현, vLLM/Ollama/SGLang 안정성, 실제 저장소 작업, 차기 Laguna가 Terminal-Bench 격차를 줄이는지다.
Laguna S 2.1은 폐쇄형 최상위 모델을 꺾는 선언이 아니다. 코드를 내부에 남기고, 긴 코딩 작업을 돌리며, 라이선스와 비용을 계산할 수 있게 하는 현실적인 선택지다.
출처: Poolside 공식 블로그, Hugging Face 모델 카드, vLLM Recipes, CocoLoop, The Next Web. 모델 크기, 활성 파라미터, 컨텍스트 창, 벤치마크 범위, 훈련 하드웨어, 라이선스, 배포 경로와 공개 제한을 확인.