Poolside, 118B 오픈 코딩 모델 공개

Poolside는 이번에 1조 파라미터 모델을 내세우지 않았다. 대신 Laguna S 2.1을 총 118B 파라미터, 활성 8B 파라미터의 MoE 코드 모델로 공개했다. 가중치는 Hugging Face에 올라갔고, 회사는 단일 NVIDIA DGX Spark에서도 실행할 수 있다고 설명한다.

핵심은 서구 기업이 자체 호스팅 가능한 오픈 웨이트 코드 모델을 내놓았다는 점이다. 다만 Poolside는 GPT나 Claude를 이겼다고 주장하지 않는다. 공식 수치에서 Laguna S 2.1은 Terminal-Bench 2.1 70.2%를 기록해 폐쇄형 최전선 모델과는 아직 차이가 있다. Poolside가 노리는 지점은 데이터가 사내 장비에 남는다면 기업이 그 격차를 감수할 수 있다는 판단이다.

배포 가능한 크기로 먼저 맞췄다

공식 블로그에 따르면 Laguna S 2.1은 최대 100만 토큰 컨텍스트를 지원하는 Mixture-of-Experts 모델이며, 훈련 시작부터 공개까지 9주가 걸리지 않았다.

모델의 주 용도는 에이전트형 코딩이다. Poolside가 제시한 결과는 Terminal-Bench 2.1 70.2%, SWE-Bench Multilingual 78.5%, 공개 SWE-Bench Pro 59.4%, DeepSWE 40.4%다. The Next Web도 Terminal-Bench와 SWE-Bench Pro에서 여러 대형 오픈 모델에 근접하거나 앞서지만, 폐쇄형 모델은 여전히 약 10~15포인트 앞선다고 정리했다.

이 숫자를 하나의 순위표처럼 읽기는 어렵다. 70.2%는 Poolside 자체 agent harness의 Terminal-Bench 2.1 결과이고, DeepSWE 40.4%는 thinking mode 기준이다. 같은 벤치마크에서 no-thinking은 16.5%에 그친다. Poolside도 일부 비교가 업체 보고치, 리더보드, 제3자 최고값을 섞는다고 밝혀, 정확한 횡비교보다 위치를 보는 데 적합하다.

인용문이 말하는 것은 작업 습관이다

Poolside는 이번 업그레이드를 단순한 파라미터 증가로 설명하지 않았다. 더 많이 검증하고, 당연하게 넘기지 않으며, 너무 일찍 완료를 선언하지 않고, 더 끈질기게 작업하도록 행동을 개선했다고 강조했다.

"What we've done in this model is not necessarily add more intelligence, but improve the behaviors that lead to a more capable model: more verification, less taking things for granted, not declaring victory early, and being more persistent."

응용연구 공동책임자 Pengming Wang의 말은 결국 코딩 에이전트의 실무 태도에 관한 설명이다. 덜 추정하고, 더 확인하고, 테스트가 끝나기 전에 멈추지 않는다는 것이다.

공개 사례도 이 방향과 맞다. Poolside는 Laguna S 2.1이 50분, 181단계 세션에서 빈 폴더로부터 간단한 HTML/CSS 렌더링 엔진을 만들었다고 밝혔다. 또 다른 내부 harness 최적화 작업에서는 속도를 5.2% 높이고 메모리 할당을 약 70% 줄였다고 한다. 실제 고객 환경을 대표한다고 보기는 어렵지만, 회사가 긴 엔지니어링 작업과 자기 검증 능력을 팔고 있다는 점은 분명하다.

오픈 웨이트의 빈틈

지난 1년간 오픈 웨이트 코드 모델의 주목도는 Kimi K3, Qwen, DeepSeek, MiniMax 등 중국 팀이 많이 끌어왔다. 서구 기업은 폐쇄형 API 판매에 집중하거나, 공개 모델의 크기와 코딩 성능에서 강한 인상을 남기지 못하는 경우가 많았다.

Laguna S 2.1의 118B-A8B 규모는 절충점에 가깝다. 30B급보다 긴 작업을 버티기 쉽고, 1조 파라미터 모델보다는 도입 부담이 낮다. Hugging Face 모델 카드는 NVFP4 버전이 OpenMDW-1.1 라이선스를 쓴다고 확인한다. vLLM Recipes는 BF16 가중치가 약 235GB라며, 단일 GPU보다는 양자화 버전과 다중 GPU 노드가 현실적이라고 안내한다.

규제 산업에서는 이 차이가 실질적이다. 코드, 취약점, 고객 데이터, 내부 시스템 로그를 해외 폐쇄형 API로 보낼 수 없는 경우가 있다. 로컬 실행, 감사 가능한 가중치와 라이선스, vLLM/SGLang/Ollama/OpenRouter/Vercel AI Gateway 연동은 벤치마크 몇 점보다 구매 검토표에 올리기 쉽다.

대가도 제한 사항에 적혀 있다

Poolside는 단점도 공개했다. 제3자 agent harness에서는 자사 도구 형식을 과하게 기억해 비슷하지만 다른 schema를 오용할 수 있다. 중첩 도구 호출에서는 이스케이프가 잘못된 JSON이 나올 수 있고, thinking mode는 특히 경시 수학 문제에서 지나치게 오래 생각할 때가 있다.

세 제한은 같은 위험을 가리킨다. 코딩 에이전트의 실패는 코드를 못 짜서만 생기지 않는다. 도구 프로토콜, 컨텍스트 예산, 멈출 시점이 더 큰 문제가 될 수 있다. CI, 저장소, 티켓, 권한 시스템에 연결한 뒤에는 잘못된 도구 호출 한 번이 오답 하나보다 더 비싸다.

비용 기준도 제시됐다. OpenRouter 무료 엔드포인트는 256K 컨텍스트를 제공하고, 전용 유료 엔드포인트는 전체 100만 컨텍스트를 제공한다. 가격은 100만 토큰당 입력 0.10달러, 출력 0.20달러, 캐시 읽기 0.01달러다. 폐쇄형 프런티어 모델보다 훨씬 싸지만, 장시간 에이전트 세션은 출력 토큰이 수십만 단위로 커질 수 있어 작업 시간이 비용을 다시 키운다.

검증은 실제 저장소에서 일어난다

Laguna S 2.1의 산업적 위치는 뚜렷하다. 폐쇄형 종합 순위 1위를 겨냥하기보다, 서구 기업에 다운로드 가능하고 자체 호스팅 가능하며 기존 추론 스택에 붙일 수 있는 코딩 에이전트 기반을 제공한다.

앞으로 볼 지표도 구체적이다. Hugging Face 다운로드와 커뮤니티 재현이 이어지는지, vLLM·Ollama·SGLang 경로가 실제 저장소에서 안정적인지, 다음 세대의 더 큰 Laguna 모델이 Terminal-Bench 격차를 줄일 수 있는지, OpenMDW 라이선스가 상업 컴플라이언스 검토에서 충분히 다루기 쉬운지가 관건이다.

이 조건이 맞으면 Laguna S 2.1의 가치는 ‘서구판 DeepSeek’이라는 구호가 아니다. 코드는 내부에 남고, 모델은 긴 저장소 작업을 수행하며, 비용은 계산 가능하고, 성능 격차는 실제 프로젝트로 시험할 만큼 좁아졌다는 조달 부서가 이해하기 쉬운 답이다.

출처: Poolside 공식 블로그, Hugging Face 모델 카드, vLLM Recipes, CocoLoop, The Next Web. 모델 파라미터, 활성 파라미터, 컨텍스트 창, 벤치마크 기준, 훈련 하드웨어, 라이선스, 추론 배포, 공개 제한 사항을 확인했다.