MS Decision-1의 기반은 Qwen 9B

마이크로소프트는 10월 9일 자사 기술 매체 Command Line에 Microsoft-Decision-1을 공개했다. 라우팅, 분류, 순위 매기기, 검증, 워크플로 제어 등 '선택'만 전담하는 모델이다. 글은 마이크로소프트 CTO실 소프트웨어 엔지니어링 담당 부사장 Achint Srivastava가 썼다. 모델은 Microsoft Foundry에 올라와 있고 OpenRouter에도 연동됐다.

출력 범위는 일부러 좁게 잡았다. 호출하는 쪽이 고정된 선택지를 주면 모델이 각 선택지에 보정된 확률을 돌려주고, 소프트웨어는 그 결과를 곧바로 실행한다. 예/아니오, 객관식, 점수 매기기, 평가 기준(루브릭)에 따른 채점을 지원한다. 긴 글 작성이나 복잡한 추론은 이 모델의 역할이 아니다.

마이크로소프트가 밝힌 성적

마이크로소프트에 따르면 Decision-1은 36개 벤치마크, 약 15만 문항을 비교한 결과 정확도가 가장 높았고, P50 지연 시간은 GPT-6 Sol의 약 35분의 1이다. 글에는 예시도 있다. 의사결정 20개가 이어진 흐름에서 결정마다 100밀리초가 더 걸리면 전체 체인이 2초 느려진다.

안정성 면에서는 같은 요청에 8가지 교란을 가했을 때 결정이 뒤집힌 비율이 평균 1.3%였다. 선택지를 다르게 표현하거나 뒤집거나 순서만 섞은 경우에는 뒤집힘 비율이 0이었다. 마이크로소프트가 이 테스트에 내세운 원칙은 다음과 같다.

"Equivalent inputs should produce equivalent decisions."(동등한 입력은 동등한 결정을 내려야 한다.)

안전성 테스트는 11개 벤치마크, 5250건의 요청을 다뤘고 유해 콘텐츠, 탈옥, 프롬프트 인젝션 등이 포함됐다. 다만 글에는 거부율이 나와 있지 않다.

내부 시험에서 나온 수치도 몇 가지 있다. Xbox 연구팀은 1만 건이 넘는 사용자 피드백 처리에 이 모델을 썼고, 품질은 GPT-6 Sol과 비슷하면서 속도는 14배 이상 빠르고 비용은 200배 이상 낮았다고 한다. Copilot 팀은 품질이 GPT-5.6 Luna와 비슷하고 속도는 100배 빠르다고 측정했다. 모두 마이크로소프트의 자체 테스트 결과다. 36개 벤치마크의 이름이나 구체적인 정확도는 글에 나와 있지 않고, 아직 제3자가 재현한 사례도 없다. 2위 모델이 무엇이고 얼마나 느린지에 대해서는 마이크로소프트 원문과 중국어 소개 기사의 설명이 서로 맞지 않아, 공식 후속 업데이트를 기다려야 한다.

가격은 사용 방식에 맞췄다

가격은 입력 100만 토큰당 0.042달러, 출력은 무료로, IT Home의 환산으로는 약 0.28위안이다. 결정형 호출은 출력이 몇 토큰에 불과한 경우가 많아 비용 대부분이 입력 컨텍스트에서 나가므로, 이 요금 체계는 실제 사용 방식과 맞아떨어진다.

이런 모델은 애플리케이션에서 보통 대형 모델 앞단에 놓인다. 요청을 어느 모델이나 어느 흐름으로 넘길지 판단하거나, 에이전트의 특정 단계 결과물이 합격선인지 가려서 다음 동작을 정한다. 이런 판단은 원래 범용 대형 모델이 겸해서 처리하던 일인데, 작고 빠른 전용 모델로 바꾸면 지연 시간과 호출 비용을 아낄 수 있다.

기반은 Qwen

글에서 무게가 실린 한 문장이 있다. Decision-1은 알리바바가 오픈소스로 공개한 Qwen3.5-9B를 후속 학습한 모델이라는 것이다. 마이크로소프트는 앞으로 같은 방법을 다른 기반 모델로도 옮기겠다며 Microsoft AI(MAI)의 자체 모델과 OpenAI의 모델을 꼽았다.

중국 개발자에게 이 소식은 세 가지로 읽힌다. 첫째, Qwen의 오픈 웨이트가 마이크로소프트의 정식 제품에 들어갔고, 마이크로소프트가 발표문에 출처를 명시했다. 둘째, 비슷한 것을 만들려는 팀에게는 경로가 거의 드러났다. 9B급 오픈소스 모델을 구해 '고정 선택지와 보정된 확률'을 중심으로 후속 학습하면 한 번의 순전파로 결과가 나온다. 셋째, Decision-1 자체는 가중치가 공개되지 않아 중국에서는 Foundry나 OpenRouter의 API로만 쓸 수 있다. 반면 기반인 Qwen3.5-9B는 직접 내려받을 수 있다.

마이크로소프트는 올해 MAI 자체 모델을 여러 개 잇달아 내놓았다. Decision-1은 외부 오픈소스 기반에서 출발했으며, MAI 기반으로 바꾼 뒤에도 성적이 유지될지는 다음 버전에서 공개될 수치에 달렸다.

참고 출처: 마이크로소프트 Command Line 발표문, CocoLoop, IT Home. 벤치마크 수, 지연 시간 배수, 100만 토큰당 가격은 마이크로소프트 자체 측정 기준으로 확인.