3월 30일, 알리바바 Qwen 팀이 Qwen3.5-Omni를 공개했다. 이는 텍스트, 이미지, 오디오, 비디오를 모두 단일 모델 내에서 처리하는 최초의 진정한 전모달 모델로, 여러 전문 모델을 조합한 방식이 아니다.
하나의 모델, 네 가지 모달리티
기존 시장의 대부분 멀티모달 시스템은 '분업' 방식에 의존해 왔다. 시각용 모델 하나, 청각용 모델 하나, 그리고 마지막으로 텍스트 모델이 출력을 통합하는 식이다. Qwen3.5-Omni는 Thinker-Talker 이중 아키텍처와 하이브리드 어텐션 MoE(총 파라미터 30B, 매 단계 3B 활성화)를 사용해 모든 모달리티가 동일한 파라미터 세트 내에서 작동한다는 점에서 다르다.
이를 통해 이전에는 불가능했던 기능이 구현된다:
- 오디오-비디오 통합 이해: 동영상 시청 후 영상 콘텐츠와 대화 음성을 함께 결합해 답변한다. 음성을 먼저 텍스트로 변환한 후 동영상을 분석할 필요가 없다.
- 실시간 음성 복제: 음성 샘플을 업로드하면 모델이 해당 음성을 복제해 출력한다(현재 API로만 이용 가능).
- 오디오-비디오 바이브 코딩: 화면 녹화로 설명하면 Qwen3.5-Omni가 직접 해당 코드를 생성한다. 타이핑이 필요 없다.
사양 개요
| 사양 | 수치 |
|---|---|
| 총 파라미터 수 | 30B MoE |
| 매 단계 활성화 파라미터 | 3B |
| 컨텍스트 윈도우 | 256K 토큰 |
| 최대 오디오 처리 시간 | 10시간 이상 |
| 최대 비디오 처리량 | 400초 720p @1FPS |
| 음성 인식 언어 수 | 113개 |
| 음성 출력 언어 수 | 36개 |
세 가지 버전: Plus(복잡한 작업용 플래그십), Flash(속도와 성능의 균형), Light(경량·고속).
벤치마크 성능
215개 테스트 데이터셋과 벤치마크에서 SOTA를 달성했으며, 오디오 부문에서는 Gemini 3.1 Pro를 직접 능가했다:
- MMAU 오디오 종합 이해: 82.2 vs Gemini 3.1 Pro의 81.1
- 음악 이해 RUL-MuchoMusic: 72.4 vs 59.6, 큰 격차
- 다국어 음성 복제 안정성: ElevenLabs, GPT-Audio, Minimax를 상회
실시간 대화 지연 시간은 234밀리초로 줄였으며, ARIA 기술(Adaptive Rate Interleave Alignment)을 사용해 음성 리듬을 동적으로 조정하여 기계적인 낭독이 아닌 자연스러운 출력을 구현했다.
일반 능력도 후퇴하지 않았다. MMMU 시각 이해 82.0%, HumanEval 코드 92.6%, LibriSpeech 음성 인식 단어 오류율 1.7%로 모두 최상위권이다.
음성 AI 구도가 변화하고 있다
ElevenLabs는 오랫동안 음성 복제 분야의 벤치마크였지만, Qwen3.5-Omni는 다국어 음성 안정성에서 이를 능가했다. 더 중요한 점은 음성 복제를 종합 멀티모달 모델의 내장 기능으로 구현했다는 것이지, 독립된 수직 제품이 아니라는 점이다.
물론 음성 복제는 현재 API로만 제공되며 제품 인터페이스에는 아직 반영되지 않았다. 상업화 속도가 따라잡힌 후에야 널리 공개될 것으로 보인다.
모델의 학습 데이터는 1억 시간 이상의 오디오 및 비디오 콘텐츠를 사용했으며, 진정한 교차 모달 이해를 지원하려면 이 정도 규모가 필요하다.
오디오-비디오 바이브 코딩 기능은 흥미로운 방향이다. 기존 바이브 코딩은 자연어로 요구사항을 기술하는 방식이었지만, 이제는 화면 녹화로 직접 설명하면 모델이 동영상을 보고 코드를 작성한다. 이 접근 방식이 실용화된다면 완전히 새로운 프로그래밍 상호작용 패러다임이 될 수 있다.
출처: Qwen 3.5 Omni: Alibaba's AI Model Can Now Hear, Watch, and Clone Your Voice (Decrypt); Qwen3.5-Omni: 10-Hour Audio, 4M Frame Video, SOTA in 215 Benchmarks (StableLearn); CocoLoop; Alibaba Qwen Team Releases Qwen3.5 Omni (MarkTechPost)