위챗 멀티모달 임베딩 모델, MMEB-v2 1위
텐센트 위챗팀이 오픈소스 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했다. 2B 모델이 MMEB-v2에서 1위를 차지했다.
멀티모달 AI 관련 제품 동향과 산업 분석 12건을 모았습니다.
텐센트 위챗팀이 오픈소스 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했다. 2B 모델이 MMEB-v2에서 1위를 차지했다.
딥시크의 신모델 deepseek-v4-flash-vision-exp는 이미지 1장을 최대 384토큰으로 환산하고 별도 비전 요금 없이 GUI 에이전트의 스크린샷 비용에 상한선을 그었다.
센스타임이 U1.5를 정식 공개했다. 네이티브 4K 생성과 정밀 편집을 통합했지만, 파라미터 수치는 이름·README·모델 카드마다 세 가지로 다르게 표기됐다.
ByteDance SeedRealtime이 더우바오 앱의 통화入口에 들어가며 영상·음성 전이중 AI를 소비자 제품으로 내놨다.
Thinking Machines가 Inkling-Small 오픈 웨이트를 공개했다. 276B 총 파라미터, 12B 활성 파라미터 모델이 여러 추론·코딩 지표에서 975B Inkling에 근접했다.
MiniMax H3는 2K 15초 영상, 네이티브 스테레오, 초당 0.8위안 가격과 오픈 웨이트 계획을 함께 내세웠다.
ByteDance, Seedream 5.0 Pro로 디자인 워크플로 공략를 한국 기술 독자가 읽기 쉬운 흐름으로 다시 정리하고 핵심 수치와 검증 지점을 유지했다.
Qwen3.7-Max의 멀티모달 버전은 이미지와 비디오를 읽지만 Alibaba는 자율 반복, 도구 사용, 자기 테스트를 강조한다.
Alibaba가 6월 2일 Qwen3.7-Plus를 공개하며 멀티모달 입력, 도구 호출, 코드 작성, 자동 테스트를 핵심으로 내세웠다.
알리바바 Qwen 팀이 텍스트, 이미지, 오디오, 비디오를 단일 아키텍처로 처리하는 최초의 진정한 전모달 모델 Qwen3.5-Omni를 출시했다. 실시간 음성 복제와 오디오-비디오 바이브 코딩 기능을 갖췄다.
알리바바의 Qwen3.5 오픈웨이트 모델이 201개 언어 및 방언을 지원하고 네이티브 멀티모달 처리를 도입했으며, 챗봇에서 AI 에이전트로의 업계 전환을 시사한다.
Moonshot AI가 출시한 Kimi K2.5는 네이티브 멀티모달 이해와 복잡한 작업을 여러 에이전트에 병렬 실행시키는 Agent Swarm 기능을 추가해 속도를 대폭 향상시켰다.