WeChat abre código de modelo de embedding multimodal e lidera o MMEB-v2
A equipe de Visão do WeChat, da Tencent, lançou o WeMM-Embedding: a versão de 2B supera o Qwen3-VL-Embedding-8B, quatro vezes maior, no ranking MMEB-v2.
12 artigos verificados sobre IA multimodal, produtos e movimentos do setor.
A equipe de Visão do WeChat, da Tencent, lançou o WeMM-Embedding: a versão de 2B supera o Qwen3-VL-Embedding-8B, quatro vezes maior, no ranking MMEB-v2.
DeepSeek lança o deepseek-v4-flash-vision-exp, primeiro modelo V4 com visão, limitado a 384 tokens por imagem, mantendo os preços do V4-Flash.
A SenseTime lançou o SenseNova-U1.5-8B-MoT sob licença Apache 2.0, com geração nativa em 4K e edição de imagem e controle preciso unificados em um único modelo.
O SeedRealtime da ByteDance chegou ao fluxo de chamadas do Doubao, levando IA audiovisual full-duplex a um app de consumo.
A Thinking Machines lançou o Inkling-Small com pesos abertos, 276B parâmetros totais, 12B ativos, entrada multimodal e resultados próximos ao Inkling de 975B.
O MiniMax H3 combina vídeo 2K de 15 segundos, estéreo nativo, preço de RMB 0,8 por segundo e promessa de pesos abertos.
ByteDance mira fluxos de design com Seedream 5.0 Pro e reescrito para leitores de tecnologia em portugues, preservando numeros, promessas de produto e pontos de verificacao.
A versão multimodal do Qwen3.7-Max lê imagens e vídeo, mas a Alibaba destaca iteração autônoma, ferramentas e autotestes.
A Alibaba lançou o Qwen3.7-Plus em 2 de junho, com foco em entrada multimodal, uso de ferramentas, escrita de código e testes autônomos.
A equipe Qwen da Alibaba lançou o Qwen3.5-Omni, seu primeiro modelo verdadeiramente multimodal que processa texto, imagens, áudio e vídeo em uma única arquitetura, com clonagem de voz em tempo real.
Alibaba lança Qwen3.5 com 397 bilhões de parâmetros, expandindo o suporte a idiomas de 82 para 201, integrando multimodalidade nativa e marcando a transição de chatbot para Agente de IA.
A Moonshot AI lançou o Kimi K2.5, que adiciona multimodalidade nativa e a funcionalidade Agent Swarm ao K2, permitindo dividir tarefas complexas em múltiplas subtarefas executadas em paralelo por agentes independentes.