WeChat libera modelo de embedding multimodal y lidera el MMEB-v2
El equipo de Visión de WeChat, de Tencent, presentó WeMM-Embedding: la versión de 2B supera al Qwen3-VL-Embedding-8B, cuatro veces más grande, en el ranking MMEB-v2.
12 artículos verificados sobre IA multimodal, productos y movimientos del sector.
El equipo de Visión de WeChat, de Tencent, presentó WeMM-Embedding: la versión de 2B supera al Qwen3-VL-Embedding-8B, cuatro veces más grande, en el ranking MMEB-v2.
DeepSeek lanza deepseek-v4-flash-vision-exp, primer modelo V4 con visión, con tope de 384 tokens por imagen y los mismos precios de V4-Flash.
SenseTime lanzó SenseNova-U1.5-8B-MoT bajo licencia Apache 2.0, con generación nativa en 4K y edición de imagen junto con control preciso integrados en un solo modelo.
SeedRealtime de ByteDance ya está en la función de llamada de Doubao, llevando IA audiovisual full-duplex a una app de consumo.
Thinking Machines publicó Inkling-Small con pesos abiertos, 276B parámetros totales, 12B activos, entrada multimodal y resultados cercanos al Inkling de 975B.
MiniMax H3 combina video 2K de 15 segundos, estéreo nativo, precio de 0,8 yuanes por segundo y promesa de pesos abiertos.
ByteDance apunta a flujos de diseno con Seedream 5.0 Pro se reescribe para lectores tecnologicos en espanol, conservando cifras clave, limites del producto y preguntas abiertas.
La versión multimodal de Qwen3.7-Max lee imagen y video, pero Alibaba enfatiza iteración autónoma, herramientas y autoevaluación.
Alibaba presentó Qwen3.7-Plus el 2 de junio con entrada multimodal, llamadas a herramientas, escritura de código y pruebas automáticas.
El equipo Qwen de Alibaba ha lanzado Qwen3.5-Omni, su primer modelo verdaderamente multimodal que procesa texto, imágenes, audio y vídeo en una sola arquitectura, con clonación de voz en tiempo real.
Alibaba lanza Qwen3.5 con 397 mil millones de parámetros, ampliando la compatibilidad de idiomas de 82 a 201, integrando multimodalidad nativa y marcando el giro de chatbot a Agente de IA.
Moonshot AI lanzó Kimi K2.5, que incorpora multimodalidad nativa y la función Agent Swarm sobre K2, permitiendo dividir tareas complejas en múltiples subtareas ejecutadas en paralelo por agentes independientes.