WeChat passe en open source son modèle d'embedding multimodal, en tête du MMEB-v2
L'équipe Vision de WeChat, chez Tencent, a publié WeMM-Embedding : la version 2B dépasse Qwen3-VL-Embedding-8B, quatre fois plus grand, sur le classement MMEB-v2.
12 articles vérifiés sur IA multimodale, les produits et le secteur.
L'équipe Vision de WeChat, chez Tencent, a publié WeMM-Embedding : la version 2B dépasse Qwen3-VL-Embedding-8B, quatre fois plus grand, sur le classement MMEB-v2.
DeepSeek lance deepseek-v4-flash-vision-exp, premier modèle V4 doté de vision, plafonné à 384 tokens par image, aux tarifs de V4-Flash.
SenseTime a publié SenseNova-U1.5-8B-MoT sous licence Apache 2.0, avec génération native en 4K et édition d'image et contrôle précis réunis dans un seul modèle.
SeedRealtime de ByteDance arrive dans le flux d'appel de Doubao et met l'IA audiovisuelle full-duplex dans une application grand public.
Thinking Machines a publié Inkling-Small en open weights, avec 276B paramètres au total, 12B actifs, des entrées multimodales et des scores proches du modèle Inkling 975B.
MiniMax H3 combine vidéo 2K de 15 secondes, stéréo native, prix de 0,8 yuan par seconde et promesse de poids ouverts.
ByteDance vise les workflows de design avec Seedream 5.0 Pro est repris pour des lecteurs tech francophones, avec les chiffres, les limites produit et les points de verification essentiels.
La version multimodale de Qwen3.7-Max lit images et vidéos, mais Alibaba met l’accent sur l’itération autonome.
Alibaba a lancé Qwen3.7-Plus le 2 juin, avec l’entrée multimodale, les appels d’outils, le code et les tests autonomes comme arguments clés.
L'équipe Qwen d'Alibaba a publié Qwen3.5-Omni, son premier modèle véritablement multimodal capable de traiter texte, images, audio et vidéo dans une seule architecture, avec clonage vocal en temps réel.
Alibaba publie Qwen3.5 avec 397 milliards de paramètres, étendant la prise en charge des langues de 82 à 201, intégrant la multimodalité native et marquant le passage du chatbot à l'agent d'IA.
Moonshot AI a lancé Kimi K2.5, qui ajoute la multimodalité native et la fonction Agent Swarm à K2, permettant de diviser une tâche complexe en plusieurs sous-tâches exécutées en parallèle par des agents indépendants.