Tencent macht WeChats multimodales Embedding-Modell quelloffen und führt MMEB-v2 an
Das WeChat-Vision-Team von Tencent hat WeMM-Embedding veröffentlicht: Die 2B-Version übertrifft das viermal größere Qwen3-VL-Embedding-8B bei MMEB-v2.
11 geprüfte Beiträge zu multimodale KI, Produkten und Branchenentwicklungen.
Das WeChat-Vision-Team von Tencent hat WeMM-Embedding veröffentlicht: Die 2B-Version übertrifft das viermal größere Qwen3-VL-Embedding-8B bei MMEB-v2.
DeepSeek veröffentlicht deepseek-v4-flash-vision-exp, das erste V4-Modell mit Bildverständnis – gedeckelt bei 384 Token pro Bild, Preise wie V4-Flash.
SenseTime veröffentlicht SenseNova-U1.5-8B-MoT unter Apache 2.0 mit nativer 4K-Generierung und vereint Bildbearbeitung sowie präzise Steuerung in einem einzigen Modell.
Thinking Machines hat Inkling-Small als Open-Weights-Modell veröffentlicht: 276B Gesamtparameter, 12B aktiv, multimodale Eingaben und mehrere Werte nahe am 975B-Flaggschiff Inkling.
MiniMax H3 verbindet 2K-Video bis 15 Sekunden, natives Stereo, RMB 0,8 pro Sekunde und angekündigte offene Gewichte.
ByteDance zielt mit Seedream 5.0 Pro auf Design-Workflows wird fuer deutschsprachige Tech-Leser eingeordnet, mit den zentralen Zahlen, Produktversprechen und offenen Pruefpunkten.
Die multimodale Version von Qwen3.7-Max kann Bilder und Video lesen, doch Alibaba betont autonome Iteration, Tool-Nutzung und Selbsttests.
Alibaba stellte Qwen3.7-Plus am 2. Juni vor und betont multimodale Eingaben, Tool-Aufrufe, Code-Erstellung und autonome Tests.
Alibabas Qwen-Team hat Qwen3.5-Omni veröffentlicht, das erste wirklich multimodale Modell des Unternehmens, das Text, Bilder, Audio und Video in einer einzigen Architektur verarbeitet und Echtzeit-Sprachklonierung bietet.
Alibaba veröffentlicht Qwen3.5 mit 397 Milliarden Parametern, erweitert die Sprachunterstützung von 82 auf 201, integriert native Multimodalität und markiert den Wandel vom Chatbot zum KI-Agenten.
Moonshot AI hat Kimi K2.5 veröffentlicht, das auf K2 native multimodale Fähigkeiten und Agent Swarm ergänzt – eine Funktion, die komplexe Aufgaben in viele Teilaufgaben zerlegt und parallel von unabhängigen Agents bearbeiten lässt.