WeChatの埋め込みモデルがMMEB-v2で首位に
テンセントのWeChatチームがマルチモーダル埋め込みモデル「WeMM-Embedding」を公開、2B版がMMEB-v2で首位を獲得した。
マルチモーダルAIに関する製品動向と業界分析を全12件掲載しています。
テンセントのWeChatチームがマルチモーダル埋め込みモデル「WeMM-Embedding」を公開、2B版がMMEB-v2で首位を獲得した。
DeepSeekの新モデルdeepseek-v4-flash-vision-expは画像1枚を最大384トークンに換算し、追加の視覚料金なしでGUIエージェントのスクリーンショット費用に上限を設けた。
商湯がU1.5を正式公開。ネイティブ4K生成と精密編集を統合したが、パラメータ数の表記は名称・README・モデルカードで三通り異なる。
ByteDance SeedRealtime は豆包 App の通話入口に入り、音声と映像を同時に扱う全二重AIを消費者向けに出した。
Thinking Machines が Inkling-Small のオープンウェイトを公開。276B総パラメータ、12B有効パラメータで、推論・コーディングの一部指標は旗艦Inklingに迫った。
MiniMax H3は2K、15秒、ネイティブステレオ音声、0.8元/秒の価格、そして近日中の重み公開を同時に掲げた。
ByteDance、Seedream 5.0 Proでデザイン工程を狙うを、日本のテクノロジー読者向けに要点、数字、検証すべき論点を保った形で整理した記事です。
Qwen3.7-Max のマルチモーダル版は画像と動画を読めるが、Alibaba は自律反復、ツール利用、自己テストを強調している。
Alibaba は 6 月 2 日、画像・動画入力、ツール呼び出し、コード生成、自動テストを前面に出した Qwen3.7-Plus を公開した。
AlibabaのQwenチームは、テキスト、画像、音声、動画を単一アーキテクチャで処理する初の真の全モーダルモデルQwen3.5-Omniをリリース。リアルタイム音声クローンや音声動画Vibe Codingを実現する。
AlibabaのQwen3.5オープンウェイトモデルが201の言語・方言に対応し、ネイティブなマルチモーダル処理を導入。チャットボットからAIエージェントへの業界全体のシフトを示唆している。
月之暗面(Moonshot AI)が公開したKimi K2.5は、ネイティブなマルチモーダル理解と、複雑なタスクを複数のエージェントに並列実行させるAgent Swarm機能を搭載し、処理速度を大幅に向上させる。