微信開源多模態嵌入模型登頂MMEB-v2
騰訊微信團隊開源多模態嵌入模型 WeMM-Embedding,2B 版在 MMEB-v2 登頂,超越參數量四倍的對手。
收錄 多模態 相關產品動態與產業觀察,共 11 篇文章。
騰訊微信團隊開源多模態嵌入模型 WeMM-Embedding,2B 版在 MMEB-v2 登頂,超越參數量四倍的對手。
DeepSeek新模型deepseek-v4-flash-vision-exp將單張圖折算最多384token、不另收視覺費,等於替GUI代理的截圖開銷設下天花板。
商湯發布SenseNova-U1.5-8B-MoT正式版,支援原生4K出圖與精確編輯控制,採用Apache 2.0授權,但模型卡也坦承列出五項尚未解決的已知缺陷。
Thinking Machines 放出 Inkling-Small 全量權重,2760億總參數、120億啟用參數,在多項推理與編碼評測上貼近975B旗艦Inkling。
MiniMax H3 同時提出 2K、15 秒、原生立體聲、0.8 元/秒價格與近期開放權重計畫。
字節 Seedream 5.0 Pro 押注設計工作流以繁體中文科技新聞語氣重寫,保留關鍵數字、產品邊界與後續觀察點。
Qwen3.7-Max 的多模態版能看圖看影片,但阿里更強調自主迭代、工具調用與自我測試。
阿里 6 月 2 日推出 Qwen3.7-Plus,主打多模態輸入、工具調用、寫程式與自動測試,市場也用股價回應。
阿里 Qwen 團隊推出 Qwen3.5-Omni,這是其首個真正意義上的全模態模型,將文字、圖片、音訊、影片全部納入單一架構處理,並具備即時語音複製與音影片 Vibe Coding 功能。
阿里巴巴Qwen3.5開放權重模型現已支援201種語言與方言,引入原生多模態處理,並預示從聊天機器人轉向AI代理的行業趨勢。
月之暗面推出 Kimi K2.5,在 K2 基礎上加入原生多模態與 Agent Swarm 功能,能將複雜任務拆解為多個子任務並行執行,大幅提升處理速度。