微信开源多模态嵌入模型登顶 MMEB-v2
编辑精选 腾讯微信视觉团队把 2B 规格的多模态嵌入模型做到 77.9 分,越过了参数量四倍的 Qwen3 VL Embedding 8B。在检索这条线上,堆参数换分数的性价比正在肉眼可见地变薄。 腾讯微信视觉团队开源了 WeMM Embe
收录 多模态 相关 AI 新闻、产品动态和产业观察。 本页收录 11 篇已发布文章。
编辑精选 腾讯微信视觉团队把 2B 规格的多模态嵌入模型做到 77.9 分,越过了参数量四倍的 Qwen3 VL Embedding 8B。在检索这条线上,堆参数换分数的性价比正在肉眼可见地变薄。 腾讯微信视觉团队开源了 WeMM Embe
编辑精选 DeepSeek 把视觉塞进了 Flash 的价目表:单图折算最多 384 token、不另收视觉费,等于给 GUI agent 的截图开销封了顶。省钱的另一面是图像表征被削薄,密集界面看不看得清,还得拿脏数据实测。 8 月 21
编辑精选 同一个模型在名字、仓库说明和模型卡上给出了三种参数口径,这不算失误,它暴露的是统一多模态架构还没有公认的数法:理解塔和生成塔要不要合并计数,各家没谈拢。 商汤 8 月 20 日在 GitHub 上给 SenseNova U1.5
编辑精选 Thinking Machines 把 Inkling Small 全量权重放出后,最醒目的信号落在成本曲线上:12B 激活参数已经能贴近 41B 激活旗舰的多个能力项。 Mira Murati 的 Thinking Machin
编辑精选 MiniMax H3 把 2K、15 秒、原生立体声和开源权重放在同一张发布牌上;0.8 元/秒的价格很醒目,但开放权重仍要等后续文件落地。 7 月 31 日,MiniMax 发布 H3,多模态视频模型赛道多了一个很少见的组合:官
字节这次更新图像模型,最值得看的不是又能生成多漂亮的图,而是它把战场往设计流程里挪了一步。 7月8日晚,字节跳动 Seed 团队发布 Seedream 5.0 Pro。按官方说法,这个多模态图像创作模型已经上线火山方舟体验中心,后续还会进入
Qwen3.7 Plus 最值得说的一点,不是它会看图——是它答完一句不会停。 6 月 2 日,阿里 Qwen 团队上线了这款新模型。它是 Qwen3.7 Max 的多模态版:Max 只懂文字,Plus 能看懂图片和视频。但真正的卖点,在它
阿里这次发模型,没在台上比谁参数大。 6 月 2 日上线的 Qwen3.7 Plus,主打的就一件事:让模型自己把活干完。当天阿里美股盘前跳了 6%,到 133.23 美元;港股收盘涨 6.6%,报 130.90 港元。一个模型发布能直接把
3月30日,阿里Qwen团队丢出了Qwen3.5 Omni,这是他们第一个真正意义上的全模态模型——文字、图片、音频、视频全部塞进同一个模型里处理,不是那种把几个专门模型拼在一起的拼接式架构。 一个模型,四种模态 之前市面上的多模态系统大多
今年2月17号,阿里在农历新年前夕放出了Qwen3.5—— 397B参数的开放权重模型 ,语言支持从82种直接拉到了 201种 。 主要升级 原生多模态 :文本、图片、视频在同一个模型里处理,不是外挂的adapter方案。这和Llama 4
今年1月27号,月之暗面发布了Kimi K2.5——在K2的基础上加了原生多模态和 Agent Swarm 功能。 Agent Swarm是什么 核心概念:把一个复杂任务 拆解成多个子任务,每个子任务分配给一个独立的agent并行执行 。