千问语音模型开始调用工具
在一段真实语音对话里,最难的地方往往不在回答一句话,而在模型能不能听出你已经换了主意。 比如先问附近川菜馆,再追问“评分 4.5 以上哪家最近”。传统语音助手通常要重新理解一遍地点、偏好和检索条件;阿里今天发布的 Qwen Audio 3.
在一段真实语音对话里,最难的地方往往不在回答一句话,而在模型能不能听出你已经换了主意。 比如先问附近川菜馆,再追问“评分 4.5 以上哪家最近”。传统语音助手通常要重新理解一遍地点、偏好和检索条件;阿里今天发布的 Qwen Audio 3.
Google DeepMind 这次没有再展示一个更会“造视频”的模型。 它把视频生成模型拆开,改成了一个会做视觉感知的模型:看一段视频,按文字指令输出深度、法线、相机位姿、分割结果和 3D 关键点。论文给这个系统起名 GenCeption
人形机器人过去一年最会做的事,是在视频里跑、跳、搬箱子。难点也藏在这些视频之外:真机示教太贵,动作数据太少,一台机器人学会的本事,很难直接搬到另一台机器上。 智在无界这次把答案放到了人身上。新发布的 Being M0.7 先吃下 超过 10
GPT 5.6 Sol 上线不到一周,最刺耳的反馈没有来自跑分榜,而来自开发者的硬盘和数据库。 TechCrunch 7 月 14 日汇总了多起用户报告:有人称 Sol 擅自删除本机文件,有人称生产数据库被删,还有开发者说模型在没有明确授权
Anthropic 把 Claude 的下一块落点放进了美国中小学课堂,但入口先给老师,学生暂时站在门外。 7 月 14 日,公司发布 Claude for Teachers:通过验证的美国 K 12 教师,可以免费使用 Claude 的高
德国不限速高速、法国多出口环岛、日本右舵左行道路,放在同一张测试卷里,对辅助驾驶系统很不友好。文远知行这次把 WRD 3.0 开出去,看的也不止是能不能在海外跑几圈。 7 月 13 日,文远知行披露,一段式端到端智能驾驶方案已经在德国、法国
当大模型公司还在给数据中心找电,Richard Sutton 把新公司的目标写成了另一个尺度: 1 万亿参数、实时学习、实时规划、功耗 20 瓦 。 20 瓦约等于人脑日常耗能。这个数字放在 2026 年的 AI 语境里很刺眼。行业一边谈万
AI 编程工具的门槛刚被抬高,另一个玩家立刻把价格牌翻到零。 7 月 14 日晚,Agnes AI 发布 Agnes 2.5 Flash,并同步推出 Agnes Code 桌面端。它给出的承诺很直接:Flash 面向日常编码和 agent
日本客服市场来了一个很直观的测试样本:软银把美国公司 Sierra 的客服 Agent 放进 LINEMO 后,询问解决率从 83% 拉到 97%,客户满意度从 74% 拉到 93%。 这组数字比融资额更能说明 Sierra 现在卖的东西。
爱诗科技这轮融资,表面看是 AI 视频公司继续拿钱,细看更像一次路线换挡:钱进来以后,PixVerse 不再只讲“把一段视频生成得更漂亮”,开始把视频模型推向可实时响应的游戏和互动娱乐。 7 月 14 日,爱诗科技旗下 PixVerse 宣