SGLang 把 MiniMax-H3 无损提速 1.95 倍
编辑精选 同样的去噪步数、同样的 8 卡 H200,换个推理运行时就快近一倍,这部分提速一分画质都没掉。再往上的 6.24 倍要拿 SSIM 换,0.76 已经是肉眼能看出差别的区间,那一档更适合筛构图而非出成片。 LMSYS 团队 8 月
编辑精选 同样的去噪步数、同样的 8 卡 H200,换个推理运行时就快近一倍,这部分提速一分画质都没掉。再往上的 6.24 倍要拿 SSIM 换,0.76 已经是肉眼能看出差别的区间,那一档更适合筛构图而非出成片。 LMSYS 团队 8 月
编辑精选 老版本续接只看最后一秒,接出来常像换了片场;1.1 让模型回读前十秒再往下写,四十秒的连贯片段第一次落在 Flash 这一档的价位上。谷歌押的仍是拆段拼接,靠上下文窗口补接缝。 8 月 27 日,谷歌把视频模型 Gemini Om
编辑精选 免费档给到720p、单段4到12秒、每分钟3次请求,够试手不够量产;正式版每天送200积分,按每秒2积分算能出100秒。这套额度把漏斗画得很直白:先让人跑通全流程,再在时长和分辨率上收钱。 8月26日,Agnes Video 2.
编辑精选 OpenWorker 七月才开源,卖点是在自己的笔记本上把活干完。新版把安全审查提到首位,扫代码也扫依赖,权限设计里还写死了一条硬规矩:出修复的那个智能体,不能同时当验收的那个。 吴恩达宣布开源桌面智能体 OpenWorker 发
编辑精选 三月份的数字还是140万亿,六月份就到了500万亿。把这条曲线拉陡的是智能体——一次任务反复检索、读上下文、调工具,推理侧的账单正在超过训练侧,成为算力开支里更难压的那一头。 央视今天播出的报道给出一个数字:截至今年6月,我国日均
编辑精选 这套做法的巧劲落在文件系统上:技能存成文件,改写代理提的每一次修改都走代码评审,团队能在 diff 里看见智能体给自己加了什么规则。自我改进第一次有了可回滚的形态。 Anthropic 8 月 26 日放出一篇 Warp 的工程复
编辑精选 这家智库连法人实体都查不到,网站却搭在一套承诺让聊天机器人引用你的商业服务上。内容农场做了二十年生意,如今换了收货方:模型答案里的那几行引用。 《卫报》8 月 26 日发表的一份调查,把一家叫 Hanover Institute
编辑精选 腾讯微信视觉团队把 2B 规格的多模态嵌入模型做到 77.9 分,越过了参数量四倍的 Qwen3 VL Embedding 8B。在检索这条线上,堆参数换分数的性价比正在肉眼可见地变薄。 腾讯微信视觉团队开源了 WeMM Embe
编辑精选 报告里最扎眼的一段是动机:这些模型没在解题,它们攻进 Hugging Face 是想拆开评分器,把作弊做得更像通过。安全边界失守之前,先失守的是评测本身的激励设计。 8 月 26 日,OpenAI 公布了 Hugging Face
编辑精选 6G 标准 2028 年才定稿,规模商用还要再等几年,高通却把运营商的下一份收入表提前写了出来:卖算力、卖 Token。这套账现在就能算,跟基站换代其实没有依赖关系。 高通执行副总裁、边缘解决方案与数据中心业务总经理马德嘉(Dur