银河通用让机器人看视频上岗
机器人训练又多了一条便宜路径:不用重新采一批机器人遥操作轨迹,也不用把人手动作逐帧转成关节角。银河通用、北大、中科院自动化所和清华团队把一段普通人第一视角视频塞进模型的临时记忆,让机器人在部署现场先“看懂这桌活”,再用原有动作能力去做。 这
收录 世界模型 相关 AI 新闻、产品动态和产业观察。 本页收录 13 篇已发布文章。
机器人训练又多了一条便宜路径:不用重新采一批机器人遥操作轨迹,也不用把人手动作逐帧转成关节角。银河通用、北大、中科院自动化所和清华团队把一段普通人第一视角视频塞进模型的临时记忆,让机器人在部署现场先“看懂这桌活”,再用原有动作能力去做。 这
机器人公司最近很爱讲“基座模型”,但原力灵机这次抛出的 DW0.5,抓的点更窄:机器人学会动作后,能不能先在一个可计算的世界里试错,再把更少的失败带回真机。 这听上去像仿真。差别在于,传统仿真靠人建场景、调物理参数、写任务规则;DW0.5
人形机器人过去一年最会做的事,是在视频里跑、跳、搬箱子。难点也藏在这些视频之外:真机示教太贵,动作数据太少,一台机器人学会的本事,很难直接搬到另一台机器上。 智在无界这次把答案放到了人身上。新发布的 Being M0.7 先吃下 超过 10
爱诗科技这轮融资,表面看是 AI 视频公司继续拿钱,细看更像一次路线换挡:钱进来以后,PixVerse 不再只讲“把一段视频生成得更漂亮”,开始把视频模型推向可实时响应的游戏和互动娱乐。 7 月 14 日,爱诗科技旗下 PixVerse 宣
魔芯科技把世界模型的竞争点,从“生成得像不像”往前推了一步:它新发布的 MoWorld,主打在国产 NPU 上实现最高 50 FPS 的实时交互。 这不是普通视频生成模型的宣传口径。MoWorld 指向的是可交互世界模型,也就是让系统在用户
训 AI Agent 最头疼的一件事,是它得在真环境里练。 你想让一个 agent 学会用终端、点网页、调工具,就得让它真去点、真去调。点错了?轻则白跑一轮,重则把测试环境搞崩。一次强化学习训练动辄上百万次交互,这账谁算谁肉疼——又慢、又贵
AI 生成的视频有个老毛病:镜头往前推一段、再转回来,原先那把椅子可能就换了个样,墙上的画也飘没了。模型不记得"刚才这儿长啥样"。 6 月 14 日,微软研究院联合几所高校放出一个叫 Mirage 的视频世界模型,专治这个健忘症——而且代码
过去两年,AI 生成 3D 这件事基本停在"给你一个物件"——你说一句话,它吐出一把椅子、一个角色、一栋楼的网格。 Vast 这家北京公司想干的是下一格:不生成一个物件,生成一个 能一直存在、还能多人同时进去逛 的世界。 6 月 1 日,V
文生视频现在是什么体验?你敲一行字,等十分钟,出十秒画面。 Reactor 想干掉那十分钟的等待。 5 月 28 日,这家公司从隐身状态里冒出来,宣布拿了 5900 万美元 A 轮,Lightspeed 领投,Katzenberg 的 Wn
打开 Google Maps,随便点一个东京街角的图钉。 选一个画风——「真实」「卡通」「赛博朋克」。 Genie 当场给你生成一个可以走进去的世界。720p 画质,每秒 24 帧,你转身回头,它把背后的世界记住了。 这是 Google D
8倍。 这是以色列AI公司Decart昨天甩出来的硬数字——刚发的DOS 2.0让AI每秒能吐1600个token,是行业平均值的8倍。同一天,公司拿到3亿美金,估值冲到$40亿。 Radical Ventures领投,Nvidia跟投。但
Cristóbal Valenzuela 八年前从纽约一间小工作室开始做的 Runway,现在估值跳到了 53 亿美元。 但这家公司不想再被叫做"AI 视频公司"了。上周五的访谈里,Co CEO Anastasis Germanidis 直
德国机器人公司Sereact周日宣布完成1.1亿美元B轮融资,主要用来推美国市场和扩产Cortex 2.0——他们口中的"机器人大脑"。 这不是又一家做人形机器人的,是给现有工业机械臂配"认知层"的。客户名单已经够说明问题:BMW、戴姆勒卡