MiniMax 发布 Design,把 15 秒镜头串成整片

MiniMax 在 8 月 20 日推出 MiniMax Design,一个围绕自研视频模型 H3 搭起来的多模态创作平台。用户用自然语言说清楚想要什么,系统自己拆脚本、排分镜、生成关键帧、出视频、配乐、加字幕、做剪辑,一路走到成片。

产品由几块拼成:工作流画布、3D 导演台、资产中心、Skills 库和一组分工的 Agent。画布把素材和镜头之间的关系留在台面上,改一处不用推倒重来,也能拉出新版本继续走。3D 导演台的做法更直白——在三维场景里摆角色、调机位和姿态,搭出来的就是分镜参考,再交给模型生成。Skills 库里放着现成的风格模板,纸拼贴、水墨、动漫科普这类,也可以靠对话现攒一个自定义 Skill 出来。素材自动落到本地,一键存进资产中心。ComfyUI 的工作流可以直接导进来。

15 秒和 3 分钟之间隔着什么

H3 单次生成的上限是 15 秒。MiniMax 放出的案例里有 42 秒的短故事、1 分钟的 MV、3 分钟的纪录片。粗算一下,3 分钟意味着至少十二个镜头首尾接起来,每个镜头的人物长相、服装、光线、镜头语言都得对得上,还得按叙事顺序排进一条时间线。

这就是 Design 真正在解决的事。过去一年 AI 视频的进步集中在单镜头质量——分辨率上去了,物理更像样了,人手不再长六根指头。但把十几个单镜头拼成一部能看的片子,靠的是另一套东西:角色一致性、风格统一、时间线组织、以及改到第五版还不崩。MiniMax 的分法是让 H3 只管镜头生成,Agent 负责统一风格和组织时间线,Harness 在关键节点回头问一句核心方向是什么,背后调专业知识库做多轮质量校验。

这套结构和当下 AI 编程工具的路子几乎是同一个模子:底层模型负责单点产出,上面套一层能规划、能自查、能被人打断的编排层。视频这边的变量更多——一个镜头错了,后面全得跟着改,所以校验环节被前置得更狠。

冲的是谁的饭碗

MiniMax 给的目标场景不含糊:短剧全流程、电商批量出图出视频、品牌 TVC、宣传物料、知识视频、PV/MV。这几类的共同点是量大、周期紧、单条预算不高,恰恰是最容易被工具链效率碾过去的一档。

爱范儿的说法是,H3 加 Design 已经切进了 Adobe 长期把着的专业创作工作流。这话有一半成立。专业剪辑师的核心资产从来不只是软件功能,还有对素材的判断力和对客户的沟通能力,这部分 Agent 短期接不走。但项目底层的重复劳动——找参考、搭分镜、批量出图、对轨、加字幕——被打包成一句话就能触发的流程之后,一个人能同时开的项目数量会变。行业里说的”AI 让内容成本降到十分之一”,降的主要是这一段。

MiniMax 的连续动作

往前捋一下时间线会清楚一些。H3 视频模型先开源放出去,把生成能力铺开;海螺 AI 在消费端跑出了国产视频生成的量;现在 Design 把这两头接起来,做成一个项目制的工作台。开源换生态、消费端换数据、专业端换收入,三条线是配着走的。

对国内做内容的团队来说,短期最实际的变化可能是 ComfyUI 工作流的导入通道。这批人手上早就攒了一堆调好参数的节点图,能原样搬进来意味着不用推翻重学。工具切换的最大摩擦很少来自学不会,多半来自舍不得丢掉已经跑通的那套东西。

参考来源:MiniMax 官方发布内容、爱范儿、CocoLoop 编辑整理;H3 单次生成时长上限与案例片长口径以公开演示为准。