打开一个 AI 视频工具,输入一段提示词,等十几秒,拿到一个片段——然后卡住。片段之间的人物不一样,镜头节奏对不上,配乐要另找工具,字幕要再导一遍。想改中间某一句台词,往往只能整段重做。这是过去一年里大多数人用文生视频的真实体验,也是 MiniMax 在 8 月 20 日推出 MiniMax Design 时想解决的那一环。
按官方的说法,MiniMax Design 是一款把多模态模型能力转化为可用生产力的 Harness,底层基础是自家的原生多模态视频模型 H3。这个定位比"AI 视频生成器"更准确一些:你提出创作需求,它负责理解目标、拆解任务、调用对应的模型与 Skills,再走完从素材处理、生成、编辑到最终交付的完整流程。
交互逻辑的变化是它对外强调的重点——从操作像素转向操作语义。用户不再需要精确指定每个画面元素怎么改,而是用自然语言表达意图,系统自己往下分解。第三方媒体的描述更直观:过去你得在 ChatGPT 里写好提示词、复制到海螺或其他网页工具里跑,现在给一个简单需求,它会自己铺开画布,生成提示词、分镜、图像、音乐、对话、剪辑、字幕和视频。
这里面真正值钱的不是"能生成",而是"能拆解"。拆脚本、排分镜、配乐这几件事本来是人在做的调度工作,把它们收进同一个流程里,输出单位就从"一个片段"变成了"一个项目"。
H3 的公开参数写得很清楚:统一理解文本、图像、视频、音频的上下文,生成带原生立体声的视频,最长 15 秒,最高 2K 分辨率。
这个数字值得盯住。15 秒意味着任何一条完整的口播、剧情或产品片,本质上都是多个短镜头拼起来的。所以画布式的组织方式不是界面上的花活,它是模型能力边界带来的必然结果——单镜头短,那就必须有东西负责把镜头之间的连续性管住:同一个角色的脸不能换、光线不能跳、上一镜的动作要接得住下一镜。
支撑这件事的是 H3 对项目级上下文的处理能力。官方提到它能处理复杂的项目级上下文,包括脚本、角色资产、历史版本和用户的风格偏好。对实际干活的人来说,这四项里"角色资产"和"历史版本"最有价值:前者决定跨镜头一致性,后者决定你改第三镜的时候,是不是要把整条片子重跑一遍。MiniMax 也明确说 H3 尤其适合视频编辑这类对理解、控制和修改要求更高的场景——编辑,而不只是生成。
MiniMax 视频模型这条线上,已经能查到几项面向控制的功能:主体参考,用于让角色、产品或关键主体在生成的多个画面中保持一致;首尾帧控制,让你指定开场帧和结束帧来做更有意图的转场;以及镜头运动指令,可以直接指定推拉、摇移、俯仰、跟拍或固定机位。
这些能力叠在一起,确实接近传统意义上的"导演"操作——你说的是镜头语言,不是像素坐标。但要提醒一句:关于 MiniMax Design 里是否存在一个完整的三维导演台界面,公开资料里我没有找到明确说明。目前能确认的是画布式工作流、自动分镜、以及上述几项参考与运镜控制。如果你是因为"3D 导演台"这个说法才打算付费,建议先自己进产品里确认功能范围,别照着二手描述做决定。
这张表里最影响日常效率的是倒数第二行。做短视频变现的人都清楚,时间不是花在第一次生成上,而是花在第五次返修上。谁能让"只改这一句"真正只改这一句,谁就赢了工时。
如果你做的是运动感强、镜头变化多的内容,或者需要固定角色、固定产品反复出片,这套逻辑对你的收益最大。反过来,如果你只是偶尔要一个十几秒的空镜素材,单点的文生视频工具够用,没必要把流程搬进画布。
真正试用的时候,别拿"能不能生成好看画面"当判断标准,那一关现在的模型基本都能过。建议用一个真实的小项目跑一遍,重点确认三件事:同一个角色跨三到四个镜头之后还认不认得出;改掉中间某一镜的台词或动作后,系统是重生成受影响的部分还是整条重跑;生成的素材、分镜和配乐能不能单独导出,拿到自己惯用的剪辑软件里继续用。第三点尤其重要——资产能不能带走,决定了你是在用工具,还是被工具锁住。
价格和额度这块我不给具体数字,MiniMax 各条产品线的定价调整比较频繁,直接看官方页面(https://design.minimax.io/)确认当前方案更靠得住,也别把旧版视频模型的免费额度经验套到这个新产品上。
另外补一个信息给愿意折腾的人:H3 在 8 月 3 日放出了 H3-Base 的开放权重,包含 FL2VA 和 Ref2VA 两个 checkpoint,采用 MiniMax H3 社区许可;但提示词预处理组件 H3-Context-IR 并不在这次开放范围内。也就是说,自己部署能拿到生成能力,拿不到那层"把人话翻译成镜头指令"的中间件——而这层,恰好是 MiniMax Design 好用与否的核心。MiniMax 另有官方 CLI 工具,支持从终端或 Agent 里生成文本、图像、视频、语音和音乐,想接进自己工作流的可以从那边入手。
Δ
Ctrl+D