实测MiniMax Design:剪视频“有嘴就行”?
创始人
2026-08-23 22:08:20

  炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!

(来源:光子星球)

MiniMax这个月推出了一款新产品,MiniMax Design,官方给它定的口号是「从操作像素,到操作语义和表达意图」。翻译一下,以后做视频不用你调参数、拉时间线,说人话就行。

标语充满吸引力,但我们按官方手册把它的功能完整测了一遍之后,结论得拆开说,在「流程」这一层,它确实做到了简单描述就可以成片;在「画面」这一层,也就是官方最想强调的视频语义编辑,它翻车了。

先说产品,再说测试。

一个Agent驱动的内容生产Harness

MiniMax Design的官方定位不是「又一个 AI 视频生成工具」,而是一个Harness,一个把多模态模型能力组织成生产力的工作台。底层是MiniMax刚开源的H3多模态视频模型,上面封装了层Agent,你提需求,它负责拆解任务、选Skill、调模型、生成、修改,直到交付。

界面是三栏结构,右边是Agent对话区,中间是画布,所有生成内容和上传素材都会出现在画布上并自动按流程连线,左边是Skill广场、模板中心、插件和资产中心。

官方手册里给了8个商用案例,覆盖电商短视频、KOC投流广告、知识科普视频、动画PV这些场景,主打的都是「短、快、模板化、批量化」的商业内容生产。

价格这里多说一句,因为这决定了它适合谁。截至8月22日,国内版会员三档,Starter 65元/月给10000积分,Plus 499 元/月给87000积分,Pro 1399元/月给270000积分。按官方换算,10000积分大约能生成83秒H3 2K视频或143秒768P视频。

翻译成人话就是,65块钱一个月,大概够你出5到9条15秒的短视频。对个人玩家不算便宜,但对一个每天要出投放素材的电商团队,这是另一笔账。

现阶段大部分都具备的远程连接,MiniMax Design也没有落下,用户可以绑定IM工具,随时随地给MiniMax Design分配任务,连接方法也非常简单,微信或者飞书扫码就可以接入。

流程层的语义化,它真的做成了

我们的第一项测试完全按官方手册的示例来,上传一张无线耳机产品图,输入一句话需求,「为一款无线耳机制作一条15秒竖屏广告,突出轻便和降噪,风格简洁、有科技感」。

Agent没有直接开干,它先拆解任务,反过来跟我们确认画幅、卖点、受众,然后规划步骤、生成人物形象、写脚本分镜,最后出片。整个过程里我们能做的只有两件事,确认,以及等。

两个细节值得说,一是成片质量,同一张产品图,走Agent链路做出来的成片,效果比当时在网页端直接生成好上一截,原因是Agent会自己扩展提示词、补充分镜。二是对小白的友好度,我们的感受是,对AIGC小白来说实用性很高,有了Agent之后,不用再花心思去学怎么使用画布。

这就是「流程层语义化」的意思,你不需要理解这个工具,你只需要说清楚你要什么。

Skill和模板是第二条验证线,Skill广场里的技能可以用三种方式调用,点「去对话中试试」直接调用、对话框输入「/」唤起、或者干脆不说用哪个,让Agent自己判断。我们三种都试了,全部成功。

在广场看到喜欢的风格可以直接复用,这也省去了试错的成本。

资产和记忆,它记得你上一个项目里干了什么

官方文章里有一个很技术向的判断,多模态模型的下一步,是理解整个Project级别的Context,包括历史对话、素材资产、版本记录和用户的风格偏好。

可以把项目中生成的角色或者场景保存为资产,方便在其他项目中复用。

更进一步,在同一个对话里聊了很多轮之后,我们问Agent,根据我们目前的对话,总结一下你已经确认的人物设定、视频风格和品牌信息,它也可以完整复述。

官方说的项目级Context,至少在我们的测试规模内,是成立的。

批量 KOC,还有一个没被要求的聪明细节

批量生产是官方最强调的商用卖点,我们上传了2张产品图,要求生成2条15秒竖屏KOC视频,每条要有不同的创作者人设、开场Hook和口播。

Agent先建了人物锚和产品锚,锁定人物长相和产品外观,再分别生成。2条全部成功,每条视频内部人物跨镜头保持了很好的一致性。

真正让我们停下手的是VR眼镜那条,我们原本有点担心,VR眼镜这个产品形态,模型会不会把它误判成按摩仪之类的竞品。结果H3的处理方式是,整条视频只字不提产品名称,只说佩戴感受。

它没有被要求这么做,这看起来像是模型知道自己可能在产品细节上出错,主动绕开了坑。从商业内容的角度,这种避免犯错的能力,比画质提升更有价值,当然,前提是它绕得足够自然。

导演台和AI剪辑,把抽卡试错提前到分镜

3D导演台是官方力推的插件,核心价值是,在3D空间里摆好角色、机位、姿态,确认构图之后,再拿这个分镜当参考去生成视频,把一部分抽卡试错提前到分镜阶段。

我们用自然语言让导演台「摆两个角色素体,面对面站立,机位从侧面拍」,它准确理解了。然后让Agent按这个分镜生成一段5秒视频,成片的构图和人物位置与导演台分镜高度一致,闭环是通的。

AI剪辑同样全部通过,加字幕、加转场、裁掉最后2秒,三条自然语言指令全部成功执行。

导演台现在是一流AI视频平台的必备功能,能有效减少因为人物姿势和站位导致的反复抽卡,但传统导演台有使用门槛,用Agent加自然语言来操作,门槛确实降下来了。

如果有描述不出来的运镜方式,MiniMax Design还准备了虚拟摄像机功能,可以用手机扫码运镜,再传回导演台。

唯独官方的头号卖点,翻车了

然后是这次实测里最重要的一项,语义级视频编辑。

官方文章的原话是,未来的创作与修改不会停留在传统意义上的Editing,而是语义层面的创作与修改,用户只需要表达高层意图,H3官方也说自己尤其适合Video Editing场景。

我们把刚开始的蓝牙耳机的广告成片喂回去,按「只说意图、不说参数」的原则,下了两条指令。第一条,把这条视频的整体色调调暖一点,氛围温馨一些。第二条,把背景换成一个明亮的咖啡馆场景,人物和产品保持不变。

第一条,执行了,但调完前后几乎没有肉眼可见的变化。第二条,背景确实换成了咖啡馆,但耳机变形了。

Agent的行为方式是对的,它直接理解意图、直接执行,没有反问你一堆参数,流程体验完全符合「语义级」的设想。问题出在画面层,色调修改约等于没改,换背景时主体保真度失守。

说白了,「说人话改视频」这件事,MiniMax Design把「听得懂」做到了,「改得准」还没做到。视频编辑恰恰是生成模型最难的场景,它要求模型同时做到两件矛盾的事,该变的变,该不变的像素级不变。至少在当前的H3上,后者还没过关。

本地部署我们没测成,但方向要说一句

最后一项是官方宣传的开放工作流,H3开源模型的本地部署和ComfyUI接入。官方提供了多套精选工作流,分轻量版和满血版,下载后可以在画布中作为节点运行,Agent也能根据对话帮你调整工作流的节点和参数。

这项我们没能实测,官方对本机配置的要求不低,我们的测试设备够不上门槛。

但方向本身值得说,官方工作流不光支持MiniMax自家模型,也可以导入自己的ComfyUI工作流。

对有显卡的专业创作者,这意味着生成成本可以压到本地电费的级别,同时保留Agent链路和画布里的整套流程,这个口子开得比大多数同类平台都大。

值不值得用

如果你是电商、投放、内容运营团队,每天要批量出投放素材,MiniMax Design现在就能用,Skill加模板加批量生成这条链路是完整的,65元/月的Starter档够小团队试水。

如果你是完全不想学专业工具的AIGC小白,它也是目前门槛最低的选择之一,因为你真的只需要说话。但如果你是冲着「说一句话就精修视频」来的,建议再等等,语义编辑这项,宣传和现实之间还有一段距离。

「从操作像素到操作语义」,这个方向本身没有争议,行业里每一家都在往这儿走。MiniMax Design的特殊之处在于,它先把脚手架搭完了,对话、资产、记忆、分镜、剪辑全都语义化了,只剩最硬的那块骨头还卡在画面里。

接下来值得盯的问题只有一个,H3的下一次更新,能不能让「改视频」变得和「说需求」一样便宜。到那天,视频编辑软件的菜单栏,才是真的要进博物馆了。

相关内容

热门资讯

东华能源上半年净利润同比增长2...   8月23日晚间,东华能源(002221.SZ)发布2026年半年度报告。面对中东地缘冲突带来的原...
凯淳股份股东上海淳溶投资中心(... 凯淳股份8月23日公告,股东上海淳溶拟于2026年9-12月减持不超159.33万股,预计套现约37...
库存一抢而空!风扇灯全球爆单欧... 来源:@央视财经微博 【 库存一抢而空!#风扇灯全球爆单...
医药板块暖意渐浓 机构看好“戴... 何雨佳 制图■投基论道医药板块暖意渐浓机构看好“戴维斯双击”行情有机构认为,除前期估值回调带来的配置...
深圳荣耀机器人连破人类纪录 继深圳荣耀机器人百米跑破人类纪录后,8月23日第二届世界人形机器人运动会400米赛跑大型组决赛,荣耀...