炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:光子星球)
MiniMax这个月推出了一款新产品,MiniMax Design,官方给它定的口号是「从操作像素,到操作语义和表达意图」。翻译一下,以后做视频不用你调参数、拉时间线,说人话就行。
标语充满吸引力,但我们按官方手册把它的功能完整测了一遍之后,结论得拆开说,在「流程」这一层,它确实做到了简单描述就可以成片;在「画面」这一层,也就是官方最想强调的视频语义编辑,它翻车了。
先说产品,再说测试。
一个Agent驱动的内容生产Harness
MiniMax Design的官方定位不是「又一个 AI 视频生成工具」,而是一个Harness,一个把多模态模型能力组织成生产力的工作台。底层是MiniMax刚开源的H3多模态视频模型,上面封装了层Agent,你提需求,它负责拆解任务、选Skill、调模型、生成、修改,直到交付。
界面是三栏结构,右边是Agent对话区,中间是画布,所有生成内容和上传素材都会出现在画布上并自动按流程连线,左边是Skill广场、模板中心、插件和资产中心。
官方手册里给了8个商用案例,覆盖电商短视频、KOC投流广告、知识科普视频、动画PV这些场景,主打的都是「短、快、模板化、批量化」的商业内容生产。
价格这里多说一句,因为这决定了它适合谁。截至8月22日,国内版会员三档,Starter 65元/月给10000积分,Plus 499 元/月给87000积分,Pro 1399元/月给270000积分。按官方换算,10000积分大约能生成83秒H3 2K视频或143秒768P视频。
翻译成人话就是,65块钱一个月,大概够你出5到9条15秒的短视频。对个人玩家不算便宜,但对一个每天要出投放素材的电商团队,这是另一笔账。
现阶段大部分都具备的远程连接,MiniMax Design也没有落下,用户可以绑定IM工具,随时随地给MiniMax Design分配任务,连接方法也非常简单,微信或者飞书扫码就可以接入。
流程层的语义化,它真的做成了
我们的第一项测试完全按官方手册的示例来,上传一张无线耳机产品图,输入一句话需求,「为一款无线耳机制作一条15秒竖屏广告,突出轻便和降噪,风格简洁、有科技感」。
Agent没有直接开干,它先拆解任务,反过来跟我们确认画幅、卖点、受众,然后规划步骤、生成人物形象、写脚本分镜,最后出片。整个过程里我们能做的只有两件事,确认,以及等。
两个细节值得说,一是成片质量,同一张产品图,走Agent链路做出来的成片,效果比当时在网页端直接生成好上一截,原因是Agent会自己扩展提示词、补充分镜。二是对小白的友好度,我们的感受是,对AIGC小白来说实用性很高,有了Agent之后,不用再花心思去学怎么使用画布。
这就是「流程层语义化」的意思,你不需要理解这个工具,你只需要说清楚你要什么。
Skill和模板是第二条验证线,Skill广场里的技能可以用三种方式调用,点「去对话中试试」直接调用、对话框输入「/」唤起、或者干脆不说用哪个,让Agent自己判断。我们三种都试了,全部成功。
在广场看到喜欢的风格可以直接复用,这也省去了试错的成本。
资产和记忆,它记得你上一个项目里干了什么
官方文章里有一个很技术向的判断,多模态模型的下一步,是理解整个Project级别的Context,包括历史对话、素材资产、版本记录和用户的风格偏好。
可以把项目中生成的角色或者场景保存为资产,方便在其他项目中复用。
更进一步,在同一个对话里聊了很多轮之后,我们问Agent,根据我们目前的对话,总结一下你已经确认的人物设定、视频风格和品牌信息,它也可以完整复述。
官方说的项目级Context,至少在我们的测试规模内,是成立的。
批量 KOC,还有一个没被要求的聪明细节
批量生产是官方最强调的商用卖点,我们上传了2张产品图,要求生成2条15秒竖屏KOC视频,每条要有不同的创作者人设、开场Hook和口播。
Agent先建了人物锚和产品锚,锁定人物长相和产品外观,再分别生成。2条全部成功,每条视频内部人物跨镜头保持了很好的一致性。
真正让我们停下手的是VR眼镜那条,我们原本有点担心,VR眼镜这个产品形态,模型会不会把它误判成按摩仪之类的竞品。结果H3的处理方式是,整条视频只字不提产品名称,只说佩戴感受。
它没有被要求这么做,这看起来像是模型知道自己可能在产品细节上出错,主动绕开了坑。从商业内容的角度,这种避免犯错的能力,比画质提升更有价值,当然,前提是它绕得足够自然。
导演台和AI剪辑,把抽卡试错提前到分镜
3D导演台是官方力推的插件,核心价值是,在3D空间里摆好角色、机位、姿态,确认构图之后,再拿这个分镜当参考去生成视频,把一部分抽卡试错提前到分镜阶段。
我们用自然语言让导演台「摆两个角色素体,面对面站立,机位从侧面拍」,它准确理解了。然后让Agent按这个分镜生成一段5秒视频,成片的构图和人物位置与导演台分镜高度一致,闭环是通的。
AI剪辑同样全部通过,加字幕、加转场、裁掉最后2秒,三条自然语言指令全部成功执行。
导演台现在是一流AI视频平台的必备功能,能有效减少因为人物姿势和站位导致的反复抽卡,但传统导演台有使用门槛,用Agent加自然语言来操作,门槛确实降下来了。
如果有描述不出来的运镜方式,MiniMax Design还准备了虚拟摄像机功能,可以用手机扫码运镜,再传回导演台。
唯独官方的头号卖点,翻车了
然后是这次实测里最重要的一项,语义级视频编辑。
官方文章的原话是,未来的创作与修改不会停留在传统意义上的Editing,而是语义层面的创作与修改,用户只需要表达高层意图,H3官方也说自己尤其适合Video Editing场景。
我们把刚开始的蓝牙耳机的广告成片喂回去,按「只说意图、不说参数」的原则,下了两条指令。第一条,把这条视频的整体色调调暖一点,氛围温馨一些。第二条,把背景换成一个明亮的咖啡馆场景,人物和产品保持不变。
第一条,执行了,但调完前后几乎没有肉眼可见的变化。第二条,背景确实换成了咖啡馆,但耳机变形了。
Agent的行为方式是对的,它直接理解意图、直接执行,没有反问你一堆参数,流程体验完全符合「语义级」的设想。问题出在画面层,色调修改约等于没改,换背景时主体保真度失守。
说白了,「说人话改视频」这件事,MiniMax Design把「听得懂」做到了,「改得准」还没做到。视频编辑恰恰是生成模型最难的场景,它要求模型同时做到两件矛盾的事,该变的变,该不变的像素级不变。至少在当前的H3上,后者还没过关。
本地部署我们没测成,但方向要说一句
最后一项是官方宣传的开放工作流,H3开源模型的本地部署和ComfyUI接入。官方提供了多套精选工作流,分轻量版和满血版,下载后可以在画布中作为节点运行,Agent也能根据对话帮你调整工作流的节点和参数。
这项我们没能实测,官方对本机配置的要求不低,我们的测试设备够不上门槛。
但方向本身值得说,官方工作流不光支持MiniMax自家模型,也可以导入自己的ComfyUI工作流。
对有显卡的专业创作者,这意味着生成成本可以压到本地电费的级别,同时保留Agent链路和画布里的整套流程,这个口子开得比大多数同类平台都大。
值不值得用
如果你是电商、投放、内容运营团队,每天要批量出投放素材,MiniMax Design现在就能用,Skill加模板加批量生成这条链路是完整的,65元/月的Starter档够小团队试水。
如果你是完全不想学专业工具的AIGC小白,它也是目前门槛最低的选择之一,因为你真的只需要说话。但如果你是冲着「说一句话就精修视频」来的,建议再等等,语义编辑这项,宣传和现实之间还有一段距离。
「从操作像素到操作语义」,这个方向本身没有争议,行业里每一家都在往这儿走。MiniMax Design的特殊之处在于,它先把脚手架搭完了,对话、资产、记忆、分镜、剪辑全都语义化了,只剩最硬的那块骨头还卡在画面里。
接下来值得盯的问题只有一个,H3的下一次更新,能不能让「改视频」变得和「说需求」一样便宜。到那天,视频编辑软件的菜单栏,才是真的要进博物馆了。