►文 观察者网 陈济深
“Bravo to MiniMax(向MiniMax致敬)”
8月3日,Stable Diffusion创始人Emad Mostaque在看到MiniMax正式开放视频模型H3的核心权重后,在社交平台上写下了这句话。
四年前,正是Stable Diffusion第一次把高质量图像生成从少数公司的服务器中释放出来,交到全球开发者和创作者手中。
几乎同一时间,硅谷顶级投资机构a16z合伙人JustineMoore也在震惊与惊叹中,按捺不住激动地晒出了自己的实测结果。
过去一年半,她一直用一道看似简单的题目测试不同AI视频模型:让画面中的男子用粉笔在黑板上写下“Hi”。此前,从没有一个模型能够通过这项测试——直到H3横空出世,一举完成了挑战。
对人而言,这不过是一个再普通不过的动作;对视频模型而言,它却要在连续时间里同时处理手、粉笔与黑板的接触关系,理解笔画出现的先后顺序,还要保证已经写出的字母不会随画面变化而扭曲、消失。
一位是生成式AI开放运动的标志人物,一位是长期关注产业竞争的硅谷投资人。他们同时对一家中国公司高度褒奖,显然不是因为市面上又多了一个头部视频模型。
真正引起关注的,是一个过去很少同时出现的组合:世界第一梯队的视频生成能力,不再锁在闭源产品和高价接口背后,而是以开源的方式交到了开发者手中。
这很容易让人想起2025年DeepSeek-R1发布时带来的开源震撼。
从文本延伸至视频,中国AI 企业的持续开放,正将单点突破凝练为明确的技术范式。
视频,曾是AI最难打开的门
过去几年,开源语言模型已经走出一条相对清晰的道路。
从美国的Llama到中国的DeepSeek,开源模型的性能不断提高,量化、微调和本地部署工具也日趋成熟。如今,企业乃至个人开发者在本地运行一个具有实用能力的语言模型,已经不再令人意外。
在视频赛道,却是另一幅光景。
文本模型输出的主要是一串token,而视频模型要同时解决空间与时间问题。一个人物在连续数百帧中不能突然换脸,服饰、场景和光线不能随意漂移,动作必须承接前后状态,镜头还要准确执行人的创作意图。
若要做到音画同步,对白、环境音与配乐更需要与画面进行毫秒级的时空匹配。
这使视频成为生成式AI中计算最密集、工程链条最复杂的领域之一。视频生成不仅推理负担沉重,容错率也极低——文字错了一句可以局部修改,而视频动作一旦出错,往往意味着整段重来,之前消耗的算力全部作废。
因此,前沿视频能力长期主要存在于云端产品和付费接口中。视频赛道的开源模型并非没有,但真正稀缺的是:一个开源模型,能不能同时站上全球商业竞争的最前沿?
MiniMax发布的H3跨过的正是这道门槛。
在全球AI模型评测平台Artificial Analysis的评测中,H3的视频编辑位居第一、文生视频排名第二、图生视频排名第三;在视频模型对战平台Arena的最新结果中,它成为文生视频和图生视频两类排名最高的开源模型。
更值得注意的是性能与成本的组合。Artificial Analysis的数据显示,H3的2K音视频生成价格约为每分钟7.8美元,低于当下多款1080p主流商业模型,在质量与价格象限中跻身最优梯队。
在过去,音画同步直出对于闭源模型都称得上核心竞争力。而H3同时把行业顶级的性能、极高的性价比和全面开源带到了同一张牌桌上,完成了视频领域的DeepSeek级突破。
用户还可以同时输入图片、视频和音频作为参考素材,让模型在一套系统内完成从画面生成到声音匹配的完整流程,而过去这通常需要在多个模型和软件之间反复切换。MiniMax开放的,不只是一项单一功能,而是一种理解并执行复杂视听意图的生产力。
从DeepSeek到MiniMax,开源正在变成行业引擎
DeepSeek证明了高性能、低成本与开源权重可以同时成立;H3的出现,则把这套逻辑推进到了AI研发门槛最高、也最具商业价值的另一高地:创意生产力。
H3开放当天,包括华为昇腾、AMD、Intel在内的国内外芯片厂商迅速完成适配,Hugging Face、魔搭ModelScope、ComfyUI等平台同步接入,多个主流推理框架也提供支持。在Hugging Face上,H3一度升至趋势榜首,与DeepSeek最新模型共同占据前列。
开源AI工作流平台ComfyUI对H3的优化就是一个缩影。通过一系列工程优化,其方案把模型的总体内存占用从123.6GB降至42.5GB,使消费级显卡也有机会本地运行前沿视频模型。
过去,开源模型经常是“够用但不是最好”的次优选择。真正追求效果的企业,最终仍要回到更强的闭源模型。
DeepSeek在文本领域打破了这条分界线。
DeepSeek V4 Flash发布时,每百万token输出定价仅2元人民币;而OpenAI的GPT-5.6 Luna即便经过80%的大幅降价,输出定价折合人民币仍要约8.7元。开发者社区由此喊出了“斩杀线”这个说法:当开源模型的性能达到准一线水平,价格却只要对手的零头,闭源产品就必须证明自己贵得有道理。
如今,MiniMax H3正在视频领域画出同样一条线。H3以2K分辨率音视频直出,每分钟生成成本约7.8美元;而当下多款主流闭源视频模型仅提供1080p输出,每分钟定价却在20美元以上。
更高的画质,不到对手四成的价格,再加上全面开源——这意味着,闭源视频模型昂贵的定价逻辑正在被彻底动摇。
过去,用户为封闭接口付费是因为没有同等水平的替代品;现在,替代品不仅出现了,而且更便宜、更开放,开发者还可以自行部署和优化。开源不再是退而求其次,封闭也不再天然等于能力领先。
中国正在把产业能力带入AI竞争
无论是DeepSeek还是MiniMax,它们的开源选择背后都折射出一种正在形成的中国AI发展路径。
DeepSeek和MiniMax面对不同领域与商业模式,却共同强化了一组越来越清晰的中国模型特征:世界级性能、持续降本、开源权重、工程优化与广泛适配。
这条发展路径并非凭空出现。
中国拥有高度竞争的电商、短视频、游戏、广告和内容产业。市场不只关心模型能否生成惊艳样片,更关心它是否便宜、稳定,能否批量运行,能否接入真实业务。
与此同时,中国拥有高度成熟的工程化落地能力与正在成长的国产算力生态。开源模型可以被不同芯片、框架、云平台和行业软件反复优化,将实验室里的能力快速挤掉水分,变成真正的生产工具。
这种路径,与中国过去推动光伏、电池、通信设备等技术普及的方式有某种相似之处。真正改变全球市场的,从来不只是性能最强的单个样品,也包括把复杂技术工程化、规模化,通过产业协作持续降低使用门槛的行业生态和土壤。
如今,这种能力正在进入AI。
在全球最大的AI模型调用平台OpenRouter上,文本模型周调用量前十名中有八个来自中国;Hugging Face CEO Clément Delangue近期表示,中国已经在开源模型领域占据主导地位。英伟达CEO黄仁勋也强调,世界既需要前沿闭源模型,也需要前沿开源模型,因为AI最终将“由每个国家构建”。
这种开放的生态,正在让全球开发者得以站在中国开源模型的肩膀上,建立属于自己的AI能力。
如果这一趋势持续下去,中国AI对世界的影响就不会只表现为排行榜上多了几个中国名字。它还可能表现为,越来越多国家与企业在建立自己的AI能力时,底层运行的是中国开源模型;越来越多开发者在设计下一代产品时,首先想到的是来自中国的模型底座。
中国由此输出的,不只是可以消费的技术产品,也是可以继续开发、继续创造的基础能力。
对于MiniMax的开放姿态,资本市场也并未将其解读为商业价值的让渡,反而给予了积极反馈。H3发布后MiniMax股价连续走强,8月6日正式纳入港股通,华尔街投行杰富瑞重申买入评级,花旗同样维持买入。
从追赶前沿,到为世界增加一种选择
就在几个月前,全球视频AI领域还经历了一次标志性的退场。
2026年3月,OpenAI关停了上线不久的Sora,并终止了与迪士尼的巨额合作。这款曾惊艳世界的闭源代表作,最终因日均高达百万美元的推理成本而难以为继。
Sora的退场并非技术失败,但它揭示了闭源视频模型面临的深层困境:推理成本极高,却只能由一家公司独自承担;用户只能调用接口,无法参与优化和适配;当热度退去,昂贵的算力基础设施就变成了沉重的财务负担。
H3的出现,让一个判断变得越来越清晰:
在视频这个推理成本最高、工程链条最复杂的AI领域,闭源可能从一开始就不是最优解。
当模型足够强大后,谁能让它以更低成本、更可持续的方式进入现实世界?
从DeepSeek到MiniMax H3,这条路已经从文本延伸到了成本更高、工程更复杂、与文化和产业结合更直接的视频领域。
从语言智能到视频生成,从模型产品到产业底座,中国AI正在完成一次重要的身份变化:它不再只是既有路线的追赶者,也开始为全球AI的发展提供另一种可能。
而这条路,中国可能从一开始就走对了。