新浪科技

榜单之外,MiniMax H3 真正的野心在哪?

新浪财经头条

关注

来源:MacTalk

经常有读者问我最近在倒腾什么新工具,因为 AI 发展的速度太快了。最近我刚用 DeepSeek V4 Flash 替换了墨问 CatReader 的智能翻译服务,前几天又开始玩 MiniMax Hub,因为 M 家的模型 H3 发布了。

1

我把自己的几篇墨问笔记喂给MiniMax H3,设计了一个中国纸张定格动画和 2.5D 手工纸雕风格,几分钟的功夫,一个有故事、有旁白、有音乐的墨问成长视频就出来了:

尤其是最后几帧对墨问 Logo 的渲染,优秀设计师也不过如此。这激发了我的兴趣,我想弄明白:一个开源模型,是怎么把理解、生成、配乐这些原本分散的活儿,一次做到这个水平的?于是我扒了扒它的 Model Card(模型技术说明书)和发布资料,越看越觉得,H3 真正的野心,是重新定义视频模型该长成什么样子。

这个问题似曾相识。DeepSeek 进入第一梯队时,语言模型的竞争也经历过类似的转折:开发者可以用较低成本,得到一套能够部署、修改并接入业务的能力。今天,H3 把这条路延伸到视频领域;一个面向文本、Agent 与推理,一个进入全模态内容生成,中国开源 AI 在两个关键方向上的“双雄格局”由此有了更具体的轮廓。

当这种格局逐渐成形,竞争就会从模型榜单继续传导到价格、部署方式和商业模式。文本与视频领域都出现了能力够强、成本更低、可进入生产环节的开源选项,原有的市场规则也会随之松动。最近被反复讨论的开源“斩杀线”,正是这种变化在市场竞争中的直接投射。

所谓开源“斩杀线”,可以理解为开源模型抬起的一条新基准线。当开源模型具备足够高的能力,同时提供更低成本、本地部署和二次开发的空间,闭源模型如果还想维持高溢价,就必须在质量、价格、稳定性或服务上拉开清晰差距。它“斩”掉的,是平庸能力的高溢价,以及过去由封闭形成的安全区。

2

H3 在 Artificial Analysis 的各项视频评测中均进入全球前三,在 Arena AI 最新图生视频榜单并列第一(1-4 表示同一档)。开源后,H3 迅速升至 Hugging Face 趋势榜第一,超过 DeepSeek V4 Flash。这些榜单不能替代真实生产,但这些数据说明了,H3 开放给开发者的能力已经稳居全球第一梯队。

今天设计领域最具含金量的 Design Arena 也出榜单数据了,MiniMax H3 在 Design Arena 的 3 个视频类别(多图像转视频、图像转视频和视频编辑)中位居第一,领先于其他顶级模型的表现。

海外用户则直接提供了实战反馈。Stable Diffusion 创始人 Emad Mostaque 公开写下“Bravo to MiniMax”;长期测试 AI 视频模型的 a16z 合伙人 Justine Moore 也表示,H3 第一次通过了她设计的挑战。两个人关注点不同,共同依据都是实际使用的一手体验:

过去两年,我们谈视频模型,常常围绕几个容易传播的点:画面够不够惊艳,动作是否自然,镜头能不能以假乱真。可一旦进入真实工作,问题会迅速变多。文字、参考图、人物视频、动作、音色和配乐怎样放在一起?模型能否理解它们之间的关系,并在修改时保留原来的创作意图?解决了这些问题,才能称之为生产工具,H3 这次就是这么干的。

3

H3 最值得聊的是,让文字、画面和声音“说同一种话”。

H3 这次的创新是,让不同类型的输入介质(文字图片音视频关系等)拥有一种共同语言。系统里的 Context-IR 会先接收文字、图片、视频和声音,理解人物、镜头、动作、时间顺序以及用户指令,再把这些信息整理成基础模型能够使用的结构化上下文。

怎么讲呢,它很像拍摄电影那份真正管用的执行脚本:导演、摄影、演员和后期各有专业语言,最后仍要通过它来完成一件作品。

一组输入,在原始处理阶段可能要消耗 10 万 Token,但经过这套管线(pipeline)的理解后,上下文会被压缩成平均约 4000 Token 的描述。压缩本身不是重点,重要的是压缩的同时,关系被保留了下来:谁在什么时间出现,哪段声音属于哪个画面,哪些细节必须保留,用户到底希望改变什么。文生视频、动作参考、角色替换和视频编辑等等,都可以从独立的功能点,变成同一套系统里的不同指令。

进入 H3-Base——也就是负责出片的主引擎后——文字指令、参考画面和声音会被放在一起处理,最终同步生成视频和配套声音。我们可以把它理解为,过去需要多个模型接力完成的工作,现在交给同一套系统协同完成。H3 把过去分散的工种放进了一个共享上下文里,这样模型在增加任务时,也就不必从头搭建另一条流水线。

另一项有价值的设计是 Regenerate-2K。传统的超分辨率,也就是通常所说的“超分”,主要根据低清视频补充细节、提高分辨率;H3 会把生成的 768p 视频连同原始文字、图片、声音和结构化上下文重新送入系统,再生成一次高分辨率版本。它更像带着完整创作要求重新制作一遍,这也解释了为什么把 H3 叫做内容生产系统。

4

H3 的开放边界同样值得研究。MiniMax 目前已经发布 H3-Base 的完整权重,社区可以在本地生成 768p 的音视频,并通过 ComfyUI、SGLang、vLLM 等框架部署;负责复杂输入理解的 Context-IR、2K 重生成以及部分效率能力仍由官方服务承接。更准确的说法是,H3 是一套带社区许可的开放权重系统。

许可证对美国、欧盟、英国和韩国等地区设置了额外授权要求,美国用户部署时还需承诺相应的内容合规机制。这种安排可能会引发争议,但也让 MiniMax 的商业思路变得清晰:基础模型能尽快进入开发者的环境,关键编排和高质量交付继续由官方服务提供。开放在这里既是技术选择,也是分发模式和商业模式的设计。

写到这里还是挺解气的,以前 Claude 咔咔封咱们,现在米国人用咱的开源模型,也得得到咱的允许,舒服了。

开源当天,国内外芯片厂商、开发者社区、云推理平台和推理框架同步完成适配,超过百家企业在 Day 0 上线。名单很长,真正有意义的是“同步上线”。一个模型能否成为行业基础设施,既看榜单上的能力,也要看它在厂商、开发者和用户那里的真实体验。

这正是“开源双雄”比两个明星产品更重要的地方。DeepSeek 在文本领域证明了,开放权重可以快速变成开发标准、价格参照和生态入口;H3 正在视频领域重复这条路径。双雄代表的并非两次孤立爆款,以我来看,这是一种可以连续发生的产业方法。

5

最近的体感是,中国模型开放的决心越来越坚定,速度越来越快,因为越开放越强。

把中美 AI 简化成“中国开源、美国闭源”并不准确,美国同样拥有强大的开源社区,中国公司也会保留核心服务。真正的差别是路径选择:中国模型公司缺少全球云平台和默认渠道的先发优势,开放权重可以把一次模型发布迅速转换成适配、反馈、算力合作和应用创新。模型能力越接近第一梯队,这种开放带来的网络效应越大。

最近,中国模型在全球榜单上的上升趋势越来越清晰。但如果只把 H3 看作又一次榜单登顶,就低估了它真正带来的冲击。

H3 给视频行业划出了一条新的“斩杀线”,也把竞争拉到了更真实的战场:能否进入生产流程,成本能否支撑规模化使用,生态能否让更多人基于它创造产品。闭源模型未来会更强,开源也是。现在,开源模型把“足够强”的标准抬到了此前需要付出更高价格才能抵达的位置。

DeepSeek “斩杀”文本,MiniMax H3 “斩杀”视频,这句话有趣的地方不在“斩”,而在于事情背后的连续性。中国 AI 把最接近前沿的能力开放出来,并用开放换取生态、速度和新的行业标准。当这样的突破从一次变成两次甚至多次,从语言延伸到视频、多模态,“双雄”就不再只是一个概念,而是一条已经出现、仍在向前生长的商业路线。

我的判断是,到了 2026 年的年底,对于重度用户,国内的大模型将成为我们的主力工具。 

特别声明:以上内容仅代表作者本人的观点或立场,不代表新浪财经头条的观点或立场。如因作品内容、版权或其他问题需要与新浪财经头条联系的,请于上述内容发布后的30天内进行。

加载中...