新浪科技

通用视频模型 MiniMax H3 正式开源,支持多模态上下文、2K 分辨率

IT之家

关注

IT之家 8 月 3 日消息,今日 MiniMax 正式开源新一代通用视频模型 MiniMax H3。

据介绍,MiniMax H3 是一个通用型全模态生成系统。它能够统一理解由文本、图像、视频和音频构成的多模态上下文,并可生成最高 2K 分辨率、最长 15 秒、带有原生立体声音频的视频。得益于以任务泛化为导向的系统设计,H3 在预训练阶段便已具备广泛的多模态上下文理解与生成能力,因此能够出色地遵循复杂的多模态指令。

IT之家注意到,H3 支持以下输入与输出规格:

模型版本与输入规格:

① H3-Base-FL2VA

首尾帧模式:支持输入 0 张、1 张或 2 张图像:

② H3-Base-Ref2VA

全模态参考模式:

完整的 H3 系统由以下三个模块组成:

MiniMax H3 基于 MiniMax H3 Community License 发布。

开源地址:huggingface.co/MiniMaxAI/MiniMax-H3

加载中...