MiniMax H3 是什么?8GB 显存本地部署与 API 价格全解(2026)封面图
AI 模型与产品约 12 分钟

MiniMax H3 是什么?8GB 显存本地部署与 API 价格全解(2026)

AI 指南··◉ 0 浏览

MiniMax H3 是 MiniMax 于 2026 年 8 月 3 日开源的通用全模态生成模型:能统一理解文本、图片、视频、音频,并直接生成最长 15 秒、24FPS、带原生立体声的视频,API 侧最高支持 2K 分辨率。开源权重免版税、可商用,社区实测最低 8GB 显存就能跑。 这篇文章讲清它的能力边界、两条技术路线(FL2VA / Ref2VA)、本地部署教程、API 价格和商用许可条款,事实全部对照官方 GitHub 与官方开源站核实。

本文目录

  1. MiniMax H3 是什么?
  2. 能力规格:两个变体怎么选
  3. MiniMax H3 怎么用?四条路径
  4. 本地部署教程(ComfyUI 五步)
  5. 显卡要求:8GB 也能跑
  6. API 价格
  7. 商用许可与地区限制
  8. 与 Wan2.2、Seedance 怎么选
  9. 常见问题 FAQ
  10. 总结

MiniMax H3 是什么?

MiniMax H3 是上海稀宇科技(MiniMax)发布的通用全模态生成系统,2026 年 8 月初以开源权重形式发布在 GitHub(MiniMax-AI/MiniMax-H3)和 Hugging Face、魔搭社区。

它和常见"文生视频模型"最大的区别是全模态:输入不只是文字,可以同时吃进图片、视频片段和音频;输出也不只是无声画面,而是视频和同步立体声一起生成。

热度佐证:截至 2026 年 8 月 31 日,H3 在 Hugging Face 上下载量已超过 526 万次、点赞 4600+,属于当前开源视频模型里现象级的发布;百度百科也已建立词条。

架构上,官方 README 写明:H3-Omni-Transformer 是一个 33B 参数的稠密单流 Transformer(约 13B 参数在 AdaLN 分支,纯推理部署时无需加载);文本编码器复用 Qwen3-VL-32B 的预训练权重。完整系统由三个模块组成:

  • H3-Context-IR:把复杂的文本+图片+视频+音频混合输入,整理成模型可读的"上下文中间表示"(该模块本次未开源,官方提供 API 复现);
  • H3-Base:根据中间表示生成 768p 视频与音频;
  • H3-Regenerate-2K:把 768p 结果和原始上下文一起送回模型,重新生成 2K 分辨率版本。

MiniMax H3 官方架构总览:Context-IR、Base 与 Regenerate-2K 三个模块(图片来源:MiniMax 官方 GitHub)

能力规格:两个变体怎么选

H3 以两个任务特定 checkpoint 发布,覆盖两类典型玩法:

模型变体 输入模式 适用场景
H3-Base-FL2VA 文生视频;可带 0/1/2 张图片做首帧、尾帧或首尾帧控制 常规文生视频、关键帧控制
H3-Base-Ref2VA 全参照模式:最多 9 张图 + 3 段视频 + 3 段音频,混合最多 12 个文件 角色一致性、视频编辑、动作参照、镜头续写

输出规格(官方口径):

项目 规格
时长 4–15 秒
画幅 21:9、16:9、4:3、1:1、3:4、9:16 等
分辨率 短边默认 768p;API 可用 H3-Regenerate-2K 出 2K
帧率 24 FPS
音频 32kHz 立体声,与画面同步生成
语言 稳定支持中、英、日、韩等 11 种语言指令

MiniMax H3 三模块协作流程示意图:输入经过 Context-IR 整理,H3-Base 出 768p,再由 Regenerate-2K 重生成 2K

MiniMax H3 怎么用?四条路径

按门槛从低到高,官方给了四条使用路径:

  1. 网页/App 直接玩(零门槛):国内访问 海螺 AI,海外版 hailuoai.video,选 H3 模型即可;桌面端可用 hub.minimaxi.com。
  2. API 调用(开发者):国内平台 platform.minimaxi.com、海外 platform.minimax.io,接口为 video-generation-v2,适合集成进自己的产品。
  3. ComfyUI 本地部署(个性化工作流):ComfyUI 首发日(day-0)即原生支持 H3,官方提供了工作流模板,下面展开讲。
  4. 服务化部署(企业):官方提供 vLLM-Omni 与 SGLang Diffusion 两条路线,vLLM-Omni 在 4×B300 上生成一条 8.7 秒的片子端到端约 87 秒。

如果你更习惯用 OpenRouter 这类聚合网关,也可以先看我们的 OpenRouter 使用教程,确认模型上架情况后再决定走官方 API 还是聚合平台。

MiniMax H3 本地部署教程(ComfyUI 五步)

ComfyUI 是个人用户最快的部署路径,官方开源站也把它列为首选。整体五步:

  1. 安装 ComfyUI:从 ComfyUI 官方 GitHub 按你的系统安装;
  2. 下载模型组件:到 Hugging Face 的 Comfy-Org 重打包仓库下载 MiniMax-H3 的组件包——包含扩散模型(蒸馏后的 33B 权重)、文本编码器、以及 Visual VAE 和 Audio VAE 两个 VAE 文件;
  3. 按目录放文件:把组件分别放进 ComfyUI/models/ 下对应的 diffusion_models、text_encoders、vae 目录(社区反馈最常见的翻车是放错目录);
  4. 加载官方模板工作流:ComfyUI 内置的 H3 模板里选 FL2VA(文生视频/首尾帧)或 Ref2VA(多参照);
  5. 生成并校验:先用默认参数跑一条 768p 样片,确认画面和声音都正常,再调自己的提示词。

两个官方提醒:

  • H3-Context-IR 未开源,本地跑的是模型本体,复杂多模态输入的"理解优化"需要按官方提示词指导自建,或走官方 API;
  • 初始开源版本只提供全注意力推理,稀疏注意力实现会在后续更新中发布——这意味着本地速度还有优化空间。

显卡要求:8GB 也能跑

官方 FAQ 给的参考线比很多人预想的低:

MiniMax H3 本地部署显存档位速查图:5-8GB 极限、12GB 出 480p、16-24GB 从容、24GB+ 提速、128GB Mac MLX 路线

  • 12GB 显存(RTX 3060 级):用 pruned int8 量化(全部文件约 42GB 下载)可以出带音频的 480p;
  • 16–24GB:很从容,调优后一条片子几分钟;
  • RTX 5090 / DGX Spark:配合 NVIDIA Sol Engine 栈还能再快约 4 倍;
  • Mac 用户:Apple Silicon 走 MLX 路线(建议 128GB 统一内存),或 16GB 起步的 NF4 量化路线;
  • 社区极限:B 站多个 UP 主实测 8GB 显存(16GB 内存)可以借助整合包和加速插件跑起来,代价是速度和稳定性。

系统内存建议 32–64GB,因为放不进显存的层会从内存调度。完全没有 GPU 的话,可以先在 Colab 上体验。

API 价格

按官方平台促销页口径(2026 年 8 月):H3 生成视频 2K 分辨率低至 $0.061/秒,768p 低至 $0.036/秒。折算一条 10 秒的 768p 视频约 $0.36,2K 约 $0.61。价格可能随官方活动调整,下单前以 platform.minimaxi.com 定价页 实时显示为准。

省钱建议:先用 768p 打磨提示词和分镜,定稿后再用 Regenerate-2K 出高分辨率版本,比全程 2K 便宜一半左右。

商用许可与地区限制

H3 以 MiniMax H3 Community License(社区许可协议)发布,免版税,研究和商用都可以,但有三个关键条款:

  1. 收入门槛:用 H3 的商业产品/服务年收入超过 2000 万美元,需要另行向官方申请书面授权(邮件 api@minimax.io);
  2. 显著署名:商业产品界面需显著标注 "MiniMax H3";
  3. 用途红线:H3 的产出和权重不得用于训练或改进其他非 H3 系的 AI 模型;对外托管服务需落实内容安全措施。

地区限制:欧盟、英国、美国、韩国目前无法下载开源权重(法规仍在演进),这些地区用户可走全球 API,机构可申请正式授权做合规部署。生成的产物版权归使用者所有。

与 Wan2.2、Seedance 怎么选

快速定位三者的差异(详细展开见我们的通义万相 Wan 指南和 AI 视频工具选购指南):

  • 选 H3:要"视频+同步音频"一次生成、要多模态参照(图+视频+音频混合输入)、要角色一致性——目前开源里这是独一档;
  • 选 Wan2.2:Apache 2.0 协议商用最省心,生态成熟,显存门槛也更低,但无声;
  • 选 Seedance(闭源 API):不想折腾硬件、只要云端质量,直接用字节 Seedance 的 API。

一句话:H3 的差异化在"全模态 + 原生音频",这也是它被称为"开源后首次逼近闭源旗舰"的原因。

总结

MiniMax H3 把"全模态理解 + 视频 + 原生音频"三件事第一次拉进了开源世界:33B 稠密架构、两个 checkpoint 覆盖文生视频和多参照生成、8–12GB 显存就能本地起跑、免版税可商用。对个人创作者,从海螺 AI 网页版开始最省事;对开发者,ComfyUI 工作流 + 官方 API 的组合可以覆盖从验证到上线的全流程。

最后更新:2026 年 8 月 31 日 作者:AI345 编辑部 本文事实依据:MiniMax H3 官方 GitHub、MiniMax 官方开源站、Hugging Face 模型卡,配图中的架构图为官方素材,示意图为 AI345 原创绘制。

常见问题

MiniMax H3 是免费的吗?

开源权重免费,采用社区许可协议,免版税。本地运行只花自己的硬件和电费;托管 API 按用量计费。

MiniMax H3 可以商用吗?

可以。三个条件:年收入超 2000 万美元需书面授权;界面显著标注 "MiniMax H3";不得用其产出和权重训练其他非 H3 系模型。

本地部署需要什么显卡?

12GB 显存(RTX 3060)即可用 int8 量化出 480p 带音频视频;16–24GB 从容;社区整合包最低 8GB 显存可玩;Mac 走 MLX 建议 128GB 统一内存。

为什么我在美国/欧盟下载不了模型权重?

开源许可目前暂不覆盖欧盟、英国、美国、韩国四个地区,属法规演进期的暂时限制。可用官方全球 API,或机构申请授权。

H3 生成的视频有声音吗?

有。H3 原生同步生成 32kHz 立体声音频,不需要后期单独配音,这是它与多数开源视频模型的核心区别。

显存不够又想本地玩怎么办?

三条路:社区 WanGP 低显存方案、量化整合包(8GB 级)、或先在 Colab 免费额度上体验;对画质要求高就直接用官方 API。

评论 (0)

?
0/1

还没有评论,来发第一条吧

网站上的服务均为第三方提供,
请用户注意自行甄别。

北京酷讯互动科技有限公司

备案京ICP备2024094994号-29

© 2026 AI345 · All Rights Reserved

用户服务协议·隐私政策