MiniMax H3 本地部署:量化版怎么选、显存要多少、出片要多久
自 2026 年 8 月权重放出以来,H3 在消费级显卡上就能跑了,各家教程的步骤也大同小异。分歧——或者说集体沉默——在数字上:到底哪个量化版配哪张卡,以及你实际要等多久。这一页把公开的实测数字汇总在一起。
✦ 看看不限量套餐
先选量化版,别的都在它后面
放出的权重分两家:fl2va 管文生视频和图生视频,ref2va 管参考图驱动的生成。两者都以 GGUF 量化形式发布,你选的这个文件决定了后面所有事。
原始 BF16 权重约 123.6 GB,所以没人在家里跑它。社区量化能把一套可用配置压到 21 GB 上下。
有一条要重复一遍:Q8_CR 和 U16G 依赖 ComfyUI-GGUF 自定义节点,在别的运行时里加载不了。
| 量化 | fl2va | ref2va | 说明 |
|---|---|---|---|
| Q4_0 | 11.4 GB | 11.4 GB | 标准 4-bit。体积最小,质量最低。 |
| U16G | 15.0 GB | 15.0 GB | INT8 + Q4_0 混合。在 16G 以上的卡上比 Q4_0 还快。 |
| Q8_CR | 20.2 GB | 20.2 GB | Q8_0 的质量,权重换成 INT8 ConvRot。 |
| Q8_0 | 20.2 GB | 21.4 GB | 标准 8-bit。四者里质量最高。 |
各档显卡能跑什么、要等多久
这些是权重刚放出那段时间的实测记录,不是受控基准测试,会随着 offload 策略、硬盘速度和系统内存余量变化。当量级看,别当承诺。
但底下的规律是稳的:16G 以下,你是在用时间换「装得下」;24G 以上,先放开的是画布而不是时钟。
| 显存 | 典型显卡 | 能跑的画布 | 一条 5 秒片 |
|---|---|---|---|
| 8 GB | RTX 3070 · 4060 · 3060 Ti | 640×360 – 832×480 | 9–10 分钟(RTX 3070) |
| 12 GB | RTX 3060 · 4070 · 2080 Ti | 默认 0.4 MP | 不到 9 分钟(RTX 3060,20 步) |
| 16 GB | RTX 4070 Ti Super · 4080 · 5070 Ti | 0.4–0.5 MP;配 Turbo LoRA 可上 768p | 约 3 分钟(4090 笔记本版,960×540) |
| 24 GB | RTX 3090 · 4090 | 完整 1344×768 画布 | 几分钟(个位数) |
| 32 GB | RTX 5090 | 完整画布,最长 15 秒 | 约 10 分钟(20 步 GGUF Q5) |
先加内存,再考虑换显卡
这条建议在每一篇低显存教程里都会出现,而且反直觉到值得明说:模型装不下的时候,ComfyUI 会从系统内存里流式取剩下的部分。一张 12G 的卡配 32G 内存能跑完;同一张卡配 16G 内存,要么疯狂交换,要么整机卡死。
12G 的卡请把 32G 系统内存当成底线,16G 的卡想跑得顺就上 64G。快速 NVMe 同理——从显卡挪出去的张量总得从某个地方挪回来。
真正有效的只有两个优化
Turbo LoRA 是最大的那个。它把步数降到文生/图生视频 8 步、参考图生成 4 步,省下的时间比换任何量化版都多。
Sage Attention 是第二个,通过 ComfyUI-KJNodes 的 `Patch Sage Attention KJ` 节点启用。它压低自注意力层的显存峰值,这正是让一张会 OOM 的卡变成能跑完的关键。
其余都是小杠杆。先把一个朴素工作流跑通,再一次加一个——在没有基线之前加优化,和装坏了是分不清的。
| 手段 | 作用 | 什么时候用 |
|---|---|---|
| Turbo LoRA | 步数降到 8(T2V/I2V)/ 4(R2V) | 一直开。单项收益最大。 |
| Sage Attention | 压低注意力层显存峰值 | 采样阶段 OOM 的时候。 |
| 动态 offload | 把部分权重流式放到系统内存 | checkpoint 根本装不下的时候。 |
| KJNodes 低显存注意力 | 降峰值,输出与未打补丁时一致 | 同上,且不损画质。 |
| 加系统内存 | 让 offload 活得下去 | 16G 以下,先于任何显卡升级。 |
从这套参数开始
从小画布起步,一次只改一个变量。下面是官方默认值,在你跑出一次干净的结果之前就去改它们,一个下午就没了。
有一件看着像 bug 但不是的事:帧数会对齐到 H3 的 `17k+5`,所以请求 5 秒会变成约 124 帧——24 fps 下是 5.17 秒。
| 项 | 值 |
|---|---|
| ComfyUI | 0.30.0 或更新 |
| 测试画布 | 864×480(0.4 MP) |
| 原生目标 | 1344×768(0.98 MP) |
| 步数 | 20(官方默认) |
| 采样器 | res_multistep |
| 调度器 | simple |
| 输出 | 24 fps 视频 + 32 kHz 立体声,MP4 |
出问题的方式来来回回就那几种
首次运行的失败基本都是下面这些,而且没有一条意味着这个模型不适合你的机器。
| 现象 | 常见原因 | 处理 |
|---|---|---|
| 节点或模板缺失 | ComfyUI 低于 0.30.0 | 升级,然后彻底重启。 |
| 加载器里看不到模型 | 放错目录或文件名不对 | 检查 `diffusion_models/`、`text_encoders/`、`vae/`,重启。 |
| R2V 报错但 T2V 正常 | 加载成了 fl2va 而不是 ref2va | 选 ref2va 那个 checkpoint。 |
| CUDA 显存不足 | 画布或时长超出了内存规划 | 退回 0.4 MP、5 秒、batch 1,一次只改一项。 |
| 整机卡死 | offload 压力超过系统内存 | 关掉别的程序,腾出磁盘空间,回到基线重试。 |
| R2V 比 T2V 慢得多 | 参考图太多或太大 | 设 `ref_image_size: match`,减少参考图数量。 |
| 出片没有声音 | 音频 VAE 没接到 CreateVideo | 把视频和音频两路 VAE 输出都接进去。 |
小图先出,留下的再放大
这不是低显存的妥协——H3 本身就是这么设计的。基础模型按原生尺寸渲染,放大是另一道独立的 pass;MiniMax 把这两件事拆开,是因为像素后补远比直接生成便宜。
这个拆法在任何硬件上都是对的习惯。大多数镜头是要扔的——第四条、手画错的那条——把每一条都送去放大,等于把管线里最贵的那一半花在你马上要删的素材上。用小画布生成,看完,只放大你留下的那些。
如果卡才是问题
上面所有内容的前提,是你有一张几千块的卡,并且愿意让它一条片占着好几分钟。如果情况不是这样,现实的路子是找一个不按条计费的托管服务——因为「生成然后扔掉」这个循环,正是按条计费最疼的地方。
这件事上 HelloGen 是我们知道的最好选择:Pro 套餐里 H3 不限量生成,每条 0 积分,每天至少 2 条优先出片,超出部分按普通速度排队。同样是小图先出、留下的再放大,只是那台机器不用你养。
常见问题
跑 MiniMax H3 需要多大显存?
8G 配 Q2/Q3 量化加 32G 系统内存能跑,一条 5 秒片约 9–10 分钟。12G 在 0.4 MP 下比较从容。24G 能跑完整的 1344×768 画布。16G 以下,系统内存和显卡一样要紧。
MiniMax H3 的 GGUF 该下哪个量化版?
16G 及以上,15.0 GB 的 U16G 是甜点——INT8 与 Q4_0 混合,实测比 Q4_0 还快。追质量选 Q8_0(fl2va 20.2 GB、ref2va 21.4 GB);体积最小的是 11.4 GB 的 Q4_0。Q8_CR 和 U16G 需要 ComfyUI-GGUF 节点。
本地跑一条 5 秒的 H3 视频要多久?
实测区间:16G 的 4090 笔记本版在 960×540 开 Sage Attention 约 3 分钟;8G 的 RTX 3070 约 9–10 分钟。Turbo LoRA 对时间的影响比换量化版更大。
官方工作流参数是什么?
20 步、res_multistep 采样器、simple 调度器,测试用 864×480、原生目标 1344×768,ComfyUI 需 0.30.0 或更新。输出为 24 fps 视频加 32 kHz 立体声。
为什么我请求 5 秒,出来是 124 帧?
H3 的帧数会对齐到 17k+5,所以 5 秒的请求落在约 124 帧——24 fps 下是 5.17 秒。这是预期行为,不是 bug。
没有本地显卡还能用 H3 吗?
可以,走托管服务。HelloGen 的 Pro 套餐包含 H3 不限量生成,每条 0 积分,每天至少 2 条优先出片。