MiniMax H3 本地部署:量化版怎么选、显存要多少、出片要多久

自 2026 年 8 月权重放出以来,H3 在消费级显卡上就能跑了,各家教程的步骤也大同小异。分歧——或者说集体沉默——在数字上:到底哪个量化版配哪张卡,以及你实际要等多久。这一页把公开的实测数字汇总在一起。

看看不限量套餐
一台开着侧板的主机,里面的显卡正在发光,旁边显示器上是视频时间线。
全套就在这一台机器上——而这张卡每出一条片要占用好几分钟。

先选量化版,别的都在它后面

放出的权重分两家:fl2va 管文生视频和图生视频,ref2va 管参考图驱动的生成。两者都以 GGUF 量化形式发布,你选的这个文件决定了后面所有事。

原始 BF16 权重约 123.6 GB,所以没人在家里跑它。社区量化能把一套可用配置压到 21 GB 上下。

有一条要重复一遍:Q8_CRU16G 依赖 ComfyUI-GGUF 自定义节点,在别的运行时里加载不了。

量化fl2varef2va说明
Q4_011.4 GB11.4 GB标准 4-bit。体积最小,质量最低。
U16G15.0 GB15.0 GBINT8 + Q4_0 混合。在 16G 以上的卡上比 Q4_0 还快
Q8_CR20.2 GB20.2 GBQ8_0 的质量,权重换成 INT8 ConvRot。
Q8_020.2 GB21.4 GB标准 8-bit。四者里质量最高。
体积取自社区 GGUF 仓库公布的数据。Q8_CR 与 U16G 需要 ComfyUI-GGUF。

各档显卡能跑什么、要等多久

这些是权重刚放出那段时间的实测记录,不是受控基准测试,会随着 offload 策略、硬盘速度和系统内存余量变化。当量级看,别当承诺。

但底下的规律是稳的:16G 以下,你是在用时间换「装得下」;24G 以上,先放开的是画布而不是时钟。

显存典型显卡能跑的画布一条 5 秒片
8 GBRTX 3070 · 4060 · 3060 Ti640×360 – 832×4809–10 分钟(RTX 3070)
12 GBRTX 3060 · 4070 · 2080 Ti默认 0.4 MP不到 9 分钟(RTX 3060,20 步)
16 GBRTX 4070 Ti Super · 4080 · 5070 Ti0.4–0.5 MP;配 Turbo LoRA 可上 768p约 3 分钟(4090 笔记本版,960×540)
24 GBRTX 3090 · 4090完整 1344×768 画布几分钟(个位数)
32 GBRTX 5090完整画布,最长 15 秒约 10 分钟(20 步 GGUF Q5)
个人实测记录,非基准测试。16G 以下,系统内存和显存一样要紧。

先加内存,再考虑换显卡

这条建议在每一篇低显存教程里都会出现,而且反直觉到值得明说:模型装不下的时候,ComfyUI 会从系统内存里流式取剩下的部分。一张 12G 的卡配 32G 内存能跑完;同一张卡配 16G 内存,要么疯狂交换,要么整机卡死。

12G 的卡请把 32G 系统内存当成底线,16G 的卡想跑得顺就上 64G。快速 NVMe 同理——从显卡挪出去的张量总得从某个地方挪回来。

真正有效的只有两个优化

Turbo LoRA 是最大的那个。它把步数降到文生/图生视频 8 步、参考图生成 4 步,省下的时间比换任何量化版都多。

Sage Attention 是第二个,通过 ComfyUI-KJNodes 的 `Patch Sage Attention KJ` 节点启用。它压低自注意力层的显存峰值,这正是让一张会 OOM 的卡变成能跑完的关键。

其余都是小杠杆。先把一个朴素工作流跑通,再一次加一个——在没有基线之前加优化,和装坏了是分不清的。

手段作用什么时候用
Turbo LoRA步数降到 8(T2V/I2V)/ 4(R2V)一直开。单项收益最大。
Sage Attention压低注意力层显存峰值采样阶段 OOM 的时候。
动态 offload把部分权重流式放到系统内存checkpoint 根本装不下的时候。
KJNodes 低显存注意力降峰值,输出与未打补丁时一致同上,且不损画质。
加系统内存让 offload 活得下去16G 以下,先于任何显卡升级。

从这套参数开始

从小画布起步,一次只改一个变量。下面是官方默认值,在你跑出一次干净的结果之前就去改它们,一个下午就没了。

有一件看着像 bug 但不是的事:帧数会对齐到 H3 的 `17k+5`,所以请求 5 秒会变成约 124 帧——24 fps 下是 5.17 秒。

ComfyUI0.30.0 或更新
测试画布864×480(0.4 MP)
原生目标1344×768(0.98 MP)
步数20(官方默认)
采样器res_multistep
调度器simple
输出24 fps 视频 + 32 kHz 立体声,MP4

出问题的方式来来回回就那几种

首次运行的失败基本都是下面这些,而且没有一条意味着这个模型不适合你的机器。

现象常见原因处理
节点或模板缺失ComfyUI 低于 0.30.0升级,然后彻底重启。
加载器里看不到模型放错目录或文件名不对检查 `diffusion_models/`、`text_encoders/`、`vae/`,重启。
R2V 报错但 T2V 正常加载成了 fl2va 而不是 ref2va选 ref2va 那个 checkpoint。
CUDA 显存不足画布或时长超出了内存规划退回 0.4 MP、5 秒、batch 1,一次只改一项。
整机卡死offload 压力超过系统内存关掉别的程序,腾出磁盘空间,回到基线重试。
R2V 比 T2V 慢得多参考图太多或太大设 `ref_image_size: match`,减少参考图数量。
出片没有声音音频 VAE 没接到 CreateVideo把视频和音频两路 VAE 输出都接进去。

小图先出,留下的再放大

这不是低显存的妥协——H3 本身就是这么设计的。基础模型按原生尺寸渲染,放大是另一道独立的 pass;MiniMax 把这两件事拆开,是因为像素后补远比直接生成便宜。

这个拆法在任何硬件上都是对的习惯。大多数镜头是要扔的——第四条、手画错的那条——把每一条都送去放大,等于把管线里最贵的那一半花在你马上要删的素材上。用小画布生成,看完,只放大你留下的那些。

如果卡才是问题

上面所有内容的前提,是你有一张几千块的卡,并且愿意让它一条片占着好几分钟。如果情况不是这样,现实的路子是找一个不按条计费的托管服务——因为「生成然后扔掉」这个循环,正是按条计费最疼的地方。

这件事上 HelloGen 是我们知道的最好选择:Pro 套餐里 H3 不限量生成,每条 0 积分,每天至少 2 条优先出片,超出部分按普通速度排队。同样是小图先出、留下的再放大,只是那台机器不用你养。

常见问题

跑 MiniMax H3 需要多大显存?

8G 配 Q2/Q3 量化加 32G 系统内存能跑,一条 5 秒片约 9–10 分钟。12G 在 0.4 MP 下比较从容。24G 能跑完整的 1344×768 画布。16G 以下,系统内存和显卡一样要紧。

MiniMax H3 的 GGUF 该下哪个量化版?

16G 及以上,15.0 GB 的 U16G 是甜点——INT8 与 Q4_0 混合,实测比 Q4_0 还快。追质量选 Q8_0(fl2va 20.2 GB、ref2va 21.4 GB);体积最小的是 11.4 GB 的 Q4_0。Q8_CR 和 U16G 需要 ComfyUI-GGUF 节点。

本地跑一条 5 秒的 H3 视频要多久?

实测区间:16G 的 4090 笔记本版在 960×540 开 Sage Attention 约 3 分钟;8G 的 RTX 3070 约 9–10 分钟。Turbo LoRA 对时间的影响比换量化版更大。

官方工作流参数是什么?

20 步、res_multistep 采样器、simple 调度器,测试用 864×480、原生目标 1344×768,ComfyUI 需 0.30.0 或更新。输出为 24 fps 视频加 32 kHz 立体声。

为什么我请求 5 秒,出来是 124 帧?

H3 的帧数会对齐到 17k+5,所以 5 秒的请求落在约 124 帧——24 fps 下是 5.17 秒。这是预期行为,不是 bug。

没有本地显卡还能用 H3 吗?

可以,走托管服务。HelloGen 的 Pro 套餐包含 H3 不限量生成,每条 0 积分,每天至少 2 条优先出片。

继续读

想自己做一个?

用你自己的话描述,几秒钟就能看到结果。

看看不限量套餐