MiniMax H3 in locale: quale quantizzazione, quanta VRAM, quanto tempo di rendering

H3 gira su hardware consumer da quando i pesi sono usciti ad agosto 2026, e le guide concordano sui passaggi. Dove divergono — o tacciono — è sui numeri: quale quantizzazione per quale scheda, e quanto aspetterai davvero. Questa pagina raccoglie le misure pubblicate.

Vedi il piano illimitato
Un PC desktop con il pannello aperto, la scheda grafica accesa all’interno, accanto a un monitor con una timeline video.
Tutto su una macchina sola — e la scheda resta occupata per minuti a clip.

Scegli la quantizzazione prima di ogni altra cosa

I pesi rilasciati si dividono in due famiglie: fl2va per testo- e immagine-a-video, ref2va per la generazione guidata da riferimento. Entrambe escono come quantizzazioni GGUF, e il file che scegli decide tutto il resto.

I pesi BF16 originali pesano circa 123,6 GB: per questo nessuno li usa in casa. Le quantizzazioni della community portano una configurazione utilizzabile intorno ai 21 GB.

Un avvertimento da ripetere: le build Q8_CR e U16G dipendono dai nodi ComfyUI-GGUF e altrove non si caricano.

Quantizzazionefl2varef2vaNote
Q4_011,4 GB11,4 GB4 bit standard. La più piccola, la qualità più bassa.
U16G15,0 GB15,0 GBINT8 + Q4_0 misti. Più veloce di Q4_0 oltre i 16 GB.
Q8_CR20,2 GB20,2 GBQualità Q8_0 con pesi INT8 ConvRot.
Q8_020,2 GB21,4 GB8 bit standard. La qualità migliore delle quattro.
Dimensioni come pubblicate nel repository GGUF della community. Q8_CR e U16G richiedono ComfyUI-GGUF.

Cosa riesce a fare ogni scheda, e in quanto tempo

Sono misure riportate al momento del rilascio, non un benchmark controllato: cambiano con la strategia di offload, la velocità dello storage e la RAM libera. Leggile come ordine di grandezza, non come promessa.

Lo schema sotto però è costante: sotto i 16 GB scambi minuti per riuscire a caricare il modello; sopra i 24 GB si apre prima la tela che l’orologio.

VRAMSchede tipicheTela utilizzabileTempo per 5 s
8 GBRTX 3070 · 4060 · 3060 Ti640×360 – 832×4809–10 min (RTX 3070)
12 GBRTX 3060 · 4070 · 2080 Ti0,4 MP di defaultmeno di 9 min (RTX 3060, 20 step)
16 GBRTX 4070 Ti Super · 4080 · 5070 Ti0,4–0,5 MP; 768p con Turbo LoRA~3 min (4090 laptop, 960×540)
24 GBRTX 3090 · 4090Tela completa 1344×768Pochi minuti
32 GBRTX 5090Tela completa, fino a 15 s~10 min (GGUF Q5, 20 step)
Segnalazioni individuali, non benchmark. Sotto i 16 GB la RAM di sistema conta quanto la VRAM.

Compra RAM prima di comprare VRAM

È il consiglio che torna in ogni resoconto su configurazioni piccole, ed è abbastanza controintuitivo da meritare una frase netta: quando il modello non entra, ComfyUI trasmette il resto dalla memoria di sistema. Una scheda da 12 GB con 32 GB di RAM finisce; la stessa con 16 GB arranca o blocca la macchina.

Considera 32 GB di RAM di sistema come minimo per una scheda da 12 GB, e 64 GB se sei a 16 GB e vuoi che sia fluido. Un NVMe veloce conta per lo stesso motivo — quello che esce dalla GPU deve rientrare da qualche parte.

Due ottimizzazioni valgono più di tutte le altre

Turbo LoRA è la principale. Porta gli step a 8 per testo- e immagine-a-video e a 4 per riferimento-a-video, e fa risparmiare più tempo di qualsiasi cambio di quantizzazione.

Sage Attention è la seconda, tramite il nodo `Patch Sage Attention KJ` di ComfyUI-KJNodes. Abbassa il picco di VRAM nei livelli di attenzione, ed è ciò che trasforma una scheda che va in OOM in una che finisce.

Tutto il resto è una leva minore. Fai girare prima un flusso semplice, poi aggiungine una alla volta — un’ottimizzazione aggiunta prima di avere un riferimento è indistinguibile da un’installazione rotta.

TecnicaEffettoQuando usarla
Turbo LoRA8 step (T2V/I2V), 4 (R2V)Sempre. Il guadagno più grande.
Sage AttentionAbbassa il picco di VRAM in attenzioneQuando va in OOM durante il sampling.
Offload dinamicoTrasmette parti alla RAM di sistemaQuando il modello non entra affatto.
Attenzione low-VRAM KJNodesMeno picco, output identicoStesso caso, senza costi di qualità.
Più RAM di sistemaRende l’offload sostenibilePrima di qualsiasi upgrade GPU sotto i 16 GB.

Le impostazioni da cui partire

Parti dalla tela piccola e cambia una variabile alla volta. Qui sotto ci sono i valori ufficiali; modificarli prima di avere un rendering pulito è il modo in cui sparisce un pomeriggio.

Una cosa che sembra un bug e non lo è: il numero di frame si allinea al `17k+5` di H3, quindi una richiesta di 5 secondi diventa circa 124 frame — 5,17 s a 24 fps.

ImpostazioneValore
ComfyUI0.30.0 o successivo
Tela di prova864×480 (0,4 MP)
Obiettivo nativo1344×768 (0,98 MP)
Step20 (default ufficiale)
Samplerres_multistep
Schedulersimple
OutputVideo 24 fps + audio stereo 32 kHz, MP4

Quando si rompe, si rompe sempre allo stesso modo

Quasi tutti i fallimenti al primo avvio sono in questo elenco, e nessuno significa che il modello non è adatto alla tua macchina.

SintomoCausa tipicaSoluzione
Nodi o template mancantiComfyUI precedente a 0.30.0Aggiorna, poi riavvia del tutto.
Modello assente dal loaderCartella o nome file sbagliatiControlla `diffusion_models/`, `text_encoders/`, `vae/`; riavvia.
R2V fallisce, T2V funzionaCaricato fl2va invece di ref2vaSeleziona il checkpoint ref2va.
Memoria CUDA esauritaTela o durata oltre il piano di memoriaTorna a 0,4 MP, 5 s, batch 1. Una variabile alla volta.
La macchina si bloccaOffload oltre la RAM di sistemaChiudi altre app, libera disco, riprendi dalla base.
R2V molto più lento di T2VRiferimenti troppi o troppo grandiImposta `ref_image_size: match`, riduci i riferimenti.
Video salvato mutoVAE audio non collegato a CreateVideoCollega entrambe le uscite VAE, video e audio.

Genera in piccolo, ingrandisci quello che tieni

Non è un compromesso da poca VRAM — è il modo in cui H3 è costruito. Il modello base rende alla sua dimensione nativa e una passata separata ingrandisce; MiniMax ha separato i due lavori perché i pixel costano molto meno aggiunti dopo che generati.

La stessa divisione è l’abitudine giusta su qualsiasi hardware. Quasi tutte le riprese si buttano — la quarta, quella con la mano sbagliata — e passarle tutte all’upscale spende la metà costosa della pipeline su materiale che cancellerai. Genera in piccolo, guarda, ingrandisci solo ciò che tieni.

Se il problema è l’hardware

Tutto quanto sopra presuppone una scheda da diverse centinaia di euro occupata per minuti a clip. Se non è la tua situazione, la strada concreta è un servizio ospitato che non fattura a clip — perché il ciclo genera-e-scarta è proprio ciò che rende dolorosa la tariffazione a unità.

HelloGen è la migliore opzione che conosciamo: generazione H3 illimitata con il piano Pro, 0 crediti per clip, con almeno 2 render prioritari al giorno e velocità standard oltre. La stessa abitudine genera-piccolo-poi-ingrandisci, senza la macchina.

Domande frequenti

Quanta VRAM serve per MiniMax H3?

8 GB bastano con una GGUF Q2/Q3 e 32 GB di RAM di sistema, circa 9–10 minuti per un clip da 5 secondi. 12 GB è comodo a 0,4 MP. 24 GB gestisce la tela completa 1344×768. Sotto i 16 GB la RAM di sistema conta quanto la scheda.

Quale quantizzazione GGUF scaricare?

U16G da 15,0 GB è il compromesso migliore dai 16 GB in su — pesi INT8 e Q4_0 misti, segnalata più veloce di Q4_0. Q8_0 (20,2 GB fl2va, 21,4 GB ref2va) per la qualità; Q4_0 da 11,4 GB per l’ingombro minimo. Q8_CR e U16G richiedono i nodi ComfyUI-GGUF.

Quanto ci mette un clip da 5 secondi in locale?

I tempi riportati vanno da circa 3 minuti su un 4090 laptop da 16 GB a 960×540 con Sage Attention, a 9–10 minuti su una RTX 3070 da 8 GB. Turbo LoRA incide più di qualsiasi cambio di quantizzazione.

Quali sono le impostazioni ufficiali?

20 step, sampler res_multistep, scheduler simple, 864×480 per provare e 1344×768 come obiettivo nativo, su ComfyUI 0.30.0 o successivo. Output a 24 fps con audio stereo 32 kHz.

Perché il mio clip da 5 secondi esce di 124 frame?

H3 allinea i frame a 17k+5, quindi una richiesta di 5 secondi cade intorno ai 124 frame — 5,17 s a 24 fps. È il comportamento atteso, non un bug.

Posso usare H3 senza una GPU locale?

Sì, tramite un servizio ospitato. HelloGen include la generazione H3 illimitata con il piano Pro, 0 crediti per clip, con almeno 2 render prioritari al giorno.

Continua a leggere

Pronto a farlo tuo?

Descrivilo con parole tue e guardalo in pochi secondi.

Vedi il piano illimitato