MiniMax H3 in locale: quale quantizzazione, quanta VRAM, quanto tempo di rendering
H3 gira su hardware consumer da quando i pesi sono usciti ad agosto 2026, e le guide concordano sui passaggi. Dove divergono — o tacciono — è sui numeri: quale quantizzazione per quale scheda, e quanto aspetterai davvero. Questa pagina raccoglie le misure pubblicate.
✦ Vedi il piano illimitato
Scegli la quantizzazione prima di ogni altra cosa
I pesi rilasciati si dividono in due famiglie: fl2va per testo- e immagine-a-video, ref2va per la generazione guidata da riferimento. Entrambe escono come quantizzazioni GGUF, e il file che scegli decide tutto il resto.
I pesi BF16 originali pesano circa 123,6 GB: per questo nessuno li usa in casa. Le quantizzazioni della community portano una configurazione utilizzabile intorno ai 21 GB.
Un avvertimento da ripetere: le build Q8_CR e U16G dipendono dai nodi ComfyUI-GGUF e altrove non si caricano.
| Quantizzazione | fl2va | ref2va | Note |
|---|---|---|---|
| Q4_0 | 11,4 GB | 11,4 GB | 4 bit standard. La più piccola, la qualità più bassa. |
| U16G | 15,0 GB | 15,0 GB | INT8 + Q4_0 misti. Più veloce di Q4_0 oltre i 16 GB. |
| Q8_CR | 20,2 GB | 20,2 GB | Qualità Q8_0 con pesi INT8 ConvRot. |
| Q8_0 | 20,2 GB | 21,4 GB | 8 bit standard. La qualità migliore delle quattro. |
Cosa riesce a fare ogni scheda, e in quanto tempo
Sono misure riportate al momento del rilascio, non un benchmark controllato: cambiano con la strategia di offload, la velocità dello storage e la RAM libera. Leggile come ordine di grandezza, non come promessa.
Lo schema sotto però è costante: sotto i 16 GB scambi minuti per riuscire a caricare il modello; sopra i 24 GB si apre prima la tela che l’orologio.
| VRAM | Schede tipiche | Tela utilizzabile | Tempo per 5 s |
|---|---|---|---|
| 8 GB | RTX 3070 · 4060 · 3060 Ti | 640×360 – 832×480 | 9–10 min (RTX 3070) |
| 12 GB | RTX 3060 · 4070 · 2080 Ti | 0,4 MP di default | meno di 9 min (RTX 3060, 20 step) |
| 16 GB | RTX 4070 Ti Super · 4080 · 5070 Ti | 0,4–0,5 MP; 768p con Turbo LoRA | ~3 min (4090 laptop, 960×540) |
| 24 GB | RTX 3090 · 4090 | Tela completa 1344×768 | Pochi minuti |
| 32 GB | RTX 5090 | Tela completa, fino a 15 s | ~10 min (GGUF Q5, 20 step) |
Compra RAM prima di comprare VRAM
È il consiglio che torna in ogni resoconto su configurazioni piccole, ed è abbastanza controintuitivo da meritare una frase netta: quando il modello non entra, ComfyUI trasmette il resto dalla memoria di sistema. Una scheda da 12 GB con 32 GB di RAM finisce; la stessa con 16 GB arranca o blocca la macchina.
Considera 32 GB di RAM di sistema come minimo per una scheda da 12 GB, e 64 GB se sei a 16 GB e vuoi che sia fluido. Un NVMe veloce conta per lo stesso motivo — quello che esce dalla GPU deve rientrare da qualche parte.
Due ottimizzazioni valgono più di tutte le altre
Turbo LoRA è la principale. Porta gli step a 8 per testo- e immagine-a-video e a 4 per riferimento-a-video, e fa risparmiare più tempo di qualsiasi cambio di quantizzazione.
Sage Attention è la seconda, tramite il nodo `Patch Sage Attention KJ` di ComfyUI-KJNodes. Abbassa il picco di VRAM nei livelli di attenzione, ed è ciò che trasforma una scheda che va in OOM in una che finisce.
Tutto il resto è una leva minore. Fai girare prima un flusso semplice, poi aggiungine una alla volta — un’ottimizzazione aggiunta prima di avere un riferimento è indistinguibile da un’installazione rotta.
| Tecnica | Effetto | Quando usarla |
|---|---|---|
| Turbo LoRA | 8 step (T2V/I2V), 4 (R2V) | Sempre. Il guadagno più grande. |
| Sage Attention | Abbassa il picco di VRAM in attenzione | Quando va in OOM durante il sampling. |
| Offload dinamico | Trasmette parti alla RAM di sistema | Quando il modello non entra affatto. |
| Attenzione low-VRAM KJNodes | Meno picco, output identico | Stesso caso, senza costi di qualità. |
| Più RAM di sistema | Rende l’offload sostenibile | Prima di qualsiasi upgrade GPU sotto i 16 GB. |
Le impostazioni da cui partire
Parti dalla tela piccola e cambia una variabile alla volta. Qui sotto ci sono i valori ufficiali; modificarli prima di avere un rendering pulito è il modo in cui sparisce un pomeriggio.
Una cosa che sembra un bug e non lo è: il numero di frame si allinea al `17k+5` di H3, quindi una richiesta di 5 secondi diventa circa 124 frame — 5,17 s a 24 fps.
| Impostazione | Valore |
|---|---|
| ComfyUI | 0.30.0 o successivo |
| Tela di prova | 864×480 (0,4 MP) |
| Obiettivo nativo | 1344×768 (0,98 MP) |
| Step | 20 (default ufficiale) |
| Sampler | res_multistep |
| Scheduler | simple |
| Output | Video 24 fps + audio stereo 32 kHz, MP4 |
Quando si rompe, si rompe sempre allo stesso modo
Quasi tutti i fallimenti al primo avvio sono in questo elenco, e nessuno significa che il modello non è adatto alla tua macchina.
| Sintomo | Causa tipica | Soluzione |
|---|---|---|
| Nodi o template mancanti | ComfyUI precedente a 0.30.0 | Aggiorna, poi riavvia del tutto. |
| Modello assente dal loader | Cartella o nome file sbagliati | Controlla `diffusion_models/`, `text_encoders/`, `vae/`; riavvia. |
| R2V fallisce, T2V funziona | Caricato fl2va invece di ref2va | Seleziona il checkpoint ref2va. |
| Memoria CUDA esaurita | Tela o durata oltre il piano di memoria | Torna a 0,4 MP, 5 s, batch 1. Una variabile alla volta. |
| La macchina si blocca | Offload oltre la RAM di sistema | Chiudi altre app, libera disco, riprendi dalla base. |
| R2V molto più lento di T2V | Riferimenti troppi o troppo grandi | Imposta `ref_image_size: match`, riduci i riferimenti. |
| Video salvato muto | VAE audio non collegato a CreateVideo | Collega entrambe le uscite VAE, video e audio. |
Genera in piccolo, ingrandisci quello che tieni
Non è un compromesso da poca VRAM — è il modo in cui H3 è costruito. Il modello base rende alla sua dimensione nativa e una passata separata ingrandisce; MiniMax ha separato i due lavori perché i pixel costano molto meno aggiunti dopo che generati.
La stessa divisione è l’abitudine giusta su qualsiasi hardware. Quasi tutte le riprese si buttano — la quarta, quella con la mano sbagliata — e passarle tutte all’upscale spende la metà costosa della pipeline su materiale che cancellerai. Genera in piccolo, guarda, ingrandisci solo ciò che tieni.
Se il problema è l’hardware
Tutto quanto sopra presuppone una scheda da diverse centinaia di euro occupata per minuti a clip. Se non è la tua situazione, la strada concreta è un servizio ospitato che non fattura a clip — perché il ciclo genera-e-scarta è proprio ciò che rende dolorosa la tariffazione a unità.
HelloGen è la migliore opzione che conosciamo: generazione H3 illimitata con il piano Pro, 0 crediti per clip, con almeno 2 render prioritari al giorno e velocità standard oltre. La stessa abitudine genera-piccolo-poi-ingrandisci, senza la macchina.
Domande frequenti
Quanta VRAM serve per MiniMax H3?
8 GB bastano con una GGUF Q2/Q3 e 32 GB di RAM di sistema, circa 9–10 minuti per un clip da 5 secondi. 12 GB è comodo a 0,4 MP. 24 GB gestisce la tela completa 1344×768. Sotto i 16 GB la RAM di sistema conta quanto la scheda.
Quale quantizzazione GGUF scaricare?
U16G da 15,0 GB è il compromesso migliore dai 16 GB in su — pesi INT8 e Q4_0 misti, segnalata più veloce di Q4_0. Q8_0 (20,2 GB fl2va, 21,4 GB ref2va) per la qualità; Q4_0 da 11,4 GB per l’ingombro minimo. Q8_CR e U16G richiedono i nodi ComfyUI-GGUF.
Quanto ci mette un clip da 5 secondi in locale?
I tempi riportati vanno da circa 3 minuti su un 4090 laptop da 16 GB a 960×540 con Sage Attention, a 9–10 minuti su una RTX 3070 da 8 GB. Turbo LoRA incide più di qualsiasi cambio di quantizzazione.
Quali sono le impostazioni ufficiali?
20 step, sampler res_multistep, scheduler simple, 864×480 per provare e 1344×768 come obiettivo nativo, su ComfyUI 0.30.0 o successivo. Output a 24 fps con audio stereo 32 kHz.
Perché il mio clip da 5 secondi esce di 124 frame?
H3 allinea i frame a 17k+5, quindi una richiesta di 5 secondi cade intorno ai 124 frame — 5,17 s a 24 fps. È il comportamento atteso, non un bug.
Posso usare H3 senza una GPU locale?
Sì, tramite un servizio ospitato. HelloGen include la generazione H3 illimitata con il piano Pro, 0 crediti per clip, con almeno 2 render prioritari al giorno.