Smartphone che esegue modelli AI con Gemma 4 QAT, interfaccia di inferenza in primo piano

Confronto tra i formati QAT di Gemma 4: quanto consumano su GPU, laptop e smartphone

Google DeepMind ha rilasciato i checkpoint Quantization-Aware Training (QAT) per la famiglia Gemma 4, pensati per dispositivi edge e GPU consumer. I nuovi formati riducono l’impronta in RAM senza sacrificare eccessivamente la qualità del modello, rispetto alla standard Post-Training Quantization (PTQ).

La differenza tra QAT e PTQ è nel momento in cui avviene la compressione. Con PTQ si comprime il modello già addestrato, con un inevitabile degrado della qualità. QAT simula la quantizzazione durante l’addestramento: il modello impara a compensare la perdita di precisione. Google afferma che i risultati QAT offrono una qualità superiore rispetto ai baseline PTQ, anche se per ora non ha pubblicato benchmark specifici per Gemma 4. A titolo di confronto, la generazione precedente (Gemma 3 QAT) aveva ridotto il calo di perplexity in Q4_0 del 54% su llama.cpp.

Ecco come si posizionano i tre formati principali per i modelli E2B e E4B:

  • BF16 — il riferimento di qualità. E2B occupa 9,6 GB, E4B arriva a 15 GB. Non è pensato per il deployment su dispositivi mobili.
  • Q4_0 QAT — formato generico per uso locale: E2B scende a 3,2 GB, E4B a 5 GB. Gira su GPU consumer (e, in test precedenti, su Raspberry Pi 5).
  • Mobile QAT — il nuovo schema ottimizzato per smartphone. Porta E2B a circa 1 GB, e la versione solo testo (senza encoder audio/video) scende sotto il GB.

Il formato mobile raggiunge questo risultato con quattro tecniche: attivazioni statiche (pre-calcolate in addestramento), quantizzazione channel-wise, compressione a 2 bit solo sui layer di generazione dei token, e ottimizzazione di embedding e KV cache. I layer di ragionamento principali restano a precisione più alta, preservando le capacità del modello.

Nella classifica delle dimensioni per l’uso on-device, Q4_0 QAT e Mobile QAT totalizzano 21 punti su 25, a pari merito ma pensati per hardware diverso: il primo per laptop e GPU consumer, il secondo per telefoni. BF16 resta il riferimento assoluto di qualità ma è quasi inutilizzabile su dispositivi mobili.

I pesi sono disponibili su Hugging Face da oggi, supportati da llama.cpp, Ollama, LM Studio, vLLM, MLX e LiteRT-LM.

Articoli simili