Zyphra lancia Zamba2-VL: modelli vision-language ibridi che tagliano la latenza iniziale dell’80%
Zyphra ha rilasciato Zamba2-VL, una famiglia di modelli vision-language aperti disponibili in tre taglie: 1,2 miliardi, 2,7 miliardi e 7 miliardi di parametri. Ogni modello combina un backbone ibrido Mamba2–Transformer con un encoder visivo pre-addestrato. L’obiettivo è offrire accuratezza competitiva con una latenza molto più bassa rispetto ai modelli basati esclusivamente su Transformer densi.
I modelli Zamba2-VL seguono il template LLaVA: un encoder visivo trasforma le immagini in feature, un adattatore MLP le proietta nello spazio del linguaggio, e un modello linguistico processa una sequenza intercalata di token visivi e testuali. Supportano la comprensione di immagini singole e multiple, e il grounding (cioè la capacità di indicare oggetti specifici nell’immagine).
Architettura ibrida Mamba2–Transformer
La differenza principale rispetto ai tipici VLM è nel backbone. I layer Mamba2 (state-space) eseguono il calcolo in tempo lineare con uno stato di dimensione fissa. Tra di essi sono intervallati alcuni layer di attenzione condivisi, ciascuno con un adattatore LoRA unico. I layer Mamba2 gestiscono la maggior parte del carico computazionale a basso costo; i layer di attenzione condivisi preservano la capacità di recupero nel contesto che i modelli puramente state-space perdono. Il tokenizer è Mistral v0.1.
Zyphra ha addestrato Zamba2-VL su 100 miliardi di token di dati misti (testo e visione-testo) provenienti da dataset web aperti.
Risultati sui benchmark
Il team ha valutato Zamba2-VL su 14 benchmark che coprono comprensione di grafici, diagrammi, documenti, percezione generale, ragionamento e conteggio visivo. I risultati mostrano un pattern disomogeneo.
- Conteggio visivo: è il punto di forza. Zamba2-VL-1.2B ottiene 62,5 su PixMoCount, contro 32,8 di InternVL3.5-1B e 17,7 di PerceptionLM-1B. Il modello 2.7B raggiunge 82,5, vicino a Qwen3-VL-4B (89,2).
- Comprensione documenti: solida. DocVQA per il modello 2.7B è a 90,9, superando InternVL3.5-2B (89,4) e Molmo2-4B (87,8).
- Ragionamento knowledge-heavy: inferiore a modelli più grandi. Su MMMU (val) il 2.7B segna 37,7, contro 49,9 di InternVL3.5-2B e 51,4 di Qwen3-VL-4B.
Vantaggio in inferenza: time-to-first-token ridotto
Il vantaggio principale di Zamba2-VL è nell’inferenza. L’attenzione dei Transformer scala quadraticamente con la lunghezza della sequenza. Input multimodali (immagini ad alta risoluzione, brevi clip video) possono produrre decine di migliaia di token. Zamba2-VL evita la cache KV crescente e ha un prefill quasi lineare con uno stato ricorrente di dimensione fissa.
Su un prefill di 32.000 token, i modelli Zamba2-VL ottengono punteggi competitivi con una latenza inferiore di almeno un ordine di grandezza rispetto ai Transformer VLM comparabili. L’efficienza è massima nelle taglie 1.2B e 2.7B, quelle pensate per l’esecuzione su dispositivo e sui bordi.
Casi d’uso
I punti di forza si traducono in applicazioni concrete:
- Estrazione da documenti e fatture: grazie ai buoni risultati su DocVQA, il modello è adatto per la digitalizzazione di ricevute e l’analisi di moduli.
- Conteggio in contesti retail e inventario: i punteggi su PixMoCount e CountBenchQA lo rendono utile per contare oggetti in immagini di magazzino.
- Grounding visivo: supporta l’indicazione di oggetti specifici in immagini di prodotti o interfacce utente.
- Assistenti su dispositivo: la bassa latenza iniziale lo rende adatto a telefoni e edge box, specialmente per input visivi lunghi come PDF multi-pagina.
Output e licenza
I tre modelli sono disponibili su Hugging Face nella collection Zyphra/Zamba2-VL. Il codice di inferenza funzionante è pubblico su GitHub, con dipendenze che richiedono una GPU CUDA per i kernel Mamba2 ottimizzati. La licenza è Apache 2.0.
Punti di forza e limiti
- Punti di forza: prima famiglia di VLM aperti su un LLM ibrido SSM–Transformer completamente aperto; time-to-first-token circa un ordine di grandezza inferiore; conteggio visivo e comprensione documenti competitivi; tre taglie per edge, mid e 7B; licenza Apache 2.0.
- Limiti: rilasciato come artefatto di ricerca; inferiore su ragionamento knowledge-heavy (MMMU, MathVista); OCRBench più basso di modelli simili; richiede GPU CUDA per le prestazioni ottimali; il deployment richiede self-hosting dal codice rilasciato.
Per iniziare
Per provare Zamba2-VL è necessario installare il fork di transformers di Zyphra e le dipendenze per i kernel Mamba2 ottimizzati. Il repository include uno script di esempio per caricare il modello e fare inferenza su una singola immagine.
