VibeThinker-3B: il modello AI da 3 miliardi di parametri che sfida i giganti (e divide la comunità scientifica)
Un team di nove ricercatori di Sina Weibo — il social network cinese noto più per i microblog che per l’AI — ha pubblicato un paper tecnico su arXiv che ha scosso la comunità scientifica. Il modello VibeThinker-3B ha ottenuto 94,3 su AIME 2026, l’esame di matematica dell’American Invitational Mathematics Examination, uno dei test più difficili al mondo. Con la tecnica Claim-Level Reliability Assessment, il punteggio sale a 97,1, superando praticamente tutti i sistemi pubblici.
Per capire la portata del risultato: DeepSeek V3.2 ha 671 miliardi di parametri, circa 224 volte più di VibeThinker-3B. Gemini 3 Pro di Google ha ottenuto 91,7 sullo stesso test. Un modello da 3 miliardi di parametri può girare su un laptop consumer.
I ricercatori introducono la Parametric Compression-Coverage Hypothesis: le capacità di ragionamento verificabile (matematica, coding) sono “parameter-dense” e possono essere compresse in un nucleo compatto, mentre la conoscenza enciclopedica richiede molti più parametri. Non a caso, su GPQA-Diamond (scienza avanzata) VibeThinker-3B segna solo 70,2, contro l’87 di Claude Opus 4.5.
I numeri del paper
VibeThinker-3B ha ottenuto risultati notevoli su diversi benchmark:
- AIME 2025: 91,4
- AIME 2026: 94,3
- HMMT 2025 (Harvard-MIT Mathematics Tournament): 89,3
- BruMO 2025 (Brown University Math Olympiad): 93,8
- IMO-AnswerBench (400 problemi a livello Olimpiadi): 76,4
- LiveCodeBench v6 (coding): 80,2 Pass@1
- LeetCode (contests aprile-maggio 2026): 96,1% di accettazione
- IFEval (istruzioni): 93,4
Come è stato costruito
Il modello parte da Qwen2.5-Coder-3B di Alibaba e viene post-addestrato con il “Spectrum-to-Signal Principle”. Il processo si articola in quattro fasi:
- Fase 1: Supervised fine-tuning con curriculum learning: prima dati misti, poi solo problemi di ragionamento avanzato
- Fase 2: Reinforcement learning (MGPO) su matematica, coding e STEM. I campioni con tracce sotto 5.000 token vengono scartati
- Fase 3: Distillazione delle tracce migliori con “learning-potential score”
- Fase 4: Instruct RL per il rispetto delle istruzioni
Una scoperta interessante: nei test a 3B, allungare progressivamente la finestra di contesto — tecnica che funzionava a 1,5B — ha peggiorato le performance. La soluzione è stata usare un singolo contesto da 64.000 token per tutto l’addestramento.
Il dibattito: breakthrough o benchmark falsati?
La reazione della comunità è stata profondamente scettica. L’utente @orcus108 su X ha scritto: «Un modello da 3B ha messo su coding risultati alla pari con Claude Opus 4.5. Non so se è una svolta o se i benchmark sono rotti». Il post ha accumulato oltre 161.000 visualizzazioni.
Da un lato, i risultati sembrano sfidare le leggi di scaling dell’AI. Dall’altro, la comunità è stanca di paper che “spaccano” i benchmark ma poi non funzionano nella pratica. Il paper stesso riconosce il limite: su conoscenza enciclopedica il modello è molto indietro. La domanda da molti miliardi di dollari è: possiamo avere un’AI intelligente senza costruire modelli sempre più grandi? VibeThinker-3B non dà una risposta definitiva, ma costringe a farsi la domanda.
