Meituan rilascia LongCat-2.0: modello AI open source da 1,6 trilioni di parametri addestrato su chip cinesi
Poche ore fa Meituan, la società cinese nota per la sua app di delivery, ha rilasciato ufficialmente LongCat-2.0 su GitHub, Hugging Face e sulla sua piattaforma interna. Il modello è il motore computazionale di “Owl Alpha”, il sistema anonimo che negli ultimi due mesi ha dominato le classifiche globali degli sviluppatori su OpenRouter.
LongCat-2.0 è un sistema Mixture-of-Experts (MoE) con 1,6 trilioni di parametri totali e una finestra di contesto nativa di 1 milione di token. È distribuito con licenza MIT, quindi utilizzabile anche in ambito commerciale senza restrizioni.
I prezzi per l’API sono aggressivi: in promozione limitata, l’input costa $0,30 per milione di token e l’output $1,20. I colpi alla cache di contesto sono gratuiti. I prezzi standard sono $0,75/$2,95 per milione di token in input/output.
Ciò che rende il rilascio un punto di svolta è l’indipendenza operativa: il modello è stato addestrato interamente su un cluster di oltre 50.000 ASIC cinesi, senza utilizzare GPU Nvidia, dimostrando che è possibile scalare modelli AI di frontiera con hardware alternativo.
Impatto sul mercato AI
Il successo di LongCat-2.0 arriva in un momento delicato. Washington ha chiesto a OpenAI e Anthropic di limitare l’accesso ai loro modelli più recenti (GPT-5.6 e Claude Fable 5). Molti esperti avvertono che queste restrizioni hanno spinto gli sviluppatori verso alternative open source cinesi più economiche e accessibili.
Durante la sua presenza anonima su OpenRouter, Owl Alpha ha generato circa 10,1 trilioni di token al mese, con una crescita del 242% mese su mese, piazzandosi tra i primi tre modelli della piattaforma.
Tecnologia: attenzione sparsa e zero calcolo superfluo
LongCat-2.0 attiva in media solo 48 miliardi di parametri per token (con un range tra 33 e 56 miliardi), grazie a un framework “Zero-Compute Experts” che elimina il sovraccarico computazionale delle reti ultra-dense.
Per sostenere la finestra di 1 milione di token, Meituan ha introdotto LongCat Sparse Attention (LSA), un’evoluzione della sparsità di DeepSeek. LSA si basa su tre tecniche:
- Streaming-aware Indexing: organizza la selezione dei token in blocchi sequenziali per ottimizzare l’uso della memoria HBM
- Cross-Layer Indexing: riutilizza lo stesso indice di attenzione su più livelli nascosti, riducendo i calcoli
- Hierarchical Indexing: una prima scrematura rapida a livello di blocco, seguita da una selezione fine sui candidati rimasti
Inoltre, il modello integra un modulo N-gram Embedding con 135 miliardi di parametri aggiuntivi, che espande lo spazio di embedding di circa 100 volte, accelerando le inferenze su batch grandi.
Prestazioni: supera GPT-5.5 su SWE-bench Pro
LongCat-2.0 è ottimizzato per compiti ingegneristici multi-step, integrazione di tool e automazione di repository. Nei benchmark standardizzati registra:
- SWE-bench Pro: 59,5 (contro 58,6 di GPT-5.5)
- Terminal-Bench 2.1: 70,8
- SWE-bench Multilingual: 77,3
- FORTE: 73,2
Il modello è disponibile immediatamente per download e test su GitHub e Hugging Face.
