Addestramento economico di un modello AI HRM-Text

Addestrare un modello AI da zero con soli $1.500: la svolta di HRM-Text

Addestrare un modello linguistico di base da zero costa milioni di dollari e richiede quantità enormi di dati. Sapient Intelligence ha proposto un’alternativa: il suo HRM-Text, addestrato per circa $1.500 su soli 40 miliardi di token, ha ottenuto risultati competitivi con modelli 2-7 volte più grandi.

Il problema del metodo tradizionale è che i modelli Transformer attuali spendono la maggior parte delle risorse per memorizzare dettagli irrilevanti del web (commenti Reddit, pagine vecchie) invece di imparare a ragionare. HRM-Text aggira questo limite con un’architettura gerarchica ricorrente che separa la computazione in due livelli: uno strategico a evoluzione lenta (H-module) e uno esecutivo a evoluzione rapida (L-module).

Il CEO di Sapient, Guan Wang, ha spiegato a VentureBeat che le aziende affrontano tre problemi: addestramento costoso, infrastruttura pesante e cicli di sperimentazione lenti. «Quando un modello fallisce, la risposta dell’industria è sempre la stessa: renderlo più grande, aggiungere più dati, più GPU. Ma questo sta raggiungendo rendimenti decrescenti», ha dichiarato Wang.

HRM-Text non usa la predizione del token successivo (next-token prediction) ma un obiettivo di completamento del task: il modello viene valutato solo sulla risposta finale, non sui singoli token generati. Per stabilizzare l’addestramento su sequenze ricorrenti — che tendono a far esplodere o svanire i gradienti — i ricercatori hanno introdotto due innovazioni: MagicNorm, una tecnica di normalizzazione specializzata, e una fase di warm-up iniziale su ragionamenti brevi.

Il modello da 1 miliardo di parametri è stato testato su benchmark standard: MMLU 60,7%, GSM8K 84,5% e MATH 56,2%. Prestazioni che competono con modelli open weight da 2 a 7 miliardi di parametri, a una frazione del costo.

Per le imprese, il significato è chiaro: «Immaginate un hedge fund, un’assicurazione o una banca con dati proprietari: note di ricerca, logiche di transazione, modelli di rischio. Non vogliono inviare quei dati a un modello esterno. Hanno bisogno di un nucleo di ragionamento compatto che impari la loro struttura di task», ha aggiunto Wang. Con HRM-Text, la pre-addestramento fondazionale non è più un’esclusiva di chi dispone di risorse illimitate.

Articoli simili