Rappresentazione di pipeline di intelligenza artificiale con nodi e percorsi di ottimizzazione

Cisco AI presenta FAPO: ottimizzazione automatica delle pipeline LLM con attribuzione dei fallimenti

Ottenere prompt efficaci resta il vero collo di bottiglia per chi sviluppa applicazioni basate su LLM. Piccole variazioni di formulazione possono far oscillare l’accuratezza del 20%, e ciò che funziona su pochi esempi spesso si rompe quando si scala. Cisco AI ha presentato FAPO (Fully Automated Prompt Optimization), un sistema open source guidato da Claude Code che automatizza l’intero ciclo.

L’utente fornisce un dataset e un prompt iniziale. FAPO valuta i risultati, classifica gli errori per causa, propone varianti mirate, le convalida e ripete il ciclo fino a raggiungere l’accuratezza target. Il codice è rilasciato sotto licenza Apache 2.0 e supporta anche Codex come agente di ottimizzazione.

Come funziona il ciclo di ottimizzazione

Ogni iterazione attraversa sei fasi: valutazione su tutto il dataset, attribuzione dei fallimenti per causa radice, proposta di una variante che colpisce il cluster di errori dominante, revisione indipendente della proposta per evitare data leakage, confronto con la versione precedente (accettazione solo se c’è miglioramento), e ripetizione fino al raggiungimento dell’obiettivo.

Il sistema opera su tre livelli crescenti di intervento: prima le modifiche al prompt (costo minimo), poi i parametri di configurazione come retrieval_k o temperatura, infine la struttura stessa della pipeline, ad esempio aggiungendo un nodo di auto-riflessione. FAPO esaurisce un livello prima di passare al successivo.

Classificazione dei fallimenti

L’attribuzione suddivide gli errori in quattro categorie:

  • Recupero: contenuti vuoti o irrilevanti dalla retrieval
  • Cascata: un output vuoto in un passo iniziale compromette i successivi
  • Formato: la risposta corretta è presente ma il parser non riesce a estrarla
  • Ragionamento: input validi producono conclusioni sbagliate

Errori di formato e ragionamento sono risolvibili a livello di prompt. Recupero e cascata richiedono invece interventi strutturali.

I risultati del benchmark contro GEPA

Cisco ha confrontato FAPO con GEPA (Generalized Evolutionary Prompt Architecture), un metodo basato su ricerca evolutiva. Entrambi partivano dalle stesse baseline. GEPA poteva ottimizzare solo il prompt; FAPO poteva intervenire anche sulla struttura della pipeline. Il test ha coperto sei benchmark con tre modelli: GPT-4.1-mini, GPT-5.4-mini e Gemma 3-12B.

FAPO ha vinto 15 confronti su 18 (86%), con un guadagno medio di +14,1 punti percentuali rispetto a GEPA. Sui due benchmark in cui ha attivato modifiche strutturali (HoVer e IFBench), ha vinto tutte e sei le combinazioni modello-benchmark con un guadagno medio di +33,8 punti. Sui quattro benchmark senza modifiche strutturali, ha comunque vinto 9 volte su 12 solo con l’ottimizzazione dei prompt. L’unico benchmark dove GEPA ha prevalso (AIME, per 3,1 punti) rientra nella varianza stocastica delle prove.

Casi d’uso concreti

FAPO è pensato per pipeline multi-step, non per singoli prompt. Esempi documentati da Cisco:

  • Domande a salti multipli: una pipeline recupera documenti, estrae fatti, ragiona e formatta la risposta. In un test documentato, l’accuratezza è passata dal 39,3% al 70,3% in due iterazioni. Su HotpotQA, FAPO ha raggiunto il 68,3% contro il 61,8% di GEPA.
  • Istruzioni complesse: su IFBench, i fallimenti di formato hanno spinto FAPO a modificare la pipeline, raggiungendo l’80,7%.
  • Classificazione: trasformazione di nomi software in categorie, ottimizzata fino all’esatta corrispondenza.
  • Agenti ReAct: estensione per ottimizzare agenti che chiamano strumenti usando punteggi di traiettoria e LLM-as-Judge.

Protezioni contro l’overfitting

Il sistema include tre meccanismi: ispezione limitata ai soli dati di training (validazione e test visibili solo come punteggi aggregati), ogni variante di prompt è un file immutabile (nessuna modifica in-place), e una revisione indipendente su ogni proposta prima dell’esecuzione.

Articoli simili