Torna al blog
AI Strategy20 ottobre 2026 4 min di lettura

Stesso punteggio. Quaranta volte il conto.

AP
Angelo Pallanca
Digital Transformation & AI Governance

TL;DR

Quando questa serie è partita, l'argomento sulla harness era di capacità: stesso modello, corpo diverso, sedici punti di differenza. Tre studi usciti tra giugno e settembre 2026 dicono che il divario si è spostato. Tra harness diverse i tassi di successo stanno dentro zero-otto punti, mentre il costo per arrivarci varia fino a quaranta volte. Gartner ha già messo un prezzo alla conseguenza: oltre cinque volte per workflow agentico entro il 2028. La Cornovaglia ha avuto lo stesso problema di misura nel 1811 e lo ha risolto con un numero pubblicato.


Quindici mesi fa l'argomento sulla harness era un argomento di capacità. Stessi pesi, due corpi diversi, sedici punti di distanza su un benchmark di coding. Era il primo post di questa serie e regge ancora.

Tre paper usciti tra giugno e settembre 2026 dicono che non è più quella la parte interessante.


Lo scaffold ormai sposta poco il punteggio

A giugno Naman Vats e Oleg Golev di Sentient Labs hanno condotto 300 prove: due modelli, Qwen 3.6 Plus e MiniMax M2.5, su tre harness open source, Goose, OpenCode e OpenHands-SDK, con un sottoinsieme stratificato di cinquanta task da Terminal-Bench Pro.

I tassi di successo si addensano tra il 38 e il 50 per cento. Le differenze tra harness a parità di modello: da zero a otto punti.

Poi hanno contato i token.

Il costo per task risolto va da circa 28.000 token a circa 1,55 milioni. Uno scarto da 40 a 55 volte, per lo stesso lavoro, con lo stesso tasso di successo.

OpenCode genera circa dieci volte più turni a vuoto rispetto a Goose. Cicli morti. L'agente che pensa di pensare, a contatore acceso.

Due modelli e cinquanta task sono uno studio piccolo, e le harness open source non sono quelle che girano davvero nelle grandi aziende. Prendete l'ordine di grandezza, non il decimale. L'ordine di grandezza è tutta la storia.


Il conto è un problema di architettura

Un paper di luglio sull'orchestrazione enterprise ha tenuto fermo il task su sei modelli variando solo la harness. Token per task giù del 38 per cento, costo per task del 41, latenza mediana del 44, qualità invariata.

Gli autori danno un nome al fallimento: token maxing. Qualità comprata alzando di continuo l'intensità di token, con rendimenti marginali calanti, mascherata dai prezzi per token che scendono e visibile solo in fattura.

A fine settembre NVIDIA ha pubblicato SoL-Pi, un sistema che cerca harness migliori in automatico. 152 direzioni, 535 ambienti eseguibili, oltre 3.000 run. La configurazione efficiente usa il 49 per cento di token in meno e conserva il 93,7 per cento del punteggio.

Fermatevi un attimo su questo. Una delle più grandi aziende hardware del pianeta ha bruciato migliaia di run di calcolo per ottimizzare il corpo, non il cervello.


Gartner ha già fatto il prezzo

Il 17 agosto 2026 Gartner ha previsto che il costo di inferenza per workflow agentico crescerà di oltre cinque volte entro il 2028. Il loro analista Will Sommer lo ha descritto così: economie unitarie migliori che fanno salire il costo complessivo dell'AI senza un percorso chiaro verso un valore proporzionato.

I prezzi per token scendono. Le bollette salgono. Vero entrambe le cose. La harness è il punto in cui si incontrano.


La Cornovaglia lo aveva risolto nel 1811

Le macchine delle miniere di Cornovaglia bruciavano carbone per pompare acqua, e nessuno riusciva a confrontarle onestamente, perché i cavalli vapore non dicono niente sul combustibile. Dal 1811 un rapporto mensile iniziò a pubblicare la duty di ogni macchina: milioni di libbre d'acqua sollevate di un piede per ogni staio di carbone. Non la potenza. Il lavoro per unità di combustibile.

La duty media in Cornovaglia passò da circa venti milioni negli anni Dieci a oltre ottanta alla fine degli anni Venti. Le macchine non ricevettero una fisica nuova. Ricevettero un numero pubblico, ogni mese, con il nome di tutti sopra.

Continuiamo a classificare gli agent per tasso di successo come la Cornovaglia classificava le macchine per cavalli vapore. Alcune classifiche, tra cui Artificial Analysis, ormai pubblicano costo e token per task accanto al punteggio. Lo strumento esiste. Non è ancora l'unità che tutti citano.


Perché conta per la vostra azienda

Se scegliete una piattaforma agentica sul punteggio di benchmark, state scegliendo sulla metrica che varia di zero-otto punti ignorando quella che varia di quaranta volte.

Chiedete al fornitore i token per task completato, non per chiamata. Chiedete quale quota di turni non produce nessuna azione. Poi fate il pilota sui vostri task veri e leggete la fattura, non la classifica.

Il cervello è a noleggio. Il corpo è quello che vi fatturano.

Ti interessa approfondire?

Richiedi una proposta