TL;DR
Il 19 settembre una startup ha rilasciato un modello che non scrive nemmeno una frase. Gli fai una domanda tipizzata, lui restituisce un valore e una probabilita, e il suo benchmark dichiara fino a 194 volte piu veloce e 445 volte piu economico di un modello di frontiera. La velocita e la parte noiosa. La parte interessante e che la risposta arriva con un numero che dice quanto fidarsi, ed e la prima cosa in tre anni di AI aziendale che puoi verificare sui tuoi dati.
Il 19 settembre TypeSafe AI ha rilasciato un modello che non ti scrive un paragrafo. Gli chiedi qualcosa e risponde con un valore e una probabilita. Nient'altro. Niente prosa, niente spiegazioni, niente scuse.
L'azienda lo chiama modello di decisione. Il fondatore, Diogo Almeida, ha lavorato sull'addestramento di ChatGPT in OpenAI, quindi non parliamo di qualcuno che si e perso l'era del linguaggio. Ne ha costruito l'opposto di proposito.
Cosa e uscito davvero
Tre tipi di domanda. Choice sceglie un'opzione da un insieme e restituisce la distribuzione sulle altre. Score colloca un input su una scala ordinata. Noul risponde a una proposizione vero o falso con una probabilita fra zero e uno. Tu passi uno stato, fai piu domande su quello stato in parallelo, e il tuo codice decide cosa succede dopo.
Il benchmark di TypeSafe riporta 0,114 secondi e 0,000081 dollari per chiamata, contro 8,566 secondi e 0,013880 dollari di un modello di frontiera sullo stesso flusso. Circa otto centesimi per mille decisioni. L'input costa 0,042 dollari per milione di token. L'output e gratis, perche di output non ce n'e.
Un modello di frontiera ti consegna un paragrafo sicuro di se. Un modello calibrato ti consegna un numero e ti dice quanto fidarti.
Il numero interessante non e 194x
Velocita e prezzo fanno il titolo, e sono la parte meno sorprendente. Un modello che emette un token lavora meno di un modello che ne emette quattrocento. E aritmetica, non innovazione.
La parte che merita attenzione e la probabilita. TypeSafe ha addestrato il modello con quello che chiama Reinforcement Learning for Calibrated Decisions. Calibrazione significa che quando il modello dice 70%, ha ragione circa il 70 per cento delle volte. Non sicuro di se. Corretto sulla propria sicurezza.
L'output testuale non ha mai dato questo a nessuno. Un paragrafo sbagliato e un paragrafo giusto si somigliano: scorrevoli entrambi, ben formattati entrambi, entrambi accettabili in demo. Un numero calibrato si comporta diversamente. Lo misuri per segmento, ci metti una soglia, ci fai routing. Sopra 0,9 passa. Sotto 0,6 lo guarda una persona. In mezzo logghi tutto e ogni mese rivedi quanto costa sbagliare.
La meteorologia aveva risolto la questione nel 1950, quando Glenn Brier pubblico un punteggio per valutare le previsioni probabilistiche. I meteorologi vengono giudicati sulla loro umilta da settantasei anni. Il software no.
Cosa non puoi ancora comprare
Adesso l'acqua fredda. Il benchmark lo ha fatto il fornitore, sui flussi scelti dal fornitore. Non ci sono pesi pubblicati e non c'e self hosting, solo un'API ospitata dietro lista d'attesa. La finestra di contesto si ferma a 64.000 token. Il modello e debole su aritmetica, conteggi, confronti fra date e su qualunque input avversariale, non sa spiegare la propria risposta, e TypeSafe dice chiaramente che non e un confine di sicurezza.
Quindi la calibrazione resta una dichiarazione finche non la misuri sui tuoi dati etichettati. Che poi e esattamente quello che il modello ti sta chiedendo di fare.
Perche conta per la tua azienda
Gran parte di quello che le aziende hanno comprato come AI negli ultimi tre anni era linguaggio avvolto attorno a un giudizio. Il giudizio era la parte di valore. Il linguaggio era la fattura.
Se la categoria delle decisioni tipizzate, calibrate e a basso costo regge, cambia forma la domanda da fare a un fornitore. Non "cosa sa fare il vostro modello", ma: mostrami la curva di calibrazione sui miei dati, segmento per segmento, con la soglia che consigli e il carico di revisione che comporta.
Falla questo trimestre. La risposta divide la stanza piu in fretta di qualsiasi demo.
Pan