// TOM'S HARDWARE ITALIA — INTELLIGENZA ARTIFICIALE
Il modello AI più potente deve farti guadagnare di più, altrimenti è solo più caro
Sono 2.320 i run controllati su quattro dataset pubblici e quattro architetture di forecasting, e dicono tutti la stessa cosa: il modello che vince sui confronti diretti non è quasi mai quello da mettere in produzione. Un aggiornamento che migliora l'accuratezza dello 0,2% sembra un sì automatico, ma fra test di sicurezza, canary release, nuove regole di monitoraggio e piano di rollback il conto finale supera quasi sempre il costo dell'addestramento, mentre il cliente spesso non nota alcuna differenza. Il gate a quattro domande pensato per fermare gli aggiornamenti inutili prima che partano arriva da chi si occupa di MLOps per la finanziaria di Ford.
Lo stesso calcolo vale, con numeri persino più aggressivi, quando il modello da cambiare non è un classificatore interno ma un'API di un fornitore: Gemini 3.8 Flash arriva al 90% del punteggio di Claude Fable 5.1 spendendo un sesto, e Claude Opus 5 costa la metà di Fable 5.1 sullo stesso listino. Chi passa al modello di punta ogni volta che esce, senza fare i conti, sceglie la potenza sulla carta e ignora il prezzo reale.
Nel materiale che Kandakatla porta a supporto della sua tesi, due casi interni mostrano gli estremi dello stesso problema: un modello antifrode e uno che smista i ticket di un help desk aziendale. Sul primo, un miglioramento anche minimo dell'accuratezza taglia perdite reali, perché ogni frode non intercettata ha un costo diretto e quantificabile. Sul secondo, lo stesso miglioramento statistico non si vede quasi: i tempi di chiusura dei ticket restano gli stessi, e l'azienda non vede alcuna riduzione nei costi di supporto.
Da questo confronto nasce il filtro a quattro domande: quanto vale davvero, in termini economici, il guadagno di accuratezza; chi se ne accorge oltre al team che ha addestrato il modello; quanto costa portarlo in produzione fra test di sicurezza e nuove regole di monitoraggio; e cosa succede se qualcosa va storto e serve tornare indietro. Il filtro misura il costo ricorrente di un aggiornamento, non la sua qualità tecnica, ed è lo stesso principio che Google descrive da anni come "debito tecnico" nascosto nei sistemi di machine learning, oggi affiancato da una rubrica che assegna un punteggio proprio a questi costi ricorrenti, non al modello in sé.
Chi sceglie un modello via API affronta lo stesso conto, spostato di un livello ma identico nella sostanza. Non c'è un riaddestramento da fare, però ci sono prompt da riscrivere, processi di valutazione da ricalibrare e collaudi da rifare su ogni caso d'uso già in produzione. Lo switch costa anche quando il fornitore cambia solo il nome del modello dietro la stessa API, e quel costo raramente compare nel confronto fra due punteggi su un test comparativo.
Qui il conto si complica, e in un modo che la tesi di Kandakatla non affronta direttamente. Nell'ultimo anno il prezzo per milione di token è sceso fino a un sesto per i modelli di fascia intermedia rispetto ai modelli di punta, come già misurato su queste pagine con gli stessi dati di Artificial Analysis, descritti anche dalla versione statunitense di Tom's Hardware. Nello stesso periodo il volume di token effettivamente pagati dalle aziende è cresciuto di 25 volte.
È il paradosso di Jevons applicato all'AI: quando una risorsa costa meno, il consumo aumenta invece di calare, fino ad azzerare il risparmio unitario o a ribaltarlo in una spesa complessiva più alta. Una previsione di Gartner stima che l'inferenza su un modello da mille miliardi di parametri costerà oltre il 90% in meno entro il 2030, ma quella proiezione non dice nulla su quanti nuovi compiti le aziende decideranno di automatizzare nel frattempo. In alcuni casi le aziende finiscono per spendere di più rispetto a prima, come racconta il caso di budget AI fuori controllo già documentato da Tom's Hardware.
Il filtro a quattro domande di Kandakatla guadagna valore proprio per questo: se il prezzo unitario scende ma il volume sale lo stesso, ogni aggiornamento deciso senza calcolo mol