// TOM'S HARDWARE ITALIA — INTELLIGENZA ARTIFICIALE
L'inferenza AI costa un decimo di un anno fa, ma non sappiamo ancora come misurarla bene
Il prezzo per generare un milione di token con un modello di fascia GPT-4 è sceso da 20 dollari a meno di 50 centesimi in tre anni, un crollo di oltre 40 volte. Negli ultimi mesi il ritmo non è rallentato: tra maggio e agosto 2026 il costo medio dell'inferenza è calato di un altro 43%. Le aziende che fino a poco tempo fa razionavano le chiamate alle API oggi si trovano davanti a un conto molto più leggero.
In questo scenario cresce una generazione di produttori di chip specializzati nell'inferenza, che spingono per trasformare l'intelligenza artificiale da prodotto di lusso a commodity di massa, sul modello di elettricità e banda larga. Diverse startup del settore hanno raccolto centinaia di milioni di dollari per competere sul mercato degli acceleratori per l'inferenza, finora dominato da un solo produttore. Per chi le ascolta, la metrica giusta è quanto lavoro un'azienda riesce a completare con quella spesa, al posto del confronto tecnico o del token generato.
Epoch AI misura lo stesso fenomeno su una scala più lunga: a parità di capacità del modello, il costo dell'inferenza si riduce di circa dieci volte ogni anno. Il -43% registrato fra maggio e agosto conferma quel ritmo su una finestra più corta, la stessa in cui un'analisi indipendente ha documentato nuovi minimi storici per il prezzo dei token. Due fonti indipendenti, due metodi di calcolo diversi, la stessa direzione.
OpenAI offre un esempio concreto della stessa dinamica sui modelli di punta. A fine luglio 2026 l'azienda ha tagliato i prezzi di due versioni di GPT-5.6, spostando quello che chiama il "fronte prezzo-prestazioni". Un'altra analisi indipendente ha ricostruito la mossa nello stesso contesto: le aziende clienti sono sempre più sensibili al costo per chiamata, e i vendor di modelli rispondono di conseguenza.
La stessa tendenza spiega perché il baricentro della spesa AI in azienda si sia spostato dal training all'inferenza: un modello si allena una volta, ma risponde milioni di volte, e il conto vero si vede lì. È anche l'argomento di chi sostiene che al settore serva più efficienza dei modelli già esistenti, prima ancora di modelli più potenti.
Nelle piccole e medie imprese il limite all'adozione raramente è la capacità del modello. A fermare un assistente che dovrebbe restare acceso tutto il giorno, o un'automazione che elabora centinaia di pratiche, è quasi sempre il costo delle chiamate ripetute. Con il prezzo per token sceso di un ordine di grandezza, quel vincolo si allenta, e casi che un anno fa restavano solo sulla carta oggi diventano sostenibili.
Un'attività che genera un milione di token al giorno per rispondere ai clienti spendeva quasi 20 dollari al giorno un anno fa. Con i prezzi di oggi la stessa spesa scende sotto i 50 centesimi, la differenza fra tenere un servizio acceso tutto il giorno o spegnerlo fuori orario per risparmiare.
Il cambiamento più utile riguarda cosa si sceglie di misurare, più che il prezzo in sé. Un caso pratico già raccontato su queste pagine mostra come la cache riduca del 45% il costo dei task complessi negli agenti AI, e la stessa logica vale per i KPI aziendali. Il costo per token lascia il posto al costo per pratica conclusa, al tempo risparmiato, alla percentuale di richieste chiuse senza passare a un operatore umano.
Chi ha già misurato l'impatto degli agenti AI nelle PMI italiane racconta casi concreti più che percentuali: un magazzino che risponde ai fornitori fuori orario, uno studio che smista le pratiche in arrivo prima che un dipendente le apra. In nessuno dei due casi il criterio di successo è quale modello gira dietro le quinte: il criterio è se il lavoro si è mosso mentre nessuno lo guardava. Vale anche per un piccolo negozio che affida a un agente le richieste di reso: il numero di scontrini emessi conta meno del numero di pratiche chiuse senza una telefonata di scuse.
Il prezzo per token cala, ma la bolletta aziendale non sempre lo segue con lo stesso ritmo. Un'analisi già pubblicata su queste p