30 settembre 2026
Costo dei token AI: perché conta poter cambiare modello
I prezzi per token scendono a ogni rilascio, la spesa in AI delle aziende sale. Chi ha legato i propri processi a un solo LLM resta fuori dai ribassi e paga caro ogni migrazione.
Il costo dei token AI cambia fino a cento volte da un modello all’altro per lo stesso lavoro, e i listini si muovono a ogni rilascio: il 22 settembre 2026 OpenAI e Anthropic hanno presentato nello stesso giorno tre nuovi modelli, tutti più economici dei predecessori. Ne beneficia solo chi può spostare i propri processi sul modello più conveniente senza riscrivere il software. Gli altri continuano a pagare il listino di prima.
Intanto la spesa aziendale in AI cresce più in fretta dei ribassi. Più del modello scelto oggi, quindi, conta quanto costerà cambiarlo domani.
Cosa è cambiato nei prezzi dei modelli AI?
Secondo la ricostruzione di Agenda Digitale, OpenAI ha affiancato al suo modello di punta, GPT-6 Astra, due modelli più economici. GPT-6 Sol, pensato per il coding complesso e i flussi agentici, costa 2 dollari per milione di token in input e 10 in output; GPT-6 Luna, destinato a classificazione, estrazione e sintesi ad alto volume, scende a 0,10 e 0,50 dollari. Anthropic ha lanciato Claude Opus 5.5 a 4 dollari in input e 20 in output, il 20% in meno di Opus 5.
Le percentuali di risparmio annunciate vanno lette con cautela. OpenAI calcola il suo 50% sulla tariffazione promozionale della famiglia GPT-5.6. Anthropic parla di un costo inferiore del 40% sui carichi tipici, ma è una stima: si basa sull’ipotesi che il modello usi meno token e sulle letture dalla cache, scese da 0,50 a 0,20 dollari per milione. Anche il listino va letto per intero. Oltre i 272.000 token di input Sol e Luna passano alla tariffazione per contesto lungo, l’elaborazione regionale costa il 10% in più per i modelli idonei e la residenza dei dati nell’Unione europea è disponibile solo con elaborazione standard. Un’impresa regolata, insomma, non sempre paga la cifra pubblicata.
Il confronto più utile è un altro. In un carico teorico di un milione di token in input e 200.000 in output (senza cache, strumenti esterni o tentativi falliti), Luna costa 0,20 dollari, Sol 4, Opus 5.5 8 e Astra 20. La convenienza reale dipende poi da quante risposte superano i controlli di qualità e da quanto lavoro serve per correggerle.
Perché la spesa in AI cresce se i prezzi scendono?
Negli ultimi tre anni il prezzo per milione di token è sceso di circa cento volte, eppure la spesa delle aziende continua a salire: tra inizio 2025 e inizio 2026 i prezzi sono calati di circa l’80%, mentre il consumo enterprise è cresciuto di 13 volte. Il meccanismo ha un nome preso dall’economia dell’Ottocento, il paradosso di Jevons. Quando una risorsa diventa più efficiente ed economica, la domanda complessiva aumenta invece di calare.
Nel caso dell’AI a spingere i consumi sono gli agenti. Un compito che nel 2023 richiedeva 500 token oggi può consumarne 50.000, perché un sistema agentico non si ferma a una risposta: ragiona per passaggi, verifica, interroga database, richiama il modello più volte. Nei dati di maggio del gateway AI di Vercel, le richieste chiuse con la chiamata a uno strumento erano il 22,2% del totale ma generavano il 58,9% dei token. Un prezzo basso per chiamata, moltiplicato per una catena di passaggi, diventa una voce di bilancio.
Nei conti delle aziende il fenomeno si vede già. Uber ha esaurito il budget AI del 2026 nei primi quattro mesi dell’anno, soprattutto per gli strumenti di coding agentico: prima dei limiti alcuni ingegneri generavano da soli bollette da 500 a 2.000 dollari al mese, e l’azienda ha poi fissato un tetto di 1.500 dollari mensili per dipendente su ciascuno strumento. Royal Bank of Canada ha visto il proprio consumo di token crescere del 500% in sei mesi. Secondo KPMG, solo il 26% delle aziende sa davvero quanto spende in AI, e il 22% lo scopre quando arriva la fattura. Questi casi sono raccolti nell’articolo sul costo nascosto dei token nei bilanci aziendali.
Il modello più recente è sempre quello che conviene?
No. Nel Coding Agent Index di Artificial Analysis GPT-6 Sol sale da 55 a 57 punti e dimezza circa il costo per task, mentre Luna scende da 43 a 41 pur diventando molto più economico. Nei benchmark sul lavoro d’ufficio, costruiti su attività di 44 professioni, entrambi arretrano rispetto ai predecessori.
Il listino, da solo, non dice quale modello sia giusto per un processo. La misura utile è il costo per risultato accettato: per richiesta risolta senza riapertura in un servizio clienti, per campo estratto e convalidato nell’analisi documentale, per modifica che supera test e revisione nello sviluppo software. Con questo metro un modello caro può risultare conveniente, se riduce errori e correzioni manuali, e uno economico può vincere sui compiti ripetitivi e verificabili.
La scelta del modello, quindi, non si fa una volta sola. Va rifatta a ogni rilascio, processo per processo.
Perché cambiare modello è difficile per molte aziende?
Perché il software è stato scritto attorno a un fornitore. Anche quando l’API di base sembra compatibile, strumenti integrati, gestione della memoria, filtri di sicurezza e modalità di caching legano l’applicazione a una piattaforma. Ogni cambio diventa un progetto: codice da riscrivere, test da rifare, budget da approvare. Quando il progetto si chiude, il ribasso successivo è già arrivato.
E le alternative da cui si resta esclusi aumentano. I modelli open-weight, molti dei quali sviluppati in Cina, hanno pesi scaricabili che si possono eseguire su un cloud a scelta o su un’infrastruttura propria. Nei tre mesi fino al 22 settembre valevano il 77,1% dei token passati dal gateway di Vercel, e DeepSeek V4.1 Flash da solo arrivava al 58%, con tariffe API di 0,30 dollari in input e 1,20 in output nelle ore di punta. Sono cifre di una sola piattaforma, che ha di recente ampliato i criteri con cui classifica gli open-weight, ma indicano dove si sposta il traffico ad alto volume quando costo e prestazioni bastano. Anche l’open-weight ha un prezzo: hardware, competenze, sicurezza, continuità di servizio e, per i modelli cinesi, valutazioni geopolitiche.
C’è poi l’errore opposto, il cambio disordinato. Quando un team passa da un modello leggero a uno di frontiera per motivi di qualità, senza coinvolgere chi gestisce il budget, il costo per token può moltiplicarsi da 10 a 100 volte. I rischi sono due: non poter cambiare modello quando conviene, e cambiarlo senza controllo.
Come si costruisce un portafoglio di modelli governato?
Un solo modello per tutta l’organizzazione regge sempre meno. Agenda Digitale propone una ripartizione per livelli: un modello leggero o un open-weight per classificazioni, sintesi standard ed estrazione massiva; un modello intermedio per coding e agenti di media complessità; un modello premium per i casi più ambigui o con conseguenze economiche rilevanti. L’instradamento verso il modello giusto può seguire il tipo di attività, la sensibilità dei dati, la latenza richiesta e la confidenza rilevata durante l’esecuzione.
Perché funzioni servono alcune condizioni, da costruire prima di averne bisogno:
- interfacce disaccoppiate dal singolo provider, prompt versionati e formati di output standard;
- una seconda opzione già testata, pronta a subentrare;
- test su casi reali dell’azienda, in italiano, con documenti interni ed errori frequenti, con soglie di accettazione e una procedura di ritorno al modello precedente;
- telemetria vicina al processo: costo per attività, distribuzione dei token, tasso di errore, latenza, quota di casi passati al modello superiore;
- attribuzione del costo per singola richiesta, con la stessa logica di chargeback già usata per il cloud, e limiti di spesa con flussi di approvazione.
Conta anche il modo in cui si usa il modello. Nei tre nuovi modelli l’output costa cinque volte l’input: prompt chiari, risposte strutturate, limiti alla verbosità e riuso della cache incidono sul conto quanto la scelta del modello. Senza telemetria, un listino più basso si traduce soltanto in più chiamate e in una spesa che nessuno sa attribuire.
Come AVA elimina il lock-in sui modelli
AVA è la piattaforma proprietaria di Aidia che collega i software aziendali ai modelli linguistici senza legarli a un fornitore. Il modello diventa un componente sostituibile: è proprio questo il senso di uno dei pilastri di AVA, ovvero no vendor lock-in.
AVA lavora con qualsiasi LLM, open source o commerciale. Quando esce un modello più economico per i volumi alti, o un open-weight da eseguire sulla propria infrastruttura, l’azienda può adottarlo senza cambiare piattaforma. Il routing è dinamico: ogni richiesta va al modello più adatto, così una classificazione non consuma i token di un modello premium e un’analisi complessa non finisce su un modello che sbaglia. È la ripartizione per livelli descritta da Agenda Digitale, applicata richiesta per richiesta.
Un modello nuovo si adotta senza riscrivere il software: integrazioni con ERP e CRM, strumenti e flussi restano dove sono, cambia solo il modello sotto. Quando arriverà il prossimo ribasso, coglierlo non richiederà un progetto di migrazione.
AVA si installa on-premise, con zero data leakage e costi di calcolo fissi: i dati restano in azienda e la spesa non segue l’andamento delle bollette a consumo. Per lo sviluppo software, il fronte su cui Uber ha bruciato il budget, AVA Code lavora direttamente sul codebase con controllo centralizzato di accessi, modelli e consumi.
Contattaci per capire quanto i processi AI della tua azienda dipendono oggi da un solo modello.
Domande frequenti
Quanto costano i token dei nuovi modelli AI?
Con i listini di settembre 2026, GPT-6 Luna costa 0,10 dollari per milione di token in input e 0,50 in output, GPT-6 Sol 2 e 10, Claude Opus 5.5 4 e 20, GPT-6 Astra 10 e 50. Su un carico di un milione di token in input e 200.000 in output, la differenza tra il modello più economico e il più caro è di cento volte.
Perché la spesa in AI aumenta se i prezzi per token diminuiscono?
Per il paradosso di Jevons: quando una risorsa costa meno, se ne usa molta di più. I sistemi agentici ragionano per passaggi e richiamano il modello più volte, tanto che un compito da 500 token nel 2023 oggi può consumarne 50.000. Tra il 2025 e il 2026 i prezzi sono calati dell’80% e il consumo enterprise è cresciuto di 13 volte.
Cos’è il vendor lock-in nei modelli AI?
È la dipendenza da un singolo fornitore di modelli. Strumenti integrati, gestione della memoria, filtri di sicurezza e caching legano l’applicazione a una piattaforma anche quando l’API sembra compatibile. Cambiare modello diventa un progetto di migrazione, e l’azienda non riesce a sfruttare i ribassi dei concorrenti o modelli più adatti ai propri processi.
Conviene usare un solo modello AI per tutta l’azienda?
Di rado. Un modello leggero basta per classificazioni ed estrazioni ad alto volume, uno intermedio per coding e agenti, uno premium per i casi ambigui o ad alto impatto economico. Il criterio di scelta è il costo per risultato accettato su ogni processo, misurato su casi reali dell’azienda e non dedotto dai listini o dai benchmark generali.
Come si tengono sotto controllo i costi dei token AI?
Servono tre leve: attribuire il costo a ogni singola richiesta, collegandolo a team e caso d’uso; fissare limiti di spesa con flussi di approvazione; allineare tecnologia e finance su criteri condivisi. A questo si aggiunge il routing verso modelli più piccoli per i compiti semplici, con telemetria su costi, errori e casi passati al modello superiore.
Fonti
- Agenda Digitale, Alessandro Longo (23 settembre 2026) «GPT-6 e Claude Opus 5.5: prezzi in calo e più sicurezza».
- Aidia (13 luglio 2026) «Token AI: perché i costi dell’intelligenza artificiale stanno cambiando i bilanci aziendali».

Marta Magnini
Digital Marketing & Communication Assistant in Aidia, laureata in Scienze della Comunicazione e appassionata delle arti performative.
In Aidia sviluppiamo soluzioni software basate su IA, soluzioni di NLP, Big Data Analytics e Data Science. Soluzioni innovative per ottimizzare i processi ed efficientizzare i flussi di lavoro. Per saperne di più, contattaci o inviaci una mail a info@aidia.it.
Ultime notizie

30 settembre 2026
Costo dei token AI: perché conta poter cambiare modello

24 settembre 2026
Audit trail e AI: cosa cambia con il D.Lgs. 160/2026

21 settembre 2026
Cos'è l'enshittification?
