🤖 Cosa cambia
- OpenAI lancia GPT-6 Sol e Luna con prezzi API fino a 2 dollari per milione di token input per Sol e 0,10 dollari per Luna.
- Anthropic risponde con Claude Opus 5.5, più veloce ed efficiente di Opus 5 e proposto a 4 dollari input e 20 dollari output.
- La guerra al ribasso sui token coincide con la ricerca di capacità immediata: OpenAI e Anthropic sondano data center da appena 20-30 MW nel Regno Unito e nei Paesi nordici.
OpenAI e Anthropic hanno aperto una nuova fase della competizione nell’intelligenza artificiale: non basta più costruire il modello migliore, bisogna riuscire a servirlo a un costo sufficientemente basso e trovare abbastanza elettricità, GPU e data center per soddisfare la domanda. Il 22 settembre OpenAI ha portato sul mercato GPT-6 Sol e GPT-6 Luna, mentre Anthropic ha presentato Claude Opus 5.5 nello stesso giorno. I prezzi scendono proprio mentre le due aziende cercano in Europa capacità infrastrutturale molto più piccola delle grandi fabbriche AI annunciate negli ultimi anni. Il paradosso è industriale prima ancora che tecnologico: l’inferenza diventa più economica per il cliente mentre produrla continua a richiedere quantità crescenti di capitale e megawatt.
Cosa leggere
GPT-6 Sol e Luna trasformano il prezzo in un’arma competitiva
OpenAI ha inserito GPT-6 Sol e GPT-6 Luna nelle API Responses e Chat Completions. Il changelog ufficiale OpenAI fissa GPT-6 Sol a 2 dollari per milione di token input, 0,20 dollari per il cached input e 10 dollari per l’output. Luna scende invece a 0,10 dollari input, 0,01 cached e 0,50 dollari output, collocandosi chiaramente nel segmento dei workload ad alto volume nei quali il costo unitario conta quanto la capacità assoluta del modello. OpenAI sostiene inoltre che i due modelli beneficino delle ottimizzazioni di caching e inferenza sviluppate intorno alla famiglia GPT-6. La strategia è diversa da quella seguita con GPT-6 Astra, pensato come modello di frontiera per reasoning, coding e workflow complessi. Sol e soprattutto Luna servono a spostare quelle capacità verso volumi molto superiori. La concorrenza non riguarda quindi soltanto i benchmark: riguarda quanto costa eseguire milioni di richieste dentro applicazioni, agenti e pipeline aziendali. È precisamente qui che la riduzione del prezzo per token assume importanza industriale. Per un’app consumer la differenza può apparire minima; per piattaforme che elaborano miliardi di token al giorno, pochi decimi di dollaro per milione cambiano direttamente i margini.
Leggi anche: GPT-6 Astra trova zero-day ma OpenAI affronta outage e una falla cross-account in ChatGPT
Claude Opus 5.5 risponde riducendo compute, token e costo per attività
Anthropic ha risposto nello stesso giorno con Claude Opus 5.5, primo componente della nuova famiglia 5.5. L’annuncio ufficiale Anthropic indica 4 dollari per milione di token input e 20 dollari output, contro 5 e 25 dollari di Opus 5. Le cache read scendono da 0,50 a 0,20 dollari, elemento particolarmente importante negli agenti che riutilizzano continuamente grandi quantità di contesto. Anthropic afferma inoltre che il modello generi output oltre il 30% più velocemente e costi mediamente il 40% in meno per workload reali.
| Categoria | Benchmark | Opus 5.5 | Fable 5.1 | Opus 5 | GPT-6 Astra | GPT-5.6 Sol |
|---|---|---|---|---|---|---|
| Programmazione agentica | Terminal-Bench 4.0¹ | 66,4% | 55,8% | 52,3% | 57,9% | 37,3% |
| Programmazione agentica | FrontierCode v1.1 (Main) | 54,4% | 50,3% | 48,0% | 53,3% | 47,5% |
| Programmazione agentica | CursorBench 4.0 | 57,8% | 51,8% | 46,6% | — | 41,7% |
| Lavoro intellettuale | GDPval-AA v2.1 | 1846 | 1735 | 1708 | 1542 | 1588 |
| Flussi di lavoro aziendali | AutomationBench² | 40,0% | 31,4% | 26,9% | 41,4% | 28,8% |
| Ragionamento multidisciplinare | Humanity’s Last Exam | 67,7% (con strumenti) | 65,6% (con strumenti) | 63,6% (con strumenti) | 57,2% (con strumenti) | — |
| Ricerca scientifica agentica | Terminal-Bench-Science 0.1³ | 58,7% | 52,6% | 29,0% | 64,6% | 22,4% |
| Utilizzo del computer | OSWorld 2.0 | 81,8% (parziale) | 80,7% (parziale) | 74,0% (parziale) | — | — |
| Riconoscimento di grafici visivi | Chartography | 89,0% (con strumenti) | 88,4% (con strumenti) | 83,4% (con strumenti) | — | — |
Il dato interessante è che Anthropic non presenta il risparmio come semplice sconto commerciale. Opus 5.5 richiederebbe meno compute e meno token per completare la stessa attività, spostando quindi la competizione dall’intelligenza assoluta all’efficienza. Nei benchmark pubblicati dal vendor il modello raggiunge o supera GPT-6 Astra in diversi workload di coding e knowledge work, ma Anthropic stessa riconosce che le differenze tra benchmark stanno diventando meno indicative quando i modelli raggiungono livelli così elevati. L’uscita arriva inoltre pochi giorni dopo la richiesta di Dario Amodei di rallentare lo sviluppo della frontiera. La contraddizione è soltanto apparente: rallentare la frontiera non significa smettere di comprimere costi e distribuire capacità già sviluppate. Anzi, proprio la pressione competitiva rende evidente quanto sia difficile coordinare un rallentamento mentre ogni laboratorio deve contemporaneamente difendere clienti, ricavi e quote di mercato.
Il prezzo dei token scende ma il compute fisico non compare dal nulla
La seconda metà della storia è meno visibile nelle demo dei modelli. OpenAI e Anthropic starebbero cercando blocchi di capacità da 20-30 MW nel Regno Unito e nei Paesi nordici, dimensioni minuscole rispetto ai campus da centinaia di megawatt o gigawatt annunciati negli ultimi anni. La ricostruzione attribuisce la ricerca all’esigenza di portare online capacità utilizzabile rapidamente mentre i progetti maggiori richiedono ancora anni tra rete elettrica, permitting, costruzione e installazione dell’hardware. Anthropic avrebbe sondato accordi nel Regno Unito e nell’area nordica, mentre OpenAI avrebbe cercato opportunità simili soprattutto nel Nord Europa. Non si tratta di sostituire le mega-infrastrutture, ma di riempire il vuoto temporale tra domanda immediata e capacità futura. Un deployment da 20 MW può entrare in produzione molto prima di un campus da un gigawatt e risulta sufficiente per una quantità rilevante di inferenza. Il collo di bottiglia era già apparso negli outage e nei problemi di capacità che hanno accompagnato alcuni rollout OpenAI. Modelli migliori aumentano l’utilizzo; prezzi inferiori lo aumentano ancora di più. Ridurre il costo per token può quindi aggravare proprio la pressione sull’infrastruttura che ha permesso quella riduzione.
Europa e Paesi nordici diventano una riserva di megawatt per l’AI americana
Il ricorso a installazioni europee più piccole mostra anche un cambiamento nella geografia dell’AI. Regno Unito e Paesi nordici offrono rete elettrica, disponibilità di energia, clima favorevole al raffreddamento e data center già operativi o più rapidamente convertibili, caratteristiche preziose quando la velocità conta più della scala assoluta. Per l’Europa il fenomeno è ambiguo. Da una parte porta investimenti, domanda energetica e infrastrutture. Dall’altra rischia di consolidare un modello nel quale il continente fornisce energia, suolo e capacità computazionale a laboratori statunitensi, mentre il valore più elevato resta concentrato nei modelli e nelle piattaforme proprietarie. Proprio nei giorni in cui Bruxelles prepara obblighi più stringenti di trasparenza energetica e idrica per i data center, la capacità europea sta diventando una risorsa strategica per l’espansione dell’AI globale. La tensione è ancora più evidente considerando che i modelli cinesi open-weight continuano a comprimere prezzi e margini occidentali. La crescita di Kimi e delle nuove famiglie cinesi rende difficile per OpenAI e Anthropic mantenere tariffe elevate semplicemente grazie al marchio o a pochi punti percentuali di vantaggio sui benchmark.
Continua con:
GPT-6 Astra arriva su Amazon Bedrock e AWS industrializza agenti, modelli e inferenza
Qwen 3.8 27B su RTX 5090: la VRAM non basta e l’inferenza locale sbatte contro il software
La guerra dell’AI si sposta dal modello al costo marginale dell’intelligenza
La coincidenza tra GPT-6 Sol, Luna, Claude Opus 5.5 e la corsa ai piccoli data center mostra quindi dove si sta spostando la competizione. Il modello di frontiera resta importante, ma non basta più. Serve trasformare quell’intelligenza in un servizio abbastanza economico da essere invocato continuamente da agenti, software aziendali e applicazioni consumer. OpenAI spinge il prezzo di Luna fino a pochi centesimi per enormi volumi di input; Anthropic prova a ridurre contemporaneamente compute, token utilizzati e prezzo per attività. Dietro questa apparente deflazione rimane però una struttura fisica estremamente costosa fatta di GPU, memoria, trasformatori elettrici, raffreddamento, fibra e megawatt. La contraddizione del mercato AI del 2026 è tutta qui: l’intelligenza artificiale costa sempre meno all’API, mentre costa sempre di più costruire la macchina industriale necessaria per produrla. La ricerca di data center da appena 20-30 MW non segnala la fine delle megafabbriche AI. Segnala che OpenAI e Anthropic non possono aspettare che siano finite.
Iscriviti alla Newsletter
Non perdere le analisi settimanali: Entra nella Matrice Digitale.
Matrice Digitale partecipa al Programma Affiliazione Amazon EU. In qualità di Affiliato Amazon, ricevo un guadagno dagli acquisti idonei. Questo non influenza i prezzi per te.








