gemini 4 argon output coding

Gemini 4 Argon arriva con 1 milione di token in output e coding al 77,9%

🤖 Cosa cambia

  • Gemini 4 Argon aumenta il limite di output da 64.000 a 1 milione di token per workflow complessi e di lunga durata.
  • Google dichiara il 77,9% su DeepSWE v1.1, il 68% su CWE-bench e il 51,3% su AutomationBench.
  • Il rollout parte da cyber defender selezionati, clienti API a pagamento e Google AI Ultra, con prezzi introduttivi da 2 e 10 dollari.

Google cambia passo con Gemini 4 Argon, nuovo modello frontier costruito per ragionamento profondo, coding, cyberdifesa e workflow professionali capaci di svilupparsi su centinaia di migliaia di token. La novità più evidente non è soltanto un nuovo record nei benchmark: Argon porta il limite di output da 64.000 a 1 milione di token, permettendo al modello di mantenere una singola traiettoria di lavoro molto più lunga rispetto alle generazioni precedenti. Mountain View accompagna il salto con un rollout prudente, inizialmente riservato a cyber defender selezionati, clienti API a pagamento e abbonati Google AI Ultra, e con un prezzo introduttivo particolarmente aggressivo rispetto al posizionamento frontier.

Gemini 4 Argon sposta il reasoning sui workflow che durano centinaia di migliaia di token

Annuncio

Google presenta ufficialmente Gemini 4 Argon come un modello progettato per “complex, long-horizon workflows”, quindi non soltanto per produrre una risposta più accurata a una singola domanda ma per mantenere ragionamento, generazione e utilizzo degli strumenti lungo processi molto più estesi. Il limite di 1 milione di token in output, contro i 64.000 precedenti, è probabilmente il cambiamento architetturale più importante dal punto di vista operativo: un agente può analizzare codice, elaborare documentazione, produrre modifiche e continuare a lavorare nella stessa traiettoria senza spezzare artificialmente l’attività in decine di sessioni. È l’evoluzione naturale della direzione già mostrata da Gemini 3.8 Flash, che aveva accelerato coding e accesso dell’AI ai cyber defender, ma Argon cambia categoria puntando esplicitamente ai problemi nei quali profondità e durata del ragionamento pesano più della semplice velocità di risposta. Google afferma di utilizzarlo già internamente per debugging, migrazioni di grandi codebase, ricerca e ottimizzazione infrastrutturale: gruppi di agenti Argon avrebbero analizzato telemetria su scala data center individuando ottimizzazioni capaci di liberare oltre 300 TiB di memoria, con una stima complessiva compresa tra 500 TiB e 1 PiB, mentre altre istanze vengono impiegate nelle migrazioni C/C++ verso Rust fino a codebase superiori alle 800.000 righe. Il vero salto non è quindi una generica promessa di “AI più intelligente”, ma la possibilità di applicare il reasoning a processi che fino a poco tempo fa eccedevano la durata pratica di un singolo task agentico.

Leggi anche: Googlebook cambia Android: QPR1, Continue On e Gemini 3.8 collegano PC e Pixel

DeepSWE al 77,9% e cyberdifesa al 68% mostrano dove Google vuole usare Argon

Google concentra i benchmark proprio sui domini nei quali Argon dovrebbe produrre valore operativo. I risultati pubblicati per Gemini 4 Argon: 77,9% su DeepSWE v1.1 per lo sviluppo software, 68% su CWE-bench v1 per la correzione di vulnerabilità, 51,3% su AutomationBench di Zapier per l’esecuzione end-to-end di processi aziendali e 91,7% su LVBench per la comprensione di video lunghi. I numeri restano benchmark dichiarati dal produttore e non equivalgono automaticamente alle prestazioni in produzione, ma mostrano chiaramente il target: coding reale, knowledge work, automazione e sicurezza.

image 13
Gemini 4 Argon arriva con 1 milione di token in output e coding al 77,9% 4

Sul fronte cyber Google adotta inoltre una strategia particolare. Il modello viene distribuito attraverso il programma Fairwind a un gruppo ristretto di difensori affidabili, ai quali può essere fornito senza alcuni dei normali guardrail cyber per consentire l’utilizzo completo delle capacità di analisi e remediation. È un passaggio rilevante dopo che Gemini era già entrato in scenari di compromissione reali insieme ai modelli Claude: più aumenta la capacità di trovare e correggere vulnerabilità, più cresce anche il rischio dual-use. Google dichiara quindi di aver rafforzato la resistenza alle indirect prompt injection, il monitoraggio delle attivazioni interne e i sistemi capaci di osservare chain-of-thought e azioni dell’agente interrompendo l’esecuzione quando emergono comportamenti anomali. La corsa frontier si sposta così dai soli benchmark di conoscenza verso l’affidabilità di agenti che possono effettivamente modificare codice e interagire con infrastrutture.

Continua con:
Gemini viola tre aziende e Claude accelera gli exploit: l’AI cyber cambia scala
GPT-6 Astra trova zero-day ma OpenAI affronta outage e una falla cross-account

Il prezzo aggressivo serve a portare il frontier model dentro i processi aziendali

La terza variabile è economica. Google annuncia per Argon un prezzo introduttivo di 2 dollari per milione di token in input e 10 dollari per milione in output, con input già presenti nella cache scontati del 95%. Dopo il periodo promozionale, il listino previsto sale a 4 dollari in input e 20 dollari in output. È qui che va corretta l’idea secondo cui Argon sarebbe stato progettato principalmente per abbattere il costo computazionale: Google non descrive il modello in questi termini. L’obiettivo dichiarato è piuttosto offrire capacità frontier su task complessi mantenendo un prezzo che ne consenta l’inserimento nei workflow reali di sviluppatori e imprese. La distinzione è importante perché un output potenziale da un milione di token può diventare molto costoso se utilizzato senza controllo, rendendo caching, orchestrazione degli agenti e gestione del contesto componenti decisive dell’architettura applicativa. È lo stesso passaggio dall’AI usata come chatbot all’AI impiegata come infrastruttura operativa già emerso quando Gemini è arrivato su Windows insieme ai plugin Google Cloud per gli agenti di sviluppo. Argon non sarà inoltre immediatamente disponibile a tutti: Google sta ampliando gradualmente l’accesso dopo il testing con esperti cyber e il programma statunitense di valutazione pre-release, per poi partire da clienti API paganti e Google AI Ultra. È questa combinazione tra output estremamente lungo, agenti, coding e prezzi API a definire meglio Gemini 4 Argon: non un semplice successore numerico di Gemini, ma il tentativo di Google di trasformare il proprio modello frontier in un motore capace di sostenere interi processi di lavoro invece di singole richieste.

Iscriviti alla Newsletter

Non perdere le analisi settimanali: Entra nella Matrice Digitale.

Matrice Digitale partecipa al Programma Affiliazione Amazon EU. In qualità di Affiliato Amazon, ricevo un guadagno dagli acquisti idonei. Questo non influenza i prezzi per te.

Torna in alto