Gemini 4 Argon: prezzi, benchmark e limiti di rollout

Simbolo Gemini e scritta Gemini 4 Argon su sfondo blu scuro
In questo articolo

Google ha annunciato Gemini 4 Argon, il suo nuovo modello frontier, inizialmente per cyber defender fidati tramite il Fairwind Program. Cosa significano il limite di 1M token in output, i prezzi 2$/10$ e i benchmark rivendicati per i team che confrontano modelli frontier per coding e workload agentici.

Google ha annunciato Gemini 4 Argon, un modello frontier per coding di lungo periodo, lavoro aziendale e difesa cibernetica. L'accesso parte dai defender fidati tramite il Fairwind Program. I prezzi sono 2$ per milione di token in input e 10$ per milione in output, input in cache al 95% di sconto; il limite di output è 1M di token. Google rivendica punteggi di vertice su DeepSWE e AutomationBench, ma il Vals Index pubblico è ancora guidato da Sonnet 5.5 e Opus 5.5.

Copertina: illustrazione originale. Icona Gemini: Source: Google (Google Image Library). Google e Gemini sono marchi di Google LLC. Questo articolo è indipendente e non è affiliato né approvato da Google.

I team che fanno benchmark di modelli frontier per coding e workload agentici stanno attraversando un ciclo di confronti affollato, con il Vals Index che attualmente mostra Claude Sonnet 5.5 e Claude Opus 5.5 di fatto in testa a pari merito. Il 30 settembre 2026 Google ha aggiunto una nuova variabile a questo esercizio: Gemini 4 Argon, annunciato sul blog aziendale come il suo modello frontier più recente, con risultati dichiarati all'avanguardia in ingegneria del software su lungo periodo, knowledge work aziendale e cybersecurity difensiva. La complicazione per i team di valutazione è che Argon non è ancora disponibile a livello generale, quindi gran parte di ciò che si può pianificare oggi si basa su specifiche, prezzi e punteggi riportati dal fornitore.

Vista esterna del campus della sede di Google a Mountain View
Google ha annunciato Gemini 4 Argon come suo modello frontier più recente il 30 settembre 2026 ("Googleplex HQ (cropped)", di Asoundd, CC BY-SA 4.0)

Il lancio ha attirato subito l'attenzione degli sviluppatori: l'annuncio ha raccolto 1.475 punti e 981 commenti su Hacker News. L'interesse non sorprende, perché i punti di forza dichiarati coincidono con i workload che molti team stanno già testando: task di coding multi-step, agenti autonomi e operazioni di sicurezza.

Cosa è stato annunciato, e chi ha accesso per primo

Secondo il post di annuncio, Gemini 4 Argon è costruito per sostenere ragionamento profondo su workflow complessi e di lungo periodo, e viene distribuito per primo a un gruppo di cyber defender fidati tramite il Fairwind Program. Google dichiara di partecipare al processo volontario del governo statunitense per l'accesso ai modelli pre-rilascio, di raccogliere feedback dai primi tester e di iterare sui guardrail prima di rendere Argon disponibile a sviluppatori, imprese e consumatori. Non è stata fornita una data di disponibilità generale.

Due specifiche spiccano per i team di ingegneria. Il limite di token in output è stato ampliato a 1 milione di token, dai precedenti 64K, che Google presenta come margine per pensare in profondità e risolvere problemi difficili in un'unica traiettoria. Argon debutta inoltre a un prezzo lancio di 2$ per milione di token in input e 10$ per milione di token in output, con token in input in cache a sconto del 95% sul prezzo di input, che si traduce in circa 0,10$ per milione di token in cache. Per i loop agentici che riutilizzano un ampio contesto stabile, la tariffa dell'input in cache può contare quanto i prezzi di listino.

Benchmark rivendicati contro le classifiche che i team usano

Google riporta un nuovo stato dell'arte su DeepSWE v1.1, che misura task reali di ingegneria del software su lungo periodo, con un punteggio del 77,9%. Colloca inoltre Argon al primo posto sull'AutomationBench di Zapier al 51,3%, un benchmark di esecuzione end-to-end sulle funzioni aziendali principali, e riporta risultati di vertice su Vals Finance Agent v2 e sul Legal Agent Benchmark di Harvey. Su LVBench, che misura la comprensione di video lunghi, Google dichiara un record del 91,7%.

Queste rivendicazioni arrivano in un mercato dove le classifiche indipendenti sono osservate da vicino. La leaderboard pubblica del Vals Index elenca attualmente Claude Sonnet 5.5 al 67,04% e Claude Opus 5.5 al 66,97%, un divario di 0,07 punti ben dentro l'errore standard del benchmark, circa ±0,9. Sonnet 5.5 raggiunge quel punteggio a 21,34$ per test contro i 32,14$ di Opus 5.5, e i due si dividono le componenti di coding: Sonnet 5.5 guida Vibe Code Bench e Code Migration, mentre Opus 5.5 guida Terminal-Bench 4.0. Argon non compare tra i modelli nelle classifiche pubblicate, quindi la rivendicazione di Google di guidare il Vals Index va trattata come in attesa di conferma finché la leaderboard non viene aggiornata.

La metodologia conta quando si confrontano questi numeri. Il Vals Index aggrega sei benchmark privati e due pubblici su finanza, coding, legale e fiscale, ponderando ogni settore per la sua quota del PIL statunitense, circa 8,0%, 5,6%, 1,2% e 0,5% rispettivamente, sulla base dei dati del Bureau of Economic Analysis. Vals rivela inoltre che alcuni punteggi di componente per Sonnet 5.5, Opus 5.5 e Claude Fable 5.1 includono task serviti da un modello di fallback dopo rifiuti del provider, e che contarli come fallimenti abbasserebbe i loro risultati complessivi. Vals posiziona l'indice come un segnale sui trade-off tra capacità, latenza e costo, quindi quando Argon comparirà sulla leaderboard, la cifra da confrontare sarà il suo costo per test, non i prezzi grezzi dei token.

Cosa suggeriscono i risultati interni di Google sul coding agentico

All'interno di Google, Argon è già usato da migliaia di dipendenti per task di coding, ricerca e scrittura. L'annuncio descrive migrazioni da C e C++ a Rust che vanno da decine di migliaia di righe in librerie come re2 e libgav1 fino a oltre 800.000 righe nel kernel Zircon di Fuchsia, con auditing automatizzato e manuale, test di emulazione e revisione prima del rollout in produzione. Su libgav1, Google dichiara che gli agenti Argon hanno sostituito 32.000 righe di codice SIMD attraverso esperimenti guidati dal profiling, producendo Rust sicuro che il compilatore vettorizza automaticamente: un decoder video memory-safe che gira 2,7 volte più veloce del porting Rust esistente con output identico.

Due altri esempi interni puntano su workload di infrastruttura e ricerca. Un team di agenti Argon ha analizzato telemetria di profiling a livello di flotta e applicato ottimizzazioni di memoria nei data center di Google, liberando oltre 300 TiB una volta completato il rollout, con risparmi totali stimati tra 500 TiB e 1 PiB. Nella ricerca sull'informatica quantistica, il modello ha superato del 40% una baseline pubblicata sull'ottimizzazione delle risorse spaziotemporali per subroutine critiche, nel giro di pochi minuti. Si tratta di risultati interni riportati dal fornitore, non di benchmark indipendentemente riproducibili, ma mirano esattamente alle categorie, migrazione di codice, ottimizzazione delle prestazioni e lunghe esecuzioni autonome, che molti programmi di valutazione stanno oggi testando.

File di rack server all'interno di una grande sala data center
Agenti Argon interni hanno applicato ottimizzazioni di memoria nei data center di Google, liberando oltre 300 TiB; foto illustrativa di una sala data center ("Virginia Tech - data center", di cbowns, CC BY-SA 2.0)

La cybersecurity è il primo canale di deployment reale

Google ha addestrato Argon per la cybersecurity difensiva e dichiara che può trovare, validare e correggere autonomamente vulnerabilità software critiche. Su CWE-bench v1, che misura la remediation delle vulnerabilità, Google riporta un pareggio al primo posto al 68%, costruendo sulla precedente prestazione frontier di 3.8 Flash Cyber su CWE-bench v0. L'azienda afferma inoltre che Argon ha scoperto un'ampia gamma di esposizioni su codebase in 20 linguaggi di programmazione in un benchmark interno, e supera 3.8 Flash Cyber sul benchmark interno di penetration testing black-box di Wiz, che testa l'analisi di sistemi web in produzione senza codice sorgente.

La prima prova esterna passa da Wiz. Google dichiara che Wiz usa Argon per la difesa cibernetica nella sua iniziativa Scan for Good, un programma che mappa la superficie internet-facing di infrastrutture critiche, servizi pubblici, organizzazioni sanitarie e nonprofit, poi valida i risultati ad alto impatto prima della divulgazione privata. La pagina del programma conta 17.761 domini collegati a organizzazioni, 326.891 endpoint monitorati e 475 esposizioni critiche trovate. Google cita un risultato precoce: Argon ha scoperto una vulnerabilità critica che esponeva informazioni personali sensibili in software sanitario usato da ospedali in tutto il mondo, un rischio che i modelli frontier precedenti avevano trascurato.

Un confine merita l'attenzione dei team di sicurezza: Google rilascerà Argon senza cyber guardrail ai defender fidati e ai propri team interni, così che possano usare le sue piene capacità di cybersecurity. Quella variante senza restrizioni non fa parte del rollout generale; i destinatari dichiarati sono i defender fidati, che ottengono l'accesso tramite il Fairwind Program, e i team interni di Google.

Salvaguardie e rilascio graduale

Prima della disponibilità ampia, Google dichiara di rafforzare le salvaguardie frontier su quattro aree principali. L'annuncio dettaglia difese contro l'uso improprio, con un modello progettato per rifiutare richieste dannose di natura cyber e CBRN preservando la ricerca dual-use legittima secondo il suo Frontier Safety Framework, oltre a un monitoraggio migliorato delle attivazioni interne del modello per individuare abusi, testato da red team interni ed esterni con metodi manuali e automatizzati. Descrive inoltre Argon come il modello di Google più resiliente finora agli indirect prompt injection, in testa al benchmark di Gray Swan sugli Indirect Prompt Injection dopo red teaming automatizzato e addestramento avversariale, e menziona il monitoraggio del disallineamento.

Per i team che costruiscono sistemi agentici, la rivendicazione sui prompt injection è la più direttamente rilevante, poiché gli agenti che leggono documenti, navigano sul web o usano strumenti sono i bersagli principali di questi attacchi. Come per i benchmark di capacità, i punteggi di robustezza riportati dal fornitore stesso del modello sono un punto di partenza, non un sostituto del test contro la propria superficie di attacco.

Cosa possono fare ora i team di benchmarking

Finché l'accesso alle API non si apre, i team di valutazione possono prepararsi invece di attendere:

  1. Trattare i punteggi annunciati come rivendicazioni da riprodurre: mantenete la vostra matrice attuale, incluse le baseline Sonnet 5.5 e Opus 5.5, e aggiungete Argon appena l'accesso per sviluppatori lo consente, con run comparabili.

  2. Ricalibrare i task di lungo periodo: un limite di output di 1 milione di token rende fattibili le esecuzioni in singola traiettoria per lavori che prima richiedevano orchestrazione multi-chiamata, quindi harness, strategie di contesto e criteri di successo potrebbero richiedere aggiornamenti.

  3. Modellare i costi per i pattern agentici: con l'input in cache al 95% di sconto, i loop che riutilizzano ampi contesti stabili cambiano l'economia, quindi simulate gli scenari di prezzo rispetto ai listini di 2$ e 10$ per milione di token.

  4. Seguire il Vals Index per l'ingresso di Argon: la sua metodologia ponderata sul PIL e attenta ai costi è pensata per decisioni di deployment e differisce dalle leaderboard di solo coding.

  5. Se valutate casi d'uso di sicurezza, monitorate gli esiti di Fairwind e Scan for Good, e tenete presente che la variante senza guardrail resta riservata ai defender fidati e ai team interni di Google.

Il quadro pratico: Gemini 4 Argon arriva con evidenze di deployment reali alle spalle, ma per la maggior parte dei team la sua rilevanza è prospettica. Le specifiche che contano per la pianificazione, la finestra di output da 1M, i prezzi dei token e il focus sulla sicurezza difensiva, sono pubbliche; i punteggi indipendenti che giustificherebbero un cambio non lo sono. I team nel bel mezzo dell'attuale ciclo di confronti frontier dovrebbero registrare le rivendicazioni, adeguare i piani di valutazione e attendere l'accesso prima di riscrivere le conclusioni.

Punti chiave

  • Gemini 4 Argon è annunciato ma non disponibile a livello generale: l'accesso parte dai cyber defender fidati tramite il Fairwind Program, senza data pubblica di GA.
  • Il limite di token in output sale a 1 milione dai precedenti 64K, abilitando esecuzioni in singola traiettoria per coding e task agentici di lungo periodo.
  • Il prezzo lancio è 2$ per milione di token in input e 10$ per milione in output, con input in cache al 95% di sconto, circa 0,10$ per milione.
  • Google rivendica risultati all'avanguardia su DeepSWE v1.1 (77,9%), AutomationBench (51,3%) e LVBench (91,7%), più un pareggio al primo posto su CWE-bench v1 (68%).
  • Il Vals Index pubblico elenca ancora in testa Claude Sonnet 5.5 (67,04%) e Opus 5.5 (66,97%); il primato rivendicato da Argon attende conferma indipendente.
  • I risultati interni di Google includono migrazioni C/C++ a Rust fino a oltre 800K righe e un decoder libgav1 2,7 volte più veloce del porting Rust; sono dati del fornitore, non benchmark indipendenti.
  • Una variante senza guardrail con piena capacità di cybersecurity è riservata ai defender fidati e ai team interni di Google.
  • Per i team di valutazione, le azioni immediate sono pianificare attorno alla finestra di output da 1M, ai prezzi dell'input in cache e aggiungere Argon alle matrici appena l'accesso alle API si apre.

Domande frequenti

Che cos'è Gemini 4 Argon?

Un modello frontier annunciato da Google il 30 settembre 2026, costruito per ragionamento profondo su workflow di lungo periodo in ingegneria del software, knowledge work aziendale come legale e finanza, e cybersecurity difensiva.

Gli sviluppatori possono usare Gemini 4 Argon oggi?

Non in modo ampio. Viene distribuito a un gruppo di cyber defender fidati tramite il Fairwind Program, e Google dichiara che amplierà l'accesso a sviluppatori, imprese e consumatori dopo aver raccolto feedback e iterato sui guardrail. Non è stata fornita una data di disponibilità generale.

Quanto costa Gemini 4 Argon?

Google ha annunciato un prezzo lancio di 2$ per milione di token in input e 10$ per milione di token in output, con token in input in cache al 95% di sconto sul prezzo di input, che si traduce in circa 0,10$ per milione di token in cache.

Come si posiziona Argon sui benchmark di coding?

Google riporta un nuovo stato dell'arte su DeepSWE v1.1 al 77,9% e il primo posto sull'AutomationBench di Zapier al 51,3%. Il Vals Index pubblico non ha ancora pubblicato un risultato per Argon.

Argon guida il Vals Index?

Google lo afferma, ma la pagina pubblica del Vals Index elenca ancora in testa Claude Sonnet 5.5 al 67,04% e Claude Opus 5.5 al 66,97%. I team dovrebbero attendere che la leaderboard aggiunga Argon prima di considerare confermata la rivendicazione.

Che cos'è il Fairwind Program?

Il canale di accesso graduale scelto da Google per questo lancio: Argon viene inizialmente distribuito ai cyber defender fidati tramite esso, inclusa una variante senza cyber guardrail per la piena capacità difensiva.

Quali risultati di cybersecurity cita Google?

Un pareggio al primo posto su CWE-bench v1 al 68%, una scoperta di vulnerabilità migliorata rispetto a 3.8 Flash Cyber su benchmark interni e sul penetration testing black-box di Wiz, e una vulnerabilità critica in software sanitario trovata tramite Scan for Good di Wiz.

Perché conta il limite di output di 1 milione di token?

Consente al modello di generare traiettorie singole molto lunghe, così task prima suddivisi in più chiamate possono girare in un'unica passata. Questo cambia la progettazione degli harness e la modellazione dei costi per i workload agentici.

Fonti

Altri articoli sul tema

Strategia digitale
Strategia digitale
Architettura software
Architettura software
Sviluppo
Sviluppo
Esperienza utente
Esperienza utente
App mobile
App mobile
Intelligenza artificiale
Intelligenza artificiale
Cybersecurity
Cybersecurity
Automazione
Automazione
Infrastruttura cloud
Infrastruttura cloud
DevOps
DevOps
Strategia digitale
Strategia digitale
Architettura software
Architettura software
Sviluppo
Sviluppo
Esperienza utente
Esperienza utente
App mobile
App mobile