Gemini 4 Argon alla prova: i benchmark bastano davvero
Il nuovo modello di Google promette autonomia su software, ricerca e sicurezza digitale, ma l’esperienza interna segnala risultati meno uniformi nella programmazione.
Il giudizio decisivo su Gemini 4 Argon arriverà soltanto quando il modello sarà utilizzabile da sviluppatori e imprese al di fuori della cerchia di Google e dei partner selezionati. A quel punto si capirà con quale frequenza porterà a termine un incarico senza correzioni umane, quanto costerà ottenere un risultato affidabile e come reagirà agli errori in progetti lontani dalle prove standardizzate.
Anche la gestione della disponibilità resta prudente. Google non ha ancora aperto Argon al pubblico e il calendario arriva mentre Google DeepMind affronta un riassetto ai vertici: il modello rappresenta quindi il primo banco di prova della divisione dopo l’avvicendamento avvenuto lo scorso agosto.
Il prezzo è già fissato, l’accesso no
Per l’utilizzo del modello Google indica una tariffa iniziale di 2 dollari ogni milione di token elaborati in ingresso e di 10 dollari ogni milione di token generati in uscita. Al termine del periodo promozionale, i costi dovrebbero salire rispettivamente a 4 dollari e 20 dollari, secondo quanto riportato nella comunicazione ufficiale.
L’accesso anticipato passa invece dal Fairwind Program, riservato a soggetti ritenuti prioritari per la protezione digitale. Nell’elenco rientrano amministrazioni pubbliche, gestori di infrastrutture essenziali, aziende sanitarie, operatori delle telecomunicazioni e grandi realtà tecnologiche.
Un modello pensato per lavori estesi
Gemini 4 Argon è stato progettato per mantenere il filo di attività molto lunghe. La quantità massima di testo producibile in una singola generazione passa da 64mila a un milione di token: in teoria, ciò permette di affrontare migrazioni di codice, esami documentali e ricerche complesse senza dividere il lavoro in numerose sessioni.
Google afferma che migliaia di propri dipendenti stanno già usando Argon. Tra gli impieghi interni citati figurano l’ottimizzazione di algoritmi per il calcolo quantistico, interventi sui centri di elaborazione dati e la conversione di ampie basi software dai linguaggi C e C++ a Rust.
L’azienda porta inoltre come esempio l’analisi di più di 800mila righe di Zircon, il componente centrale del sistema operativo Fuchsia. Si tratta tuttavia di risultati presentati da Google, senza una verifica indipendente disponibile.
I numeri premiano Argon, ma non ovunque
Nei confronti pubblici il modello parte da una posizione forte. Nel Vals Index, che combina esercizi di finanza, informatica, diritto e fisco tenendo conto del peso dei settori nell’economia statunitense, Argon raggiunge il 68,9% e si colloca davanti agli altri sistemi considerati.
Google gli attribuisce anche il 77,9% in DeepSWE v1.1, prova dedicata a incarichi prolungati di ingegneria del software, oltre al primo posto in AutomationBench, che valuta l’esecuzione di procedure aziendali. Artificial Analysis lo inserisce tra i modelli di vertice del proprio indice generale e ne evidenzia il rapporto tra prestazioni e spesa.
Fai una domanda su questo articolo o sul suo argomento: l'AI risponde in modo pertinente.
Il quadro cambia in alcune verifiche specifiche di programmazione. In FrontierSWE v2 Argon si ferma al 55%, contro il 65,5% di Gpt-6 Astra di OpenAI e il 62,3% di Claude Opus 5.5 di Anthropic. Nel Terminal-bench 4.0, dedicato ai compiti svolti tramite riga di comando, arriva al 57,4%, mentre Claude Opus 5.5 raggiunge il 66,4%.
Sul lavoro quotidiano restano interrogativi
Alcune persone coinvolte nello sviluppo e dotate di accesso diretto al sistema descrivono prestazioni meno regolari rispetto a quelle suggerite dai test. Le perplessità riguarderebbero soprattutto determinati incarichi di programmazione, compresa la progettazione dell’interfaccia visibile di siti e applicazioni, cioè l’area che stabilisce aspetto, interazioni e comportamento per l’utente.
Google respinge l’idea che Argon sia globalmente debole nel lavoro informatico e richiama i giudizi positivi espressi da Koray Kavukcuoglu, responsabile operativo di Google DeepMind. Un altro dipendente, citato nelle ricostruzioni sul modello, sostiene che all’interno dell’azienda sia ormai ampiamente riconosciuto il suo livello di frontiera. Le due letture possono convivere: un sistema può essere competitivo nel complesso e, allo stesso tempo, mostrare limiti in specifiche procedure.
La sicurezza precede il debutto generale
Per i partner considerati affidabili Google prevede una configurazione priva dei normali filtri dedicati alla sicurezza informatica, così da consentire attività difensive più complete. Nel CWE-bench v1, che simula controlli su depositi di codice reali senza svelare in anticipo quale falla individuare, Argon ottiene il 68%, lo stesso risultato di Grok 4.7 e GPT-6 Astra.
L’apertura di simili capacità richiede però controlli stringenti. Google riconosce che l’intelligenza artificiale può rafforzare anche le organizzazioni criminali attive nel digitale: più autonomia nella ricerca e nella correzione delle vulnerabilità significa quindi maggiore attenzione all’identità degli utilizzatori e alle condizioni d’impiego.
Prima di un rilascio più ampio, l’azienda indica quattro linee di protezione. La prima prevede il blocco delle richieste nocive nei campi informatico e CBRN, cioè chimico, biologico, radiologico e nucleare; la seconda mira a neutralizzare le istruzioni nascoste in pagine o documenti, capaci di ingannare un agente artificiale.
Le altre due aree riguardano il controllo di comportamenti che potrebbero oltrepassare l’obiettivo assegnato e il rafforzamento degli ambienti isolati in cui il sistema esegue le operazioni. Google DeepMind sta lavorando su contenitori protetti e altre misure di separazione, all’interno della strategia per la sicurezza degli agenti presentata a giugno del 2026. L’azienda dichiara inoltre di partecipare a un’iniziativa volontaria del governo americano per consentire valutazioni sui modelli prima della loro diffusione.
Continua a leggere
Due killer e una crisi: Dexter ha già la data del ritorno
La seconda stagione di Dexter: Resurrection debutterà il 30 ottobre su Paramount+, accompagnata da un trailer che anticipa una nuova sfida per Dexter Morgan.
iPhone 18 Pro Max, il chip A20 Pro ruba la scena alla fotocamera
Il nuovo top di gamma Apple convince per qualità fotografica e potenza, ma in Europa l’assenza di Siri AI limita parte dell’esperienza promessa.
Googlebook, il codice corre da solo: la svolta di Antigravity
Google prepara il debutto di Antigravity sul Play Store per trasformare i Googlebook in strumenti di sviluppo basati su Linux e agenti di intelligenza artificiale.
Kindle, la svolta è nella batteria: nuovi modelli e accessori
Amazon aggiorna quasi tutta la linea con strutture più sottili, materiali riciclati, comandi esterni per le pagine e prezzi più alti in Italia.