13.000Lettori online ora
Tecnologia 2 min di lettura1 ott

Gemini 4 Argon sfida i rivali: i numeri dei primi test

Google punta su un modello capace di gestire attività prolungate, usare strumenti e affrontare sviluppo software, automazione e video di lunga durata.

Il nuovo confronto nell’intelligenza artificiale si misura sempre meno sulla semplice risposta a una domanda. La sfida si sposta verso incarichi articolati, che richiedono tempi lunghi, utilizzo di strumenti e la capacità di arrivare in autonomia a un risultato.

Google entra in questo terreno con Gemini 4 Argon, il modello di punta con cui l’azienda cerca di ridurre le distanze da OpenAI e dagli altri principali protagonisti del settore. I primi dati diffusi riguardano soprattutto prove dedicate a programmazione, automazione e comprensione di contenuti video estesi.


Argon mette alla prova il lavoro complesso

Nel test DeepSWE v1.1, pensato per valutare attività di sviluppo software portate avanti per periodi prolungati, Gemini 4 Argon ha ottenuto il 77,9%. Il dato segnala l’attenzione di Google verso compiti che non si esauriscono in una singola risposta, ma richiedono più passaggi operativi.

Un altro risultato arriva da AutomationBench di Zapier, dove il modello ha raggiunto il 51,3%. Questa verifica è dedicata alle capacità di automazione e misura quindi la gestione di procedure composte da diverse azioni, un ambito sempre più centrale nell’evoluzione degli assistenti basati sull’intelligenza artificiale.


Video lunghi e confronto con i rivali

La prestazione più alta tra quelle rese note riguarda LVBench, prova dedicata alla comprensione di filmati molto lunghi. In questo caso Argon ha totalizzato il 91,7%, mostrando secondo Google una particolare efficacia nell’analisi di contenuti video estesi.

Chiedi a Readoo3 / 3 oggi

Fai una domanda su questo articolo o sul suo argomento: l'AI risponde in modo pertinente.

L’azienda sostiene inoltre che Gemini 4 Argon abbia superato GPT-6 Astra e Claude Opus 5.5 in diverse valutazioni. Si tratta tuttavia di risultati iniziali legati a specifici parametri: i punteggi dei benchmark possono offrire indicazioni utili, ma non descrivono da soli l’esperienza complessiva né tutte le capacità di un modello.


La nuova direzione di Google

Con Argon, Google presenta dunque un sistema orientato non soltanto alla qualità delle risposte, ma anche alla gestione autonoma di incarichi complessi. Il modello viene collocato dall’azienda nella fascia dei sistemi più avanzati, in un mercato nel quale la durata delle attività e l’impiego di strumenti stanno diventando elementi decisivi.

I numeri comunicati rappresentano il primo elemento per valutare la proposta, mentre il confronto più ampio dipenderà dal comportamento del modello in scenari reali e da ulteriori verifiche indipendenti. Per ora, la strategia di Google appare concentrata sulle applicazioni che richiedono continuità e capacità operative.

Ti è piaciuto? Condividilo

Continua a leggere