Gemini 4 Argon sfida i rivali: i numeri dei primi test
Google punta su un modello capace di gestire attività prolungate, usare strumenti e affrontare sviluppo software, automazione e video di lunga durata.
Il nuovo confronto nell’intelligenza artificiale si misura sempre meno sulla semplice risposta a una domanda. La sfida si sposta verso incarichi articolati, che richiedono tempi lunghi, utilizzo di strumenti e la capacità di arrivare in autonomia a un risultato.
Google entra in questo terreno con Gemini 4 Argon, il modello di punta con cui l’azienda cerca di ridurre le distanze da OpenAI e dagli altri principali protagonisti del settore. I primi dati diffusi riguardano soprattutto prove dedicate a programmazione, automazione e comprensione di contenuti video estesi.
Argon mette alla prova il lavoro complesso
Nel test DeepSWE v1.1, pensato per valutare attività di sviluppo software portate avanti per periodi prolungati, Gemini 4 Argon ha ottenuto il 77,9%. Il dato segnala l’attenzione di Google verso compiti che non si esauriscono in una singola risposta, ma richiedono più passaggi operativi.
Un altro risultato arriva da AutomationBench di Zapier, dove il modello ha raggiunto il 51,3%. Questa verifica è dedicata alle capacità di automazione e misura quindi la gestione di procedure composte da diverse azioni, un ambito sempre più centrale nell’evoluzione degli assistenti basati sull’intelligenza artificiale.
Video lunghi e confronto con i rivali
La prestazione più alta tra quelle rese note riguarda LVBench, prova dedicata alla comprensione di filmati molto lunghi. In questo caso Argon ha totalizzato il 91,7%, mostrando secondo Google una particolare efficacia nell’analisi di contenuti video estesi.
Fai una domanda su questo articolo o sul suo argomento: l'AI risponde in modo pertinente.
L’azienda sostiene inoltre che Gemini 4 Argon abbia superato GPT-6 Astra e Claude Opus 5.5 in diverse valutazioni. Si tratta tuttavia di risultati iniziali legati a specifici parametri: i punteggi dei benchmark possono offrire indicazioni utili, ma non descrivono da soli l’esperienza complessiva né tutte le capacità di un modello.
La nuova direzione di Google
Con Argon, Google presenta dunque un sistema orientato non soltanto alla qualità delle risposte, ma anche alla gestione autonoma di incarichi complessi. Il modello viene collocato dall’azienda nella fascia dei sistemi più avanzati, in un mercato nel quale la durata delle attività e l’impiego di strumenti stanno diventando elementi decisivi.
I numeri comunicati rappresentano il primo elemento per valutare la proposta, mentre il confronto più ampio dipenderà dal comportamento del modello in scenari reali e da ulteriori verifiche indipendenti. Per ora, la strategia di Google appare concentrata sulle applicazioni che richiedono continuità e capacità operative.
Continua a leggere
Il caso delle informazioni riservate scuote OpenAI: tre esperti fuori
Tre professionisti impegnati su sicurezza e allineamento dei modelli hanno lasciato la società dopo la presunta condivisione di dati sensibili con un’organizzazione esterna.
Alle Hawaii il tetto che raffresca casa e coltiva verdure
«Non conosciamo nulla di simile al mondo che sia così tecnologicamente avanzato e abbia un’applicazione così concreta».
Griffin inganna 26 persone su 54: Tavus frena il debutto
L’avatar video di Tavus interpreta espressioni e pause durante le conversazioni, ma il risultato del test interno ha spinto l’azienda a limitarne l’accesso.
Galaxy S27 Ultra, la sorpresa è sotto lo schermo: cosa cambia davvero
Il design anteriore dovrebbe restare quasi invariato, ma sotto la superficie Samsung potrebbe introdurre un pannello OLED più luminoso, preciso ed efficiente.