EMPVResearch NotesEN
EMPV / RESEARCH NOTESNOTE / 006

NEWS NOTE / AI

Google presenta Gemini 4 Argon, un modello per task AI di lunga durata

Argon porta l'output fino a 1 milione di token ed è già usato internamente da Google su coding, data center e cybersecurity. Per ora l'accesso resta limitato.

Pubblicata2026-10-01 · 5 min
Gemini 4 ArgonGoogle DeepMindAI agentsLong-horizon
01 / L'annuncio

Argon è il primo modello della famiglia Gemini 4.

Google ha annunciato Gemini 4 Argon il 30 settembre. Il modello è pensato per attività che richiedono molti passaggi, con un focus dichiarato su software engineering, ricerca finanziaria, lavoro legale e cybersecurity difensiva.

Il prezzo introduttivo annunciato da Google è di 2 dollari per milione di token in input e 10 dollari per milione di token in output. Terminato il periodo iniziale, i prezzi indicati salgono rispettivamente a 4 e 20 dollari. Reuters segnala che Google non ha ancora dato una data per il rilascio pubblico.

02 / Un milione di token in output

Google ha portato il limite di output da 64K a 1 milione di token.

È uno dei cambiamenti più concreti rispetto ai modelli precedenti. Un output molto più lungo dà al modello spazio per mantenere una singola traiettoria di lavoro attraverso più passaggi, invece di spezzare continuamente il task in richieste separate.

Questo non significa che un milione di token equivalga automaticamente a un milione di token utili. Per gli agenti conta soprattutto cosa succede lungo la sequenza: se il modello mantiene lo stato, usa correttamente gli strumenti e non accumula errori mentre il task si allunga.

03 / Google lo sta già usando

Gli esempi più interessanti arrivano dai sistemi interni di Google.

Secondo Google, un gruppo di agenti Argon ha analizzato la telemetria dei data center e individuato modifiche che hanno liberato oltre 300 TiB di memoria dopo il rollout. L'azienda stima un risparmio complessivo potenziale tra 500 TiB e 1 PiB.

Google cita anche migrazioni da C/C++ a Rust su codebase che arrivano a oltre 800.000 linee, incluso il kernel Zircon di Fuchsia. In un altro caso Argon ha lavorato su 32.000 linee di codice SIMD di libgav1; Google afferma che il risultato in Rust è 2,7 volte più veloce del port precedente, mantenendo lo stesso output video.

Sono risultati dichiarati da Google, non test indipendenti. La parte utile è che l'azienda descrive anche ciò che sta intorno al modello: test automatici, audit manuale, emulazione e review prima del rilascio delle modifiche.

04 / Enterprise e cybersecurity

Google sta spingendo Argon oltre il coding.

Il modello viene valutato anche su finanza, legal e automazione di processi. Su AutomationBench di Zapier, che misura l'esecuzione end-to-end di attività attraverso strumenti aziendali, la configurazione Argon High è attualmente indicata al 51,29%.

La cybersecurity è l'altro ambito centrale. Google dice che Argon può trovare, validare e correggere vulnerabilità software. Per questo l'accesso iniziale passa dal Fairwind Program, riservato a governi, clienti Google Cloud e partner di cybersecurity selezionati.

05 / I benchmark vanno letti con cautela

Uno dei risultati più pubblicizzati da Google arriva da un benchmark contestato.

Google dichiara un 77,9% su DeepSWE v1.1, un benchmark dedicato a task di software engineering di lunga durata. Ma una review indipendente di Epoch AI ha classificato il benchmark come “Flawed” dopo aver trovato problemi in almeno 23 dei 113 task esaminati.

Reuters nota inoltre che Argon rimane dietro ai concorrenti in due dei quattro benchmark di coding inclusi nel materiale di lancio di Google. Quindi il quadro è meno semplice di quanto suggerisca una singola percentuale.

06 / Cosa manca ancora

Argon deve ancora essere provato fuori dai workflow controllati da Google.

L'accesso ristretto rende ancora difficile capire come il modello si comporti su task lunghi costruiti da team esterni, con strumenti, dati e failure mode diversi da quelli usati internamente da Google.

Quando l'accesso si allargherà, le misure più utili saranno meno spettacolari dei benchmark: percentuale di task completati, errori accumulati lungo la sequenza, recupero dopo un tool failure, costo per task e numero di interventi umani necessari.

EMPV / TAKEAWAY

Per ora Argon resta a disponibilità limitata. Il test decisivo sarà vedere come regge task lunghi costruiti fuori da Google.

Research Notes