Google e Meta hanno lanciato i loro modelli di frontiera AI più recenti a poche ore di distanza mercoledì. Google ha presentato Gemini 3.8 Flash insieme a una variante per la cybersecurity, mentre Meta ha rilasciato Muse Spark 1.3.
I due lanci invitano a un confronto diretto. Test indipendenti effettuati da Artificial Analysis dividono il risultato. Meta prevale nei lavori di conoscenza agentica e nel ragionamento scientifico, mentre Google si distingue per il richiamo dei fatti e per la programmazione terminale.
Due Lanci di Frontiera nello Stesso Giorno
Gemini 3.8 Flash è il terzo rilascio Flash di Google in sei settimane. Il modello costa $0,75 per 1 milione di token in ingresso e $3,75 per 1 milione di token in uscita.
Seguici su X per ricevere le ultime notizie in tempo reale
Today we’re introducing a new 3.8 Flash model, our 3rd Flash release in just 6 wks.
— Sundar Pichai (@sundarpichai) September 2, 2026
It delivers significant leaps from 3.7 Flash across software engineering, agentic tasks, and multi-step reasoning. On DeepSWE v1.1, it outperforms most larger frontier models in autonomously… pic.twitter.com/MB5seliluh
Questa tariffa promozionale è valida fino al 31 dicembre 2026. Successivamente, i prezzi raddoppieranno a $1,50 e $7,50 per 1 milione di token.
Google ha abbinato il modello generale a Gemini 3.8 Flash Cyber. Il modello è disponibile per un gruppo selezionato di difensori di fiducia. Ha ottenuto l’86,2% su CyberGym, un benchmark per l’individuazione di vulnerabilità.
La variante cyber ha inoltre raggiunto il 47,2% su CWE-Bench, un benchmark per le patch. Google ha dichiarato che il modello ha generato 2,6 volte più patch corrette per le vulnerabilità di Chrome rispetto a modelli commerciali più grandi.
L’accesso è gestito dal Fairwind Program, che limita l’utilizzo del modello alle autorità governative e agli operatori di infrastrutture critiche. OpenAI aveva posto un limite simile il giorno prima attorno ad Astra, il primo modello che la società ha considerato a una soglia critica di cybersecurity.
Nel frattempo, Meta ha distribuito Muse Spark 1.3 tramite Muse Code e Meta Model API. Gli ingegneri della società hanno rilevato circa il 20% in meno di chiamate agli strumenti rispetto alla versione 1.2.
Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter. This is the biggest jump we've made so far on coding and agentic work. Try it in Muse Code and our API.
— Mark Zuckerberg (@finkd) September 2, 2026
Next up 🍉 and Muse Spark open weights releases coming soon. pic.twitter.com/XQQEDEJGD7
Gemini 3.8 Flash vs Muse Spark 1.3: I Benchmark Indipendenti Dividono il Risultato
Artificial Analysis ha testato i modelli e i risultati mostrano come si posizionano. Muse Spark 1.3 in modalità max ha ottenuto 1.754 Elo su GDPval-AA v2. Gemini 3.8 Flash (high) ha registrato 1.545.
Meta ha inoltre guidato il test Sierra Research banking agent (52,4% contro 44,9%) e il ragionamento fisico CritPt. Gemini 3.8 Flash si è distinta su Terminal-Bench 2.1 con l’87,6%, AA-LCR su contesto lungo con l’81% e AA-Omniscience per accuratezza con il 55%.
Gemini 3.8 Flash ha fatto registrare anche il punteggio GPQA Diamond più alto tra i modelli testati, pari al 95%. I due modelli sono rimasti distanziati di meno di un punto su Humanity’s Last Exam.
Il modello di punta di Meta oggi non viene distribuito. L’azienda ha dichiarato che la modalità max reasoning sarà resa disponibile solo dopo ulteriori test di sicurezza, lasciando per ora disponibile la variante xhigh.
Questa versione ha ottenuto 61 punti sull’Artificial Analysis Intelligence Index, quattro punti in più rispetto a Muse Spark 1.2. Rimane però dietro Claude Fable 5.1 con 66 e Claude Opus 5 con 63.
Altri rilasci sono già in arrivo. Elon Musk ha dichiarato che Grok 4.7 arriverà a breve, portando a quattro i lanci di modelli di frontiera in due settimane.
Iscriviti al nostro canale YouTube per guardare leader e giornalisti che forniscono approfondimenti da esperti
https://youtu.be/6uixXOg1e8ILeggi la storia originale Google e Meta rilasciano modelli di IA rivali a poche ore di distanza, nessuna delle due ha vinto: chi è in testa? di Kamina Bashir su it.beincrypto.com