Venerdì 4 settembre 2026Sostieni

Aube.

Le notizie del progresso
In esercizioCorroborato · 2 fonti

Arriva Gemini 3.8 Flash: ragiona meglio, ma costa di più

Lingue di questo articolo

Tradotto dall’IA, lingua originale cinese — vedi il testo originale. 6 lingue disponibili, la tua si aggiunge con un clic.

Nelle prime ore del 2 settembre, il numero di versione di Gemini è salito ancora di una tacca: Google ha lanciato Gemini 3.8 Flash. È il terzo modello Flash pubblicato nell'arco di sei settimane e il quarto in meno di quattro mesi dopo Gemini 3.5 Flash, annunciato a maggio; nel frattempo, l'atteso modello di punta Gemini 3.5 Pro non è ancora stato pubblicato. In origine Flash puntava su velocità e costi contenuti, ma ora viene indirizzato verso l'ingegneria del software a lungo termine, gli agenti intelligenti capaci di invocare strumenti in successione e i complessi flussi di lavoro aziendali della durata di diverse ore.

I punteggi dei benchmark hanno subito portato il modello vicino alla fascia dei modelli di punta. Google afferma che 3.8 Flash ha raggiunto il 73,7% nel test di sviluppo software DeepSWE v1.1, mentre in Terminal-Bench 2.1 è passato dall'85,8% all'89,4%, leggermente al di sopra dell'89,1% di Claude Opus 5. Artificial Analysis ha misurato per il modello un indice di intelligenza di 59 punti, paragonabile al risultato di GPT-5.6 Sol con un livello di ragionamento elevato, ma inferiore al punteggio massimo di 63 punti di Claude Opus 5. Anche questi numeri vanno tuttavia letti con cautela: il risultato di DeepSWE v1.1 riportato da ifanr è del 71,0%, non del 73,7%. Le due testate presentano quindi risultati discordanti per lo stesso test.

Una capacità maggiore non è priva di costi. Google spiega che, davanti ai problemi complessi, 3.8 Flash investe più passaggi nel ragionamento, richiama ripetutamente gli strumenti e controlla il lavoro. Questo comporta un consumo maggiore di Token, l'unità di fatturazione utilizzata dal modello per elaborare il testo. Artificial Analysis ha osservato che il numero medio di Token generati in output è aumentato di circa il 30%, mentre il tempo medio per attività è passato da 2,2 a 2,5 minuti; anche con una velocità di generazione di circa 300 Token al secondo, il costo per attività sale comunque a 0,58 dollari, circa il 40% in più rispetto a 3.7 Flash. Al momento i prezzi dell'API sono gli stessi della generazione precedente: 0,75 dollari per milione di Token in input e 3,75 dollari per milione di Token in output. Dal 1° gennaio 2027 torneranno però rispettivamente a 1,5 e 7,5 dollari.

L'uso reale mostra un altro lato del modello. ifanr ha chiesto al modello di creare con Three.js un modello 3D dell'elicottero Airbus H145: la scomposizione della richiesta è stata completata in meno di un minuto e, dopo 109 secondi, la scena e il modello erano pronti. La velocità è effettivamente all'altezza di Flash, ma i dettagli della fusoliera, i rapporti tra i componenti e i movimenti erano molto approssimativi. Una seconda simulazione del flusso dell'acqua in un terreno è stata completata in circa due minuti e le funzioni erano sostanzialmente tutte presenti, ma dal cratere del vulcano fuoriusciva acqua. La dimostrazione ufficiale Magic Castle di Google, invece, mostra 3.8 Flash al lavoro in un ciclo continuo all'interno di Antigravity, con il ricorso a Nano Banana per generare le texture, sostenuto da un framework per agenti, un ambiente di strumenti e un processo articolato in più fasi. Il risultato ottenuto con un prompt impartito una sola volta rappresenta il limite inferiore del modello che lavora da solo, non il limite superiore raggiunto dall'intero sistema che lo sostiene.

Gemini 3.8 Flash Cyber, presentato lo stesso giorno, utilizza lo stesso modello di base ma è ottimizzato specificamente per la scoperta e la correzione delle vulnerabilità. Google afferma che nei test interni, che coprono 20 linguaggi di programmazione, il tasso di successo ha superato il 70% e che in CyberGym il modello ha risolto l'86,2% delle attività al primo tentativo. Non è tuttavia disponibile per gli utenti comuni: attraverso il Fairwind Program viene fornito a enti di cybersicurezza verificati, amministrazioni pubbliche, operatori di infrastrutture critiche e principali aziende tecnologiche. Google afferma che i partner sono già più di 650.

Per gli utenti, gli sviluppatori possono ora usare 3.8 Flash tramite Gemini API, l'interfaccia che consente ai software di richiamare il modello, Google AI Studio e Gemini Enterprise. Alcuni utenti abbonati possono inoltre richiamarlo nell'app Gemini e nella modalità di intelligenza artificiale di Google Search. Il modello è adatto ai lavori in cui velocità, prezzo e capacità di affrontare attività più lunghe vengono prima di tutto: dispone di una finestra di contesto da un milione di Token, può elaborare testo, immagini, audio e video e generare fino a 64.000 Token. Se invece l'attività richiede soprattutto efficienza di calcolo, Google consiglia di ridurre il livello di ragionamento o di continuare a usare 3.7 Flash. In altre parole, 3.8 Flash rende più accessibili agli sviluppatori le capacità dei modelli complessi, ma non ha ancora eliminato la verifica umana dal flusso di lavoro.

0,58 dollariCosto medio per attività di 3.8 Flash misurato da Artificial Analysis

Fonti — leggere gli originali(ora di Parigi)

heise onlineDE
爱范儿ZH
0000

Da leggere dopo

Commenti

Caricamento della discussione…

Accedi per scrivere un commento. Accedi