Venerdì 4 settembre 2026Sostieni

Aube.

Le notizie del progresso
Originale e traduzione

Arriva Gemini 3.8 Flash: ragiona meglio, ma costa di più

Esci dal confronto

Le due versioni sono allineate blocco per blocco, nell’ordine del testo: titolo, l’essenziale, poi paragrafo per paragrafo. Quando la traduzione ha fuso o diviso un paragrafo, la casella corrispondente resta vuota — non accostiamo mai due passaggi a occhio.

Originale · cinese
Gemini 3.8 Flash上线,推理更强也更耗算力
Traduzione · italiano
Arriva Gemini 3.8 Flash: ragiona meglio, ma costa di più
Originale · cinese
它面向长程软件工程、能连续调用工具的智能代理,以及复杂企业工作流。
Traduzione · italiano
È pensato per l'ingegneria del software a lungo termine, gli agenti intelligenti capaci di invocare strumenti in successione e i complessi flussi di lavoro aziendali.
Originale · cinese
Google给出的成绩逼近旗舰模型,但两家媒体对DeepSWE成绩报道为71.0%和73.7%。
Traduzione · italiano
I risultati forniti da Google sfiorano quelli dei modelli di punta, ma due testate hanno riportato per DeepSWE risultati del 71,0% e del 73,7%.
Originale · cinese
3.8 Flash Cyber专攻漏洞发现与修复,仅向Fairwind Program中的可信机构开放。
Traduzione · italiano
3.8 Flash Cyber è specializzato nella scoperta e nella correzione delle vulnerabilità ed è disponibile soltanto per enti affidabili inclusi nel Fairwind Program.
Originale · cinese

9月2日凌晨,Gemini的版本号又跳了一格:Google上线Gemini 3.8 Flash。它是六周内发布的第三款Flash模型,也是5月宣布的Gemini 3.5 Flash之后、不到四个月内的第四款;与此同时,原定的旗舰Gemini 3.5 Pro至今仍未发布。Flash原本强调速度和成本,如今却被推向长程软件工程、能连续调用工具的智能代理,以及持续数小时的复杂企业工作流。\n\n跑分先把故事推到了旗舰模型附近。Google称,3.8 Flash在DeepSWE v1.1软件开发测试中达到73.7%,Terminal-Bench 2.1从85.8%升至89.4%,略高于Claude Opus 5的89.1%;Artificial Analysis测得它的智能指数为59分,和GPT-5.6 Sol在较高推理档位的成绩相当,但低于Claude Opus 5最高的63分。数字也有需要保留的地方:爱范儿对DeepSWE v1.1的报道记录为71.0%,而非73.7%,两家媒体呈现的同一项成绩并不一致。\n\n更高的能力并非没有代价。Google解释,3.8 Flash面对复杂问题会投入更多推理步骤、反复调用工具并检查工作,这意味着消耗更多Token——模型处理文本时使用的计费单位。Artificial Analysis观察到,它平均生成的输出Token增加约30%,任务平均耗时从2.2分钟变为2.5分钟;即使输出速度约为每秒300个Token,单项任务成本仍升至0.58美元,比3.7 Flash高约40%。目前API价格与前代相同,为每百万输入Token 0.75美元、输出3.75美元,但2027年1月1日起将分别恢复至1.5美元和7.5美元。\n\n真实使用呈现出另一面。爱范儿让模型用Three.js制作空客H145直升机的3D模型,需求拆解不到一分钟完成,109秒后场景和模型生成完毕;速度确实配得上Flash,但机身细节、部件关系和运动方式都很粗糙。第二个地形水流模拟约两分钟完成,功能基本齐全,火山口却出现了漏水。Google官方的魔法城堡演示则由3.8 Flash在Antigravity中循环工作,并调用Nano Banana生成纹理,背后有代理框架、工具环境和多轮流程;一次性提示词得到的,是它单独工作的下限,而不是整套系统托举出的上限。\n\n同日发布的Gemini 3.8 Flash Cyber沿用同一基础模型,但专门优化漏洞发现与修复。Google称它在覆盖20种编程语言的内部测试中成功率超过70%,在CyberGym中一次尝试解决86.2%的任务;不过它没有向普通用户开放,而是通过Fairwind Program提供给经过验证的网络安全机构、政府部门、关键基础设施运营者和主要科技企业,Google称目前已有超过650个合作伙伴。\n\n具体到使用者,开发者现在可以通过Gemini API——让软件调用模型的接口——、Google AI Studio和Gemini Enterprise使用3.8 Flash,部分订阅用户也能在Gemini应用和Google搜索的人工智能模式中调用它。它适合把速度、价格和较长任务能力放在前面的工作:模型拥有一百万Token上下文窗口,可处理文本、图片、音频和视频,最多输出64,000个Token;但若任务更看重计算效率,Google建议降低推理档位或继续使用3.7 Flash。换句话说,3.8 Flash让复杂模型能力更容易被开发者买到,却还没有把人工复核从工作流里拿掉。

Traduzione · italiano

Nelle prime ore del 2 settembre, il numero di versione di Gemini è salito ancora di una tacca: Google ha lanciato Gemini 3.8 Flash. È il terzo modello Flash pubblicato nell'arco di sei settimane e il quarto in meno di quattro mesi dopo Gemini 3.5 Flash, annunciato a maggio; nel frattempo, l'atteso modello di punta Gemini 3.5 Pro non è ancora stato pubblicato. In origine Flash puntava su velocità e costi contenuti, ma ora viene indirizzato verso l'ingegneria del software a lungo termine, gli agenti intelligenti capaci di invocare strumenti in successione e i complessi flussi di lavoro aziendali della durata di diverse ore.

Originale · cinese(nessun corrispondente in questo punto)
Traduzione · italiano

I punteggi dei benchmark hanno subito portato il modello vicino alla fascia dei modelli di punta. Google afferma che 3.8 Flash ha raggiunto il 73,7% nel test di sviluppo software DeepSWE v1.1, mentre in Terminal-Bench 2.1 è passato dall'85,8% all'89,4%, leggermente al di sopra dell'89,1% di Claude Opus 5. Artificial Analysis ha misurato per il modello un indice di intelligenza di 59 punti, paragonabile al risultato di GPT-5.6 Sol con un livello di ragionamento elevato, ma inferiore al punteggio massimo di 63 punti di Claude Opus 5. Anche questi numeri vanno tuttavia letti con cautela: il risultato di DeepSWE v1.1 riportato da ifanr è del 71,0%, non del 73,7%. Le due testate presentano quindi risultati discordanti per lo stesso test.

Originale · cinese(nessun corrispondente in questo punto)
Traduzione · italiano

Una capacità maggiore non è priva di costi. Google spiega che, davanti ai problemi complessi, 3.8 Flash investe più passaggi nel ragionamento, richiama ripetutamente gli strumenti e controlla il lavoro. Questo comporta un consumo maggiore di Token, l'unità di fatturazione utilizzata dal modello per elaborare il testo. Artificial Analysis ha osservato che il numero medio di Token generati in output è aumentato di circa il 30%, mentre il tempo medio per attività è passato da 2,2 a 2,5 minuti; anche con una velocità di generazione di circa 300 Token al secondo, il costo per attività sale comunque a 0,58 dollari, circa il 40% in più rispetto a 3.7 Flash. Al momento i prezzi dell'API sono gli stessi della generazione precedente: 0,75 dollari per milione di Token in input e 3,75 dollari per milione di Token in output. Dal 1° gennaio 2027 torneranno però rispettivamente a 1,5 e 7,5 dollari.

Originale · cinese(nessun corrispondente in questo punto)
Traduzione · italiano

L'uso reale mostra un altro lato del modello. ifanr ha chiesto al modello di creare con Three.js un modello 3D dell'elicottero Airbus H145: la scomposizione della richiesta è stata completata in meno di un minuto e, dopo 109 secondi, la scena e il modello erano pronti. La velocità è effettivamente all'altezza di Flash, ma i dettagli della fusoliera, i rapporti tra i componenti e i movimenti erano molto approssimativi. Una seconda simulazione del flusso dell'acqua in un terreno è stata completata in circa due minuti e le funzioni erano sostanzialmente tutte presenti, ma dal cratere del vulcano fuoriusciva acqua. La dimostrazione ufficiale Magic Castle di Google, invece, mostra 3.8 Flash al lavoro in un ciclo continuo all'interno di Antigravity, con il ricorso a Nano Banana per generare le texture, sostenuto da un framework per agenti, un ambiente di strumenti e un processo articolato in più fasi. Il risultato ottenuto con un prompt impartito una sola volta rappresenta il limite inferiore del modello che lavora da solo, non il limite superiore raggiunto dall'intero sistema che lo sostiene.

Originale · cinese(nessun corrispondente in questo punto)
Traduzione · italiano

Gemini 3.8 Flash Cyber, presentato lo stesso giorno, utilizza lo stesso modello di base ma è ottimizzato specificamente per la scoperta e la correzione delle vulnerabilità. Google afferma che nei test interni, che coprono 20 linguaggi di programmazione, il tasso di successo ha superato il 70% e che in CyberGym il modello ha risolto l'86,2% delle attività al primo tentativo. Non è tuttavia disponibile per gli utenti comuni: attraverso il Fairwind Program viene fornito a enti di cybersicurezza verificati, amministrazioni pubbliche, operatori di infrastrutture critiche e principali aziende tecnologiche. Google afferma che i partner sono già più di 650.

Originale · cinese(nessun corrispondente in questo punto)
Traduzione · italiano

Per gli utenti, gli sviluppatori possono ora usare 3.8 Flash tramite Gemini API, l'interfaccia che consente ai software di richiamare il modello, Google AI Studio e Gemini Enterprise. Alcuni utenti abbonati possono inoltre richiamarlo nell'app Gemini e nella modalità di intelligenza artificiale di Google Search. Il modello è adatto ai lavori in cui velocità, prezzo e capacità di affrontare attività più lunghe vengono prima di tutto: dispone di una finestra di contesto da un milione di Token, può elaborare testo, immagini, audio e video e generare fino a 64.000 Token. Se invece l'attività richiede soprattutto efficienza di calcolo, Google consiglia di ridurre il livello di ragionamento o di continuare a usare 3.7 Flash. In altre parole, 3.8 Flash rende più accessibili agli sviluppatori le capacità dei modelli complessi, ma non ha ancora eliminato la verifica umana dal flusso di lavoro.

Torna all’articolo