Viernes, 4 de septiembre de 2026Apoyar

Aube.

Las noticias del progreso
Original y traducción

Gemini 3.8 Flash llega con más razonamiento y coste

Salir de la comparación

Las dos versiones están alineadas bloque a bloque, en el orden del texto: titular, lo esencial y después párrafo a párrafo. Cuando la traducción ha fusionado o dividido un párrafo, la casilla correspondiente queda vacía — nunca emparejamos dos pasajes a ojo.

Original · chino
Gemini 3.8 Flash上线,推理更强也更耗算力
Traducción · español
Gemini 3.8 Flash llega con más razonamiento y coste
Original · chino
它面向长程软件工程、能连续调用工具的智能代理,以及复杂企业工作流。
Traducción · español
Está orientado a la ingeniería de software de larga duración, los agentes inteligentes capaces de invocar herramientas de forma continua y los flujos de trabajo empresariales complejos.
Original · chino
Google给出的成绩逼近旗舰模型,但两家媒体对DeepSWE成绩报道为71.0%和73.7%。
Traducción · español
Los resultados ofrecidos por Google se acercan a los de los modelos insignia, pero dos medios sitúan el rendimiento de DeepSWE en el 71,0 % y el 73,7 %.
Original · chino
3.8 Flash Cyber专攻漏洞发现与修复,仅向Fairwind Program中的可信机构开放。
Traducción · español
3.8 Flash Cyber se especializa en descubrir y corregir vulnerabilidades y solo está disponible para instituciones de confianza del Fairwind Program.
Original · chino

9月2日凌晨,Gemini的版本号又跳了一格:Google上线Gemini 3.8 Flash。它是六周内发布的第三款Flash模型,也是5月宣布的Gemini 3.5 Flash之后、不到四个月内的第四款;与此同时,原定的旗舰Gemini 3.5 Pro至今仍未发布。Flash原本强调速度和成本,如今却被推向长程软件工程、能连续调用工具的智能代理,以及持续数小时的复杂企业工作流。\n\n跑分先把故事推到了旗舰模型附近。Google称,3.8 Flash在DeepSWE v1.1软件开发测试中达到73.7%,Terminal-Bench 2.1从85.8%升至89.4%,略高于Claude Opus 5的89.1%;Artificial Analysis测得它的智能指数为59分,和GPT-5.6 Sol在较高推理档位的成绩相当,但低于Claude Opus 5最高的63分。数字也有需要保留的地方:爱范儿对DeepSWE v1.1的报道记录为71.0%,而非73.7%,两家媒体呈现的同一项成绩并不一致。\n\n更高的能力并非没有代价。Google解释,3.8 Flash面对复杂问题会投入更多推理步骤、反复调用工具并检查工作,这意味着消耗更多Token——模型处理文本时使用的计费单位。Artificial Analysis观察到,它平均生成的输出Token增加约30%,任务平均耗时从2.2分钟变为2.5分钟;即使输出速度约为每秒300个Token,单项任务成本仍升至0.58美元,比3.7 Flash高约40%。目前API价格与前代相同,为每百万输入Token 0.75美元、输出3.75美元,但2027年1月1日起将分别恢复至1.5美元和7.5美元。\n\n真实使用呈现出另一面。爱范儿让模型用Three.js制作空客H145直升机的3D模型,需求拆解不到一分钟完成,109秒后场景和模型生成完毕;速度确实配得上Flash,但机身细节、部件关系和运动方式都很粗糙。第二个地形水流模拟约两分钟完成,功能基本齐全,火山口却出现了漏水。Google官方的魔法城堡演示则由3.8 Flash在Antigravity中循环工作,并调用Nano Banana生成纹理,背后有代理框架、工具环境和多轮流程;一次性提示词得到的,是它单独工作的下限,而不是整套系统托举出的上限。\n\n同日发布的Gemini 3.8 Flash Cyber沿用同一基础模型,但专门优化漏洞发现与修复。Google称它在覆盖20种编程语言的内部测试中成功率超过70%,在CyberGym中一次尝试解决86.2%的任务;不过它没有向普通用户开放,而是通过Fairwind Program提供给经过验证的网络安全机构、政府部门、关键基础设施运营者和主要科技企业,Google称目前已有超过650个合作伙伴。\n\n具体到使用者,开发者现在可以通过Gemini API——让软件调用模型的接口——、Google AI Studio和Gemini Enterprise使用3.8 Flash,部分订阅用户也能在Gemini应用和Google搜索的人工智能模式中调用它。它适合把速度、价格和较长任务能力放在前面的工作:模型拥有一百万Token上下文窗口,可处理文本、图片、音频和视频,最多输出64,000个Token;但若任务更看重计算效率,Google建议降低推理档位或继续使用3.7 Flash。换句话说,3.8 Flash让复杂模型能力更容易被开发者买到,却还没有把人工复核从工作流里拿掉。

Traducción · español

En la madrugada del 2 de septiembre, el número de versión de Gemini volvió a subir: Google lanzó Gemini 3.8 Flash. Es el tercer modelo Flash publicado en seis semanas y el cuarto en menos de cuatro meses desde el anuncio de Gemini 3.5 Flash en mayo. Mientras tanto, el modelo insignia Gemini 3.5 Pro, previsto inicialmente, aún no se ha publicado. Flash hacía hincapié en la velocidad y el coste, pero ahora también se orienta a la ingeniería de software de larga duración, los agentes inteligentes capaces de invocar herramientas de forma continua y los flujos de trabajo empresariales complejos que se prolongan durante horas.

Original · chino(sin equivalente en este punto)
Traducción · español

Los resultados de las pruebas situaron primero la historia cerca de los modelos insignia. Google afirma que 3.8 Flash alcanzó el 73,7 % en la prueba de desarrollo de software DeepSWE v1.1, mientras que en Terminal-Bench 2.1 pasó del 85,8 % al 89,4 %, ligeramente por encima del 89,1 % de Claude Opus 5. Artificial Analysis midió para el modelo un índice de inteligencia de 59 puntos, similar al resultado de GPT-5.6 Sol en una configuración de razonamiento más alta, aunque inferior a los 63 puntos máximos de Claude Opus 5. Las cifras también requieren cierta cautela: el informe de ifanr sobre DeepSWE v1.1 registró un 71,0 %, no un 73,7 %. Los dos medios ofrecen resultados diferentes para la misma prueba.

Original · chino(sin equivalente en este punto)
Traducción · español

Una mayor capacidad no sale gratis. Google explica que, ante problemas complejos, 3.8 Flash dedica más pasos al razonamiento, invoca herramientas repetidamente y comprueba el trabajo realizado. Eso implica consumir más tokens, la unidad de facturación que utiliza el modelo al procesar texto. Artificial Analysis observó que la cantidad media de tokens de salida generados aumentó aproximadamente un 30 % y que el tiempo medio por tarea pasó de 2,2 a 2,5 minutos. Aunque la velocidad de salida ronda los 300 tokens por segundo, el coste por tarea asciende a 0,58 dólares, alrededor de un 40 % más que con 3.7 Flash. Por ahora, el precio de la API es el mismo que el de la generación anterior: 0,75 dólares por cada millón de tokens de entrada y 3,75 dólares por cada millón de tokens de salida. Sin embargo, a partir del 1 de enero de 2027 volverá a ser de 1,5 y 7,5 dólares, respectivamente.

Original · chino(sin equivalente en este punto)
Traducción · español

El uso real muestra otra cara. ifanr pidió al modelo que utilizara Three.js para crear un modelo 3D del helicóptero Airbus H145. El desglose de los requisitos se completó en menos de un minuto y, 109 segundos después, la escena y el modelo estaban terminados. La velocidad está a la altura de Flash, pero los detalles del fuselaje, las relaciones entre los componentes y el movimiento eran muy rudimentarios. Una segunda simulación de la circulación del agua por un terreno se completó en unos dos minutos y contaba básicamente con todas las funciones, aunque el cráter volcánico tenía una fuga de agua. En la demostración oficial del castillo mágico de Google, 3.8 Flash trabajaba en bucle dentro de Antigravity y utilizaba Nano Banana para generar texturas, con un marco de agentes, un entorno de herramientas y un proceso de varias rondas. El resultado de una instrucción única muestra el límite inferior de su trabajo en solitario, no el límite superior que puede alcanzar cuando todo el sistema lo respalda.

Original · chino(sin equivalente en este punto)
Traducción · español

Presentado el mismo día, Gemini 3.8 Flash Cyber utiliza el mismo modelo base, pero está optimizado específicamente para descubrir y corregir vulnerabilidades. Google afirma que logró una tasa de éxito superior al 70 % en pruebas internas que cubrían 20 lenguajes de programación y que resolvió el 86,2 % de las tareas en CyberGym en un único intento. Sin embargo, no está disponible para el público general: Google lo ofrece a través del Fairwind Program a instituciones de ciberseguridad verificadas, organismos gubernamentales, operadores de infraestructuras críticas y grandes empresas tecnológicas. La compañía afirma que actualmente cuenta con más de 650 socios.

Original · chino(sin equivalente en este punto)
Traducción · español

En cuanto a los usuarios, los desarrolladores ya pueden utilizar 3.8 Flash a través de Gemini API —la interfaz que permite a los programas invocar el modelo—, Google AI Studio y Gemini Enterprise. Algunos suscriptores también pueden acceder a él desde la aplicación Gemini y el modo de inteligencia artificial de Google Search. Es adecuado para trabajos que priorizan la velocidad, el precio y la capacidad para abordar tareas largas: el modelo dispone de una ventana de contexto de un millón de tokens, puede procesar texto, imágenes, audio y vídeo, y generar hasta 64.000 tokens. Si la tarea da más importancia a la eficiencia computacional, Google recomienda reducir el nivel de razonamiento o seguir utilizando 3.7 Flash. En otras palabras, 3.8 Flash facilita que los desarrolladores puedan adquirir capacidades propias de modelos complejos, pero todavía no elimina la revisión humana del flujo de trabajo.

Volver al artículo