
Gemini 4 ha sido lanzado oficialmente, y por fin tenemos un modelo de vanguardia donde escribir es superior a programar
El modelo insignia Gemini, que había estado fuera de servicio durante siete meses y medio, finalmente ha sido actualizado.
Hace un momento, varias cuentas relacionadas con Google anunciaron simultáneamente: Gemini 4 Argon ha sido lanzado oficialmente.
Además, este podría ser el único modelo de vanguardia reciente en el que las capacidades de escritura, conocimiento y textos largos son significativamente más fuertes que las capacidades de programación y de los agentes.
En tan solo tres días, incluso la nomenclatura de Gemini 4 ha cambiado, haciendo que parezca casi un modelo de OpenAI . La explicación oficial sobre este nombre es mínima; solo sabemos que se trata de un nombre en clave interno utilizado durante la fase de pruebas y que ahora se emplea en la versión final.
Literalmente, representa el elemento 18, el argón, un gas inerte, lo que establece un interesante paralelismo con el cromo.
No se apresure a probarlo en la aplicación Gemini: siguiendo la reciente tendencia de la "seguridad", Gemini 4 Argon actualmente solo está disponible para un número limitado de socios de ciberseguridad a través del programa Fairwind. El anuncio oficial no ha especificado una fecha para su lanzamiento público completo, limitándose a indicar que "estará disponible primero para los usuarios de API de pago y los suscriptores de Google AI Ultra". Los suscriptores regulares tendrán que esperar un poco más.

Anteriormente, se filtró en el campo de pruebas una supuesta versión del Gemini 4, pero dado que nadie la ha confirmado oficialmente, se desconoce si se trata de un Gemini 4 real o si incluye Fable y Astra. Por lo tanto, los resultados de estas supuestas pruebas comparativas no son muy fiables. Por ahora, solo podemos presentar los datos publicados por las autoridades oficiales (lo que, además, simplifica considerablemente la redacción de este artículo).
Al menos, a juzgar por las puntuaciones de referencia oficiales, el Gemini 4 Argon es extremadamente potente:

Lo has leído bien. De las 18 pruebas enumeradas, el Géminis 4 obtuvo resultados excelentes en 13 de ellas.
La mayor ventaja se observa en el trabajo intelectual. Tanto en las pruebas Vals Finance Agent v2 como en las Harvey's Legal Agent Benchmark, que implican análisis financieros y trabajo legal reales, no es exagerado afirmar que Gemini 4 se sitúa dos niveles por delante de cualquier otro modelo. Esto no sorprende, ya que, incluso en sus peores momentos, nadie ha dudado jamás de la capacidad de Gemini para comprender el mundo.

Otra fortaleza tradicional de Gemini es su contexto extenso. En la prueba de rendimiento GraphWalks, que evalúa la capacidad de utilizar eficazmente contextos ultralargos que van desde 256k hasta 1M, Gemini 4 también superó a otros modelos insignia en más del 10%.
Una nueva función puede explicar esta pista.

Gemini 4 Argon aumenta el límite de salida de 64.000 tokens en la generación anterior a 1 millón de tokens. Esto significa que, si tu billetera lo permite y Gemini está dispuesto a expresarse, puede emitir aproximadamente entre 700.000 y 1 millón de caracteres chinos a la vez, lo que representa una mejora épica para la construcción de cadenas de comunicación. La explicación oficial es:
Cuando un modelo tiene suficiente espacio para pensar profundamente y genera cientos de miles de unidades léxicas en una sola trayectoria de razonamiento, aportará un nivel de profundidad completamente nuevo al razonamiento, resolviendo así problemas complejos de una sola vez.
En cambio, el rendimiento de programación de Gemini 4 es algo inconsistente. En DeepSWE v1.1, la prueba de compilación de software de ciclo largo más utilizada en el mundo real, Gemini 4 obtuvo una puntuación del 77,9 %, superando a GPT-6 Astra y Claude Opus 5.5 por casi 4 puntos porcentuales.

Sin embargo, Gemini 4 tiene un rendimiento deficiente en FrontierSWE v2, que requiere la creación de proyectos desde cero para resolver problemas, y en Terminal-Bench 4.0, que utiliza terminales Linux para gestionar tareas complejas.
Podemos resumir a grandes rasgos las características de Géminis 4 de la siguiente manera: Conocimiento/Escritura > Programación > Terminal.
Las pruebas realizadas por terceros también pueden corroborar este dictamen.
En el sistema de votación anónima de Arena.ai, Gemini 4 ocupó el primer lugar en Text Arena gracias a sus altas puntuaciones en la resolución de problemas complejos, el seguimiento de instrucciones y la escritura creativa. Sin embargo, en Code Arena: WebDev y Agent Arena, que se centran más en las capacidades de ingeniería, Gemini 4 solo alcanzó el octavo puesto.

En cierto modo, las limitaciones de programación de Gemini resultan ser una ventaja. La sobreoptimización de la programación de agentes parece haber vuelto "poco comunicativos" a muchos modelos de vanguardia, incluyendo los saltos de línea excesivos que persisten desde la era de GPT-5.3 y la jerga misteriosa que surgió con Opus 4.7. En tales situaciones, un modelo Gemini que conserva cierto sentido estético del lenguaje a pesar de sus limitadas capacidades de programación puede resolver muchos problemas de escritura.
Otro cambio destacable es la disminución significativa de la frecuencia de las alucinaciones.

En la prueba de Análisis Artificial, Gemini 4 presentó una tasa de alucinaciones de tan solo el 15%, la más baja entre todos los modelos de vanguardia. Esto significa que, ante respuestas inciertas, es más probable que diga "No lo sé" que inventarse una respuesta.
Pero para los usuarios comunes, la cuestión más importante es, por supuesto, el precio, y Google siempre ha sido muy generoso en este sentido.
El precio oficial de la API para Gemini 4 Argon es de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida, con una tasa de acierto del 5 % (0,10 dólares). El anuncio oficial indica que el precio se duplicará tras el periodo inicial de descuento por lanzamiento, pero, según la experiencia, es muy probable que dicho periodo no finalice hasta el lanzamiento del modelo de próxima generación.

Con el precio rebajado, el Gemini 4 cuesta una quinta parte del GPT-6 Astra y el Fable 5.1, aproximadamente al mismo nivel que el GPT-6.1 Sol y el Sonnet 5.5. En otras palabras, siempre que no haya publicidad engañosa, el Gemini 4 es actualmente el modelo con la mejor relación "inteligencia-precio", ofreciendo inteligencia de gama alta a un precio medio.
El lanzamiento de Gemini 4 Argon también puso fin a una racha vergonzosa: durante casi medio año, las ventajas del paquete Google AI Pro se describían como "poder usar el modelo 3 Pro"… Teniendo en cuenta que incluso los modelos Flash pueden superar a los modelos Pro después de la era Flash 3.5, este paquete de suscripción resulta bastante gracioso, ya que en gran medida la gente compraba la suscripción solo por los 5 TB de Google Drive.

Al menos ahora, Google por fin puede promocionar abiertamente su programa de membresía.
Llegados a este punto, también me gustaría decir unas palabras sobre un tema diferente.
Cada persona tiene su dispositivo ideal, y para mí, ese dispositivo en el campo de la IA es el Gemini 2.5 Pro. A principios del año pasado, las capacidades de procesamiento de texto del 2.5 Pro me parecieron realmente asombrosas, y fue entonces cuando incorporé oficialmente la IA a mi flujo de trabajo. Más tarde, cuando vi el lanzamiento del Gemini 3, lo compartí inmediatamente en mis Momentos de WeChat.
En ese sentido, nadie quiere que el Géminis 4 destaque más que yo.

Sin embargo, debemos respetar las leyes objetivas. Como muchos han comentado, la fabricación a gran escala es, en última instancia, un tipo de industria manufacturera, como la fabricación de teléfonos móviles y chips. No podemos esperar que un modelo que lleva mucho tiempo sin actualizarse domine repentinamente el mercado; esto es tan irreal como que una fábrica de chips estancada en 10 nm produzca de repente un chip de 2 nm.
La notable discrepancia entre los resultados de las pruebas de rendimiento de Gemini 3.8 Flash y su desempeño real sugiere que Google podría haber implementado algunas "optimizaciones especiales" para inflar dichos resultados e intentar disimular su fracaso. Asimismo, resulta muy cuestionable que Gemini 4 alcance niveles de vanguardia (SOTA) en la mayoría de las pruebas de rendimiento.
Casi simultáneamente con el anuncio del Gemini 4, Bloomberg también informó que los empleados de Google se mostraban escépticos sobre su rendimiento real. Citaron a "fuentes internas" que afirmaron que el Gemini 4 tenía un rendimiento deficiente en tareas cotidianas y "dificultaba con ciertas tareas de programación".

Aunque Google refutó rápidamente las afirmaciones, y algunos empleados dijeron que Gemini 4 era bastante bueno, es probable que la versión final no sea tan potente como sugieren las puntuaciones de referencia. Además, el tiempo necesario para la implementación de Gemini 4 es suficiente para que ChatGPT y Claude completen varias versiones.
En cualquier caso, el lado positivo es que el lanzamiento del Gemini 4 Argon significa que Google finalmente ha vuelto a la competencia.
Puede que su límite superior no sea muy alto, pero su límite inferior aún está garantizado. Lo que se debe hacer a continuación es ponerse al día paso a paso utilizando los métodos de fabricación de modelos a gran escala.
