Saltar al contenido
Neurolime
Logotipo de Gemini 4 Argon junto a un gran número 4 luminoso sobre un fondo degradado en tonos azules y violetas

Gemini 4 Argon: benchmarks, precio y dudas del nuevo modelo de Google

Inteligencia artificial1 oct 2026

Gemini 4 Argon es el nuevo modelo de inteligencia artificial de Google, con el que la compañía busca volver a la primera línea frente a OpenAI y Anthropic. Iguala a GPT-6 Astra en el índice de inteligencia de Artificial Analysis y destaca por inventarse muchas menos respuestas. Aun así, hay voces dentro de la propia Google que dudan de que ese rendimiento se note igual en el trabajo del día a día, sobre todo al programar.

¿Qué dicen los benchmarks de Gemini 4 Argon?

Los datos publicados dibujan un modelo muy competitivo:

  • Inteligencia general: 53 puntos en el Artificial Analysis Intelligence Index, los mismos que GPT-6 Astra. En ese índice, Claude sigue por delante.
  • Pruebas internas de Google: según la propia compañía, supera a Opus 5.5 y Fable 5.1, los modelos de Anthropic, en distintos tests.
  • Alucinaciones: en la prueba AA-Omniscience, Gemini 4 Argon se equivoca inventando respuestas en un 15 % de los casos, frente al 50 % de GPT-6 Astra. La diferencia se explica en gran parte porque el modelo prefiere admitir que no sabe algo antes que improvisar.

¿Cuánto cuesta?

Durante la fase promocional, el precio es de 2 dólares por millón de tokens de entrada y 10 de salida, lo que según Google supone un coste por tarea un 40 % inferior al de GPT-6 Astra. La tarifa estándar prevista sube a 4 y 20 dólares, con lo que esa ventaja se reduce y resulta más difícil de justificar en usos intensivos.

¿Quién puede usarlo ahora?

Por el momento, el acceso es limitado: solo lo usan probadores de confianza y especialistas en ciberseguridad a través del programa Fairwind de Google. El modelo también está siendo evaluado por el Gobierno de Estados Unidos, un paso que se ha vuelto habitual entre los laboratorios para evitar bloqueos regulatorios antes de un lanzamiento general.

El problema de fiarse solo de los benchmarks

Los buenos resultados llegan acompañados de una advertencia. Según informó Bloomberg, algunos empleados de Google se mostraron escépticos con el rendimiento real del modelo en tareas de programación, algo que Sundar Pichai, consejero delegado de Google, ha desmentido.

Más allá de ese cruce de versiones, la cuestión de fondo es conocida: los benchmarks miden tareas acotadas y verificables, mientras que el trabajo real es mucho más desordenado. Hay repositorios enormes, dependencias imperfectas y documentación incompleta, condiciones que una prueba estándar no reproduce.

Qué significa para una empresa que quiere usar IA

Elegir un modelo por su posición en un ranking es una mala idea. Lo más sensato es:

  • Probarlo con casos reales de tu negocio, como facturas, correos o atención al cliente, y no con ejemplos genéricos.
  • Medir el coste por tarea y la tasa de errores, no solo el precio por token.
  • Diseñar la solución para poder cambiar de modelo sin rehacerlo todo, porque el liderazgo se reparte y cambia cada pocas semanas.

En resumen

  • Gemini 4 Argon iguala a GPT-6 Astra en inteligencia general y alucina bastante menos.
  • Su precio promocional es competitivo, pero la tarifa estándar duplica el coste.
  • Por ahora solo está disponible para un grupo reducido de usuarios.
  • Los benchmarks son una buena referencia, pero no sustituyen a probar el modelo en tu propio caso de uso.