La plataforma de referencia LLM Stats compara más de 300 modelos de inteligencia artificial. Esta cifra es un buen ejemplo de cómo una tecnología que antes era exclusiva de investigadores, desarrolladores y demás perfiles técnicos se ha extendido a todos los ámbitos de la sociedad, como hicieron en su día Internet o las aplicaciones móviles. Y aunque el mercado de la IA es enorme, la competencia es dura. Todos quieren tener la mejor IA. Y cada pocos meses, la respuesta puede cambiar. En esta ocasión, comparamos ChatGPT 5.6, Claude 5 y Gemini 3.7.
No es fácil elegir entre decenas o centenares de modelos de IA diferentes. Además, los hay para todos los gustos. Algunos de ellos están disponibles con su propio asistente de inteligencia artificial, como los antes mencionados. Instalas la aplicación del asistente y ya puedes preguntarle lo que quieras. Otros modelos de IA vienen en forma de agente de IA con prestaciones más avanzadas. Y unos terceros vienen disponibles para instalar en tu propia computadora. Así tú tienes más control sobre la IA y puedes manejarla a tu antojo.
Lo bueno es que hay maneras de cuantificar y analizar qué modelo de IA es mejor que la competencia. Para empezar, los propios creadores publican los resultados de sus pruebas. En ocasiones, incluyendo modelos anteriores propios. Pero, por lo general, comparan sus modelos con los de sus rivales. Por otro lado, abundan las plataformas que confeccionan rankings y listados con los modelos de IA más populares. En el pasado hemos visto varios ejemplos. Si hace unos meses vimos si era mejor IA ChatGPT 5.2, Claude 4.5, Gemini 3 Pro o Grok 4.1, hoy toca ver cuál es mejor entre ChatGPT 5.6 (GPT 5.6), Claude 5 y Gemini 3.7.
Ficha técnica de ChatGPT 5.6, Claude 5 y Gemini 3.7
Antes de ver los resultados de las pruebas a las que someten a estos modelos de IA, conozcamos un poco más los modelos a comparar. Para empezar, si elegimos estos tres, es porque pertenecen a tres de las empresas estadounidenses más importantes en desarrollo de IA y de las que más se suele hablar. Es decir, OpenAI (ChatGPT), Anthropic (Claude) y Google (Gemini). Sin embargo, para hacer justicia, tendríamos que mencionar a muchas otras. Sin ir más lejos, en el ranking actual de mejores modelos, destacan tres modelos chinos: Kimi K3 (de Moonshot AI), GLM-5.3 (de Zhipu AI) y DeepSeek-V4-Pro-0813 (de DeepSeek).

ChatGPT 5.6, aunque deberíamos decir GPT 5.6, es el modelo más reciente de OpenAI. Al menos, en el momento de escribir estas líneas. Anunciado a principios de julio de 2026, está disponible en tres versiones: Sol, Terra y Luna. El modelo más potente es GPT 5.6 Sol. Por su parte, Luna es la versión rápida y económica y Terra la versión equilibrada. Este modelo tiene una ventana de contexto de 1.050.000 tokens y un máximo de salida de 128.000 tokens.
Claude 5 es el modelo de Anthropic presentado a principios de junio de 2026. Por motivos legales, se pausó y volvió a anunciarse en julio. Está disponible en tres versiones. La más importante es Claude Fable 5. Sus hermanos menores, Opus 5 y Sonnet 5, se anunciaron posteriormente. Sonnet 5 el 30 de junio y Opus 5 el 24 de julio. La ventana de contexto de Claude 5 es de 1.000.000 de tokens y un máximo de salida de 128.000 tokens.
Gemini 3.7 es el modelo de IA de Google. Su versión Flash fue anunciada en agosto de 2026. Tiene una ventana de contexto de 1.048.576 tokens y un máximo de salida de 65.536 tokens. Esa diferencia con sus otros dos competidores se debe a que Flash es la versión rápida y económica de la familia Gemini. A diferencia de Claude y GPT, a los que comparamos en sus versiones más completas.
Qué dicen los resultados de OpenAI, Anthropic y Google
Cuando empresas como OpenAI, Anthropic y Google anuncian nuevos modelos de IA o nuevas versiones mejores a las anteriores, siempre incluyen exámenes y pruebas que han realizado a sus propios modelos y a la competencia. Veamos qué dicen esos resultados.
Cuando OpenAI anunció GPT-5.6 en sus versiones GPT-5.6 Sol, GPT-5.6 Terra y GPT-5.6 Luna, incluyó los tests realizados a esas versiones y a modelos de IA como Claude Fable 5, Gemini 3.1 Pro Preview y Claude Opus 4.8. En tokens de salida y en latencia o velocidad de respuesta, los tres modelos de OpenAI salían victoriosos e incluso superan la versión anterior GPT-5.5. Si quieres repasar todas las pruebas realizadas, puedes hacerlo aquí.

Anthropic mostró tablas de resultados en su anuncio original de Claude Fable 5 y de su variante Claude Mythos 5. Al anunciarse en junio de 2026, las pruebas se realizaron comparando con Claude Opus 4.8, GPT 5.5 y Gemini 3.1 Pro. Y en todos los rankings aparece Claude 5 como ganador: programación agéntica, razonamiento espacial, uso de computadora, razonamiento multidisciplinar, ciberseguridad y salud, entre otros parámetros. Curiosamente, sus buenos resultados en seguridad no impidieron la polémica que protagonizó nada más ser anunciado.
En tercer lugar, Google presentó también Gemini 3.7 Flash con las correspondientes tablas comparativas con Claude y GPT. En concreto, se comparó con Claude Sonnet 5, que es la versión más sencilla, y GPT-5.6 Terra, que es la versión intermedia. Las pruebas incluían análisis de código, ingeniería de software, desarrollo web, comprensión de documentos PDF o automatización de rutinas de trabajo.
Qué IA es la mejor de las tres
Si cada desarrollador afirma que su modelo de IA es el mejor, ¿cómo saber cuál tiene razón? En realidad, si analizamos al detalle, todos dicen la verdad, ya que son pruebas distintas aunque similares. Es decir, que cada empresa destaca las pruebas que le dan la razón. Pero hay pequeñas variantes, como las versiones de los modelos de IA comparados o la prueba estándar elegida para cada test.
Buscando una respuesta a la pregunta de cuál es la mejor IA, podemos acudir a plataformas de comparativas como LLM Stats, que mencioné al principio. En esta plataforma encontrarás la mayoría de pruebas estandarizadas para IA, organizadas por categoría. Así como rankings genéricos y específicos para saber qué IA es mejor como agente, cuál razona mejor o la que programa más bien. Y también puedes filtrar por tipo de modelo, es decir, si es experto en generar imágenes, convertir texto a voz o viceversa, etc.
En el ranking de agosto de 2026 de LLM Stats, el primer puesto lo ocupa GPT-5.6 Sol. O ChatGPT 5.6 para algunos. Primer puesto en el ranking general y también en las pruebas de razonamiento, programación y funciones de agente de IA. Segundo y tercer puesto para Claude Opus 5 y Claude Fable 5. Y Gemini 3.7 Flash lo encontramos en el puesto 12. En su favor, se trata de un modelo simplificado con respecto a los que encontramos en los diez primeros puestos.
Si te ha gustado este artículo y quieres recibir más contenido sobre innovación y tecnología directamente en tu correo, suscríbete a nuestra newsletter y mantente siempre actualizado. No somos de los que llenan tu bandeja, solo compartimos los lunes.









