Inteligencia Artificial · Noticia

GPT-5.6 de OpenAI: benchmarks reales de ARC Prize y el primer veto de acceso pedido por un gobierno

26 de junio de 2026 · 5 min de lectura · Por Redacción Cubix Academia · Nivel intermedio

OpenAI presentó el 26 de junio de 2026 su familia GPT-5.6 (Sol, Terra, Luna) con resultados verificados en ARC-AGI y TerminalBench, pero con el acceso restringido por primera vez a petición del gobierno de Estados Unidos tras clasificar el modelo con capacidad "alta" en ciberseguridad y riesgo biológico.

El 26 de junio de 2026, OpenAI presentó GPT-5.6, su nueva familia de modelos frontera, en formato de vista previa limitada. La noticia no fue tanto el salto de capacidades (real y medible) como el hecho de que, por primera vez, un lanzamiento de este calibre llegó con el acceso restringido a un grupo de socios aprobados por el gobierno de Estados Unidos. Conviene separar ambas cosas: qué es capaz de hacer el modelo, según benchmarks reportados, y por qué su despliegue se ha limitado.

Tres modelos, un mismo lanzamiento

Según el anuncio de OpenAI, GPT-5.6 no es un modelo único sino una familia de tres variantes con distinto balance entre capacidad y coste:

  • Sol, el modelo insignia, orientado a problemas complejos: codificación avanzada e investigación en seguridad.
  • Terra, pensado para tareas empresariales de alto volumen (soporte, herramientas internas, análisis documental).
  • Luna, la opción más rápida y económica para resumen, redacción y automatización rutinaria.

Los precios publicados por OpenAI son de 5 dólares de entrada y 30 de salida por millón de tokens para Sol, 2,50/15 para Terra y 1/6 para Luna. Microsoft ya ha adoptado el modelo como opción preferente en Microsoft 365 Copilot, un dato de adopción real más que una cifra de marketing.

Los benchmarks que sí están verificados

ARC Prize, la organización independiente que mantiene el benchmark ARC-AGI, publicó resultados propios para las tres variantes con esfuerzo de razonamiento máximo. En ARC-AGI-1, Sol y Terra empatan en 96,5% y Luna queda en 88,0%. En ARC-AGI-2, la brecha se abre: 92,5% para Sol, 83,9% para Terra y 59,5% para Luna. En ARC-AGI-3 (la versión más reciente y exigente del benchmark, centrada en juegos interactivos) ningún modelo se acerca a un rendimiento sólido: Sol es, a la fecha de esta publicación, el único con una puntuación reseñable en el conjunto semi-privado (7,8%; las otras dos variantes se quedan por debajo del 1%) y el primero en completar de forma pública una de las tareas del benchmark (87% en la prueba FT09). Es una cifra que ilustra bien el estado real del campo: capacidades muy altas en tareas de patrón estático, y aún frágiles en entornos que exigen interacción secuencial.

En TerminalBench 2.1, un benchmark de automatización por línea de comandos citado por VentureBeat, Sol alcanzó 91,91% en su modo de razonamiento más intensivo y 88,76% en modo máximo estándar, superando a GPT-5.5 en la misma prueba. Son datos coherentes con el posicionamiento de Sol como modelo para tareas de codificación e ingeniería, no como asistente generalista.

Inicia sesión para leer este artículo

Es una publicación gratuita: solo hace falta una cuenta, sin suscripción.