Inteligencia Artificial · Noticia
Gemini 3.1 Pro dobla su puntuación en ARC-AGI-2: lectura técnica de un update de mitad de ciclo
19 de febrero de 2026 · 4 min de lectura · Por Redacción Cubix Academia · Nivel avanzado
Google DeepMind publicó Gemini 3.1 Pro en preview el 19 de febrero de 2026. Analizamos el único salto de benchmark que de verdad es notable y por qué el resto de la tabla se decide en décimas.
El 19 de febrero de 2026, Google DeepMind publicó Gemini 3.1 Pro en preview, una actualización de mitad de ciclo de la familia Gemini 3. Es la primera vez que Google emplea la nomenclatura ".1" dentro de la serie, y la etiqueta importa: no es un modelo nuevo, sino un refinamiento del Gemini 3 Pro presentado a finales de 2025. Para quien construye sobre estos modelos, la pregunta útil no es si "es mejor", sino en qué ejes concretos se mueve y cuánto de ese movimiento se traduce en trabajo real.
El dato que sí es notable
El titular técnico está en ARC-AGI-2, el benchmark de razonamiento abstracto de la fundación ARC Prize diseñado para resistir la memorización: mide la capacidad de inferir reglas nuevas a partir de muy pocos ejemplos. Según la ficha del modelo (model card) publicada por Google DeepMind, Gemini 3.1 Pro obtiene un 77,1 % verificado, frente al 31,1 % de Gemini 3 Pro. Más del doble dentro del mismo linaje y en pocos meses.
Conviene situar ese número. ARC-AGI-2 llevaba tiempo siendo el hueso duro de los benchmarks de frontera: la mayoría de modelos comerciales se movía por debajo del 60%, con la excepción de Claude Opus 4.6 (68,8% verificado, lanzado dos semanas antes), y la propia ARC Prize diseñó el benchmark porque ARC-AGI-1 empezaba a saturarse. Un salto de 31 a 77 en la misma línea de producto es la clase de movimiento que no se explica solo con "más datos de entrenamiento". Dicho esto, un benchmark no es una capacidad: mide desempeño en un formato acotado, y la generalización a tareas abiertas sigue siendo una cuestión empírica que cada equipo debe verificar en su propio dominio.
El resto del cuadro: liderazgos estrechos
Fuera de ARC-AGI-2, el retrato es más matizado y merece leerse con frialdad. Los números que la propia model card compara contra Claude (Opus/Sonnet 4.6) y GPT-5.2:
- GPQA Diamond (preguntas de ciencia a nivel doctorado): 94,3 %, por delante de GPT-5.2 (92,4 %) y de Claude Opus 4.6 (91,3 %).
- SWE-bench Verified (resolución de issues reales de software): 80,6 %. Aquí Opus 4.6 marca 80,8 %: es un empate estadístico, no una ventaja.
- Terminal-Bench 2.0 (tareas de agente en terminal): 68,5 %, frente al 65,4 % de Opus 4.6 y el 54,0 % de GPT-5.2.
- LiveCodeBench Pro (Elo de programación competitiva): 2887, frente a 2439 de Gemini 3 Pro.
- MMMLU (conocimiento multilingüe): 92,6 %.
- Humanity's Last Exam, con herramientas de búsqueda y código: 51,4 % según la model card.
La lectura de consultoría es directa: en varios ejes el liderazgo se mide en décimas o queda en empate técnico con los modelos de Anthropic y OpenAI. En coding aplicado (SWE-bench) no hay una ventaja explotable; la diferencia real está en razonamiento abstracto (ARC-AGI-2) y en tareas agénticas de terminal, donde el margen es mayor. Para un equipo que ya tiene un pipeline sobre otro proveedor, ese cuadro no justifica por sí solo una migración.
Inicia sesión para leer este artículo
Es una publicación gratuita: solo hace falta una cuenta, sin suscripción.