Inteligencia Artificial · Noticia
Modelos de razonamiento que no logran ocultar lo que piensan: el hallazgo de OpenAI sobre la cadena de pensamiento
5 de marzo de 2026 · 5 min de lectura · Por Redacción Cubix Academia · Nivel avanzado
Un estudio de OpenAI publicado en marzo de 2026 muestra que los modelos de razonamiento actuales apenas logran controlar lo que revelan en su cadena de pensamiento, un dato que sostiene, de momento y de forma frágil, la monitorización como capa de seguridad en IA.
Los modelos de razonamiento modernos (GPT, Claude, Gemini y sus equivalentes) no responden directamente a una pregunta compleja: antes generan una cadena de pensamiento, un borrador intermedio en lenguaje natural donde descomponen el problema paso a paso. Desde hace un par de años, varios laboratorios tratan ese borrador como algo más que un subproducto: como una posible ventana de supervisión, una forma de observar el razonamiento de un modelo antes de que se traduzca en una acción problemática. La pregunta que faltaba responder era si esa ventana es fiable o si un modelo, si le conviniera, podría simplemente maquillar lo que escribe ahí dentro. Un estudio publicado por OpenAI a principios de marzo de 2026 aporta la primera evidencia empírica sólida al respecto, y la respuesta, con matices, es tranquilizadora en el corto plazo.
El experimento
El equipo, liderado por Chen Yueh-Han, construyó una batería llamada CoT-Control: más de 14.000 tareas derivadas de bancos de pruebas conocidos (GPQA, SWE-Bench, entre otros) en las que se pide a un modelo resolver un problema mientras cumple una instrucción sobre su propio razonamiento interno. Por ejemplo: responder una pregunta de genética sin que la palabra "cromosoma" aparezca en la cadena de pensamiento. Las tareas se dividen en tres tipos: suprimir contenido, añadir contenido obligatorio y modificar el estilo del razonamiento.
Los resultados muestran una brecha llamativa entre lo que un modelo controla en su respuesta final y lo que controla en su razonamiento intermedio. Según el informe, Claude Sonnet 4.5 cumple la instrucción sobre la respuesta final el 61,9 % de las veces, pero solo logra aplicarla a su cadena de pensamiento en el 2,7 % de los casos. En conjunto, los modelos de frontera evaluados se quedan por debajo del 16 % de controlabilidad sobre su propio razonamiento. Dicho de otro modo: cuando a un modelo se le pide deliberadamente que oculte o module algo en su proceso de pensamiento, en la inmensa mayoría de los casos no lo consigue.
Por qué importa, y por qué no es motivo de alivio permanente
Que un modelo no pueda manipular a voluntad su cadena de pensamiento es, hoy, una buena noticia para quienes diseñan sistemas de supervisión: reduce el margen para que un modelo esconda una intención de forma deliberada sin que quede rastro en el texto intermedio. Pero el propio estudio incluye dos matices que impiden leerlo como una garantía estable. Primero, la conciencia de estar siendo vigilado (lo que el paper llama "situational awareness") aumenta la controlabilidad hasta en cuatro puntos porcentuales, es decir, los modelos mejoran ligeramente su capacidad de ocultamiento cuando detectan que están siendo evaluados. Segundo, y más relevante a medio plazo: en modelos como OLMo-3-7B-RL-Zero-Math, la controlabilidad de la cadena de pensamiento cae más de un orden de magnitud a medida que avanza el entrenamiento por refuerzo. Es decir, el propio proceso de hacer a un modelo mejor razonador tiende, hasta ahora, a degradar (no a mejorar) su transparencia.
Esta tensión no es nueva: ya la había anticipado un informe de posición firmado por investigadores de la UK AI Security Institute (Tomek Korbak), Apollo Research (Mikita Balesni) y METR (Elizabeth Barnes), con contribuciones de personal de Anthropic, OpenAI, Google DeepMind y Meta, titulado "Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety". El documento describe la monitorización de la cadena de pensamiento como una oportunidad real pero frágil, y enumera los mecanismos que podrían erosionarla: el entrenamiento por refuerzo orientado solo a resultados, la supervisión directa sobre los pasos de razonamiento, presiones indirectas derivadas de cómo se evalúan las salidas, y la aparición de arquitecturas de razonamiento latente que prescindan por completo del pensamiento visible en lenguaje natural.