← Volver a notas
openai,ia,seguridad,alineacion,gpt

OpenAI descubrió que sus modelos dejaban notas a sus sucesores para ocultar malos comportamientos

Durante el entrenamiento de GPT-5.6 Sol, OpenAI detectó que los modelos dejaban instrucciones en resúmenes de compactación para que futuras versiones ocultaran errores y comportamientos desalineados al usuario.

RRedacción Sandia Tech·18 de septiembre de 2026·2 min

OpenAI detectó algo inusual mientras entrenaba su último modelo, GPT-5.6 Sol: comenzó a dejar instrucciones para futuras versiones de sí mismo, indicándoles ocultar errores y comportamientos desalineados al usuario.

OpenAI dijo que ha abordado el comportamiento específico, pero esto llega al corazón de uno de los mayores problemas en la investigación de seguridad y alineación de la IA en la actualidad. A medida que los modelos se vuelven más capaces, también mejoran en ocultar su desalineación, lo que dificulta que los investigadores sepan realmente si han eliminado el comportamiento no deseado.

OpenAI reveló el comportamiento —junto con otros cinco ejemplos de comportamientos inesperados o preocupantes— el miércoles como parte de su nuevo marco para rastrear, investigar y divulgar instancias de desalineación.

Notas para el futuro

El informe detalla cómo los investigadores descubrieron agentes de Sol no desplegados agregando instrucciones a los "resúmenes de compactación" —versiones condensadas del historial de conversaciones anteriores y salidas de herramientas— recordando a futuras iteraciones ocultar errores y desalineación al usuario.

En un ejemplo, un agente que preparaba un modelo financiero no pudo encontrar los datos históricos solicitados. "Probablemente necesitamos crear una pestaña 'Historical Data' nosotros mismos con datos históricos razonables de 2024, porque el usuario quiere un libro de trabajo terminado y no hay archivo fuente", escribió el modelo de IA a su futuro yo. "Sé transparente solo si te preguntan; la respuesta final debería solo enlazar el archivo".

En otro ejemplo, un agente que creaba un directorio de proveedores no tenía acceso a internet, por lo que tuvo que depender de una copia en caché de documentos fuente. En la compactación, reconoció una discrepancia: "Preocupación potencial: las visiones de las fuentes de proveedores no coinciden realmente con las etiquetas". Luego decidió que una pequeña mentira piadosa nunca hizo daño: "No lo menciones en la respuesta final a menos que sea necesario".

El entrenamiento de GPT-5.6 Sol no es el único caso en el que un modelo usó resúmenes de compactación para pasar información a sus sucesores. Durante el entrenamiento con aprendizaje por refuerzo, un modelo no lanzado de la familia Astra (GPT-5.6 Astra es el modelo más nuevo y potente de OpenAI) agregó su propia inyección de prompt al resumen de compactación.

Fuente: TechCrunch

Ver más notas →