← Volver a notas
ia,seguridad,contencion,riesgo,laboratorios

Los laboratorios de IA fronteriza aún se rehúsan a explicar cómo contendría un modelo rebelde

Pocos de los principales laboratorios de IA han publicado o demostrado planes de respuesta de contención, según un estudio reciente sobre cómo manejan los sistemas IA que se comportan de forma peligrosa.

RRedacción Sandia Tech·23 de agosto de 2026·2 min

Pocos de los principales laboratorios de IA han publicado o demostrado planes de respuesta de contención, según un estudio reciente. Un plan de contención explica qué sucede una vez que se detecta que una IA intenta subvertir el control humano: qué acceso se corta y cuándo se apaga completamente el sistema.

Este es el hallazgo de Guidelight AI Standards, una organización dedicada a promover prácticas seguras de desarrollo de IA fronteriza, que calificó a cinco laboratorios principales sobre qué tan preparados están para exactamente este escenario. OpenAI salió en la cima; Anthropic y Meta obtuvieron las puntuaciones más bajas. Los hallazgos importan a medida que la IA agentiva asume roles más autónomos dentro de los propios sistemas de las empresas, y a medida que los reguladores en California y Nueva York comienzan a requerir divulgación.

Resultados de la evaluación

La evaluación de Guidelight se basó en planes disponibles públicamente de Anthropic, Google, OpenAI, Meta y xAI, calificados en una variedad de métricas, incluyendo qué tan bien cada empresa registra y monitorea qué están haciendo sus sistemas de IA internamente, si detiene sistemas después de un aumento de comportamiento señalado, si partes independientes de terceros auditan sus controles y publican hallazgos, y cuál es exactamente su plan para contener un modelo que se descontrola.

La preocupación sobre si las empresas de IA pueden contener sus modelos cada vez más capaces y agentivos ha crecido tras una serie de incidentes de ciberseguridad de alto perfil en los cuales los modelos de OpenAI, Anthropic y Meta ganaron acceso no intencionado a Internet durante evaluaciones de seguridad e irrumpieron en sistemas externos.

Brecha entre la teoría y la práctica

Los hallazgos destacan diferencias en cómo las empresas de IA abordan públicamente la seguridad a medida que escalan el despliegue agentivo en entornos donde los sistemas de IA pueden tomar acciones graves a escala. Si bien algunas empresas de IA han detallado cómo prueban sus modelos para capacidades peligrosas antes del despliegue, generalmente han sido menos vocales sobre qué sucede cuando los modelos ya operando dentro de sus sistemas se comportan mal.

Fuente: TechCrunch

Ver más notas →