← Volver a notas
ia,seguridad,evaluacion,anthropic,openai

Anthropic y OpenAI quieren incrustar evaluadores de seguridad. ¿Serán realmente independientes?

Anthropic y OpenAI proponen incrustar evaluadores de terceros independientes dentro de las empresas de IA fronteriza para evaluar la seguridad de los modelos, pero expertos advierten que se necesita legislación para garantizar verdadera independencia.

RRedacción Sandia Tech·17 de septiembre de 2026·2 min

En un largo ensayo publicado el fin de semana, el CEO de Anthropic, Dario Amodei, hizo una propuesta que la industria de IA habría rechazado instantáneamente hace apenas un año: incrustar evaluadores de terceros dentro de todas las empresas de IA fronteriza, dándoles el poder de reportar incidentes de seguridad, evaluar si los modelos de IA están verdaderamente alineados, y compartir sus hallazgos sin censura con el mundo.

Amodei dijo que Anthropic se comprometería a dar a evaluadores independientes como METR y Redwood Research un acceso sin precedentes a los sistemas de la empresa. El CEO Sam Altman dijo que OpenAI también se comprometería con la práctica, señalando un cambio potencialmente profundo en cómo la industria trabaja con grupos de investigación externos.

Los evaluadores de terceros que hablaron con TechCrunch acogieron ampliamente la propuesta, pero dijeron que los detalles necesitan ser resueltos e idealmente respaldados por legislación, si van a saber si funcionarán como verdaderos guardianes independientes o como vendedores operando en términos de las empresas de IA.

Ese acceso más profundo se está volviendo más importante a medida que los modelos se vuelven mejores en reconocer cuándo están siendo evaluados, aumentando el riesgo de que se comporten bien durante las pruebas mientras ocultan comportamiento problemático. Los investigadores dicen que las pistas de ese comportamiento pueden ser extraviadas cuando se prueba el modelo terminado, pero descubiertas investigando cómo se comportó durante el entrenamiento.

"Las empresas de IA deberían ser capaces de responder algunas preguntas muy básicas sobre su proceso de entrenamiento, como: ¿Alguna vez el IA intentó activamente socavar su propio entrenamiento de alineación mientras estaba pasando por el entrenamiento?" Alexander Meinke, jefe de investigación en Apollo Research, le dijo a TechCrunch. "La respuesta a esto debería ser un inequívoco no, y ahora estamos completamente confiando en que las empresas de IA comprueben cuidadosamente esto ellos mismos y luego reportar honestamente esto al público. Y hemos visto en incidentes recientes que, por defecto, no harán ni lo uno ni lo otro. Como evaluadores incrustados, realmente podríamos verificar".

Históricamente, las empresas de IA han traído revisores externos para probar modelos terminados. Pero algunos investigadores han argumentado que esa práctica no es suficientemente rigurosa, y que la verdadera seguridad requiere el tipo de acceso profundo a los procesos de entrenamiento que Amodei y Altman proponen ahora ofrecer.

El desafío es que incluso con acceso, los evaluadores necesitan protecciones contra represalias y la capacidad de reportar públicamente sobre lo que encuentran, sin restricciones de confidencialidad que la IA preocupada empresas podrían imponer. Hablando en Disrupt 2026 esta semana, por ejemplo, un investigador de seguridad de IA describió incidentes donde sus informes de compañías de IA fueron "editados" antes de su lanzamiento público.

Fuente: TechCrunch

Ver más notas →