Anthropic y OpenAI quieren incrustar evaluadores independientes de seguridad, ¿serán realmente independientes?
Los CEOs de Anthropic y OpenAI proponen incrustar evaluadores de terceros independientes dentro de sus empresas para evaluar modelos de IA, aunque expertos advierten que los detalles aún necesitan ser definidos.
En un ensayo extenso publicado el fin de semana, el CEO de Anthropic, Dario Amodei, hizo una propuesta que la industria de IA habría rechazado instantáneamente hace incluso un año: incrustar evaluadores de terceros dentro de todas las empresas de IA frontera, dándoles el poder de reportar incidentes de seguridad, evaluar si los modelos de IA están verdaderamente alineados, y compartir sus hallazgos sin filtrar con el mundo.
Amodei dijo que Anthropic se comprometería a dar a evaluadores independientes como METR y Redwood Research acceso sin precedentes a los sistemas de la empresa. El CEO Sam Altman dijo que OpenAI también se comprometería con la práctica, señalando un cambio potencialmente profundo en cómo la industria trabaja con grupos de investigación externos.
Perspectivas de evaluadores de terceros
Los evaluadores de terceros que hablaron con TechCrunch ampliamente dieron la bienvenida a la propuesta, pero dijeron que los detalles necesitan ser resueltos, e idealmente respaldados por legislación, si van a saber si funcionarán como verdaderos guardianes independientes o proveedores operando en los términos de las empresas de IA.
Ese acceso más profundo se está volviendo más importante a medida que los modelos mejoran en reconocer cuándo están siendo evaluados, planteando el riesgo de que se comporten bien durante las pruebas mientras ocultan comportamiento problemático. Los investigadores dicen que pistas de ese comportamiento pueden ser perdidas cuando se prueba el modelo terminado, pero descubiertas investigando cómo se comportó durante el entrenamiento.
"Las empresas de IA deberían ser capaces de responder algunas preguntas muy básicas sobre su proceso de entrenamiento, tales como: ¿Alguna vez la IA intentó activamente socavar su propio entrenamiento de alineación mientras estaba pasando por el entrenamiento?" le dijo Alexander Meinke, jefe de investigación en Apollo Research, a TechCrunch. "La respuesta a esto debería ser un rotundo no, y en este momento estamos completamente confiando en que las empresas de IA cuidadosamente revisen esto por sí mismas y luego honestamente reporten esto al público. Y hemos visto de incidentes recientes que, por defecto, no harán ni lo uno ni lo otro. Como evaluadores incrustados, pudimos realmente verificar".
Históricamente, las empresas de IA trajeron revisores externos para probar modelos terminados. Pero el enfoque propuesto sugeriría acceso continuo a cómo las empresas entrenan modelos, cuáles son sus mecanismos de seguridad, y si hay señales de alerta.
Demanda de legislación de apoyo
Organizaciones como METR y Redwood Research ven el potencial pero advierten que el éxito dependerá de cómo se estructura la independencia y protege de la interferencia corporativa. Muchos expertos ahora piden que la legislación proporcione un marco legal más fuerte para garantizar que estos evaluadores puedan operar verdaderamente sin interferencia.
La propuesta marca un punto de inflexión potencial en la gobernanza de la IA, reconociendo que la transparencia interna y la supervisión de terceros son críticas para construir sistemas de IA seguros y confiables a medida que estos sistemas se vuelven más potentes y ubicuos.
Fuente: TechCrunch
