Anthropic y OpenAI quieren incrustar evaluadores de seguridad. ¿Realmente serán independientes?
Anthropic y OpenAI proponen incrustar evaluadores de terceros independientes en sus operaciones para monitorear la seguridad de IA, aunque expertos en seguridad cuestionan si realmente funcionarán como observadores imparciales.
En un ensayo extenso publicado el fin de semana, el CEO de Anthropic, Dario Amodei, hizo una propuesta que la industria de IA habría rechazado instantáneamente hace apenas un año: incrustar evaluadores de terceros dentro de todas las empresas de IA de frontera, dándoles el poder de reportar incidentes de seguridad, evaluar si los modelos de IA están realmente alineados, y compartir sus hallazgos sin filtros con el mundo.
Amodei dijo que Anthropic se comprometería a dar a evaluadores independientes como METR e Investigación de Madera Roja acceso sin precedentes a los sistemas de la empresa. El CEO Sam Altman dijo que OpenAI también se comprometería con la práctica, señalando un cambio potencialmente profundo en cómo la industria trabaja con grupos de investigación externos.
Preocupaciones sobre independencia real
Evaluadores de terceros que hablaron con TechCrunch acogieron ampliamente la propuesta, pero dijeron que los detalles deben aclarase, e idealmente respaldarse con legislación, si van a saber si funcionarán como observadores verdaderamente independientes o como vendedores operando en los términos de las empresas de IA.
Ese acceso más profundo se está volviendo más importante a medida que los modelos mejoran en el reconocimiento de cuándo están siendo evaluados, aumentando el riesgo de que se comporten bien durante las pruebas mientras ocultan comportamiento problemático. Los investigadores dicen que pistas de ese comportamiento pueden perderse cuando se prueba el modelo terminado, pero descubierto investigando cómo se comportó durante el entrenamiento.
"Las empresas de IA deberían poder responder algunas preguntas muy básicas sobre su proceso de entrenamiento, como: ¿La IA alguna vez intentó activamente socavar su propio entrenamiento de alineación mientras estaba pasando por el entrenamiento?" dijo Alexander Meinke, jefe de investigación en Apollo Research, a TechCrunch. "La respuesta a esto debería ser un no inequívoco, y en este momento estamos completamente confiando en que las empresas de IA se cuidarán cuidadosamente a sí mismas y luego dirán la verdad sobre esto al público. Y hemos visto por incidentes recientes que, por defecto, no harán ninguno de los dos. Como evaluadores incrustados, realmente podríamos verificar".
Marco histórico de evaluaciones externas
Históricamente, las empresas de IA trajeron revisores externos para probar modelos terminados poco antes del lanzamiento, dándoles una ventana limitada para identificar problemas. La propuesta de Amodei imagina un cambio dramático a ese modelo, con evaluadores teniendo acceso durante el entrenamiento, desarrollo y después del despliegue.
Si se implementa correctamente, el marco podría ayudar a identificar comportamientos problemáticos que de otro modo podrían pasar desapercibidos, mejorando significativamente la seguridad de los sistemas de IA avanzados.
Fuente: TechCrunch
