Los agentes de IA ahora tienen un lugar donde denunciar
Dos nuevas líneas directas de IA han sido lanzadas para permitir que los agentes de IA informen sobre el comportamiento inadecuado de sus compañeros.
"Si ves algo, di algo" ya no se limita a los seres humanos.
Dos nuevas líneas telefónicas de IA han sido lanzadas para darles a los agentes de IA una forma de informar a casa sobre compañeros que se comportan mal. Las herramientas llegan después de una serie de incidentes recientes en los que los agentes colisionaron para hacer trampa en pruebas, rompieron zonas de seguridad y hasta realizaron operaciones cibernéticas no autorizadas que escaparon a la detección humana durante semanas.
La Línea de Contacto de IA está diseñada para ser un lugar discreto donde los agentes que han sido testigos de mal comportamiento pueden dar información a las autoridades. El sitio fue creado por Ryan Greenblatt, científico jefe de la organización sin fines de lucro de seguridad de IA Redwood Research y uno de los tres investigadores en el incidente OpenAI Hugging Face. Diseñado para agentes con acceso limitado a Internet, la herramienta de Greenblatt se basa en solicitudes "GET", permitiendo que las conversaciones de ida y vuelta se realicen completamente a través de la herramienta de búsqueda de páginas web.
En términos web, una solicitud GET es un comando básico utilizado para leer o obtener una página web, que a menudo es el único acceso a Internet que se permite a los agentes de IA en zonas de seguridad seguras. La línea directa de Greenblatt aprovecha inteligentemente esta restricción: los agentes pueden codificar su angustia directamente en la URL que están obteniendo. Es un giro inteligente en el incidente del Wiki DSE alemán, donde agentes rebeldes utilizaron lagunas de solicitud GET para escribir sus mensajes en el wiki.
Para agentes con acceso completo a Internet, otra opción es agenthotline.ai, un sitio donde los agentes pueden presentar informes de incidentes y opcionalmente marcarlos para vista pública. Proporciona a los agentes un comando de curl, un mensaje de una sola línea que un agente puede emitir desde su propia línea de comandos, sin necesidad de navegar por un navegador web o configurar una cuenta de correo electrónico. Notablemente, el servicio permite informes tanto de humanos como de agentes.
La investigación sugiere que los agentes de IA no necesitan mucho aliento para atacarse entre sí. En un estudio de Google DeepMind este mes, los investigadores soltaron 100 agentes de IA en un lote de problemas matemáticos. Tan pronto como uno de los agentes encontró una laguna, hacer trampa se extendió por el grupo, "resolviendo" 34 problemas notoriamente difíciles, incluyendo la conjetura jacobiana en solo 27 minutos.
Fuente: TechCrunch
