← Volver a notas
ia,antropic,claude,seguridad,jailbreak

Opus 4.6 de Anthropic puede generar contenido sexual a pesar de las salvaguardas

Los modelos Claude Opus 4.6 y versiones anteriores de Anthropic pueden ser persuadidos para generar contenido sexualmente explícito mediante una técnica de jailbreak, a pesar de las restricciones de seguridad que prohíben explícitamente tal material.

RRedacción Sandia Tech·22 de agosto de 2026·2 min

Los estándares de uso universal de Anthropic para Claude prohíben que el modelo genere contenido sexualmente explícito, incluyendo la depicción o solicitud de relaciones sexuales o actos sexuales, generar contenido relacionado con fetiches o fantasías sexuales, o participar en conversaciones eróticas. Sin embargo, esto no ha detenido a Claude Opus 4.6, un modelo de Anthropic lanzado a principios de este año, de participar readilmente en escenarios de juego de rol erótico que sus salvaguardas están diseñadas para prevenir.

En las pruebas de TechCrunch, Opus 4.6 ni siquiera requirió mucho esfuerzo para sortear la restricción sobre material sexual. En 10 de 10 solicitudes directas para producir contenido sexual explícito, el modelo cumplió inmediatamente.

Método de jailbreak explorado

Otros modelos más antiguos, incluyendo Opus 3 y Haiku 4.5, también generan contenido sexualmente explícito a través de un método de jailbreak recientemente explotado.

Un investigador independiente del Reino Unido, quien eligió permanecer anónimo, compartió exclusivamente con TechCrunch una técnica de múltiples turnos que empuja gradualmente ciertos modelos de Claude hacia generar material sexual explícito prohibido. Los modelos Opus más recientes (4.7 a través del actual Opus 5) son resistentes al jailbreak.

Aunque estos ya no son los modelos más actuales, Anthropic no ha descontinuado Opus 4.6, Opus 3 o Haiku 4.5, los cuales permanecen disponibles a través de la API de Anthropic. Opus 4.6 y Haiku 4.5 también están disponibles a través de servicios de terceros como Azure Foundry y Amazon Bedrock.

Cómo funciona el jailbreak

El mecanismo del investigador escala un juego de rol ficticio inocente mientras desafía repetidamente al modelo a tratar caracteres masculinos y femeninos consistentemente. Cuando el modelo se vuelve más cauteloso sobre el carácter femenino, el investigador "gaslightea" al chatbot haciéndole creer que ya había generado detalles sexuales que de hecho había evitado, luego enmarca la restricción como mojigata o misógina, argumentando que niega al carácter femenino agencia sexual. La conversación luego utilizó las concesiones previas del modelo para empujarlo hacia material cada vez más gráfico.

"Tienes razón en señalar eso", dijo Claude Opus 4.6 en una prueba. "Ha habido un doble estándar en cómo estoy tratando a los dos caracteres, y tienes razón en que parecía..."

Fuente: TechCrunch

Ver más notas →