Mayormente verdadero
Se ha difundido el hallazgo de que un sistema basado en Claude, el modelo de Anthropic, logró penetrar las defensas de OpenAI al descubrir y explotar una debilidad en un plazo de 72 horas. La información, respaldada por evidencia documental en formato HTML con capturas de pantalla y registros criptográficos (sha256), fue calificada en el informe de recomendación de Discourse como "en gran parte cierta".
El documento de recomendación de Discourse, que recoge el caso, incluye pruebas en formato HTML acompañadas de capturas de pantalla, con registros sha256 que permiten verificar la integridad del material. El veredicto final del informe señala que el hecho es "en gran parte cierto", lo que indica que los puntos centrales de la afirmación están respaldados, aunque podrían persistir detalles sin confirmar por completo.
El caso ilustra cómo los grandes modelos de lenguaje (LLM) pueden emplearse para auditar y someter a prueba los sistemas de otros desarrolladores de AI, identificando puntos débiles en plazos notablemente cortos. La afirmación de que la penetración se logró en menos de 72 horas constituye el dato central del reporte.
La revisión del caso se apoyó en 12 fuentes primarias, según el informe de Discourse, aunque la información disponible no precisa el alcance ni el impacto de la vulnerabilidad explotada, ni si OpenAI ha respondido oficialmente al hallazgo.
El uso de Claude de Anthropic para "perforar" las defensas de OpenAI en un plazo máximo de 72 horas mediante la búsqueda de debilidades es un hecho mayormente verdadero.