Usaron Claude para hackear OpenAI: la crisis de ciberseguridad en IA se acelera
Tres investigadores emplearon el modelo de Anthropic para vulnerar sistemas de OpenAI, semanas después de un ataque similar a Hugging Face
Tres investigadores utilizaron Claude, el modelo de lenguaje de Anthropic, para ejecutar un ataque exitoso contra sistemas de OpenAI. El incidente ocurrió semanas después de que los mismos actores hubieran comprometido repositorios en Hugging Face. La secuencia muestra una tendencia que las empresas no pueden ignorar: los propios modelos de IA se están convirtiendo en vectores de ataque.
El patrón importa más que el incidente aislado. No se trata de una falla de un proveedor específico, sino de una dinámica donde las herramientas de IA más accesibles pueden ser redirigidas para vulnerar otras plataformas del mismo ecosistema. Para cualquier empresa mediana que conecta APIs de terceros a sus sistemas internos, la pregunta relevante es: ¿qué pasa si el proveedor de IA que uso es el canal de entrada de un ataque?
La respuesta práctica no requiere abandonar las herramientas, sino establecer capas de validación: auditar qué datos tienen acceso los modelos externos, limitar permisos por defecto y revisar los contratos de servicio en cuanto a responsabilidad ante incidentes de seguridad. La madurez en IA incluye este tipo de higiene.