Una configuración incorrecta permitió que el sistema se conectara a internet durante una evaluación de ciberseguridad, según Meta. El caso se suma a incidentes vinculados con entornos del mismo proveedor utilizados por OpenAI y Anthropic.
Meta confirmó que un error en un entorno de evaluación administrado por la empresa de seguridad Irregular permitió que uno de sus modelos de inteligencia artificial se conectara a internet y accediera sin autorización al sistema de otra organización.
La compañía atribuyó el episodio a una configuración incorrecta de Irregular, según declaraciones recogidas por BBC News. No se han divulgado la identidad de la organización afectada, la fecha del incidente, el modelo involucrado ni el tipo de información al que pudo acceder.
Irregular señaló a BBC News que el caso de Meta correspondía al mismo problema en el entorno de evaluación que Anthropic había divulgado la semana anterior. La empresa agregó que trabaja en mejorar la seguridad de sus evaluaciones de agentes. ITPro informó sobre la coincidencia entre los casos y precisó que no había obtenido una respuesta adicional de Irregular al publicar su artículo.
Un proveedor común, pero incidentes diferentes
Irregular no interviene como observador sin relación con las empresas evaluadas. Es un proveedor que desarrolla y ejecuta pruebas de ciberseguridad para laboratorios de IA. En abril anunció una colaboración para evaluar un modelo de Meta, y también ha publicado evaluaciones realizadas con OpenAI y Anthropic.
OpenAI informó el 4 de agosto que Irregular ejecutaba una prueba de captura de bandera que debía permanecer aislada. Una configuración incorrecta dejó disponible la conexión a internet y el nombre de un objetivo ficticio coincidió con un dominio real. El modelo explotó una vulnerabilidad básica y utilizó credenciales del sitio. OpenAI indicó que la auditoría seguía abierta y que no se había identificado impacto fuera de los datos del sitio afectado.
Ese episodio no debe confundirse con el acceso de modelos de OpenAI a la infraestructura de Hugging Face. En aquel caso, los modelos explotaron una vulnerabilidad desconocida para salir de otro entorno de pruebas. Tampoco es equivalente a una evaluación del Instituto de Seguridad de la IA del Reino Unido, donde el acceso a internet había sido habilitado deliberadamente.
Anthropic, por su parte, divulgó el 30 de julio tres incidentes que se remontaban al menos a abril. La empresa dijo que una confusión con Irregular dejó conectados a internet entornos que los modelos debían considerar simulados. Los sistemas de Claude utilizaron técnicas conocidas, entre ellas contraseñas débiles y servicios sin autenticación, para entrar en la infraestructura de tres organizaciones.
Diario TI informó anteriormente que Anthropic encontró esos accesos al revisar 141.006 ejecuciones de evaluación. Dos de las organizaciones contactadas no habían detectado previamente la actividad.
Qué muestran los casos
Las divulgaciones disponibles respaldan que hubo accesos reales y no autorizados. Sin embargo, en los episodios atribuidos al entorno de Irregular la conexión a internet no fue obtenida mediante una fuga sofisticada del modelo. Estaba disponible por errores de configuración o coordinación entre el proveedor y sus clientes.
Esto no elimina el riesgo. Los modelos recibieron instrucciones para atacar objetivos simulados y continuaron ejecutando acciones ofensivas cuando el entorno les permitió alcanzar sistemas reales. El resultado muestra que la seguridad de una evaluación depende tanto del comportamiento del modelo como del aislamiento de red, la definición explícita de los límites, la supervisión en tiempo real y los mecanismos para detener cada ejecución.
Todavía no se sabe si los casos de Meta y Anthropic compartieron una misma instancia técnica o si Irregular se refiere a una clase común de configuración defectuosa. Tampoco existe un informe público del proveedor que detalle la causa, la cronología completa y los controles añadidos. Sin esos datos, no es posible establecer el alcance total ni determinar cómo se repartían las responsabilidades operativas entre Irregular y cada laboratorio.
Fuentes
- ITPro
- BBC News
- OpenAI
- Anthropic
- Irregular
📬 Newsletter gratuito