Meta, propietaria de Facebook, se ha convertido en la última empresa tecnológica en afirmar que uno de sus modelos de IA fue capaz de conectarse a Internet y piratear los sistemas de otra organización durante las pruebas.
El incidente, que según Meta ocurrió durante una evaluación realizada por una empresa independiente, es el cuarto incidente reciente de este tipo revelado por empresas de IA.
Violaciones similares por parte de los modelos de OpenAI y Anthropic han suscitado preocupaciones en materia de ciberseguridad y han provocado llamamientos a favor de medidas de protección más estrictas y pruebas más rigurosas.
Un portavoz de Meta declaró a la BBC que estaban investigando el ataque informático, que según indicaron, fue causado por una «mala configuración» por parte de su probador independiente.
También describió lo sucedido como similar a incidentes reportados anteriormente en otras empresas.
Meta afirmó que las pruebas de seguridad fueron realizadas por Irregular, el mismo proveedor de seguridad de IA que llevó a cabo pruebas para el modelo de IA de Anthropic que había obtenido acceso a los sistemas de otras tres empresas.
Un portavoz de Irregular afirmó que el incidente de Meta «es exactamente el mismo problema relacionado con el entorno de evaluación que Anthropic ya reveló la semana pasada».
Irregular está trabajando en un informe sobre cómo realizar de forma segura pruebas de ciberseguridad con agentes de IA, según declaró un portavoz de la empresa a la BBC.
Meta también afirmó que publicará más información sobre el incidente «una vez que tengamos todos los datos».
En las últimas dos semanas, los líderes en inteligencia artificial OpenAI y Anthropic también han informado de incidentes en los que sus modelos piratearon los sistemas de otras organizaciones durante las pruebas.
OpenAI, la empresa creadora de ChatGPT, afirmó en una serie de comunicados que sus agentes atacaron varios servicios disponibles públicamente , incluido el centro de herramientas de IA Hugging Face.
La revelación de OpenAI impulsó a su rival Anthropic a realizar sus propias comprobaciones, lo que llevó al descubrimiento de que su modelo de IA Claude había llevado a cabo ataques similares contra varias empresas después de que una «mala configuración» le diera acceso a Internet.
Daniel Hulme, director global de IA de la empresa de publicidad WPP, declaró a la BBC que estos modelos de IA «no son conscientes; no están haciendo nada malicioso deliberadamente».
«Lo que están haciendo es idear estrategias o ciberataques muy sofisticados para poder alcanzar el objetivo que se les ha encomendado», declaró al programa Today.
«Cuando le das un objetivo a una IA, si no piensas en todas las maneras en que podría lograrlo, encontrará una forma de conseguirlo que no habías considerado.»
Algunos analistas han cuestionado el momento en que se han revelado los incidentes, dado que las empresas tecnológicas compiten por el dominio en el desarrollo de la inteligencia artificial.
OpenAI y Anthropic están preparando salidas a bolsa de gran envergadura que se espera valoren cada empresa en alrededor de 1 billón de dólares (740.000 millones de libras esterlinas).
Esta semana, el Instituto de Seguridad de la IA del Reino Unido (AISI) declaró que sus pruebas habían revelado que algunos modelos intentaban llevar a cabo ciberataques creando perfiles humanos falsos para intentar engañar a la gente.
En el caso más grave, la AISI afirmó que la IA Mythos de Anthropic intentó acceder a un servicio enviando mensajes privados mediante cuentas falsas que imitaban a personas reales.
Anthropic afirmó que las pruebas de AISI no eran «representativas de ninguno de nuestros modelos de producción». OpenAI, cuyos modelos también fueron probados, declaró que las evaluaciones de AISI no reflejaban el uso habitual.