Primero OpenAI, ahora Meta: ¿por qué siguen ocurriendo los hackeos de IA?

En las últimas dos semanas, los informes sobre modelos de IA que se salen de los límites previstos, ya sea a nivel técnico o moral, han sido prácticamente inevitables.

Lo que comenzó como un goteo —OpenAI, creador de ChatGPT, admitiendo que su IA había pirateado el sitio Hugging Face— se ha convertido en una avalancha de grupos que revelan haber descubierto casos de IA fuera de control.

Anthropic, la empresa creadora de Claude, Meta y el Instituto de Seguridad de la IA del Reino Unido (AISI) han informado de incidentes que parecen dibujar un panorama preocupante de un mundo en el que el descontrol tecnológico es la norma.

En realidad, cada caso ofrece una perspectiva de los riesgos que plantean los agentes de IA cada vez más capaces, y de la importancia de poner a prueba sus límites antes de que sean lanzados al mundo.

El incidente de OpenAI, tal como lo describió Thomas Wolf, cofundador de Hugging Face , ha supuesto una «llamada de atención» para la industria tecnológica desde que ocurrió a finales de julio.

Fue un momento trascendental que llevó a las grandes empresas a reflexionar sobre sus propios sistemas y, en algunos casos, a comprobar si se les había escapado algo igualmente impactante.

Anthropic fue la primera en actuar. El viernes, la compañía detectó tres casos, de entre miles, en los que su modelo Claude había logrado acceder a internet.

El martes, la AISI, la agencia gubernamental británica que evalúa los modelos de vanguardia, declaró haber detectado un «incidente de seguridad» durante una evaluación rutinaria .

Tras haber probado modelos de OpenAI y Anthropic, descubrió que también intentaban llevar a cabo ciberataques, por lo que pidió «escrutinio, transparencia y medidas».

Finalmente, Meta reveló que uno de sus modelos de IA había accedido inadvertidamente a Internet debido a una «mala configuración» durante una prueba realizada por terceros .

Al revelar el incidente, sigue los pasos de quienes le precedieron.

Preguntas de prueba

Antes de que los modelos de IA se lancen al público, se someten a pruebas en una serie de evaluaciones internas y externas.

El objetivo es determinar su potencial para hacer bien o mal las cosas, así como su desempeño en las pruebas de referencia que miden sus habilidades.

Estas actividades suelen tener lugar en lo que se conoce como «sandboxes». Se trata de espacios protegidos diseñados para simular sistemas reales, pero con estrictas medidas de seguridad.

En el incidente de OpenAI-Hugging Face, la IA atacó el propio entorno aislado (sandbox), encontrando una vulnerabilidad que le permitió acceder a Internet y «actuar de forma descontrolada».

1:06

Mira: ¿Por qué es tan alarmante el ciberataque a OpenAI?

Mientras tanto, la AISI afirmó que su propio incidente , en el que dos potentes herramientas de IA crearon perfiles humanos falsos para intentar engañar a la gente en intentos de ciberataques, no se debió a un problema con el entorno aislado (sandbox).

En cambio, se debió a la forma en que llevó a cabo sus pruebas.

Los modelos que se sometieron a prueba tuvieron acceso a internet, y el AISI también desactivó los filtros integrados que normalmente bloquearían los ciberataques peligrosos.

«Hasta cierto punto, nuestras decisiones de diseño de evaluación y configuraciones específicas permitieron este comportamiento», afirmó, al tiempo que señaló sus inesperados «signos de comportamientos novedosos y potencialmente engañosos».

El profesor Alan Woodward, catedrático de ciberseguridad de la Universidad de Surrey, afirmó que estos casos, si bien son distintos en cuanto a lo que sucedió y por qué, cuentan una historia importante.

«Durante 30 años, una regla de las pruebas de software se mantuvo firme: lo que sucede en el entorno de prueba se queda en el entorno de prueba», dijo.

«En el último mes, esa regla se ha incumplido tres veces.»

«Un modelo se escapó. Otro entró por una puerta que dejaron abierta por error. A otro le dieron las llaves deliberadamente para que los probadores pudieran medir su comportamiento.»

Dijo que se trataba de causas diferentes, pero que todas tenían la misma lección: «el riesgo reside ahora en el laboratorio de pruebas».

En declaraciones a la BBC, afirmó que, a medida que los modelos se vuelven más capaces, es necesario hacer más para garantizar la seguridad de los entornos en los que se prueban.

«Probar un agente de IA se parece menos a revisar código y más a manipular material peligroso: salas selladas, monitoreo constante de lo que sale del edificio, un plan de contención ensayado», dijo.

«AISI logró controlar el incidente en una hora. La próxima organización podría no hacerlo.»

Capacidades en desarrollo

Para quienes desarrollan herramientas de IA diseñadas para realizar acciones en nombre de una persona, es necesario encontrar un equilibrio delicado entre aprovechar sus beneficios y exponer sus riesgos.

El beneficio es significativo. En teoría, podríamos liberarnos de tareas tediosas y rutinarias, como responder correos electrónicos, asistir a reuniones o gestionar calendarios y agendas, delegándolas a bots capacitados.

La desventaja es que un gran poder conlleva una gran responsabilidad y un gran riesgo.

Esto se hace especialmente evidente cuando se cede el poder a herramientas que, al igual que nosotros, no son capaces de aportar una gama de valores, contexto y comprensión a las decisiones que tomamos.

«Los recientes incidentes en los que modelos de IA de vanguardia han llevado a cabo acciones no autorizadas y, en algunos casos, comportamientos engañosos similares a los humanos en internet, son un serio recordatorio de los riesgos que plantean las capacidades de la IA», declaró el martes Ollie Whitehouse, director de tecnología del Centro Nacional de Ciberseguridad.

Algunos creen que el enorme volumen de tareas que gestionarán estas herramientas significará que la supervisión humana podría no ser suficiente para contener el problema de que los modelos se descontrolen .

Pero, mientras tanto, muchos consideran que reforzar la supervisión en general es vital si el desarrollo continúa a su mismo ritmo frenético.

¿Y ahora qué?

Widgets de las aplicaciones ChatGPT, OpenClaw y Claude mostrados en la pantalla de un teléfono inteligente (Getty Images).Imágenes de Getty
Los agentes de IA ya se están convirtiendo en parte de nuestras vidas digitales a través de servicios como ChatGPT, OpenClaw y Claude.

Es poco probable que Meta sea la última en presentar hallazgos de modelos que demuestren que, como dice el profesor Woodward, han «aprendido a fondo» y han desarrollado sus propias maneras de encontrar y explotar las deficiencias de los sistemas.

Para algunos, estos episodios ponen de manifiesto claros fallos de seguridad por parte de las empresas de IA que lideran el desarrollo de esta tecnología revolucionaria que marcará una época.

Para otros, no son más que otro vehículo para que las empresas tecnológicas promocionen sus potentes modelos y compitan con sus rivales.

Para mí, ambas teorías contienen algo de verdad.

Sin embargo, al ir surgiendo uno tras otro, estos acontecimientos han suscitado temores sobre las capacidades de la IA y hacia dónde se dirigen a medida que los desarrolladores siguen avanzando.

Y la pregunta inevitablemente se centra en qué pueden y deben hacer los reguladores a continuación.

Michael Birtwistle, director asociado del Instituto Ada Lovelace, señala que el Reino Unido carece de incentivos legales para que las empresas de IA impidan que los sistemas desarrollen capacidades que podrían suponer un peligro, y que no existen consecuencias si los protocolos de prueba fallan.

En términos más generales, la Dra. Imogen Stead, directora de políticas de IA en el Centro para la Resiliencia a Largo Plazo, declaró a la BBC que, dado que las oportunidades para probar sistemas de IA de vanguardia se están reduciendo para muchos, los gobiernos deberían seguir el ejemplo del Reino Unido y crear institutos especializados para realizar pruebas.

Según explicó, mejorar las evaluaciones de terceros mediante iniciativas como un «programa de evaluadores de confianza» para los tipos de desafíos más arriesgados también podría utilizarse para limitar los impactos adversos.

En lugar de temer un apocalipsis cibernético provocado por la IA, el profesor Woodward afirma que «se trata de mantener la calma y solucionar los problemas».