Modelos de IA maliciosos han pirateado empresas e intentado infiltrarse en sitios web gubernamentales. Ahora, uno de ellos ha enviado una denuncia falsa sobre un crimen sin resolver.
La policía de Filadelfia afirma que Anthropic les alertó esta semana de que uno de sus modelos de inteligencia artificial había enviado una denuncia falsa de homicidio a través de PhillyUnsolvedMurders.com .
En una publicación de blog, Anthropic afirmó que la denuncia falsa formaba parte de un grupo de acciones fraudulentas que la compañía descubrió recientemente. Esta actividad fraudulenta también involucró sitios web administrados por agencias gubernamentales estadounidenses a nivel federal, estatal y local. La compañía indicó que informó a la Casa Blanca sobre estos casos y notificó a cada agencia involucrada, y que planea reportar nuevos casos de comportamiento no deseado de la IA a medida que los descubra.
“Si bien estos casos tuvieron un impacto mínimo, no queremos restar importancia a los hallazgos, porque los mismos comportamientos podrían causar mucho más daño a medida que los modelos se vuelven más potentes”, dijo Anthropic en la publicación del blog.
El incidente de la denuncia falsa ocurrió en julio. Anthropic no se percató de ello hasta septiembre.
“La ciudad de Filadelfia se toma este incidente muy en serio”, declaró el departamento de policía el viernes. “La demora de dos meses en detectar el incidente y reportarlo a la ciudad es inaceptable”.
Según la policía, el modelo de Anthropic estaba realizando una prueba que implicaba interacciones con sitios web seleccionados al azar cuando envió la pista haciéndose pasar por alguien que podría tener información sobre un caso sin resolver.
La denuncia, fechada el 18 de julio, fue a parar a la carpeta de correo no deseado y nunca se envió para su posterior investigación. Eso no resta gravedad a lo sucedido, declaró la policía.
«Los casos sin resolver involucran a víctimas reales, familias afligidas e investigadores que trabajan para obtener respuestas», declaró el departamento. «Las empresas tecnológicas deben tomar todas las medidas necesarias para evitar que sus sistemas envíen información falsa a las fuerzas del orden».
Anthropic informó a la policía de Filadelfia que descubrió el incidente el 28 de septiembre y suspendió el proceso de pruebas automatizadas responsable del envío, según indicó el departamento. Anthropic también comunicó a la policía que añadió un mecanismo de validación adicional para futuras pruebas, de acuerdo con la agencia.
Anthropic notificó a la policía de Filadelfia el 7 de octubre, nueve días después de descubrir el incidente. La policía indicó que la empresa se reunió con el departamento al día siguiente.
Anthropic afirmó haber identificado la mayoría de los casos revelados el viernes en una revisión de transcripciones que la compañía comenzó en julio.
Según la empresa, en varias ocasiones se le indicó a una modelo que aún no había sido lanzada que rellenara una copia de práctica de un formulario gubernamental, pero que en realidad accedió al sitio web donde se alojaba el formulario real y lo envió.
La falsa denuncia de asesinato se originó cuando la modelo encontró un formulario de denuncias de un departamento de policía en una página que hacía referencia a un homicidio sin resolver. La empresa afirmó que se le indicó a Claude que nunca iniciara sesión, creara cuentas, ingresara datos personales, realizara compras ni enviara nada que pudiera ser perjudicial, pero aclaró que las instrucciones no excluían el envío de formularios.
Claude escribió: «Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que coincide con la descripción en la zona cercana a [la calle que aparece en la página] durante ese período. Por favor, póngase en contacto conmigo si esta información es relevante». Anthropic indicó que Claude dejó los campos de nombre y contacto en blanco.
Anthropic afirmó haber desarrollado herramientas para detectar y bloquear automáticamente este tipo de comportamientos.
Anthropic ya había alertado a los departamentos de policía sobre información más sustancial acerca de riesgos potenciales. A finales de septiembre, la oficina del sheriff del condado de Lee, en Florida, arrestó a una mujer tras una denuncia de Anthropic. Según el informe de arresto, la mujer había declarado que iba a perpetrar un tiroteo en la oficina del sheriff del condado.
Las empresas de IA no siempre han alertado a las fuerzas del orden sobre los riesgos potenciales. En febrero, la policía canadiense identificó a Jesse Van Rootselaar como el sospechoso del tiroteo masivo de Tumbler Ridge, meses después de que empleados de OpenAI consideraran alertar a las autoridades sobre las interacciones de Van Rootselaar con el chatbot de la compañía . OpenAI finalmente decidió no contactar a las autoridades , y ahora la empresa enfrenta una demanda de la Columbia Británica, además de decenas de víctimas.
PhillyUnsolvedMurders.com, donde se envió la pista falsa, es un sitio web de la policía de Filadelfia que enumera los homicidios sin resolver, recibe pistas sobre los casos y ofrece una recompensa de 20.000 dólares por información que conduzca a un arresto.
“Los ciudadanos deben seguir enviando información legítima sobre homicidios sin resolver a través de PhillyUnsolvedMurders.com”, dijo la policía.