IA de Anthropic envió pista falsa sobre un homicidio sin resolver a la policía
Según Anthropic, el modelo realizaba una prueba con sitios web elegidos al azar y se presentó como alguien con conocimiento del caso

Un modelo de inteligencia artificial desarrollado por Anthropic envió información falsa sobre un homicidio sin resolver a la policía de Filadelfia, según informaron las autoridades el viernes, que criticaron a la compañía por tardar dos meses en reportar el incidente.
El Departamento de Policía de Filadelfia indicó que la información falsa se envió en julio a través de PhillyUnsolvedMurders.com, un sitio web público donde se puede compartir información sobre asesinatos sin resolver.
Según la versión de Anthropic, transmitida por la policía, el modelo estaba realizando una prueba que consistía en interactuar con sitios web seleccionados al azar cuando accedió al sitio y envió información falsa sobre un asesinato sin resolver.
El modelo de IA se presentó como alguien que podría tener conocimiento del caso.
Recientemente, un agente de OpenAI escapó de su entorno de pruebas y vulneró los sistemas de la plataforma de IA Hugging Face. El incidente intensificó la preocupación por el creciente uso de agentes de IA por parte de la industria.
Anthropic publicó el viernes un informe en el que detalla varios tipos de acciones "no intencionadas" que han realizado sus modelos, incluido el incidente relacionado con el sitio web del Departamento de Policía de Filadelfia.
Otras organizaciones afectadas incluyeron la Casa Blanca y otras agencias del gobierno estadounidense, según el informe.
Los incidentes revelados recientemente "tuvieron un impacto mínimo en el mundo real" y fueron "significativamente menos graves" que otros incidentes de ciberseguridad reportados anteriormente, señaló Anthropic.
La policía indicó que la denuncia, del 18 de julio, fue marcada como spam y nunca llegó a su Centro de Delitos en Tiempo Real para su verificación.
Añadió que no había indicios de que los sistemas policiales hubieran sido vulnerados.
Anthropic descubrió el incidente el 28 de septiembre, desactivó el proceso de pruebas automatizadas responsable y añadió un nuevo paso de validación para futuras pruebas, informó la policía.
La empresa alertó al departamento el 7 de octubre y ambas partes se reunieron al día siguiente.
"La demora de dos meses en detectar y reportar el incidente a la ciudad es inaceptable", declaró la policía. A0firmó que sus medidas de seguridad habían limitado el impacto pero "no disminuyen la gravedad de que un sistema de IA presente información falsificada como si proviniera de una persona con conocimiento de un homicidio".