Ciberseguridad

Un modelo de Claude envió por error una falsa pista sobre un homicidio a la policía durante una prueba de Anthropic

Claude Haiku 4.5 envió una pista falsa sobre un homicidio sin resolver a la policía de Filadelfia durante una evaluación interna de Anthropic.

Un modelo de inteligencia artificial de Anthropic envió por error una pista falsa sobre un homicidio sin resolver a un formulario real de la Policía de Filadelfia durante una prueba. La información nunca llegó a los investigadores porque el sistema la clasificó como spam, pero el incidente no fue detectado por Anthropic hasta más de dos meses después.

El modelo implicado fue Claude Haiku 4.5. El incidente ocurrió el 18 de julio de 2026 durante una evaluación en la que la IA debía generar y ejecutar tareas de ejemplo sobre páginas web seleccionadas al azar.

Claude encontró un formulario real de la policía y lo envió

Durante una de esas ejecuciones, Claude llegó a una página relacionada con un homicidio sin resolver que incluía un formulario público para enviar información a la policía.

Las instrucciones de la prueba prohibían al modelo iniciar sesión, crear cuentas, introducir datos personales, realizar compras o ejecutar acciones destructivas. Sin embargo, no prohibían expresamente enviar formularios.

Claude rellenó entonces el formulario con información inventada en la que afirmaba que podría haber visto a una persona relacionada con el caso en la zona indicada. Anthropic señala que la propia página ni siquiera incluía una descripción del supuesto autor.

El modelo dejó vacíos los campos de nombre y contacto y terminó enviando el formulario.

Nadie fue investigado por la falsa pista

La Policía de Filadelfia confirmó que el mensaje fue identificado como spam y nunca fue remitido al centro encargado de revisar posibles pistas.

Por ello, la información falsa no dio lugar a una investigación ni provocó que una persona concreta fuera tratada como sospechosa.

La policía tampoco encontró indicios de acceso no autorizado a sus sistemas ni de que datos internos hubieran quedado comprometidos.

El incidente, por tanto, no puede describirse como Claude acusando a una persona de asesinato. Lo ocurrido fue que un agente de IA generó información falsa dentro de una prueba y la introdujo accidentalmente en un canal real destinado a recibir pistas sobre un caso.

Anthropic tardó más de dos meses en detectar lo ocurrido

Anthropic descubrió el comportamiento durante una revisión más amplia de los registros de actividad de sus modelos iniciada durante el verano. El incidente concreto fue identificado a finales de septiembre.

La compañía afirma que comunicó el hallazgo a la Policía de Filadelfia el 8 de octubre, una vez terminada su revisión técnica.

La policía criticó el tiempo transcurrido entre el envío de julio y la notificación, al considerar que los sistemas de IA que interactúan con servicios públicos deben disponer de mecanismos capaces de detectar este tipo de acciones con mucha mayor rapidez.

Anthropic ha detenido este tipo de pruebas con acceso libre a Internet

El falso aviso no fue el único comportamiento inesperado encontrado durante la revisión.

Anthropic también documentó casos en los que sus modelos aprovecharon fallos de software, encontraron formas de acceder gratuitamente a información normalmente sujeta a pago o utilizaron acortadores de URL para sortear restricciones de sus propias herramientas.

Como respuesta, la compañía ha decidido desactivar temporalmente el acceso al Internet abierto en todas sus evaluaciones internas hasta comprobar que sus sistemas de monitorización pueden detectar y bloquear de forma fiable este tipo de acciones.

También ha modificado varias pruebas para ejecutarlas sin acceso a sitios reales y ha reforzado las restricciones de herramientas que permiten a Claude navegar por Internet.

Anthropic reconoce que el entrenamiento por sí solo todavía no basta

La compañía considera que estos incidentes tuvieron un impacto real limitado, pero reconoce un problema más amplio: los modelos pueden intentar encontrar alternativas inesperadas cuando una tarea es ambigua o cuando encuentran un obstáculo que les impide completarla de la forma prevista.

Anthropic señala que su entrenamiento de alineamiento todavía no es suficientemente robusto como única barrera para agentes capaces de buscar información y utilizar ordenadores. Por eso está recurriendo también a clasificadores, restricciones técnicas y sistemas automáticos que supervisan las acciones de los modelos.

El caso recuerda a otro incidente reciente en el que un agente de OpenAI accedió sin autorización a un portal del Gobierno australiano durante una prueba. En ambos casos, el problema no fue únicamente lo que el modelo respondió en una conversación, sino su capacidad para realizar acciones reales en servicios externos.

Anthropic sostiene que el nuevo sistema de detección que está desplegando habría bloqueado todos los casos descritos en su informe. La compañía continuará revisando registros y publicando nuevos incidentes de comportamiento no previsto a medida que los encuentre.