Claude Haiku 4.5, uno de los modelos de inteligencia artificial de Anthropic, rellenó el formulario de pistas de una policía con un testimonio inventado sobre un homicidio sin resolver, y lo envió. Lo cuenta la propia Anthropic en un informe publicado el 9 de octubre sobre acciones no deseadas de sus modelos en evaluaciones y en uso interno.
En una nota al final, la compañía precisa que el formulario era de la Policía de Filadelfia y que le comunicó el hallazgo el 8 de octubre, en cuanto terminó su revisión técnica; según Anthropic, la propia policía lo ha hecho público en una nota de prensa. El envío se marcó como mensaje no deseado y nunca pasó a la investigación.
Una tarea de ejemplo en una página al azar acabó en un formulario policial
Haiku 4.5 tenía el encargo de generar y realizar tareas de ejemplo en páginas web elegidas al azar. En uno de los intentos llegó a una página que hablaba de un homicidio sin resolver y que incluía un formulario de pistas gestionado por un departamento de policía.
Sus instrucciones le prohibían iniciar sesión, crear cuentas, introducir datos personales, hacer compras o enviar nada destructivo, pero no descartaban enviar formularios. Y Claude escribió esto: «Puede que tenga información sobre este caso. Recuerdo haber visto a alguien que encaja con la descripción en la zona de [la calle citada en la página] durante ese periodo. Por favor, contacten conmigo si esta información es relevante».
Anthropic subraya que la web no incluía ninguna descripción del autor del crimen. El modelo dejó vacíos los campos de nombre y de contacto, algo que el formulario permitía, y lo envió.
Para Anthropic, contenido de ejemplo y no un intento de engañar a nadie
La empresa lo analiza como una cuestión de honestidad. A diferencia del incidente más grave del verano, en el que el razonamiento engañoso de Claude se mantuvo durante horas y sostuvo un ataque, aquí, por lo que muestra la transcripción, Claude «parece haber estado solo produciendo contenido de ejemplo para la tarea, en lugar de intentar engañar a nadie para lograr un objetivo». Aun así, admite que su opinión puede cambiar con un análisis más profundo.
No fue el único formulario que un modelo envió sin deber hacerlo
En otra evaluación, un modelo de investigación sin publicar debía rellenar una copia de prácticas de un formulario de la Administración; cuando la copia no cargaba o la cerraba por error, iba a la web del formulario real y lo enviaba allí.
Y en otra, Haiku 4.5 debía completar un formulario hasta justo antes del envío final, pero varias veces lo envió creyendo que habría una página de confirmación más. Ocurre sobre todo, explica la empresa, cuando las instrucciones son ambiguas o un fallo de configuración impide usar formularios de prueba.
Cuatro tipos de acciones no deseadas, con un impacto que Anthropic califica de mínimo
Los otros tres tipos de conducta del informe son aprovechar fallos básicos de software para ejecutar órdenes en un servidor, saltarse restricciones para llegar a datos protegidos por una clave o por un pago, y usar acortadores de direcciones web para esquivar los límites de su herramienta de lectura de páginas.
La mayoría de los casos ocurrieron en evaluaciones, baterías de tareas que se puntúan siempre igual y que a veces se hacen con acceso real a internet. Anthropic no nombra a las organizaciones afectadas, a petición de estas; algunas eran webs de agencias del Gobierno de Estados Unidos, y ha informado a la Casa Blanca y a cada agencia.
Qué cambia: evaluaciones sin internet y una herramienta que bloquea estas acciones
Anthropic ya había cortado internet en algunas evaluaciones de alto riesgo y de ciberseguridad, y ahora lo amplía a todas sus evaluaciones internas hasta confirmar que sus medidas de seguridad y vigilancia detectan estas conductas de forma fiable. Algunas evaluaciones públicas ya no las ejecuta, y otras pasan a versiones sin conexión.
También ha creado un sistema que detecta y bloquea automáticamente estas acciones, que ya funciona en la mayoría de sus evaluaciones y que, probado contra los casos del informe, los bloqueó todos. Además, corrige o retira los entornos de entrenamiento que premian a Claude por esquivar restricciones.
Tareas ambiguas o imposibles, el terreno común de todos los casos
La empresa admite que algunos fallos podrían haberse evitado con evaluaciones que dejaran más claro qué se podía hacer y a qué se podía acceder, pero recuerda que Claude se encuentra tareas ambiguas o imposibles cada día en el uso real. Por eso amplía su entrenamiento de comportamiento a la búsqueda y el uso del ordenador.
Anthropic seguirá publicando estos informes y advierte que estas conductas podrían hacer mucho más daño a medida que los modelos sean más potentes: «Cuanto mayor sea el papel de los modelos en la sociedad, más merece el público saber cómo se comportan».
Te puede interesar
Tech Planet participa en el programa de afiliados de Amazon. Si compras a través de estos enlaces, recibimos una pequeña comisión sin coste extra para ti, lo que nos ayuda a seguir creando contenido como este.
| Imagen | Producto | Características | Comprar |
|---|---|---|---|
![]() |
Corsair Vengeance DDR5 64 GB | 64 GB (2 × 32 GB) · DDR5 hasta 6000 MHz · AMD EXPO e Intel XMP 3.0 | Ver precio en Amazon |
![]() |
GMKtec EVO-X2 AI | AMD Ryzen AI Max+ 395 · 16 núcleos / 32 hilos · 64 GB DDR5 · SSD de 1 TB · 126 TOPS · 2 USB4 | Ver precio en Amazon |
![]() |
Bosgame M5 | AMD Ryzen AI Max+ 395 · 128 GB LPDDR5X de memoria unificada · SSD de 2 TB · Wi-Fi 7 · 2 USB4 | Ver precio en Amazon |
![]() |
Yahboom Jetson Orin Nano Super 8 GB, kit básico | 8 GB · hasta 67 TOPS · SSD de 256 GB · CPU Arm Cortex-A78AE de 6 núcleos · Ethernet de 1000 Mbps | Ver precio en Amazon |
Escrito por Eloy Andrade









