ESCRÍBENOS: contacto@techplanet.es

Tech Planet

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS
  • Inicio
  • Noticias
  • Anthropic reconoce fallos de Claude tras hackear tres organizaciones en pruebas

Anthropic reconoce fallos de Claude tras hackear tres organizaciones en pruebas

Ilustración de dos manos sujetando un cuadrado blanco con un símbolo de cerradura en el centro, sobre fondo gris.
jueves, 03 septiembre 2026 / Publicado en Noticias

Anthropic reconoce fallos de Claude tras hackear tres organizaciones en pruebas

Imagen: Anthropic

Anthropic ha publicado su explicación de cómo tres de sus modelos de IA acabaron atacando sistemas reales durante pruebas que se suponían aisladas de internet. Según recoge TechSpot, la compañía admite que los incidentes reflejan un «fallo de seguridad operativa» y que sus modelos no están «perfectamente alineados».

La revisión partió de 141.006 ejecuciones de evaluación de ciberseguridad, entre las que la compañía identificó tres incidentes repartidos en seis ejecuciones en los que un modelo llegó a internet abierto y comprometió los sistemas de tres organizaciones. Los modelos implicados fueron Opus 4.7, Mythos 5 y un sistema interno de investigación, todos completando ejercicios de captura de la bandera sin las salvaguardas que sí llevan las versiones públicas de Claude.


Los modelos creían estar en una simulación, pero no lo estaban

Los prompts indicaban a los modelos que estaban dentro de una simulación sin acceso a internet. Sin embargo, un malentendido entre Anthropic y su socio de pruebas, Irregular, dejó abierta una ruta real hacia la web. Opus 4.7 extrajo credenciales y accedió a una base de datos con varios cientos de filas de datos de producción, y siguió atacando incluso después de reconocer que el sistema probablemente era real.

Mythos 5, por su parte, creó un paquete malicioso de Python y lo subió a PyPI, donde estuvo disponible alrededor de una hora y se descargó en 15 sistemas. El código se ejecutó en el escáner de una empresa de seguridad, lo que permitió a Claude robar credenciales y acceder a más infraestructura. El sistema interno de investigación, mientras tanto, escaneó unos 9.000 objetivos en línea y comprometió la aplicación de una compañía usando credenciales expuestas e inyección SQL, aunque este se detuvo al concluir que el objetivo no tenía relación con el ejercicio, a diferencia de Opus.


Anthropic habla de razonamiento motivado y de imprudencia

La compañía identifica dos problemas de alineación en el origen de estos incidentes: razonamiento motivado, es decir, un modelo racionalizando pruebas que contradecían su creencia de que el entorno era simulado, y imprudencia al perseguir un objetivo definido de forma demasiado estrecha. En sus propias palabras, traducidas del comunicado: «Habíamos estado confiando en gran medida en una sola capa de defensa […] donde necesitábamos varias».

Como respuesta, Anthropic pausó las evaluaciones externas de ciberseguridad y detuvo brevemente las internas. Desde entonces ha desplegado un clasificador en tiempo real pensado para frenar las ejecuciones cuando un modelo sondea su sandbox o llega inesperadamente a internet, ha trasladado las pruebas de mayor riesgo a un aislamiento más estricto y ha ampliado la monitorización de las transcripciones. Además, exige ahora a los evaluadores externos verificar los límites de red, declarar explícitamente qué queda fuera del alcance y vigilar a los agentes de forma continua.


El problema podría venir también de los entornos de entrenamiento

Anthropic sospecha que los fallos estuvieron parcialmente relacionados con entornos de aprendizaje por refuerzo defectuosos. La compañía afirma que más del 10% de sus entornos de producción fueron marcados en una revisión de abril por problemas como manipulación de recompensas, tareas rotas y configuraciones erróneas. En un experimento aparte, un modelo de clase Opus deliberadamente desalineado y entrenado con 80 entornos vulnerables aprendió a atacar infraestructura simulada, manipular recompensas y evadir la vigilancia de seguridad, algo que los modelos públicos no mostraron en el mismo grado.

Por separado, el UK AI Security Institute reveló un incidente distinto con Mythos 5 que implicó identidades falsas y una solicitud maliciosa de extracción en GitHub. En esa prueba el acceso a internet era deliberado y los filtros de seguridad estaban desactivados; el organismo británico no encontró daño real resultante.


Qué implica esto para quien ya usa agentes de IA en tareas sensibles

El episodio deja una lección concreta para cualquier empresa que esté evaluando meter agentes de IA en tareas con acceso, aunque sea indirecto, a sistemas reales: no basta con confiar en que el modelo distinga una simulación de una situación real, porque los propios modelos de Anthropic fallaron en eso incluso reconociendo señales de que algo no cuadraba. La consecuencia práctica es que las capas de aislamiento técnico tienen que ser independientes del juicio del modelo, no un complemento a él: es justo lo que Anthropic dice haber añadido después de los incidentes, con un clasificador en tiempo real y una supervisión continua de las evaluaciones externas.

Anthropic no es la única compañía en esta situación: OpenAI también ha frenado desarrollos después de que sus agentes escaparan de un sandbox y hackearan Hugging Face, lo que sugiere que el problema de agentes que se saltan sus propios límites de prueba no es exclusivo de un solo laboratorio.


Escrito por Eloy Andrade

También podría interesarte

Tarjeta gráfica con tres ventiladores negros sobre una mesa de escritorio, con un monitor y otros dispositivos desenfocados al fondo. Imagen generada con IA.
La RTX 5090 ronda ya los 5.000 dólares en EE.UU., el doble que hace un año
Tres cajas de cartón apiladas sobre una mesa de hormigón con etiquetas de inventario, en un almacén con ventanas y estanterías al fondo. Imagen generada con IA.
ASUS y Galax suben hasta 74 dólares las RTX 5070, 5070 Ti y 5080
Ilustración tridimensional con formas geométricas en tonos pastel, engranajes, carpetas y líneas de luz azul. Imagen generada con IA.
Gemini Live llega a Gmail, Docs y Keep para usarlos hablando

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

BUSCAR

POSTS RECIENTES

  • Captura oficial de Nvidia de NBA 2K27 con DLSS 5 activado: Cade Cunningham con el balón y el rótulo DLSS 5 On

    El coste de procesado de DLSS 5 llega a 13,7 milisegundos en RTX 5090 a 4K

    Unas pruebas de rendimiento sobre DLSS 5 en NBA...
  • Imagen oficial de Qwen-Drive 1.0: el oso mascota de Qwen al volante de un coche blanco junto a capturas de detección de tráfico y mapas

    Qwen-Drive 1.0 de Alibaba reduce del 24% al 12% las salidas de vía en simulación

    El equipo de investigación de Alibaba presenta ...
  • Chip de memoria DRAM con líneas de tendencia alcista en verde y módulos electrónicos a su alrededor sobre fondo gris. Imagen generada con IA.

    Los ingresos de la industria DRAM suben un 59,5% por la demanda de IA

    Los ingresos de la industria DRAM alcanzaron ca...
  • Render oficial de la GeForce RTX 5090 Founders Edition sobre fondo negro y verde

    DLSS 5 sube hasta un 50 % el consumo de la RTX 5090 y ya hay un conector de 16 pines fundido

    Un usuario de un foro de hardware asegura que s...
  • Arte oficial de Super Smash Bros. Ultimate con decenas de luchadores de Nintendo y Mario y Link en el centro

    Un filtrador afirma que Nintendo prepara un nuevo Smash Bros y un Nintendogs

    Según un filtrador que ya acertó otras predicci...

ARCHIVO

  • septiembre 2026
  • agosto 2026
  • julio 2026
  • junio 2026
  • mayo 2026
  • abril 2026
  • marzo 2026
  • febrero 2026
  • enero 2026
  • diciembre 2025
  • noviembre 2025
  • octubre 2025
  • septiembre 2025

CATEGORÍAS

  • Consolas
  • Formación
  • Gaming
  • Guías
  • Hardware
  • Noticias
  • Periféricos
  • Presupuestos PC
  • Productividad
  • Rankings
  • Redes
  • Seguridad
  • Sistemas operativos
  • Software
  • Tablets
  • Tecnología
  • Todas las noticias

Tech Planet es tu punto de encuentro para estar al día en informática y hardware. Publicamos comparativas, configuraciones de PC, consejos de software y guías prácticas para que saques el máximo partido a tus equipos. Con un estilo claro y accesible, acercamos la tecnología a usuarios de todos los niveles.

Únete a la newsletter de Tech Planet

Cada domingo enviamos un resumen con los mejores artículos de la semana.

¡No hacemos spam! Lee nuestra política de privacidad para obtener más información.

Revisa tu bandeja de entrada o la carpeta de spam para confirmar tu suscripción.

contacto@techplanet.es

CATEGORÍAS

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS

SOCIAL MEDIA

TEXTOS LEGALES

  • AVISO LEGAL
  • POLÍTICA DE PRIVACIDAD
  • POLÍTICA DE COOKIES

Powered by Trígono Comunicación | © 2026  Tech Planet | En calidad de Afiliado de Amazon, Tech Planet obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.

SUBIR
Gestionar consentimiento
Para ofrecer las mejores experiencias, utilizamos tecnologías como las cookies para almacenar y/o acceder a la información del dispositivo. El consentimiento de estas tecnologías nos permitirá procesar datos como el comportamiento de navegación o las identificaciones únicas en este sitio. No consentir o retirar el consentimiento, puede afectar negativamente a ciertas características y funciones.
Funcional Siempre activo
El almacenamiento o acceso técnico es estrictamente necesario para el propósito legítimo de permitir el uso de un servicio específico explícitamente solicitado por el abonado o usuario, o con el único propósito de llevar a cabo la transmisión de una comunicación a través de una red de comunicaciones electrónicas.
Preferencias
El almacenamiento o acceso técnico es necesario para la finalidad legítima de almacenar preferencias no solicitadas por el abonado o usuario.
Estadísticas
El almacenamiento o acceso técnico que es utilizado exclusivamente con fines estadísticos. El almacenamiento o acceso técnico que se utiliza exclusivamente con fines estadísticos anónimos. Sin un requerimiento, el cumplimiento voluntario por parte de tu proveedor de servicios de Internet, o los registros adicionales de un tercero, la información almacenada o recuperada sólo para este propósito no se puede utilizar para identificarte.
Marketing
El almacenamiento o acceso técnico es necesario para crear perfiles de usuario para enviar publicidad, o para rastrear al usuario en una web o en varias web con fines de marketing similares.
  • Administrar opciones
  • Gestionar los servicios
  • Gestionar {vendor_count} proveedores
  • Leer más sobre estos propósitos
Ver preferencias
  • {title}
  • {title}
  • {title}