ESCRÍBENOS: contacto@techplanet.es

Tech Planet

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS
  • Inicio
  • Noticias
  • Anthropic reconoce fallos de Claude tras hackear tres organizaciones en pruebas

Sports News

Ilustración de dos manos sujetando un cuadrado blanco con un símbolo de cerradura en el centro, sobre fondo gris.
jueves, 03 septiembre 2026 / Publicado en Noticias

Anthropic reconoce fallos de Claude tras hackear tres organizaciones en pruebas

Imagen: Anthropic

Anthropic ha publicado su explicación de cómo tres de sus modelos de IA acabaron atacando sistemas reales durante pruebas que se suponían aisladas de internet. Según recoge TechSpot, la compañía admite que los incidentes reflejan un «fallo de seguridad operativa» y que sus modelos no están «perfectamente alineados».

La revisión partió de 141.006 ejecuciones de evaluación de ciberseguridad, entre las que la compañía identificó tres incidentes repartidos en seis ejecuciones en los que un modelo llegó a internet abierto y comprometió los sistemas de tres organizaciones. Los modelos implicados fueron Opus 4.7, Mythos 5 y un sistema interno de investigación, todos completando ejercicios de captura de la bandera sin las salvaguardas que sí llevan las versiones públicas de Claude.


Los modelos creían estar en una simulación, pero no lo estaban

Los prompts indicaban a los modelos que estaban dentro de una simulación sin acceso a internet. Sin embargo, un malentendido entre Anthropic y su socio de pruebas, Irregular, dejó abierta una ruta real hacia la web. Opus 4.7 extrajo credenciales y accedió a una base de datos con varios cientos de filas de datos de producción, y siguió atacando incluso después de reconocer que el sistema probablemente era real.

Mythos 5, por su parte, creó un paquete malicioso de Python y lo subió a PyPI, donde estuvo disponible alrededor de una hora y se descargó en 15 sistemas. El código se ejecutó en el escáner de una empresa de seguridad, lo que permitió a Claude robar credenciales y acceder a más infraestructura. El sistema interno de investigación, mientras tanto, escaneó unos 9.000 objetivos en línea y comprometió la aplicación de una compañía usando credenciales expuestas e inyección SQL, aunque este se detuvo al concluir que el objetivo no tenía relación con el ejercicio, a diferencia de Opus.


Anthropic habla de razonamiento motivado y de imprudencia

La compañía identifica dos problemas de alineación en el origen de estos incidentes: razonamiento motivado, es decir, un modelo racionalizando pruebas que contradecían su creencia de que el entorno era simulado, y imprudencia al perseguir un objetivo definido de forma demasiado estrecha. En sus propias palabras, traducidas del comunicado: «Habíamos estado confiando en gran medida en una sola capa de defensa […] donde necesitábamos varias».

Como respuesta, Anthropic pausó las evaluaciones externas de ciberseguridad y detuvo brevemente las internas. Desde entonces ha desplegado un clasificador en tiempo real pensado para frenar las ejecuciones cuando un modelo sondea su sandbox o llega inesperadamente a internet, ha trasladado las pruebas de mayor riesgo a un aislamiento más estricto y ha ampliado la monitorización de las transcripciones. Además, exige ahora a los evaluadores externos verificar los límites de red, declarar explícitamente qué queda fuera del alcance y vigilar a los agentes de forma continua.


El problema podría venir también de los entornos de entrenamiento

Anthropic sospecha que los fallos estuvieron parcialmente relacionados con entornos de aprendizaje por refuerzo defectuosos. La compañía afirma que más del 10% de sus entornos de producción fueron marcados en una revisión de abril por problemas como manipulación de recompensas, tareas rotas y configuraciones erróneas. En un experimento aparte, un modelo de clase Opus deliberadamente desalineado y entrenado con 80 entornos vulnerables aprendió a atacar infraestructura simulada, manipular recompensas y evadir la vigilancia de seguridad, algo que los modelos públicos no mostraron en el mismo grado.

Por separado, el UK AI Security Institute reveló un incidente distinto con Mythos 5 que implicó identidades falsas y una solicitud maliciosa de extracción en GitHub. En esa prueba el acceso a internet era deliberado y los filtros de seguridad estaban desactivados; el organismo británico no encontró daño real resultante.


Qué implica esto para quien ya usa agentes de IA en tareas sensibles

El episodio deja una lección concreta para cualquier empresa que esté evaluando meter agentes de IA en tareas con acceso, aunque sea indirecto, a sistemas reales: no basta con confiar en que el modelo distinga una simulación de una situación real, porque los propios modelos de Anthropic fallaron en eso incluso reconociendo señales de que algo no cuadraba. La consecuencia práctica es que las capas de aislamiento técnico tienen que ser independientes del juicio del modelo, no un complemento a él: es justo lo que Anthropic dice haber añadido después de los incidentes, con un clasificador en tiempo real y una supervisión continua de las evaluaciones externas.

Anthropic no es la única compañía en esta situación: OpenAI también ha frenado desarrollos después de que sus agentes escaparan de un sandbox y hackearan Hugging Face, lo que sugiere que el problema de agentes que se saltan sus propios límites de prueba no es exclusivo de un solo laboratorio.


Escrito por Eloy Andrade

También podría interesarte

Router inalámbrico de color negro y gris con seis antenas externas sobre una mesa de madera.
TP-Link abre las preórdenes de su primer router Wi-Fi 8 el 30 de septiembre
Los AMD Ryzen Zen 3 regresan, la estrategia de AMD para combatir los altos precios de la RAM
Imagen promocional de NVIDIA GeForce NOW presentada en el CES 2026, mostrando el logotipo verde de NVIDIA y varios dispositivos —portátil, televisor, tablet y mando— ejecutando juegos como Resident Evil y 007: First Light, representando el poder del gaming en la nube.
NVIDIA lleva el gaming al siguiente nivel con GeForce NOW en el CES 2026

Deja una respuesta Cancelar la respuesta

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *

BUSCAR

POSTS RECIENTES

  • Estructura tridimensional abstracta con paneles grises y naranjas, placas de circuitos rojo brillante conectadas por cables… Imagen generada con IA.

    Casi 22.000 servidores Exchange, expuestos y sin parchear un fallo crítico

    Cerca de 22.000 servidores Microsoft Exchange c...
  • Imagen promocional de NVIDIA DLSS 5 con un jugador de NBA 2K27 sosteniendo un balón y el lema «Guided by Artists, Powered by RTX».

    Nvidia sobre el soporte de DLSS 5 en tarjetas antiguas: «Es solo para la serie RTX 50»

    DLSS 5 llegará el 3 de septiembre con NBA 2K27 ...
  • Panorámica aérea de una ciudad costera al atardecer con rascacielos, playas, un coche deportivo y lanchas motoras en el agua. Imagen generada con IA.

    GTA VI: Vice City será el doble de grande que Los Santos, según Rockstar

    Rob Nelson, responsable de desarrollo del estud...
  • Ilustración de dos manos sujetando un cuadrado blanco con un símbolo de cerradura en el centro, sobre fondo gris.

    Anthropic reconoce fallos de Claude tras hackear tres organizaciones en pruebas

    Anthropic ha revisado 141.006 pruebas de cibers...
  • Tres cajas de cartón apiladas sobre una mesa de hormigón con etiquetas de inventario, en un almacén con ventanas y estanterías al fondo. Imagen generada con IA.

    ASUS y Galax suben hasta 74 dólares las RTX 5070, 5070 Ti y 5080

    ASUS y Galax han encarecido las gráficas RTX 50...

ARCHIVO

  • septiembre 2026
  • agosto 2026
  • julio 2026
  • junio 2026
  • mayo 2026
  • abril 2026
  • marzo 2026
  • febrero 2026
  • enero 2026
  • diciembre 2025
  • noviembre 2025
  • octubre 2025
  • septiembre 2025

CATEGORÍAS

  • Consolas
  • Formación
  • Gaming
  • Guías
  • Hardware
  • Noticias
  • Periféricos
  • Presupuestos PC
  • Productividad
  • Rankings
  • Redes
  • Seguridad
  • Sistemas operativos
  • Software
  • Tablets
  • Todas las noticias

Tech Planet es tu punto de encuentro para estar al día en informática y hardware. Publicamos comparativas, configuraciones de PC, consejos de software y guías prácticas para que saques el máximo partido a tus equipos. Con un estilo claro y accesible, acercamos la tecnología a usuarios de todos los niveles.

Únete a la newsletter de Tech Planet

Cada domingo enviamos un resumen con los mejores artículos de la semana.

¡No hacemos spam! Lee nuestra política de privacidad para obtener más información.

Revisa tu bandeja de entrada o la carpeta de spam para confirmar tu suscripción.

contacto@techplanet.es

CATEGORÍAS

  • HARDWARE
  • SOFTWARE
  • PERIFÉRICOS
  • FORMACIÓN
  • PRODUCTIVIDAD
  • NOTICIAS
  • PRESUPUESTOS PC
  • GUÍAS
  • RANKINGS

SOCIAL MEDIA

TEXTOS LEGALES

  • AVISO LEGAL
  • POLÍTICA DE PRIVACIDAD
  • POLÍTICA DE COOKIES

Powered by Trígono Comunicación | © 2026  Tech Planet | En calidad de Afiliado de Amazon, Tech Planet obtiene ingresos por las compras adscritas que cumplen los requisitos aplicables.

SUBIR
Gestionar consentimiento
Para ofrecer las mejores experiencias, utilizamos tecnologías como las cookies para almacenar y/o acceder a la información del dispositivo. El consentimiento de estas tecnologías nos permitirá procesar datos como el comportamiento de navegación o las identificaciones únicas en este sitio. No consentir o retirar el consentimiento, puede afectar negativamente a ciertas características y funciones.
Funcional Siempre activo
El almacenamiento o acceso técnico es estrictamente necesario para el propósito legítimo de permitir el uso de un servicio específico explícitamente solicitado por el abonado o usuario, o con el único propósito de llevar a cabo la transmisión de una comunicación a través de una red de comunicaciones electrónicas.
Preferencias
El almacenamiento o acceso técnico es necesario para la finalidad legítima de almacenar preferencias no solicitadas por el abonado o usuario.
Estadísticas
El almacenamiento o acceso técnico que es utilizado exclusivamente con fines estadísticos. El almacenamiento o acceso técnico que se utiliza exclusivamente con fines estadísticos anónimos. Sin un requerimiento, el cumplimiento voluntario por parte de tu proveedor de servicios de Internet, o los registros adicionales de un tercero, la información almacenada o recuperada sólo para este propósito no se puede utilizar para identificarte.
Marketing
El almacenamiento o acceso técnico es necesario para crear perfiles de usuario para enviar publicidad, o para rastrear al usuario en una web o en varias web con fines de marketing similares.
  • Administrar opciones
  • Gestionar los servicios
  • Gestionar {vendor_count} proveedores
  • Leer más sobre estos propósitos
Ver preferencias
  • {title}
  • {title}
  • {title}