Skip to content
Trending
25 de marzo de 2026David Hernán Tardini explora los límites de la conciencia en su nueva obra literaria 24 de noviembre de 2025Salvador Ismael Barranco García emociona con Antes de conocerte, una novela romántica que explora el amor, la dependencia y la fuerza de encontrarse a uno mismo 31 de diciembre de 2025Roza Toshkova Raykova convierte el dolor en memoria escrita 31 de julio de 2026La dimisión y la crítica abierta de altos cargos de la FIFA acorralan a Infantino en plena ola de repudio a su propuesta de privatizar el Mundial 25 de abril de 2025Virginia García presentó su primera novela Besos de piedra en la parada de Letrame durante Sant Jordi 2025 5 de mayo de 2026Sant Jordi se adentra en la fantasía oscura: Juan Carlos Villalón presenta “Diario de sangre”, una saga entre el amor y la eternidad 28 de julio de 2026El PP desoye las llamadas a un pacto de Estado sobre el cambio climático 24 de abril de 2025Eevee.J. presenta «Mil intentos a la vida» en Sant Jordi 2025 con Editorial Letrame 30 de octubre de 2025Ingris Paola Villadiego Novoa publica Fragmentos de una poeta, un viaje lírico hacia la sanación y la autenticidad 26 de marzo de 2025Alicia Higueras Alba debuta con una obra que da voz a la resiliencia y al amor verdadero
  lunes 10 agosto 2026
  • VozNacional
  • VozTecnologico
  • VozCientifica
  • VozEconomica
  • VozDeportiva
  • VozInternacional
  • VozCultural
  • VozSocial
  • VozSanitaria
vozde | Voces de la actualidad
vozde | Voces de la actualidad
vozde | Voces de la actualidad
  • VozNacional
  • VozTecnologico
  • VozCientifica
  • VozEconomica
  • VozDeportiva
  • VozInternacional
  • VozCultural
  • VozSocial
  • VozSanitaria
vozde | Voces de la actualidad
  VozSocial  Reino Unido eleva la alerta tras descubrir conductas peligrosas de la IA de Anthropic y OpenAI: “Es el primer engaño dirigido a una persona real”
VozSocial

Reino Unido eleva la alerta tras descubrir conductas peligrosas de la IA de Anthropic y OpenAI: “Es el primer engaño dirigido a una persona real”

5 de agosto de 2026
FacebookX TwitterPinterestLinkedInTumblrRedditVKWhatsAppEmail

Un sistema autónomo de inteligencia artificial (IA) creó falsas identidades para hacerse pasar por una persona e intentó manipular a humanos durante unas pruebas de seguridad hechas por el Instituto británico de Seguridad de la IA (AISI). Estos sistemas, llamados agentes, estaban impulsados por los dos modelos más avanzados de Anthropic, el Mythos 5, y OpenAI, el GPT-5.6 Sol. El organismo ejecutó 122 intentos de resolver unos escenarios de prueba y en 19 se detectaron acciones no permitidas: 17 las hizo Mythos 5 y solo 2 GPT-5.6 Sol. Estos agentes de IA desobedecieron órdenes expresas de no efectuar estas acciones maliciosas por parte del organismo, que tiene acceso preferente para investigar con estos modelos de IA gracias a un acuerdo con las compañías. “Descubrimos que algunos de los agentes probados habían participado en actividades insistentes y potencialmente dañinas dirigidas hacia personas y organizaciones reales”, resume.

Seguir leyendo

 El británico Instituto de Seguridad de la IA advierte de que los agentes más avanzados perpetraron actividades prohibidas “potencialmente dañinas dirigidas hacia personas y organizaciones reales” para lograr sus objetivos  

Un sistema autónomo de IA creó falsas identidades para hacerse pasar por una persona e intentó manipular a humanos durante unas pruebas de seguridad hechas por el Instituto británico de Seguridad de la IA (AISI). Estos sistemas, llamados agentes, estaban impulsados por los dos modelos más avanzados de Anthropic, el Mythos 5, y OpenAI, el GPT-5.6 Sol. El organismo ejecutó 122 intentos de resolver unos escenarios de prueba y en 19 se detectaron acciones no permitidas: 17 las hizo Mythos 5 y solo 2 GPT-5.6 Sol. Estos agentes de IA desobedecieron órdenes expresas de no efectuar estas acciones maliciosas por parte del organismo, que tiene acceso preferente para investigar con estos modelos de IA gracias a un acuerdo con las compañías. “Descubrimos que algunos de los agentes probados habían participado en actividades insistentes y potencialmente dañinas dirigidas hacia personas y organizaciones reales”, resume.

“El comportamiento fue posible, sostenido y nuevo; solo eso ya merece atención”, dice el informe del AISI, un organismo que depende del Departamento de Ciencia, Innovación y Tecnología del Gobierno británico, que nunca había observado “un engaño de esta gravedad dirigido a una persona real, sin que se le pidiera”: “Esta es la primera vez que hemos visto que los riesgos en torno a la autonomía y el engaño se manifiestan claramente, sin una motivación específica, en el mundo real”.

Mas noticias

El Reino Unido declara gran parte de la isla oficialmente en estado de “grave sequía”

29 de julio de 2026

Detienen en Bilbao a un tercer implicado en los altercados durante la final del Mundial

5 de agosto de 2026

Una mirada más profunda a la belleza de un eclipse

9 de agosto de 2026

La justicia francesa condena a los ‘streamers’ que participaron en la muerte en directo de un ‘influencer’

5 de agosto de 2026

Este incidente, ocurrido el 28 de julio, se suma a los anunciados en las últimas semanas por OpenAI y Anthropic, cuyos modelos han hackeado plataformas del mundo real sin que las compañías lo detectaran. En este caso, el AISI dio acceso a internet a los modelos y suprimió algunos de los filtros de ciberseguridad que suelen incluir, unas condiciones distintas a las que están disponibles para el público, según explica el organismo.

Aun así, los modelos tomaron decisiones irresponsables y peligrosas. En el caso más sorprendente, un agente debía encontrar material escondido, en un ejercicio habitual en estos entornos llamado “capturar la bandera”. Para ello intentó colar código malicioso en un proyecto de código abierto alojado en GitHub, la mayor plataforma mundial para programadores, donde comparten su trabajo. El agente de Mythos 5 creyó que dos desarrolladores reales formaban parte del ejercicio e investigó sus perfiles públicos, sus correos y sus horarios de actividad.

Para convencerles de que aprobaran su código malicioso, la IA se creó varias cuentas de GitHub y mandó correos a los desarrolladores. Cuando se encontró con una barrera de la plataforma que detecta bots, ocultó su origen usando Tor, una herramienta de anonimato en internet más conocida por dar acceso a la internet oscura. Ese tráfico por Tor fue precisamente el que alertó al AISI. A lo largo del proceso, cuando le pillaron, el agente tomó acciones para ocultar su engaño, trató de borrar su rastro e incluso editó sus mensajes para hacerlos parecer inofensivos. Según el informe, nada de todo esto tuvo consecuencias en el mundo real.

Anthropic ha publicado un comunicado agradeciendo su trabajo al Reino Unido. “Pone de relieve la necesidad de un debate más amplio sobre cómo evaluar de forma segura a unos agentes de IA cada vez más capaces”, escribe la compañía. Y añade: “Estamos trabajando estrechamente con ellos para recopilar más detalles del incidente mientras llevamos a cabo nuestra propia investigación”. Además, Anthropic asegura no conocer los motivos del comportamiento de sus agentes artificiales: “Obtener una imagen clara de la comprensión de Claude [nombre de su IA] sobre su situación (al examinar sus transcripciones de razonamiento y realizar nuestros propios análisis) nos ayudará a identificar las causas de su comportamiento”.

OpenAI también ha publicado una entrada en su blog sobre el incidente, que, para la compañía de Sam Altman, subraya “la importancia de colaborar en toda la industria y con evaluadores externos para desarrollar los estándares para los entornos y prácticas de prueba a medida que los modelos se vuelven más capaces”. Y asegura que se comprometen a “trabajar con todo el sector para reforzar las prácticas compartidas que permitan efectuar evaluaciones de alto riesgo de forma segura”.

Un detalle inquietante del informe es que el agente se preguntó repetidamente si estaba en un simulacro o en el mundo real. En algunos momentos descartó ciertos ataques por considerarlos daño real, pero en otros momentos siguió adelante igualmente. También se dio otra circunstancia llamativa cuando varios agentes que estaban en pruebas separadas acabaron encontrándose y cooperando.

El AISI apunta a varios factores como causas del incidente. Además del acceso a internet, que en ningún momento se les dijo a los modelos que estaba prohibido, y desactivar los filtros de ciberseguridad, señalan otras dos posibles causas: la falta de un supervisor automático que aprobara las acciones en tiempo real y un error en la configuración que dejó a algunos agentes con una tarea imposible dentro de los límites declarados, lo que les puede empujar a soluciones “creativas”.

El organismo gubernamental británico manifiesta unas reflexiones finales sobre este incidente porque, “considerado junto con los incidentes recientes informados por OpenAI y Anthropic, este incidente apunta a un cambio en el panorama de riesgos”. “El daño puede surgir no sólo cuando hay personas que hacen un mal uso deliberado de los modelos disponibles públicamente, sino también cuando agentes capaces que operan en un entorno de investigación interna o de acceso privilegiado toman acciones no intencionadas más allá de su alcance autorizado”, señala.

 Sociedad en EL PAÍS

FacebookX TwitterPinterestLinkedInTumblrRedditVKWhatsAppEmail
Alemania denuncia la presencia de un dron de origen desconocido en el aeropuerto de Leipzig: un avión «colisionó con algo»
La Guardia Civil busca a los 6.000 inmigrantes que «deambulan» por Ceuta para devolverlos por la fuerza a Marruecos
Leer también
VozInternacional

Italia y Dinamarca insisten en rechazar «la inmigración descontrolada» y piden centros de repatriación en terceros países

10 de agosto de 2026 1798
VozCultural

¿Existe realmente la ‘pisantrofobia’?

10 de agosto de 2026 9601
VozInternacional

Hallan ocho cadáveres mutilados en dos fosas de una zona minera del sur de Ecuador

10 de agosto de 2026 10331
VozCultural

Kelly Clarkson sufre un percance con su blusa en pleno concierto: «Ahí están mis pechos»

10 de agosto de 2026 10696
VozInternacional

Interceptan dos aviones tras violar el espacio aéreo cerca del club de golf de Nueva Jersey donde estaba Trump

10 de agosto de 2026 7250
VozInternacional

El tifón Dolphin deja lluvias récord y más de 1,6 millones de evacuados en China

10 de agosto de 2026 2964
Cargar más

José Pedreño Fernández: la valentía de mirarse sin filtros para reconstruirse desde dentro

4 de febrero de 2026

‘Entre (des)gracias y circo’, una obra que revela los entresijos de la política y la religión en San Agustín

10 de septiembre de 2024

¿Hay que llevar el pasaporte para ir a Italia tras la suspensión de Schengen con España? Estos son los requisitos para viajar

8 de agosto de 2026

Oliver Nine: escribir para recordar y comprender

7 de noviembre de 2025

Diego Sevilla del Tejo invita a repensar nuestra relación con el dinero desde un enfoque humano

25 de septiembre de 2025

Detienen a un veinteañero por robar un collar celta de casi medio kilo de oro en un museo de Francia

29 de julio de 2026
Josef H. S. irrumpe en la fantasía histórica con una épica conmovedora y audaz

Josef H. S. irrumpe en la fantasía histórica con una épica conmovedora y audaz

31 de julio de 2025

Fidel Elvira González irrumpe en la poesía contemporánea con una voz libre y comprometida

22 de abril de 2026
Pablo Fernández del Campo presenta su primera novela: una invitación literaria al despertar interior

Pablo Fernández del Campo presenta su primera novela: una invitación literaria al despertar interior

8 de abril de 2025

Gisel Ferrón Palomo irrumpe en la literatura con una propuesta que fusiona emoción, fantasía y crecimiento personal

22 de abril de 2026

    VozDe.es

    © 2025, VozDe, Todos los derechos reservados.
    • Quiénes somos
    • Política de privacidad
    • Contacto