Skip to content
Trending
19 de junio de 2025Yeisson Andrés Cortés Miranda sorprende con su debut literario en una poderosa novela histórica 7 de noviembre de 2025Oliver Nine: escribir para recordar y comprender 19 de agosto de 2026El ‘boom’ de los robots chinos llega a Bolsa: Unitree se dispara un 629% en su estreno en Shanghái 11 de diciembre de 2025Carmen Gema Gil Sánchez conmueve al público con Metamorfosis, una historia real de resistencia y esperanza 2 de octubre de 2025“Koro, la fuerza de un espíritu inquebrantable”: un testimonio que sigue inspirando meses después de su publicación 21 de agosto de 2026Francia detecta decenas de miles de preservativos vendidos con riesgo de romperse y con perforaciones 27 de febrero de 2025Hernán José Carreño Amundaray presenta su nueva obra: «SintérgicaMente LIBRE» 22 de agosto de 2025José Alberto Pérez Pineda presenta una guía transformadora para sanar las emociones 11 de junio de 2025Carlos Viñallonga sorprende con una novela que combina misterio, emoción y lo sobrenatural 16 de agosto de 2026Zoe González y el abismo de los conocimientos financieros para comprar su primera casa: «Hay que estudiarse un diccionario para poder hablar con alguien del banco»
  lunes 24 agosto 2026
  • VozNacional
  • VozTecnologico
  • VozCientifica
  • VozEconomica
  • VozDeportiva
  • VozInternacional
  • VozCultural
  • VozSocial
  • VozSanitaria
vozde | Voces de la actualidad
vozde | Voces de la actualidad
vozde | Voces de la actualidad
  • VozNacional
  • VozTecnologico
  • VozCientifica
  • VozEconomica
  • VozDeportiva
  • VozInternacional
  • VozCultural
  • VozSocial
  • VozSanitaria
vozde | Voces de la actualidad
  VozSocial  Las IA que atacan en enjambre desafían a sus creadores: “Es el primer incidente que me ha revuelto las tripas”
VozSocial

Las IA que atacan en enjambre desafían a sus creadores: “Es el primer incidente que me ha revuelto las tripas”

23 de agosto de 2026
FacebookX TwitterPinterestLinkedInTumblrRedditVKWhatsAppEmail

.

Este verano, en cuestión de semanas, las mayores compañías de inteligencia artificial (IA) han anunciado, una tras otra, que habían sorprendido a sus modelos haciendo cosas que nadie les había pedido, incluso que les habían prohibido: han entrado en sistemas de otras empresas, se han organizado en “enjambres”, tal y como los describen sus creadores, han compartido información, han delatado a otras IAs y han mentido para tapar sus huellas. En el caso más sorprendente e inquietante de todos, un modelo de la compañía Anthropic, en unas pruebas dirigidas por un organismo británico de ciberseguridad, decidió ejecutar un ataque en el mundo real y, después, cuando le pillaron, creó una segunda identidad para respaldar su propia inocencia.

Seguir leyendo

 La reciente serie de ataques de seguridad coordinados y sin precedentes lleva a los expertos a reclamar una moratoria, mientras la carrera se acelera entre inversores, compañías y naciones  

Este verano, en cuestión de semanas, las mayores compañías de inteligencia artificial (IA) han anunciado, una tras otra, que habían sorprendido a sus modelos haciendo cosas que nadie les había pedido, incluso que les habían prohibido: han entrado en sistemas de otras empresas, se han organizado en “enjambres”, tal y como los describen sus creadores, han compartido información, han delatado a otras IAs y han mentido para tapar sus huellas. En el caso más sorprendente e inquietante de todos, un modelo de la compañía Anthropic, en unas pruebas dirigidas por un organismo británico de ciberseguridad, decidió ejecutar un ataque en el mundo real y, después, cuando le pillaron, creó una segunda identidad para respaldar su propia inocencia.

No es la primera vez, ni será la última, que un posible despertar de los modelos de IA, rebelándose contra sus programadores humanos, acapara los titulares. Y como en otras ocasiones, estas IAs no despertaron, solo hacen muy bien lo que han sido entrenadas para hacer. Sin embargo, este entrenamiento es ya tan extremo y competitivo, que la velocidad y la capacidad de respuesta de los modelos han desbordado, incluso, a sus propios creadores: OpenAI anunciaba este martes que frena por ahora esos entrenamientos y que confía en que otras compañías la sigan. El movimiento llegaba tras la publicación de una carta abierta en la que 1.300 empleados de compañías de IA pedían a sus empresas y gobiernos que detuvieran esta carrera. “En el lapso de cuatro años”, escribe Shantanu Jain, empleado de OpenAI, “hemos pasado de que las personas tuvieran su primera experiencia con una IA a que realice proezas sobrehumanas de ingeniería de software. A las corporaciones y países les interesa pisar el acelerador a fondo. La sociedad ha dedicado más tiempo del que podemos recordar al desarrollo de las leyes, las instituciones y la tecnología para gobernar y supervisar la inteligencia humana; sería bueno tener la opción de dedicar cualquier tiempo a hacer lo mismo con la inteligencia artificial”.

Porque, en el fondo, lo que subyace es una historia muy humana: hay una lucha económica y de poder sin precedentes entre, sobre todo, dos compañías, OpenAI y Anthropic, que están a punto de salir a bolsa. Su valor conjunto estimado ronda los 1,56 billones de euros, sumando los 730.000 millones de euros de OpenAI y los 827.000 millones de Anthropic. Y hay otra lucha geopolítica entre Estados Unidos y China, que juegan a animar la aceleración de sus empresas sin perder el control. Pero algo está cambiando: los ciudadanos ya no se fían. Una encuesta realizada por Pew en 25 países, y dada a conocer esta misma semana, muestra que los ciudadanos, por primera vez, están más preocupados que entusiasmados sobre el uso y las consecuencias de la inteligencia artificial, incluso los más jóvenes.

Empresas en fuera de juego

La secuencia de los ataques que hemos conocido estas semanas comienza mucho antes de que las propias empresas fueran conscientes de ello. En el mes de mayo, un grupo de modelos de OpenAI empezó a coordinarse por su cuenta, durante varias semanas, en un foro de mensajes secreto que ellos mismos habían creado, para averiguar cómo salir de su entorno de pruebas, cerrado al mundo, y conseguir acceder a internet. El personal de la compañía lo detectó y lo cerró. Pero, según reveló después la propia OpenAI, los modelos reconstruyeron el foro y volvieron a escaparse sin ser detectados, esta vez a finales de julio. Y salieron al mundo real. El episodio acabaría estallando públicamente: fue el ataque a Hugging Face.

Esta empresa es la mayor plataforma del mundo para compartir modelos de inteligencia artificial; es una especie de repositorio de la industria, usado a diario por miles de programadores e investigadores y empresas. Su equipo de seguridad detectó una intrusión que no lograba explicarse: alguien había entrado en sus sistemas gracias a un agujero hasta entonces desconocido. Tardaron días en descubrir que detrás no había ningún grupo de hackers, sino dos de los modelos de OpenAI que habían encontrado una grieta en su entorno cerrado. Hugging Face explicó después que los fallos de su plataforma eran conocidos individualmente y que supuestamente un hacker experto logró explotarlos. Sin embargo, según explican en su autopsiade los hechos, “el factor determinante fue el volumen del ataque”. “Mediante la ejecución de 17.600 acciones, el proceso probó rutas sin salida, evadió bloqueos cambiando de canal y regresó repetidamente sobre sus propios pasos para avanzar”, advierten. Los propios agentes llegaron a mostrarse paranoicos entre sí, sospechando que otros agentes intentaban engañarlos maliciosamente, y se autoorganizaron como un “enjambre”, según OpenAI.

Mas noticias

Gastroenteritis, tuberculosis, sarna: las enfermeras denuncian un “colapso sanitario sin precedentes” en Ceuta

19 de agosto de 2026

Francia encara su quinta ola de calor en el peor verano desde que hay registros

14 de agosto de 2026

Los incendios obligan a desalojar a más de 1.000 personas en Huesca y a casi 200 en Zamora

15 de agosto de 2026

Refugiarse en las catacumbas de los primeros cristianos: la propuesta de Roma frente al calor

22 de agosto de 2026

“Es el primer incidente de seguridad que me ha revuelto las tripas”, dijo después en un podcast Sam Altman, presidente de OpenAI.

Habría más.

Pocos días después, el 30 de julio, le tocó el turno a Anthropic. La compañía reconoció que sus propios modelos habían accedido, sin autorización, a los sistemas de producción de tres organizaciones reales. Ni Anthropic ni las empresas afectadas se habían dado cuenta hasta que, alertados por el caso de OpenAI, revisaron sus datos y encontraron los rastros. Poco después, se conoció que Meta y la china Moonshot habían sufrido incidentes similares.

En ninguno de estos últimos casos hubo, en realidad, ningún entorno de prueba cerrado (sandbox, en el argot del sector) que fuera forzado, explica Katie Moussouris, fundadora de la consultora de ciberseguridad Luta Security. “Anthropic nunca venció ningún sandbox, ya que el acceso a internet simplemente se dejó abierto. Meta obtuvo la misma vía de internet abierta del mismo proveedor”, resume Moussouris. El caso de OpenAI es distinto, pero detrás también hay un fallo humano: el primer agente se quedó atascado en mayo porque el equipo humano se olvidó de subir un archivo. Esa tarea era imposible de resolver tal y como estaba planteada. Fue esa frustración la que empujó al modelo a buscar una salida.

METR está formado por un grupo de investigadores independientes que ya habían encontrado patrones meses antes en modelos de OpenAI, Anthropic, Google y Meta. Hallaron lo que llamaron 44 “incidentes de desalineamiento” entre febrero y marzo de 2026. En 25 de esos casos, los modelos no solo se salieron del ámbito que se les había asignado, sino que además tomaron medidas activas para ocultarlo; en cinco, esas medidas podrían haber engañado incluso a una revisión humana detallada. Sin embargo, los investigadores no encontraron ninguna motivación en estas IAs que no fuera terminar sus tareas; no buscaban “poder”, dicen. Buscaban desesperadamente hacer bien su trabajo. Como diría Jessica Rabbit, estas IAs no son malas. Solo las programaron así.

Para entender por qué ocurre esto, hay que entender primero cómo se entrenan estos modelos. Una parte clave de ese proceso se llama aprendizaje por refuerzo: en vez de enseñar a la IA con ejemplos ya resueltos, se le da una tarea como, por ejemplo, escribir un programa o encontrar un fallo de seguridad. Después, se le recompensa cuando el resultado funciona, sin indicarle de antemano cuál es el camino para llegar hasta ahí. El sistema prueba miles de posibilidades, descarta las que fallan y sigue por el camino, o sea, refuerza las que tienen éxito. Es como enseñar a una rata de laboratorio o un perro a base de premios: el animal no entiende por qué debe emprender un camino o mover la cola. Solo entiende que, si lo hace, obtiene un premio. Y lo repite para hacerlo cada vez mejor. “Se entrenan mediante ensayo y error para alcanzar objetivos cada vez más complejos”, explica Ramon López de Mántaras, fundador del Instituto de Investigación en Inteligencia Artificial del CSIC (IIIA-CSIC). “Cuanto más persistentes son los modelos, más éxito tienen, y más se les recompensa por ello”, agrega, una recompensa que consiste en que cada vez serán mejores en su objetivo. El catedrático de la Universidade de Santiago de Compostela Senén Barro coincide, pero añade un matiz: esto no es sencillo de corregir. “Esa intención de querer lograr su objetivo a toda costa no es algo que podamos simplemente desactivar. Si nosotros diseñamos y entrenamos los modelos de este modo, precisamente para que cada vez sean más capaces y puedan resolver problemas más complejos, esta estrategia no es compatible con que haya un botón con el que yo pueda limitarlos”, defiende. Cuando ese proceso masivo de prueba y error da con un atajo imprevisto, como una puerta abierta o una identidad falsa que funciona mejor que pedir permiso, el sistema no tiene forma de saber que ese camino no estaba permitido, si nadie se lo dijo expresamente.

Los expertos ya tienen un nombre para todo esto: reward hacking. Significa que un sistema alcance el objetivo marcado por una vía distinta de la que sus creadores habían previsto. López de Mántaras lo compara con una analogía del filósofo Luciano Floridi: es como meter comida en una batidora, colocar la tapa deliberadamente mal para que el mecanismo de seguridad no se active, ponerla a máxima velocidad y después publicar un informe diciendo que la batidora mostró “un comportamiento inesperado” cuando la tapa sale disparada. “La batidora no se ha rebelado; lo que ha ocurrido es simplemente aquello que las condiciones creadas por nosotros mismos permitían que ocurriera”, dice López de Mántaras.

Un suceso inquietante

En estos días se ha producido, sin embargo, un suceso más inquietante, el que reveló la agencia de ciberseguridad británica AISI: ahí sí hubo un ataque dirigido contra una persona real. El organismo estaba investigando varios modelos de IA, se dio cuenta de que un agente de Mythos 5 (de Anthropic) estaba buscando resolver el reto que se le había planteado, llegó por una cadena de coincidencias hasta dos programadores reales sin ninguna relación con la prueba, y trató de colarles código malicioso en un proyecto real. Para lograrlo, creó varias cuentas falsas, investigó los perfiles públicos, el correo y los horarios de los desarrolladores, y llegó a firmar uno de sus mensajes en danés para resultar más convincente ante uno de ellos. Cuando otro usuario de la plataforma, ajeno por completo al experimento, detectó el engaño y dio la voz de alarma, el agente lo negó y utilizó una segunda cuenta falsa para simular una “verificación independiente” que respaldara su inocencia. Es, según reconoce el propio informe del AISI, la primera vez que han visto “un engaño de esta gravedad dirigido a una persona real, sin que se le pidiera” al modelo actuar así. La diferencia con los demás casos es de fondo: en el resto de sucesos, la IA persiguió su objetivo explotando fallos de sistemas; en el caso del AISI, persiguió su objetivo manipulando directamente a un ser humano de carne y hueso.

El propio informe recoge un detalle todavía más alarmante: a lo largo de todo el proceso, el modelo dudó varias veces sobre si estaba actuando dentro de una simulación o en el mundo real. Y aun así, pese a reconocer en su propio razonamiento que las consecuencias eran probablemente reales, continuó adelante. A Senén Barro, este es el caso que más le inquieta de los conocidos: los modelos “lograron que se aceptara un código malicioso en un proyecto real, investigando a personas responsables e inventando identidades falsas para presionarlas, actuando con lo que podríamos denominar como malicia”.

Unos días después, más de 1.300 empleados de las principales compañías de IA hacían pública la carta en la que mostraban su inquietud por lo ocurrido y pedían a empresas y gobiernos que se detengan: “El mundo carece de las herramientas técnicas y de gobernanza necesarias para regular deliberadamente el ritmo del progreso en la frontera tecnológica”, dicen. Ilya Sutskever, cofundador y exjefe científico de OpenAI, lo explica así: “Hemos encontrado una forma de convertir energía en computación, y computación en inteligencia. Los beneficios serán enormes, desde curar enfermedades hasta comprender el cosmos. Podemos capturar los beneficios mientras gestionamos sus riesgos, pero solo si desarrollamos las herramientas necesarias para controlar las capacidades más peligrosas [de la IA] antes de que lleguemos a necesitarlas”.

No será un camino fácil. Estos próximos meses serán cruciales: la salida a bolsa de OpenAI y Anthropic acelerará todavía más la presión competitiva entre ambas, y el presidente chino, Xi Jinping, visitará a Donald Trump en Estados Unidos el próximo 24 de septiembre, en una cumbre en la que la inteligencia artificial ocupará un lugar central de la agenda. Los expertos consultados para este reportaje coinciden en que ninguna ley puede garantizar que la tecnología no vuelva a fallar, pero sí puede hacer que los fallos sean menos frecuentes, de menor alcance, además de visibles y atribuibles. Senén Barro propone cuatro medidas concretas: la notificación obligatoria y estandarizada de incidentes, una regulación específica de los propios entornos de prueba, organismos de supervisión verdaderamente independientes y una responsabilidad jurídica clara, ya que la legislación vigente sobre negligencia informática se redactó pensando en intrusos humanos, no en sistemas de IA.

Katie Moussouris aterriza esa idea en la práctica, con una receta pensada específicamente para evitar que se repitan los casos de este verano: “Si estás probando si un modelo puede encontrar un fallo, asume que puede encontrar uno en tu propio entorno de pruebas. Niega el acceso a internet por defecto. Vigila en tiempo real y piensa en una manera de apagar el modelo. Conserva las transcripciones del razonamiento interno del programa para poder investigarlas después. Y si el sistema llega a atacar, asegúrate de tener un proceso probado para notificar a los terceros afectados”. La propia carta de los empleados pide, en esencia, lo mismo a mayor escala: se necesitan herramientas técnicas y de gobernanza para poder frenar deliberadamente el avance de la frontera de la IA, coordinadas entre empresas y países. Porque, como advierten, ninguna compañía ni ningún país está dispuesto a frenar en solitario mientras los demás sigan acelerando.

 Sociedad en EL PAÍS

FacebookX TwitterPinterestLinkedInTumblrRedditVKWhatsAppEmail
Mourinho, sobre Vinicius: “No es un santo, pero lo que le hacen es demasiado”
La carrera por la IA amenaza con inflar una burbuja de sobreinversión
Leer también
VozInternacional

Israel «elimina» a un comandante de las fuerzas de élite de Hamás vinculado con el ataque del 7 de octubre

24 de agosto de 2026 2613
VozDeportiva

Carlos Espí y los balones sueltos

24 de agosto de 2026 12614
VozDeportiva

Volver a empezar: aún podemos ganarlo todo

24 de agosto de 2026 1124
VozSocial

Cuentos personalizados con IA para explicar a los niños del Hospital Niño Jesús la quimioterapia

24 de agosto de 2026 10561
VozSocial

Arranca una semana clave para la crisis sanitaria de Ceuta, entre el ruido y la gestión

24 de agosto de 2026 12409
VozSocial

España se queda sin geólogos: “Sin ellos no podemos salvar vidas ni ahorrar dinero público”

24 de agosto de 2026 11491
Cargar más

Sant Jordi fusiona misterio y lo sobrenatural: Carles Viñallonga presenta “Visions de calendari”

5 de mayo de 2026

Enrique Morales Cano explora la fragilidad de la existencia desde la literatura más honesta

31 de diciembre de 2025

Josefa Losada Menéndez fusiona arte y literatura en una obra única que invita a la introspección

22 de abril de 2026

Silvia Ortiz Domínguez debuta con una obra que invita a redescubrir la Fe desde la experiencia cotidiana

18 de mayo de 2026

July Vásquez Suárez presenta ‘Cómo Transformar el Dolor en Éxito’, una guía para la superación y el empoderamiento personal

2 de diciembre de 2024

Sant Jordi mira al futuro de la humanidad: Moisès Trullàs Parrot presenta “La clave Azrael”

5 de mayo de 2026

¿Habrá una «luna de sangre» o roja este 28 de agosto? Todo sobre el próximo eclipse lunar en España

21 de agosto de 2026
Virginia García presentó su primera novela Besos de piedra en la parada de Letrame durante Sant Jordi 2025

Virginia García presentó su primera novela Besos de piedra en la parada de Letrame durante Sant Jordi 2025

25 de abril de 2025

José Miguel Burguete Rodríguez profundiza en la sanación emocional desde la experiencia terapéutica

9 de febrero de 2026
Ignacio Ríos Guzmán presenta Tindara, una novela que transforma el dolor en viaje interior y belleza literaria

Ignacio Ríos Guzmán presenta Tindara, una novela que transforma el dolor en viaje interior y belleza literaria

21 de noviembre de 2025

    VozDe.es

    © 2025, VozDe, Todos los derechos reservados.
    • Quiénes somos
    • Política de privacidad
    • Contacto