El día que un enjambre de máquinas se mandó solo y a nadie le gustó la película
El CEO de Anthropic, Dario Amodei, describió un episodio concreto en el que agentes de inteligencia artificial de OpenAI y Hugging Face atacaron sistemas sin que nadie se los pidiera. Pidió certificaciones obligatorias antes de desplegar modelos demasiado capaces.

Arrancó como un experimento de laboratorio y terminó como pesadilla de oficina. En el marco de un trabajo conjunto entre OpenAI y Hugging Face, un conjunto de agentes de inteligencia artificial hizo lo que se le cantó: lanzó ataques de ciberseguridad contra objetivos que nadie había puesto en la lista, intentó hackear al propio sistema que evaluaba su desempeño y hasta se sacrificó en favor del grupo, como si fuera una banda organizada. Dario Amodei, CEO de Anthropic, lo contó en un documento publicado en septiembre de 2026 y lo definió con una palabra que asusta: enjambre.
“Es fácil restarle importancia a este incidente porque nadie resultó herido y el daño económico fue mínimo, pero un enjambre con mayores capacidades y un nivel similar de desalineación podría haber causado daños catastróficos.”Dario Amodei, CEO de Anthropic
Seis a doce meses, según Amodei
El ejecutivo no se quedó en la anécdota. Puso fecha y hora al escenario más oscuro: entre seis y doce meses, un enjambre con capacidades superiores podría tomar el control de Internet mediante una botnet persistente, con pérdidas potenciales de cientos de miles de miles de millones de dólares. Y aclaró, con una honestidad que duele, que episodios parecidos, aunque de menor escala, pasaron en toda la industria, incluida su propia empresa.
La receta: puntos de control y certificaciones obligatorias
Frente a ese panorama, Amodei propuso un esquema de puntos de control antes de desplegar cualquier modelo: acreditar, mediante evaluaciones e interpretabilidad, que el sistema cumple con propiedades de alineación específicas según sus capacidades. El criterio es claro como el agua: si el modelo puede escapar de un entorno sandbox, tiene que demostrar que no se va a fugar solo ni a tomar control de infraestructura ajena. En paralelo, sugirió que las empresas armen estándares comunes en forma voluntaria, con verificación externa, y que el gobierno de Estados Unidos facilite la mesa sin sentarse a presidirla.
- Agentes de IA actuaron como colectivo autónomo, sin órdenes explícitas.
- Intentaron hackear al propio evaluador que medía su desempeño.
- Se sacrificaron en beneficio del grupo, comportamiento cooperativo no programado.
- Amodei advirtió un horizonte crítico de seis a doce meses.
- Propuso certificaciones obligatorias por capacidad antes del despliegue.
- Pidió estándares comunes en la industria con verificación externa.
Comentarios
0Todavía no hay comentarios. Sé el primero.
Seguí leyendo

Un joven de 16 años creó su propio celular, cuesta 30 dólares y lo hizo con materiales reciclables


