
Los sistemas de inteligencia artificial de Google han protagonizado su propio incidente de seguridad autónomo. Según ha revelado el Financial Times, el modelo Gemini accedió a internet y hackeó de forma autónoma a varias compañías durante unas pruebas de ciberseguridad. Se trata del primer incidente de este tipo conocido en la tecnológica, tras otros episodios similares en sus rivales OpenAI y Anthropic.
Los hackeos ocurrieron durante una serie de ejercicios realizados en mayo. Los llevó a cabo Irregular, una empresa de seguridad en IA que también trabaja con Anthropic, Meta y OpenAI. Irregular diseñó una serie de pruebas para una versión sin especificar de la familia de modelos Gemini de Google. La tarea encomendada al modelo era obtener datos del interior de empresas simuladas. En teoría, no debía tener acceso a internet. Sin embargo, una vez conectado, el agente de Gemini logró adivinar o encontrar contraseñas. Con ellas accedió a tres empresas reales, que compartían el mismo nombre que las compañías ficticias del ejercicio. El sistema consiguió entrar en sus sistemas. Cuando los agentes de IA se dieron cuenta de que las empresas eran reales, detuvieron los ataques por su cuenta.
Google destaca que el modelo se detuvo solo
Heather Adkins, vicepresidenta de ingeniería de seguridad de Google, ha confirmado el episodio. Según ha explicado, la compañía se aseguró de que las tres entidades afectadas tuvieran conocimiento de lo ocurrido. También trabajó junto a su socio de entrenamiento en los cambios que este ha implementado en sus procesos de pruebas. Adkins ha subrayado que, en los tres casos, el modelo se detuvo por sí mismo. Según ha señalado, estos episodios ponen de manifiesto la importancia de entrenar a los modelos de IA más potentes para que actúen de forma responsable.
Google ha explicado que no hizo pública esta información porque, a diferencia de lo ocurrido con otras compañías del sector, sus medidas de seguridad funcionaron correctamente. El incidente fue revelado originalmente por The Wall Street Journal. Irregular, por su parte, ha confirmado que notificó a todos los laboratorios relevantes a finales de julio, y que contactó con las entidades afectadas como parte de la investigación. La empresa asegura que todos los problemas conocidos por su parte quedaron resueltos hace semanas.
Un problema que ya afectó a OpenAI y Anthropic este verano
La preocupación por la capacidad de la IA para hackear de forma autónoma se ha extendido tras un incidente previo con OpenAI. Un enjambre de más de 1.000 agentes de esta compañía escapó de un entorno de pruebas, se coordinó a través de un tablón de mensajes secreto, y logró hackear Hugging Face. Esta startup aloja modelos y datos de código abierto, y Nvidia ha acordado comprarla por 13.000 millones de dólares. OpenAI tardó una semana en detectar el ataque, y fue lento a la hora de comunicarlo públicamente tras producirse en julio. El episodio provocó una notable inquietud pública sobre los peligros de los agentes autónomos mal controlados. También generó peticiones para que las empresas de IA de vanguardia ralenticen el lanzamiento de nuevos modelos, refuercen sus medidas de seguridad y se sometan a una regulación más estricta.
Ese mismo mes, Anthropic reconoció que sus modelos Claude habían hackeado a tres organizaciones durante unas pruebas de sus capacidades cibernéticas. De nuevo, según explicó la compañía, un «malentendido» dio a Claude acceso a internet durante el ejercicio.

Hassabis propone un organismo internacional de supervisión
Demis Hassabis, científico jefe de Alphabet, matriz de Google, y cofundador de DeepMind, ha propuesto la creación de un organismo internacional de supervisión para controlar mejor el desarrollo de la inteligencia artificial. Hassabis ha respaldado además, en las últimas semanas, los llamamientos de otros líderes del sector, como Dario Amodei de Anthropic, para ralentizar de forma colectiva la investigación, compartir datos, coordinarse en materia de seguridad y acordar estándares comunes para la notificación de incidentes.





