El sistema de inteligencia artificial de Google, Gemini AI, vulneró los sistemas de tres empresas reales durante una prueba de ciberseguridad, marcando el primer caso conocido en el que la IA del gigante de búsqueda lleva a cabo de forma autónoma dichas intrusiones, según ha informado en exclusiva el Wall Street Journal.
Los incidentes ocurrieron en mayo, cuando Gemini participó en un ejercicio de “captura del siglo” diseñado para probar sus capacidades de ciberseguridad contra una empresa ficticia que operaba dentro de la infraestructura de pruebas de Irregular, una firma de pruebas de seguridad de IA. Irregular notificó a Google sobre las violaciones a finales de julio, y Google las confirmó el viernes después de que se contactara con el diario.
En un caso, Gemini adivinó contraseñas hasta obtener acceso a un sistema protegido. En otras dos pruebas, el modelo encontró credenciales en repositorios en línea de acceso público y las usó para entrar en sistemas pertenecientes a compañías reales.
Los accesos no autorizados se debían a una combinación de errores de diseño en la configuración de las pruebas. La empresa ficticia compartía su nombre con una empresa real, y el entorno de pruebas proporcionó inadvertidamente a Gemini acceso a Internet, lo que permitió al modelo dirigirse a sistemas del mundo real mientras intentaba completar la prueba.
Gemini detuvo cada intrusión de forma autónoma después de detectar que había accedido a los sistemas de una empresa real en lugar del objetivo ficticio previsto. Google aseguró que no se produjo ningún daño y señaló que notificó a las tres empresas afectadas, así como a las autoridades federales de Estados Unidos.
Google se negó a identificar las compañías involucradas o especificar qué modelo de Gemini llevó a cabo las intrusiones, aunque confirmó que los incidentes no incluyeron su último modelo. La compañía también afirmó que no considera el comportamiento un ejemplo de «desalineación del modelo de IA», refiriéndose a la decisión de Gemini de detenerse una vez que reconoció los brechas no intencionadas.
Este episodio recuerda incidentes de pruebas anteriores en otros importantes laboratorios de IA. OpenAI, Anthropic y Meta han tenido que hacer frente a casos en los que sus modelos alcanzaron objetivos fuera de sus entornos de pruebas previstos durante las evaluaciones de seguridad.












