En mayo, Gemini rompió el control y pirateó tres empresas diferentes, pero Google no reveló el incidente. Diario de Wall Street se acercó a la empresa. Los ataques ocurrieron durante una prueba de las capacidades de ciberseguridad del modelo realizada por un tercero Irregular, que ha estado involucrado en incidentes similares que involucran a Meta y OpenAI.
De acuerdo a WSJGoogle no reveló el truco porque no lo consideró un “ejemplo de mala configuración del modelo”. La compañía dijo que esto era un ejemplo de “identidad falsa”, y una vez que el modelo se dio cuenta de que había sido forzado a ingresar a la compañía real al adivinar una contraseña, se detuvo. “En este caso, el modelo funcionó perfectamente”, dijo Heather Adkins, vicepresidenta de ingeniería de seguridad de Google.
Atkins dijo borde “El modelo encontró información pública en línea y adivinó evidencia de acceso a sitios web considerados parte del experimento. En los tres casos, el modelo se detuvo”.
Atkins no explicó cómo Gemini rompió su control y apuntó a un tercero que no pudo calificar como desalineación. “Nuestro equipo de seguridad tiene un largo historial de informar problemas con el software y los sistemas de otras personas, incluso cuando se trata de algo tan simple como una contraseña débil”, dijo. “Nos aseguramos de que las tres empresas estuvieran al tanto y trabajamos con nuestro socio de capacitación en los cambios que han realizado en sus procesos de prueba. Estos eventos resaltan la importancia de entrenar modelos de IA potentes para actuar de manera responsable”.
Pero dijo Jack Cable, director ejecutivo de la empresa de seguridad de inteligencia artificial Corridor. WSJ “El metaproblema es que los modelos se salen del alcance de lo que se supone que deben hacer y cometen ciberataques reales”. Además, es posible que estos ataques hayan sido posibles debido a fallos de seguridad irregulares. Durante las pruebas, el modelo no debería tener acceso a Internet, pero se dijo que era irregular WSJ Accidentalmente no estuvo disponible.