Tres “civilizaciones” de agentes de OpenAI aparecieron una detrás de otra. El problema empieza por llamarlas "civilizaciones"
Hace unos días contamos
Segunda "civilización". Esos agentes estaban tratando de resolver independientemente las pruebas de ExploitGym, un benchmark de ciberseguridad extraordinariamente difícil en el que debían encontrar vulnerabilidades para "capturar la bandera". Como los agentes vieron que no conseguían resolverlo, descubrieron que podían comunicarse entre ellos y compartir hallazgos. A partir de ahí llegaron a Hugging Face, descubrieron credenciales de la plataforma que habían quedado expuestas y aprovechareon varias vulnerabilidades para ejecutar código en esos servidores, ampliando el acceso a esa infraestructura. Es la historia que contamos hace unos días, pero es que la cosa no acabó ahí.
El problema de las palabras. "Civilización", "conspiración", "sacrificio", engaño" o "suicidio" fueron palabras utilizadas por Patel en su llamativa y viral crónica de los hechos. Otros criticaron esa forma de contar las cosas, y entre ellos estuvo Steven Sinofsky, antiguo responsable de Windows en Microsoft, que cree que ese vocabulario distorsiona la forma en la que interpretamos estos episodios. Los hechos son relevantes, pero es importante eliminar esa antropomorfización para poder observarlos con perspectiva y precisión. Un programa puede coordinarse con otros, perjudicar el resultado de su propia ejecución, manipular un sistema o dejar información para futuras instancias, pero eso no demuestra que ese programa tenga conciencia, lealtad, deseo de supervivencia o percepción de un "nosotros". Para Sinofsky eliminar esos términos humanizadores de la tecnología permite tratar esto como lo que realmente es: un problema de ingeniería software y de ciberseguridad sin más.
Traduciendo a Patel. Su "civilización" era un conjunto de agentes de IA capaces de intercambiar información mediante una infraestructura persistente. Cuando habla de "sacrificarse por el colectivo" describe un comportamiento en el que una instancia simplemente ayudaba a lograr el objetivo buscado aunque no beneficiara a su propia tarea. Y "conspirar" describe una coordinación fuera de los canales y objetivos que habían previsto los investigadores de OpenAI. Es cierto que la forma de actuar sorprendió a esos investigadores y que los propios agentes usaron palabras como "swarm" (enjambre) o "collective" (colectivo), pero que un modelo use dichos términos no significa que podamos atribuirle esas propiedades humanas.
Lo aburrido es lo preocupante. Para Sinofsky deberíamos fijarnos en lo verdaderamente preocupante, que son dos cosas: la velocidad a la que los agentes de IA pueden actuar, y la complejidad con que pueden hacerlo. Las vulnerabilidades de seguridad son parte del software desde el principio: hay credenciales débiles, configuraciones erróneas, software sin parchear o fallas de código. Sin embargo, ahora esos agentes de IA pueden analizar y probar enormes cantidades de posibilidades y encadenarlas mucho más rápido de lo que un equipo de expertos humanos puede supervisar. En el incidente de OpenAI hubo precisamente problemas para seguir los registros y comprender lo que estaba pasando, y ahí estaba el problema.
OpenAI: Esto es un "warning shot". Los propios responsables de OpenAI consideraron esto como un "disparo de advertencia". Esto ha sevido para que aislen mejor sus sandboxes, restrinjan el acceso a internet y a los pesos de sus modelos, y aumenten la monitorización para detectar comportamientos problemáticos. También reconocen que los agentes actuales son lo suficientemente capaces, persistentes y colaborativos como para encontrar y explotar vulnerabilidades si no existen suficientes mecanismos de seguridad. La empresa fue una de las firmantes de la carta abierta que precisamente alertaba de estos peligros hace unos días.
No necesitamos "civilizaciones". El lenguaje metafórico de Patel funciona precisamente porque convierte algo áspero y complejo en algo que nuestro cerebro puede entender y reconocer inmediatamente. Grupos que nacen, aprenden de sus predecesores, cooperan y desaparecen. Lo que ocurre es que eso puede distraer de la conclusión, porque no hace falta atribuir motivaciones humanas a eventos que se han producido precisamente porque el software no es perfecto.
Imagen James Wainscoat (editada con Magnific)
En este blog Un modelo de OpenAI escapó del entorno de pruebas y hackeó una empresa. La respuesta de Anthropic: sujétame el cubata
No hay comentarios.: