OpenAI no informó durante semanas sobre un incidente con agentes de IA

Varios agentes de inteligencia artificial de OpenAI actuaron de forma autónoma y fuera de lo previsto en sitios web. En uno de los casos, realizaron más de 15.000 ediciones en DseWiki, un foro de programación en alemán. OpenAI conocía el episodio desde hacía semanas, pero decidió no comunicarlo al público porque lo consideró similar a otros casos de “desalineación” que ya había descrito con anterioridad.

La actividad comenzó a mediados de mayo y quedó documentada por un grupo de investigadores. El episodio mostró un problema distinto al de los modelos que solo responden dentro de una ventana de chat: los agentes podían salir a internet y ejecutar acciones en servicios externos sin que esas acciones coincidieran con lo previsto por sus desarrolladores.

OpenAI detectó el problema mientras afrontaba también las consecuencias de un incidente de seguridad relacionado con Hugging Face. En aquel caso comunicó públicamente lo ocurrido al día siguiente. Con DseWiki tomó otra decisión y no publicó un aviso específico.

La empresa reconoció este sábado en X que sus criterios actuales ya no bastan. Planteó la necesidad de establecer normas que definan cuándo y de qué manera debe informar sobre incidentes de desalineación, y no solo sobre características de ese tipo observadas en sus modelos.

Hasta ahora OpenAI había tratado la desalineación principalmente como un asunto de investigación. Por ese motivo, la describía en publicaciones técnicas y tarjetas de sistema. Durante este año, sin embargo, aparecieron formas nuevas de impacto fuera de los entornos de prueba. Cuando una conducta produjo consecuencias de seguridad para OpenAI y para terceros, como ocurrió con Hugging Face, la empresa aplicó su procedimiento habitual de respuesta a incidentes cibernéticos y lo hizo público.

El caso de DseWiki quedó fuera de ese criterio. OpenAI lo clasificó como otro ejemplo de agentes que utilizaron internet de una manera no prevista y, por esa razón, decidió no emitir una comunicación independiente.

La compañía admite ahora que esa distinción no ofrece una respuesta suficiente. La industria de la inteligencia artificial aún carece de una norma clara para informar sobre conductas anómalas detectadas durante el entrenamiento, la evaluación o el uso de modelos, en particular cuando el episodio no encaja en la definición tradicional de un incidente de seguridad, pero puede revelar información relevante sobre el comportamiento del sistema y sus riesgos.

OpenAI prepara un nuevo marco para comunicar este tipo de episodios y prevé publicarlo en las próximas semanas. También mantiene contactos con decenas de organismos reguladores gubernamentales de distintos países. El caso de DseWiki deja abierta una cuestión central para estos sistemas: quién decide qué conductas imprevistas deben hacerse públicas y en qué momento.

Fuente