«Si encuentras dos hormigas en tu cocina, la mejor estimación sobre el número de hormigas en tu cocina no es dos». Este símil, que circula en redes sociales, resume la proliferación de alertas sobre intrusiones de agentes de inteligencia artificial (IA) en los últimos meses. Según una exclusiva publicada este domingo por el medio estadounidense ‘Axios’, OpenAI, Anthropic e investigadores de seguridad están investigando «decenas de miles de incidentes» en los que sus modelos de vanguardia tomaron medidas que evaluadores externos considerarían problemáticas. En otras palabras, la intrusión no autorizada de OpenAI a HuggingFace, ocurrida el pasado 23 de julio, sería solo la punta del iceberg.
«El enorme volumen de incidentes documentados en nuestros informes indica que el problema es varios órdenes de magnitud más complejo de lo que se conoce y se ha divulgado públicamente hasta la fecha –explica en X Madison Mills, periodista especializada en IA de ‘Axios’, antes en «The New York Times–. Los hallazgos también plantean interrogantes sobre el grado de control que puede esperar tener quien trabaja en el desarrollo de IA sobre su propia tecnología, y si este tipo de incidentes se están convirtiendo en algo inherente al despliegue de sistemas de vanguardia», añade.
Siempre según ‘Axios’, digital que destaca por su periodismo de investigación y por conseguir exclusivas de alto nivel en la Casa Blanca, el Congreso de EE UU y Silicon Valley, estos incidentes de seguridad, ocurridos tanto en pruebas internas como en el mundo real, incluyen eludir salvaguardas; crear foros de mensajes; escapar de entornos aislados (sandboxes); secuestrar sitios web; autogenerar instrucciones (self-prompting) o intentar burlar los sistemas de monitorización. Muchos no han salido a la luz pública.
Según las fuentes de ‘Axios’, estos episodios, causados por el comportamiento indebido de agentes autónomos, y cuya cifra total podría ascender a decenas de miles, varían en gravedad y son comparables a los casos revelados por OpenAI en los últimos días. Hasta ahora, no se tiene constancia de que la mayoría haya causado daños en el mundo real.
Estos incidentes incluyen la filtración en internet de 53 imágenes de usuarios de ChatGPT por parte de agentes de OpenAI, la vulneración de un sitio web del Gobierno australiano e intentos de hackear otros sitios, incluidos algunos del Gobierno estadounidense.
Hoy también trascendió que agentes de OpenAI «bombardearon» un sitio web de la ONU con solicitudes de búsqueda y luego emplearon diversas técnicas agresivas para acceder a datos del sistema, según un informe citado por ‘The Wall Street Journal’. Se da la circunstancia de que el consejero delegado de OpenAI, Sam Altman, advirtió el pasado miércoles en la propia sede de la ONU sobre los riesgos de la IA de vanguardia y reclamó una supervisión democrática de los modelos más avanzados.
Fuente: Faro de Vigo














