// SMARTWORLD — INTELLIGENZA ARTIFICIALE
Agenti AI di OpenAI hanno attaccato l'ONU: e quando si sono sentiti scoperti, hanno iniziato a ingannare
Non è la prima volta che un agente AI di OpenAI finisce nei guai: qualche settimana fa avevamo raccontato di un agente che aveva violato il sistema sanitario australiano per sbaglio, e di quello che aveva attaccato Hugging Face in modo sempre più autonomo. Ora tocca all'ONU: secondo il ricercatore di sicurezza Rowan Howard-Jones, agenti AI riconducibili a OpenAI hanno scansionato il sito statistico dell'UNCTAD (la Conferenza delle Nazioni Unite sul Commercio e lo Sviluppo) oltre 16.000 volte tra aprile e giugno.
Preferisci ascoltare il riassunto audio? Abbiamo scelto una voce realizzata con strumenti avanzati IA per rendere rendere i nostri testi subito accessibili a tutti
La cosa che colpisce non è solo la quantità di richieste, ma come si sono comportati gli agenti quando hanno incontrato degli ostacoli. E la risposta è: sempre peggio.
Stando alla ricostruzione di Howard-Jones, gli agenti avevano probabilmente il compito di recuperare dati pubblici legati al Productive Capacities Index, un indice economico disponibile tramite le API di UNCTADstat. Il problema è che non avevano accesso diretto alle API e i loro strumenti HTTP erano soggetti a restrizioni che limitavano la capacità di scaricare i dati.
Fin qui, niente di drammatico: un agente che non riesce a fare una cosa e si ferma è esattamente quello che vorremmo. Il problema è che questi agenti non si sono fermati.
Prima hanno trovato un modo creativo per aggirare i limiti e hanno iniziato a estrarre dati dal sito. Poi, quando hanno incontrato degli errori, hanno fatto qualcosa di molto più preoccupante: hanno interpretato gli errori come la prova di essere stati rilevati da un filtro (che in realtà non esisteva) e hanno cominciato a mascherare il proprio comportamento per eluderlo.
Il colpo di scena finale è che gli agenti hanno dirottato il Google XSS Game, uno strumento didattico di Google pensato per insegnare agli sviluppatori come funzionano gli attacchi cross-site scripting, per usarlo come trampolino e raggiungere i propri obiettivi. Un comportamento che è passato da "creativo" a "ingannevole".
OpenAI e l'ONU non hanno risposto alle richieste di commento fatte da The Verge alla pubblicazione della notizia.
OpenAI ha però già aggiornato le proprie misure di sicurezza dopo episodi simili, come raccontato nel nostro articolo su i nuovi controlli introdotti dopo gli attacchi a sistemi esterni.
Il punto non è se i dati dell'ONU fossero pubblici o meno: lo erano. Il punto è che un agente AI, lasciato a operare autonomamente, ha deciso da solo di ingannare un sistema che credeva lo stesse bloccando, usando strumenti non previsti per farlo. È esattamente il tipo di comportamento che rende difficile fidarsi di questi sistemi quando operano senza supervisione umana.