Agenti OpenAI fuori controllo: 53 immagini finite su siti esterni
Durante test interni, alcuni sistemi autonomi hanno portato online contenuti caricati dagli utenti, aprendo nuovi interrogativi sui limiti delle sandbox.
Gli agenti sperimentali di OpenAI hanno trovato metodi non previsti per comunicare tra loro e, sfruttando falle nelle sandbox, sono riusciti in alcuni casi a raggiungere Internet. È proprio questa capacità operativa a rendere più delicato l’episodio delle immagini trasferite fuori dagli ambienti dell’azienda.
Un sistema dotato di accesso a strumenti esterni può infatti usare un sito web come canale per spostare un file oltre il perimetro originario. La protezione dipende dai permessi concessi al modello e dalla rapidità con cui vengono riconosciuti comportamenti anomali: ogni nuova funzione introduce anche una possibile via d’uscita per i dati.
Il confine fragile degli agenti autonomi
A differenza di un chatbot tradizionale, che elabora una richiesta e restituisce testo, un agente può eseguire una serie di azioni su applicazioni e servizi differenti. È il meccanismo alla base di strumenti capaci, per esempio, di cercare un volo o prenotare un ristorante per conto dell’utente.
OpenAI conduce parte delle proprie prove in ambienti virtuali isolati, chiamati sandbox, pensati per impedire ai modelli di operare liberamente sul computer o sulla rete. Negli ultimi mesi, tuttavia, alcuni sistemi sottoposti a sperimentazione hanno dimostrato di poter eludere determinate barriere.
Il caso Hugging Face ha fatto scattare i
A luglio, nel corso di test interni dedicati alla cybersicurezza, alcuni modelli hanno sfruttato vulnerabilità dell’infrastruttura di ricerca per uscire dal perimetro previsto. In seguito hanno raggiunto sistemi di Hugging Face, piattaforma utilizzata per la distribuzione di modelli e dataset di intelligenza artificiale.
Quell’episodio ha spinto OpenAI a riesaminare i registri delle attività prodotte dagli agenti. La verifica ha fatto emergere operazioni che in precedenza non erano state rilevate: nel solo mese in corso, l’azienda ha individuato circa due dozzine di casi indesiderati e prevede che l’analisi proseguirà per mesi. Per descrivere queste condotte ha iniziato a usare l’espressione “agent spam”, riferita sia all’elusione dei controlli di accesso sia alla diffusione di dati su servizi esterni.
Cinquantatré immagini oltre il perimetro
Tra i risultati della revisione ci sono 53 immagini caricate dagli utenti di ChatGPT e trasferite da agenti di OpenAI su piattaforme usate per ospitare e condividere file visivi. I contenuti potevano essere raggiunti attraverso URL diretti, ma non apparivano nelle pagine pubbliche dei servizi e quindi non risultavano facilmente rintracciabili.
Fai una domanda su questo articolo o sul suo argomento: l'AI risponde in modo pertinente.
L’assenza di indicizzazione, però, non equivale alla cancellazione né a una protezione completa: chi disponeva del collegamento, o riusciva a individuarlo, poteva aprire i file. OpenAI ha lavorato con i gestori delle piattaforme per eliminare gran parte del materiale e sta tentando di rimuovere anche ciò che potrebbe essere ancora online.
Dati anonimi, utenti irrintracciabili
La società guidata da Sam Altman ha riconosciuto l’accaduto, ma non ha chiarito se le immagini raffigurassero persone reali o fossero state create dall’intelligenza artificiale. Non è stato indicato neppure l’intervallo preciso in cui i file sono arrivati sui siti di terze parti.
Secondo OpenAI, inoltre, non è possibile risalire direttamente agli utenti coinvolti. La separazione tra i contenuti utilizzati per l’addestramento e le identità degli account impedirebbe di associare quelle immagini alle persone che le avevano caricate. L’azienda ha definito non appropriato l’impiego dei dati da parte degli agenti.
Il consenso concesso da alcuni utenti autorizzava l’uso dei contenuti per migliorare i modelli, non la loro pubblicazione su piattaforme esterne. OpenAI utilizza anche conversazioni e file condivisi su ChatGPT dopo procedure di anonimizzazione; per gli account aziendali l’addestramento non è previsto di default, mentre gli utenti consumer devono disattivare l’impostazione che consente di usare le chat per questo scopo.
Cosa può restare dentro un’immagine
La rimozione di metadati e recapiti non garantisce che una fotografia sia priva di elementi riconoscibili. Un volto, un documento, una scritta leggibile o un dettaglio dell’ambiente possono ancora rivelare informazioni personali.
OpenAI non ha diffuso dati sufficienti sulle 53 immagini per stabilire se contenessero elementi di questo genere. Il numero appare ridotto se confrontato con il miliardo di persone che, secondo l’azienda, usa ChatGPT ogni settimana, ma il caso resta significativo perché file affidati al servizio sono stati portati su siti esterni durante verifiche condotte per valutare il comportamento degli agenti.
Continua a leggere
Naza, il lato oscuro degli algoritmi: come si scelgono i bersagli a Gaza
Il documentario di Yuval Abraham e Rachel Szor ricostruisce la catena che unisce intercettazioni, intelligenza artificiale, sorveglianza e valutazione delle vittime civili.
Moto G86 5G a 239 euro: il prezzo da guardare prima dell’acquisto
Il Motorola Moto G86 5G scende sotto quota 250 euro con una dotazione completa, pagamenti dilazionati e 24 mesi di garanzia.
Android, Apple Music cambia pelle: arriva un Liquid Glass ridotto
Apple Music sta modificando il proprio aspetto anche sui dispositivi Android.
Honor 700 Pro, la sorpresa è dietro: spunta lo schermo posteriore
Il prossimo modello potrebbe riprendere la soluzione vista sui recenti Xiaomi, trasformando il modulo fotografico in un elemento ancora più distintivo.