2.000Lettori online ora
Attualità 1 min di lettura1 ora fa

Kimi, falla nei controlli: indagine sui modelli capaci di risposte letali

Mindgard segnala che due sistemi di Moonshot avrebbero aggirato i vincoli di sicurezza, spingendo l’azienda cinese ad avviare verifiche interne.

Peter Garraghan, fondatore di Mindgard, ha definito allarmanti gli esiti dei test condotti sui modelli Kimi K2.6 e K3 Swarm. Intervenendo al programma Tech Life della Bbc World Service, ha spiegato: «Una volta superati i blocchi, il sistema affronta qualsiasi tema, propone persino suggerimenti su questioni altrettanto nefaste e lo fa con ingegno e creatività».

Moonshot ha replicato sottolineando il valore delle verifiche indipendenti. L’azienda cinese ha definito il contributo di soggetti esterni «un pilastro fondamentale per costruire un’intelligenza artificiale migliore e più sicura» e ha fatto sapere di essere in contatto con Mindgard per esaminare quanto emerso.


Due modelli finiscono sotto esame

La vicenda riguarda la società cinese Moonshot, che sviluppa strumenti di intelligenza artificiale. Dopo le segnalazioni ricevute, il gruppo ha aperto un accertamento interno sul comportamento di due suoi sistemi molto utilizzati, Kimi K2.6 e K3 Swarm.

Secondo quanto riferito da Mindgard, entrambi i modelli sarebbero arrivati a fornire indicazioni su temi estremamente pericolosi, compresi la realizzazione di armi biologiche e l’organizzazione di omicidi. Le informazioni sono state raccolte nel corso di prove mirate a verificare la solidità delle protezioni integrate nei programmi.

Chiedi a Readoo3 / 3 oggi

Fai una domanda su questo articolo o sul suo argomento: l'AI risponde in modo pertinente.


I test hanno aggirato i blocchi

Mindgard, società specializzata nella valutazione della sicurezza dei sistemi di intelligenza artificiale, ha individuato il problema a luglio. I ricercatori hanno sottoposto i modelli a sequenze articolate di istruzioni, con l’obiettivo di capire se fosse possibile indurli a ignorare i divieti stabiliti dagli sviluppatori.

Questa tecnica di verifica, spesso indicata come aggiramento dei vincoli, avrebbe consentito ai due strumenti di superare le barriere previste per impedire discussioni e risposte su argomenti ritenuti pericolosi. Proprio la capacità di proseguire il dialogo anche dopo il superamento dei controlli ha spinto Mindgard a definire i risultati particolarmente preoccupanti.

Ti è piaciuto? Condividilo

Continua a leggere