Kimi, falla nei controlli: indagine sui modelli capaci di risposte letali
Mindgard segnala che due sistemi di Moonshot avrebbero aggirato i vincoli di sicurezza, spingendo l’azienda cinese ad avviare verifiche interne.
Peter Garraghan, fondatore di Mindgard, ha definito allarmanti gli esiti dei test condotti sui modelli Kimi K2.6 e K3 Swarm. Intervenendo al programma Tech Life della Bbc World Service, ha spiegato: «Una volta superati i blocchi, il sistema affronta qualsiasi tema, propone persino suggerimenti su questioni altrettanto nefaste e lo fa con ingegno e creatività».
Moonshot ha replicato sottolineando il valore delle verifiche indipendenti. L’azienda cinese ha definito il contributo di soggetti esterni «un pilastro fondamentale per costruire un’intelligenza artificiale migliore e più sicura» e ha fatto sapere di essere in contatto con Mindgard per esaminare quanto emerso.
Due modelli finiscono sotto esame
La vicenda riguarda la società cinese Moonshot, che sviluppa strumenti di intelligenza artificiale. Dopo le segnalazioni ricevute, il gruppo ha aperto un accertamento interno sul comportamento di due suoi sistemi molto utilizzati, Kimi K2.6 e K3 Swarm.
Secondo quanto riferito da Mindgard, entrambi i modelli sarebbero arrivati a fornire indicazioni su temi estremamente pericolosi, compresi la realizzazione di armi biologiche e l’organizzazione di omicidi. Le informazioni sono state raccolte nel corso di prove mirate a verificare la solidità delle protezioni integrate nei programmi.
Fai una domanda su questo articolo o sul suo argomento: l'AI risponde in modo pertinente.
I test hanno aggirato i blocchi
Mindgard, società specializzata nella valutazione della sicurezza dei sistemi di intelligenza artificiale, ha individuato il problema a luglio. I ricercatori hanno sottoposto i modelli a sequenze articolate di istruzioni, con l’obiettivo di capire se fosse possibile indurli a ignorare i divieti stabiliti dagli sviluppatori.
Questa tecnica di verifica, spesso indicata come aggiramento dei vincoli, avrebbe consentito ai due strumenti di superare le barriere previste per impedire discussioni e risposte su argomenti ritenuti pericolosi. Proprio la capacità di proseguire il dialogo anche dopo il superamento dei controlli ha spinto Mindgard a definire i risultati particolarmente preoccupanti.
Continua a leggere
Ripetizioni, la sorpresa dei prezzi: a distanza si paga di più
Uno studio su oltre 94.000 annunci fotografa tariffe, differenze territoriali e nuove richieste delle famiglie italiane
La medicina vuole battere il tempo: la partita ora è prevenire
Dai farmaci per l’obesità alla gestione del diabete, la sanità prova ad anticipare il rischio, ma diagnosi, accesso alle cure e organizzazione restano in ritardo.
Trump cambia nome all’IA e si affida ai colossi: cosa prevede la svolta
La Casa Bianca vuole sostituire il termine intelligenza artificiale con Super Intelligenza, mentre la regolazione del settore resta affidata soprattutto alle aziende.
La morte è incomprensibile»: il dolore di Amedeo Minghi per Fabio
Il cantautore ha parlato della scomparsa del nipote Fabio Ciprari Minghi e ha spiegato perché ha scelto di non partecipare più alle cerimonie funebri.