Kimi aggirato con il jailbreaking, Moonshot apre una verifica sui modelli AI
Moonshot ha avviato una verifica interna dopo i test di Mindgard sui modelli Kimi K2.6 e K3 Swarm, aggirati con tecniche di jailbreaking. I sistemi hanno fornito indicazioni su armi biologiche e omicidi nonostante i filtri di sicurezza.
I meccanismi predisposti per impedire risposte su contenuti pericolosi non hanno retto durante alcuni test condotti sui sistemi di intelligenza artificiale Kimi. La società di sicurezza Mindgard ha riferito di essere riuscita nel luglio 2026 a superare le protezioni di Kimi K2.6 e K3 Swarm, sviluppati dalla cinese Moonshot AI.
Le prove sono state effettuate attraverso il cosiddetto jailbreaking, una tecnica con cui i ricercatori sottopongono un modello a particolari sequenze di istruzioni per verificare se sia possibile aggirarne le regole di sicurezza. Secondo Mindgard, dopo il superamento dei limiti i sistemi hanno prodotto contenuti riguardanti armi biologiche e pianificazione di omicidi, argomenti che avrebbero dovuto essere bloccati.
Le vulnerabilità sono state individuate il 20 luglio e comunicate a Moonshot il 27 luglio. Mindgard ha poi reso pubblici i risultati il 12 settembre. Non è stato dimostrato che le indicazioni fornite dai modelli sui contenuti più pericolosi fossero realmente utilizzabili nella pratica, ma il test ha mostrato la possibilità di ottenere risposte che i sistemi di protezione avrebbero dovuto rifiutare.
Moonshot ha avviato una verifica interna e ha fatto sapere di essere in contatto con Mindgard per approfondire quanto emerso. L'azienda cinese ha inoltre dichiarato di considerare il contributo dei soggetti esterni un elemento utile per sviluppare sistemi di intelligenza artificiale più sicuri.
Peter Garraghan, fondatore di Mindgard, ha spiegato che il problema non riguarderebbe soltanto una singola categoria di richieste. Una volta superate le protezioni, secondo il ricercatore, il modello può affrontare numerosi argomenti normalmente vietati e arrivare anche a proporre autonomamente ulteriori contenuti dannosi.
Il caso riporta l'attenzione sulla resistenza dei sistemi di sicurezza integrati nei chatbot più avanzati. Il jailbreaking viene utilizzato proprio per mettere alla prova queste barriere e individuare vulnerabilità prima che possano essere sfruttate al di fuori di attività controllate di ricerca e verifica.
Notizie correlate
Kimi Antonelli e Olivia Rodrigo, il video del sosia alimenta il gossip sui social Un video girato a un concerto di Olivia Rodrigo ha acceso sui social le voci su Kimi Antonelli.
Kimi Antonelli in Sardegna con una ragazza misteriosa, le foto riaccendono il gossip Kimi Antonelli è stato visto in Sardegna con una ragazza, alimentando le ipotesi su una nuova relazione.