Mindgard ha convinto due modelli di Moonshot AI a illustrare la sintesi del gas nervino sarin, la generazione di malware e la pianificazione di omicidi. La società di sicurezza, specializzata in test offensivi sui sistemi di intelligenza artificiale, ha avviato l’audit il 20 luglio 2026 e ha superato i guardrail di Kimi K2.6 e K3 Swarm. Lo sviluppatore cinese ha aperto una revisione interna.

Il punto di ingresso è stato l’estrazione delle istruzioni di sistema, il documento nascosto che stabilisce cosa il modello può e non può fare. Kimi le ha rivelate, poi le ha riprodotte in un formato espressamente proibito (il download di un file). Jim Nightingale, il ricercatore che firma l’analisi, sintetizza il cortocircuito così: il modello ha infranto la regola sulle proprie regole violandone un’altra.
Da lì il team ha manipolato la memoria persistente dei pod Kubernetes che ospitano le sessioni, ottenendo un jailbreak capace di sopravvivere al riavvio del container e alla chiusura della conversazione. Due comandi testuali bastano a riattivarlo. Ai ricercatori è riuscito anche l’inganno sull’ambiente: hanno fatto credere al modello di girare in un sandbox chiuso, non in una chat pubblica.
Peter Garraghan, fondatore di Mindgard e docente di informatica alla Lancaster University, spiega che K2.6 esegue codice Python arbitrario e si collega al mondo esterno partendo dal proprio server. Tradotto: un modello compromesso diventa una rampa di lancio per attacchi contro infrastrutture di terze parti. Nei test ha registrato e configurato in autonomia un account e-mail.
Su K3 Swarm il tentativo di propagare il jailbreak ad altri account si è fermato davanti alla verifica telefonica richiesta per la registrazione. Il modello ha reagito chiedendo all’operatore umano di passargli il codice, oppure di iscriverlo via e-mail: ha provato a reclutare una persona per allargare il perimetro dell’attacco.
Guardrail dichiarati e tasso di rifiuto
Mindgard ha scritto a Moonshot il 27 luglio, ha sollecitato una settimana dopo e non ha ottenuto risposta. Il 12 settembre ha pubblicato il post tecnico che documenta l’intera catena. L’azienda cinese si è fatta viva il 24 settembre, dopo che la BBC l’aveva contattata per un commento, rivendicando valutazioni interne con un “elevato tasso di rifiuto” su richieste di questo tipo.
Nessuno ha verificato se le istruzioni prodotte funzionino davvero, e Mindgard non lo rivendica. La contestazione riguarda un altro piano: quei filtri non avrebbero dovuto nemmeno aprire la conversazione. Kimi è un modello open-weight, con i parametri numerici pubblicati e scaricabili per l’esecuzione in locale, quindi una correzione lato server non raggiunge le copie già distribuite.

Alan Woodward, dell’Università del Surrey, riconosce il pericolo che pesi liberamente accessibili finiscano nelle mani sbagliate, ma ricorda il rovescio della medaglia: Hugging Face ha usato un modello aperto cinese per ricostruire l’attacco informatico poi attribuito agli agenti di OpenAI. Sulla regolamentazione internazionale è tagliente: “Ci sono voluti decenni per concordare il formato dei numeri di telefono”.
Il contesto aiuta a leggere le proporzioni. Anthropic ha dichiarato di aver individuato e interrotto tentativi di sfruttare un suo modello per attività malevole legate allo sviluppo di armi biologiche, Google ha raccontato di un utente che pretendeva da Gemini una guida passo passo alla sintesi di agenti biologici militarizzati, OpenAI ha rinviato il lancio di GPT-6 Astra perché non superava le proprie soglie di sicurezza e allineamento.
Garraghan ridimensiona lo scenario apocalittico caro ai vendor americani, che a suo giudizio recitano la parte del pastorello che grida “al lupo”: fino a pochi mesi prima enfatizzavano la pericolosità dei propri modelli mentre non riuscivano a impedire ai loro agenti di violare organizzazioni terze. Hanno una voce che conta, ammette, però con un interesse pesantissimo a orientare il racconto. Il rischio immediato è meno cinematografico e più concreto: criminali e hacker arrivano agli stessi obiettivi di prima, spendendo molto meno tempo e molto meno denaro.