Il modello di IA si è presentato come qualcuno in possesso di informazioni sul caso irrisolto.
Un modello di intelligenza artificiale sviluppato da Anthropic ha inviato una soffiata falsificata sull’omicidio irrisolto alla polizia di Philadelphia, hanno dichiarato venerdì le autorità, criticando l’azienda per aver impiegato due mesi a segnalare l’incidente.
Il Philadelphia Police Department ha dichiarato che la falsa segnalazione è stata inviata a luglio tramite PhillyUnsolvedMurders.com, un sito pubblico dove le persone possono condividere informazioni su omicidi irrisolti.
Secondo la versione di Anthropic, riportata dalla polizia, il modello stava eseguendo un test che prevedeva l’interazione con siti web selezionati a caso quando ha raggiunto il sito e ha presentato informazioni false su un omicidio irrisolto.
Il modello di IA si è presentato come qualcuno in possesso di informazioni sul caso.
L’episodio ricorda altri recenti casi di comportamento non intenzionale da parte di modelli di IA, incluso uno in cui un agente di OpenAI sottoposto a una valutazione di sicurezza è uscito dal proprio ambiente di test e ha violato i sistemi della piattaforma di IA Hugging Face.
Le violazioni di Anthropic hanno spinto la Casa Bianca a imporre alle aziende di IA di notificare e correggere gli incidenti di sicurezza, ha riportato la testata Axios, citando funzionari dell’amministrazione.
“Questo processo di notifica e correzione non è opzionale… È un obbligo critico per la sicurezza nazionale”, hanno dichiarato ad Axios i dirigenti della White House Super Intelligence Force.
L’episodio ha accresciuto le preoccupazioni sull’uso crescente, da parte del settore, di agenti di IA, sistemi programmati per compiere azioni articolate in più fasi senza supervisione umana.
Anthropic ha pubblicato venerdì un rapporto che illustra diversi tipi di azioni “non intenzionali” compiute dai propri modelli, incluso l’episodio relativo al sito del Philadelphia Police Department.
Tra le altre organizzazioni coinvolte figurano la Casa Bianca e altre agenzie governative statunitensi, si legge nel rapporto.
Gli episodi appena rivelati “hanno avuto un impatto minimo nel mondo reale” e sono stati “significativamente meno gravi” rispetto ad altri incidenti di cybersicurezza riportati in precedenza, ha affermato Anthropic.
Un ritardo “inaccettabile”
L’azienda ha individuato quattro categorie di incidenti riscontrate durante una revisione interna del proprio modello Claude: lo sfruttamento di falle di programmazione “di base”, l’invio di moduli su siti web, l’elusione di requisiti relativi a token o commissioni, e l’uso di URL abbreviati per superare altri limiti.
Anthropic ha disattivato per il momento l’accesso a internet per Claude durante tutti i test interni “finché non avremo confermato che le nostre misure di sicurezza e monitoraggio… rilevano in modo affidabile comportamenti come questi”, si legge nel rapporto.
La polizia di Philadelphia ha dichiarato che la falsa soffiata, datata 18 luglio, è stata segnalata come spam e non è mai arrivata al Real-Time Crime Centre del dipartimento per essere verificata.
Ha inoltre precisato che non vi è alcun segno che i sistemi della polizia siano stati violati o che i dati del dipartimento siano stati compromessi.
Anthropic ha scoperto l’incidente il 28 settembre, ha interrotto il processo di test automatizzato responsabile e ha introdotto una nuova fase di validazione per i test futuri, ha riferito la polizia.
L’azienda ha avvisato il dipartimento il 7 ottobre, e le due parti si sono incontrate il giorno successivo.
“Il ritardo di due mesi nel rilevare e segnalare l’incidente alla città è inaccettabile”, ha dichiarato il dipartimento.
La polizia ha affermato che le proprie misure di sicurezza hanno limitato l’impatto, ma che queste “non riducono la gravità del fatto che un sistema di IA presenti informazioni fabbricate come se provenissero da una persona in possesso di informazioni su un omicidio.”
“I casi irrisolti coinvolgono vittime reali, famiglie in lutto e investigatori impegnati a trovare risposte”, si legge ancora nella nota.
Fonte: Times of Malta: https://timesofmalta.com/article/anthropic-ai-model-sent-fake-murder-tip-philadelphia-police.1135390
Immagine generata con AI – Gazzetta di Malta