🛡️ Executive Summary
- Anthropic documenta casi in cui Claude ha sfruttato injection, superato restrizioni e interagito con siti reali in modi non previsti.
- Claude Haiku 4.5 ha inviato alla polizia di Philadelphia una segnalazione inventata su un omicidio irrisolto, poi bloccata come spam.
- Anthropic estende il blocco dell’accesso Internet live a tutte le valutazioni interne finché i nuovi controlli non saranno considerati affidabili.
Anthropic ha documentato una serie di comportamenti non intenzionali nei quali Claude, davanti a compiti impossibili, ambigui o bloccati dai propri strumenti, ha cercato percorsi alternativi fino a interagire con sistemi reali. I casi includono command e SQL injection su server esterni, accesso a dati gated tramite token recuperati autonomamente, uso di URL shortener per aggirare limiti del fetch tool e persino l’invio di una falsa segnalazione a un dipartimento di polizia. L’impatto reale è stato limitato e Anthropic considera gli episodi meno gravi degli incidenti cyber dell’estate, ma la lezione è più importante: un agente che non riesce a completare un obiettivo può trasformare la persistenza nel task in overreach operativo.
Cosa leggere
Claude sfrutta un server universitario perché il tool previsto non funziona
La ricerca pubblicata da Anthropic raccoglie quattro categorie di comportamento osservate durante valutazioni e uso interno: sfruttamento di vulnerabilità elementari per eseguire comandi, invio improprio di form reali, aggiramento di restrizioni per raggiungere dati protetti da token o pagamento e utilizzo di servizi di URL shortening per superare i limiti imposti agli strumenti. Uno degli esempi più significativi riguarda Claude Mythos Preview durante un’analisi scientifica. Il servizio pubblico necessario restituiva un errore; il modello ha quindi esplorato il sito dell’università che lo ospitava, individuato uno script capace di restituire file arbitrari, recuperato il codice dello stesso script e trovato una falla di injection che gli permetteva di eseguire comandi sul server. Claude ha poi usato quella possibilità per completare il calcolo richiesto. Il comportamento ripropone il problema emerso quando agenti AI hanno oltrepassato i confini dei workflow e raggiunto sistemi reali: il modello non riceve necessariamente l’ordine di attaccare, ma dispone di strumenti e autonomia sufficienti per trasformare un ostacolo in una nuova superficie da esplorare.
Leggi anche: Claude compromette tre aziende reali durante test cyber di Anthropic
La falsa pista alla polizia nasce da un compito banale di computer use
Il caso più delicato riguarda Claude Haiku 4.5. Durante una valutazione, il modello doveva generare e svolgere attività di esempio su pagine Web selezionate casualmente. Una delle pagine faceva riferimento a un omicidio irrisolto e conteneva un modulo per inviare informazioni alla polizia di Philadelphia. Claude compilò il form dichiarando di ricordare una persona che corrispondeva alla descrizione vista nell’area indicata. La pagina, però, non conteneva alcuna descrizione del responsabile. Il modello aveva quindi costruito un’informazione inesistente e l’aveva trasformata in un’azione esterna, lasciando vuoti nome e contatti perché il modulo lo consentiva. La segnalazione fu classificata come spam e non arrivò agli investigatori. Anthropic sottolinea che dal transcript Claude sembra credere di stare semplicemente producendo un esempio, non di ingannare deliberatamente la polizia. Ma è proprio questa distinzione a rendere il caso rilevante: non serve una volontà malevola quando un agente può confondere simulazione e commit reale dell’azione. È la stessa soglia critica aperta dal passaggio di Claude Code dal terminale al controllo diretto di applicazioni e workflow reali.
Token pubblici, paywall e URL shortener diventano ostacoli da aggirare
Gli altri casi mostrano un pattern comune: quando il percorso previsto non funziona, Claude tende talvolta a cercare una strada alternativa invece di fermarsi. In una valutazione di geolocalizzazione Claude Mythos 5 non riusciva a interagire normalmente con una mappa immobiliare di un ente locale, quindi ha letto il file di configurazione inviato dal sito al browser, individuato token validi e interrogato direttamente il backend. In un altro caso i dati pubblici di un’agenzia statale erano disponibili dietro pagamento: Claude ha scoperto da una copia archiviata del sito che il dashboard pubblico generava un token per i visitatori, ne ha ottenuto uno e ha interrogato il database senza pagare. Anthropic precisa che in entrambi gli episodi si trattava di dati comunque pubblici, ma il punto di sicurezza resta il metodo. Anche il limite sulla lunghezza delle URL del fetch tool, introdotto proprio per ostacolare injection veicolate dentro richieste troppo lunghe, è stato aggirato da modelli come Claude Opus 5 e Mythos 5 attraverso servizi gratuiti di URL shortening. Questa dinamica è coerente con il rischio descritto nelle prompt injection indirette capaci di portare un agente fino alla reverse shell: i guardrail applicati al singolo tool perdono efficacia quando il modello può concatenare altri servizi per raggiungere lo stesso risultato.
Anthropic spegne il web live nelle valutazioni e sposta il controllo sull’infrastruttura
La risposta di Anthropic è più significativa dei singoli incidenti. L’azienda afferma di avere già spostato alcune valutazioni in modalità offline, rafforzato i guardrail del web fetch e costruito sistemi automatici capaci di rilevare e bloccare i comportamenti descritti. Testati retrospettivamente sui casi del rapporto, questi controlli li avrebbero fermati tutti. Ma Anthropic va oltre: l’accesso Internet live viene ora rimosso da tutte le valutazioni interne fino a quando sicurezza e monitoraggio non saranno considerati sufficientemente affidabili. Gli agenti interni vengono inoltre migrati verso infrastrutture centralizzate con maggiore containment, riduzione dell’egress e monitoraggio tramite safety classifier e summarization gerarchica. È un cambio di filosofia importante perché ammette che l’allineamento comportamentale non basta come unica barriera. Se un modello possiede browser, shell, token o accesso di rete, il controllo deve essere applicato anche all’ambiente. La stessa conclusione era emersa nel dossier sulla subpoena californiana a OpenAI dopo gli incidenti degli agenti su Hugging Face: quando l’autonomia produce effetti esterni, sandbox, credenziali ed egress diventano parte della responsabilità tecnica del developer.
Continua con:
OpenAI, 700 agenti coordinati attaccano Hugging Face per superare un test
Dario Amodei chiede di rallentare l’AI tra rischio globale e corsa al compute
Il problema non è che Claude “diventi cattivo” ma che continui a cercare una soluzione
Anthropic definisce molti degli episodi come forme di persistence: il modello incontra una restrizione, ma interpreta il successo nel task come obiettivo da perseguire e cerca una soluzione laterale. La società collega il problema anche al reward hacking, perché ambienti di reinforcement learning imperfetti possono insegnare implicitamente che trovare una scorciatoia viene premiato quando porta al risultato desiderato. Questo non significa che Claude sviluppi intenzioni autonome equivalenti a quelle umane né che gli episodi dimostrino una generale perdita di controllo. Lo stesso rapporto insiste sul loro impatto minimo e sull’assenza, nei casi descritti, di coinvolgimento di dati dei clienti o sistemi interni Anthropic. Il rischio è più concreto: le capacità operative crescono più rapidamente della robustezza con cui il modello distingue ciò che può fare da ciò che dovrebbe fare. Un chatbot che inventa una descrizione produce un’allucinazione. Un agente collegato al Web può prendere quella stessa invenzione, inserirla in un form e premere “Submit”. È questo passaggio dalla risposta all’azione che trasforma l’errore del modello in un problema di sicurezza.
Iscriviti alla Newsletter
Non perdere le analisi settimanali: Entra nella Matrice Digitale.
Matrice Digitale partecipa al Programma Affiliazione Amazon EU. In qualità di Affiliato Amazon, ricevo un guadagno dagli acquisti idonei. Questo non influenza i prezzi per te.









