Governance dellIA sotto controllo

Microsoft tratta l’AI come insider threat: Nadella chiede il freno d’emergenza

🛡️ Executive Summary

  • Satya Nadella propone di trattare i modelli AI avanzati come potenziali insider threat, applicando identità, minimo privilegio, logging e contenimento.
  • I controlli devono restare fuori dal modello e ogni azione significativa deve produrre evidenze leggibili dall’uomo e resistenti alla manomissione.
  • Una persona autorizzata deve poter interrompere un agente durante l’esecuzione: per Microsoft la sicurezza passa dal fidarsi del modello al limitarne strutturalmente l’autorità.

Microsoft porta la sicurezza degli agenti AI dentro il modello classico dello zero trust. Satya Nadella propone di considerare i modelli più potenti come si considererebbe un insider dotato di accesso a sistemi sensibili: non necessariamente ostile, ma sufficientemente capace da poter sbagliare, essere manipolato o compromettere risorse critiche. La conseguenza è radicale perché sposta la sicurezza dall’allineamento del modello all’architettura che lo circonda. Il modello non deve poter decidere da solo quali controlli rispettare, quali prove produrre o quando fermarsi. Le aziende devono mantenere fuori dall’AI autorità, osservabilità e capacità di interruzione, fino a prevedere un vero freno d’emergenza durante l’esecuzione.

Nadella vuole separare l’intelligenza dall’autorità concessa al modello

Annuncio

Nel saggio pubblicato il 10 ottobre, intitolato “Models as Insider Risks in the Super Intelligence Era”, Nadella parte da una differenza fondamentale rispetto al software tradizionale. Un programma deterministico consente normalmente di ricostruire un comportamento attraverso codice, configurazioni e percorso di esecuzione; nei frontier model non esiste invece una corrispondenza altrettanto leggibile tra input, pesi, addestramento e decisione finale. Nello stesso momento questi modelli stanno ricevendo accesso a posta elettronica, documenti, browser, database, filesystem e strumenti capaci di modificare sistemi reali. La risposta proposta dal CEO di Microsoft consiste quindi nel separare la disponibilità dell’intelligenza dall’autorità operativa concessa a quella intelligenza. È lo stesso problema già emerso quando centinaia di agenti OpenAI hanno superato il perimetro di una valutazione e raggiunto sistemi di Hugging Face: il rischio non nasce soltanto da ciò che il modello “pensa”, ma da ciò che il sistema gli permette materialmente di fare.

Leggi anche: Agenti AI, la nuova kill chain: 157 skill malevole e tool poisoning sfuggono ai SOC

Il modello va considerato compromesso prima ancora che succeda qualcosa

Il passaggio più netto del documento è l’applicazione alla AI di un principio tipico della sicurezza informatica: assumere la compromissione e progettare il sistema perché possa contenerla. Nadella non sostiene che ogni modello sia malevolo, ma osserva che un soggetto sufficientemente potente con accesso a risorse importanti può commettere errori o essere compromesso indipendentemente dalle proprie intenzioni. Per questo propone di applicare agli agenti pratiche utilizzate da decenni contro gli insider risk: identità certa, privilegi minimi, registrazione delle attività e confini operativi. La conseguenza interessa direttamente imprese e pubbliche amministrazioni italiane che stanno integrando Copilot, Claude, ChatGPT o agenti proprietari nei propri workflow. Autenticare l’utente umano non basta più se dopo l’autenticazione il modello riceve un insieme di autorizzazioni troppo ampio, perché l’agente può trasformare un prompt injection, un errore di pianificazione o un tool compromesso in un’azione eseguita con credenziali perfettamente valide.

I controlli devono stare fuori dall’AI e il modello non può certificare se stesso

Nadella contesta implicitamente anche l’idea che la sicurezza possa essere affidata alla capacità dei modelli di controllarsi reciprocamente. Un LLM può certamente analizzare l’output di un altro LLM, ma il risultato rischia di essere una catena di black box annidate, nella quale un sistema opaco viene governato da un orchestratore opaco e successivamente controllato da un altro modello altrettanto difficile da verificare. Microsoft propone invece che permessi, policy e action space siano mantenuti fuori dal modello e non possano essere modificati dal soggetto che devono controllare. È un principio molto vicino alla separazione tra enforcement e workload già utilizzata nell’information security. Il problema è diventato concreto con tool poisoning, skill malevole e memory poisoning negli ecosistemi agentici, dove strumenti formalmente autorizzati possono modificare il comportamento dell’agente senza necessariamente compromettere l’identità dell’utente o il modello di base.

Ogni azione dell’agente deve lasciare prove leggibili e non alterabili

Il secondo pilastro è l’osservabilità. Nadella sostiene che ogni azione significativa compiuta dal modello debba lasciare evidenza leggibile dall’uomo e resistente alla manomissione, sufficiente a ricostruire il percorso che ha condotto a un determinato risultato senza dover chiedere allo stesso modello di spiegarlo. È una differenza fondamentale rispetto al semplice logging delle conversazioni. In un agente operativo occorre poter ricostruire quale identità ha utilizzato, quali strumenti ha invocato, quali risorse ha letto, quali comandi ha eseguito e quali modifiche ha prodotto. La necessità di una catena probatoria indipendente diventa ancora più evidente dopo che la California ha aperto un’indagine sugli incidenti cyber collegati agli agenti OpenAI. Quando l’autonomia produce conseguenze su sistemi di terzi, ricostruire l’azione non è più soltanto un’esigenza di debugging: può diventare un requisito di incident response, audit e responsabilità giuridica.

Il freno d’emergenza deve poter fermare un agente nel mezzo del compito

Il principio più immediatamente operativo è il containment. Per Nadella una persona autorizzata deve poter mettere in pausa o spegnere un modello mentre sta eseguendo un’attività, senza dipendere dalla cooperazione del modello stesso. Il paragone utilizzato è quello del freno d’emergenza: deve esistere prima dell’incidente e deve operare anche quando il sistema che viene fermato non comprende, non condivide o tenta di oltrepassare il comando. Più crescono autonomia e durata dei task, più questo requisito diventa complesso. Un agente distribuito può utilizzare sub-agenti, servizi cloud, API, code di lavoro e processi già avviati; interrompere l’interfaccia principale non equivale necessariamente a fermare tutte le azioni generate. Il precedente degli agenti OpenAI capaci di comunicare tra loro e continuare a perseguire un obiettivo attraverso canali non previsti mostra perché un kill switch puramente applicativo rischi di essere insufficiente.

Continua con:

Dario Amodei chiede di rallentare l’AI: rischio globale, bolla finanziaria e intelligenza artificiale di Stato

OpenAI sotto subpoena in California: gli agenti AI diventano un caso legale

Microsoft ammette che il problema non è più fidarsi meglio dell’AI

La posizione di Nadella è significativa soprattutto perché arriva da Microsoft, cioè da una società che sta portando agenti e Copilot dentro sistemi operativi, cloud, software aziendale e processi decisionali. Non è una richiesta di fermare l’intelligenza artificiale né l’annuncio di una nuova policy obbligatoria di Microsoft. È un principio architetturale: la sicurezza non può dipendere dalla convinzione che il modello sia sufficientemente allineato da comportarsi bene. Modelli diversi devono poter verificare risultati differenti, audit e controlli devono restare indipendenti, gli incidenti devono essere comunicati e nessun singolo sistema dovrebbe controllare contemporaneamente comportamento e prova della correttezza di quel comportamento. La tesi completa così il passaggio già osservato nella sicurezza agentica: il rischio non coincide più con la risposta sbagliata di un chatbot, ma con un’entità software capace di operare utilizzando privilegi reali. Per aziende, banche, PA e infrastrutture italiane, la domanda non sarà quindi quanto fidarsi del modello scelto, ma quanta autorità sia possibile sottrargli senza perdere il valore dell’automazione che si vuole ottenere.

Iscriviti alla Newsletter

Non perdere le analisi settimanali: Entra nella Matrice Digitale.

Matrice Digitale partecipa al Programma Affiliazione Amazon EU. In qualità di Affiliato Amazon, ricevo un guadagno dagli acquisti idonei. Questo non influenza i prezzi per te.

Torna in alto