🛡️ Executive Summary
- Nvidia introduce OpenShell e Sentry per applicare controlli agli agenti fuori dal modello e arrivare fino alla quarantena hardware.
- Il caso Meta Muse mostra quanto diventi delicata la distinzione tra permesso concesso, accesso effettivo e spiegazione fornita dall’agente.
- La sicurezza agentica si sposta verso runtime, identità, policy e telemetria indipendenti dal processo che esegue il modello.
La sicurezza degli agenti AI sta cambiando livello. Nvidia ha presentato Open Agent Safety Platform, un’architettura che sposta parte dell’enforcement fuori dal modello e dal processo dell’agente, mentre il caso di Meta Muse riapre contemporaneamente il problema opposto: stabilire con precisione quali informazioni un agente possa leggere, sulla base di quali autorizzazioni e con quale capacità di spiegare successivamente ciò che ha fatto. I due sviluppi non dimostrano lo stesso problema tecnico, ma convergono sul medesimo punto architetturale. Più un agente riceve accesso a file, messaggi, browser, API e applicazioni, meno è sufficiente affidare la sicurezza alle istruzioni del modello. Il nuovo perimetro diventa l’intera catena che separa intenzione, permesso e azione.
Cosa leggere
Nvidia mette il confine di sicurezza fuori dal processo dell’agente
Nvidia ha annunciato il 28 settembre Open Agent Safety Platform, composta dal runtime open source OpenShell e dal reference design Sentry. Nella presentazione ufficiale di Nvidia Open Agent Safety Platform l’azienda descrive OpenShell come un confine di runtime che controlla ciò che l’agente può vedere, utilizzare e raggiungere, applicando policy indipendentemente dal comportamento del modello. Sentry aggiunge un livello ancora più esterno: un watchdog eseguito sulle DPU BlueField-4, separato dal processo dell’agente, che osserva l’attività e può bloccare o mettere in quarantena un agente quando tenta di oltrepassare i limiti previsti. Nvidia afferma che l’intervento può avvenire nell’ordine dei millisecondi e che l’enforcement viene effettuato in silicon, da un dominio di fiducia fuori banda che il processo controllato non dovrebbe poter modificare. Il principio è più importante del prodotto specifico. OpenShell adotta una logica deny-by-default, esegue gli agenti in sandbox isolate, limita filesystem e rete e convoglia le richieste attraverso un canale controllato. Il runtime OpenShell descritto da Nvidia separa quindi il ragionamento dell’agente dall’autorità con cui quell’agente può interagire con l’ambiente. È una risposta diretta a una debolezza già evidente nella nuova kill chain degli agenti AI, tra tool poisoning e skill malevole: un agente può eseguire un’azione tecnicamente legittima con credenziali valide e strumenti autorizzati, ma farlo per una ragione sbagliata perché il contesto è stato manipolato. Nvidia prova a spostare quindi parte della fiducia dal modello a un livello che il modello non può convincere, riscrivere o aggirare attraverso una semplice istruzione.
Leggi anche: OpenAI Codex evade la sandbox: due falle portano i comandi direttamente sull’host
Meta Muse mostra quanto sia fragile il confine tra permesso e contesto
Il secondo sviluppo riguarda una contestazione molto diversa e va trattato con particolare precisione. Il giornalista Jason Aten ha raccontato in prima persona che Muse, installato sul proprio iPhone e su un Mac mini, gli avrebbe suggerito un’idea per un articolo facendo riferimento a una conversazione privata avuta tramite Messaggi e a una comunicazione del proprio editor. Nel resoconto originale pubblicato da Jason Aten su Inc. Aten sostiene di ricordare di avere negato a Muse l’accesso ai messaggi e ad altri dati personali e racconta di essersi quindi chiesto attraverso quale percorso l’agente avesse ottenuto quel contesto. Si tratta di una testimonianza individuale, non della prova che Muse acceda sistematicamente ai messaggi senza autorizzazione, e proprio questa distinzione è centrale.

Meta contesta infatti l’interpretazione secondo cui Muse possa leggere Messaggi senza i permessi necessari. Andy Stone, vicepresidente della comunicazione dell’azienda, ha dichiarato pubblicamente che l’integrazione su Mac è opt-in e richiede sia Full Disk Access sia l’abilitazione del connettore Messaggi. Il punto che rimane aperto nel caso descritto da Aten non è quindi dimostrare un comportamento generale del prodotto, ma ricostruire quale percorso abbia portato l’agente a conoscere informazioni che il giornalista riteneva escluse. Questo aspetto pesa ancora di più perché Muse era stato presentato con una Secure VM dedicata, permessi granulari e controlli separati: la trasformazione di Muse in agente capace di usare browser, email e pagamenti aveva già spostato la questione della privacy dalla semplice raccolta dei dati alla capacità concreta di utilizzarli per compiere azioni.
Il problema degli agenti non è soltanto impedire il jailbreak
Nvidia e Meta arrivano allo stesso nodo da due direzioni opposte. Nvidia assume esplicitamente che un agente possa comportarsi in modo inatteso e costruisce un livello esterno che continua ad applicare regole anche quando il modello decide diversamente. Il caso Muse mostra invece quanto diventi difficile per l’utente verificare la corrispondenza tra autorizzazione percepita, autorizzazione effettiva e comportamento osservato. È una differenza importante rispetto alla sicurezza dei chatbot. Un chatbot compromesso o confuso può produrre una risposta errata; un agente dotato di tool può leggere un file, consultare un database, usare un browser, inviare una richiesta o modificare uno stato esterno. È la stessa trasformazione che rende gli agenti always-on di OpenAI dipendenti da permessi, computer cloud e servizi collegati: quando il software continua a operare senza una nuova richiesta per ogni passaggio, l’autorità concessa diventa una componente del rischio. Nvidia formalizza questa separazione attraverso OpenShell e Sentry. Il primo governa accesso e runtime; il secondo introduce un controllo indipendente dal processo principale, capace di osservare identità, richieste, risposte e accesso a strumenti attraverso DOCA e BlueField-4. La piattaforma è inoltre progettata per funzionare con modelli e harness differenti e Nvidia dichiara che OpenShell può essere esteso anche a piattaforme Arm e Intel. Questo dettaglio evita di ridurre il progetto a una semplice funzione proprietaria dei sistemi Vera: l’ambizione è trasformare l’enforcement degli agenti in uno strato infrastrutturale, analogo a ciò che sandbox, hypervisor e Zero Trust hanno fatto in altri livelli dello stack.
Continua con: Meta Muse entra negli occhiali e nelle aziende: la privacy diventa un problema di accesso · Meta Muse supera ChatGPT su iPhone: gli agenti AI diventano app di massa
La sicurezza agentica diventa sicurezza dell’autorità concessa
La conseguenza più importante è che la sicurezza degli agenti non può più coincidere con la sicurezza del modello. Alignment, filtri e istruzioni di sistema continuano a servire, ma operano nello stesso ambiente logico che deve prendere decisioni, interpretare contesto e scegliere quali tool utilizzare. Se un attacco, un errore o una cattiva interpretazione riescono a modificare quella decisione, serve un secondo livello capace di dire comunque no. Nvidia sta trasformando questa idea in infrastruttura, spostando policy e quarantena nel runtime e nell’hardware. Il caso Muse, invece, mostra il lato consumer dello stesso problema: quando l’agente entra nei messaggi, nel calendario e nei servizi personali, il permesso stesso diventa un dato di sicurezza, perché deve essere comprensibile all’utente, verificabile dal sistema e osservabile dopo l’azione. Il nuovo modello difensivo sarà quindi meno interessato a chiedere se l’agente “si comporta bene” e molto più interessato a stabilire cosa può materialmente fare anche quando si comporta male. È questo il passaggio che rende runtime isolation, audit, policy granulari e controlli fuori banda elementi centrali dell’AI agentica. Più l’agente assume il ruolo di intermediario permanente tra utente e sistemi digitali, più il confine decisivo non sarà quello tra modello sicuro e modello insicuro, ma quello tra un agente che possiede un’autorità limitata e uno che dispone di abbastanza privilegi da trasformare un errore di contesto in un’azione reale.
Iscriviti alla Newsletter
Non perdere le analisi settimanali: Entra nella Matrice Digitale.
Matrice Digitale partecipa al Programma Affiliazione Amazon EU. In qualità di Affiliato Amazon, ricevo un guadagno dagli acquisti idonei. Questo non influenza i prezzi per te.









