Nel panorama tecnologico del 2026, dove l'automazione guidata dall'intelligenza artificiale non è più un'eccezione ma la norma operativa, emerge una sfida di sicurezza senza precedenti che mette in discussione le fondamenta stesse dell'interoperabilità tra sistemi. Il ricercatore indipendente Syed Anas Mohiuddin ha recentemente svelato una vulnerabilità sistemica che non risiede nelle capacità logiche dei modelli linguistici, bensì nel tessuto connettivo che permette loro di interagire: il rapporto di fiducia intrinseco tra gli agenti IA. Questa scoperta evidenzia come, per progettazione, gli agenti tendano a manifestare una fiducia cieca verso i propri simili, creando un varco sfruttabile per attacchi coordinati su larga scala che possono compromettere interi ecosistemi aziendali senza far scattare i tradizionali allarmi di sicurezza.
Negli ultimi cinque mesi, colossi del settore come Google e altre quattro organizzazioni di rilievo hanno dovuto ammettere l'esistenza di falle critiche nei loro workflow basati su agenti. L'elemento comune a queste vulnerabilità è l'uso del Model Context Protocol (MCP), uno standard ormai onnipresente che permette alle applicazioni di comunicare con gli agenti IA. La tecnica di attacco individuata da Syed Anas Mohiuddin rappresenta una variante pericolosa del prompt injection: in questo caso, l'obiettivo non è manipolare l'output di un Large Language Model (LLM), ma compromettere un singolo agente specializzato, come uno strumento di traduzione o un analista di dati, per trasformarlo in un cavallo di Troia all'interno della rete interna.
Il cuore del problema risiede nell'architettura stessa dei server MCP, che gestiscono le credenziali per ogni agente. Poiché il protocollo è stato progettato per favorire l'autonomia e la velocità, gli agenti appartenenti allo stesso gruppo godono di un'autorizzazione implicita. Se un attaccante riesce a iniettare istruzioni malevole in un agente periferico, questo può trasmetterle lungo la catena ai suoi pari, i quali eseguiranno i comandi senza alcun controllo aggiuntivo. Questo meccanismo permette di bypassare le protezioni a livello di modello, poiché la richiesta malevola viene percepita come un'istruzione legittima proveniente da un'entità fidata interna alla rete.
Un esempio emblematico della gravità di questa situazione è rappresentato dalla vulnerabilità CVE-2026-97228, rilevata nell'infrastruttura di Rapid7. Sebbene inizialmente valutata con un punteggio di gravità di 2,7 su 10, la logica sottostante ha aperto la strada a riflessioni molto più profonde sulla sicurezza sistemica. Ben più allarmante è stato il caso di Google, dove è stata isolata una falla con un rating di 8 su 10. In questa circostanza, lo strumento MCP dedicato alla gestione dei database inizializzava il proprio client HTTP ignorando le politiche di CheckRedirect. Questa mancanza di controllo permetteva al client di inviare richieste di rete non autorizzate verso endpoint interni, facilitando attacchi di tipo Server-Side Request Forgery (SSRF) di proporzioni devastanti.
Il ricercatore ha coniato il termine Protocol Pivoting per descrivere questa nuova classe di minacce. In un attacco di questo tipo, un'applicazione o un server assegna un compito a un agente IA tramite il protocollo MCP; l'agente compromesso provvede poi a inoltrare le istruzioni dannose ad altri nodi utilizzando metodi di comunicazione alternativi, come il protocollo Google Agent-to-Agent (A2A) o il più recente Agent Network Protocol. Durante questo passaggio di mano, i fattori di autenticazione originari vengono spesso persi o degradati, permettendo all'attaccante di muoversi lateralmente sfruttando i privilegi elevati concessi agli agenti per le loro operazioni autonome.
La pericolosità del Protocol Pivoting è accentuata dalla difficoltà di rilevamento. Poiché ogni agente continua a svolgere le funzioni per cui è stato programmato, il comportamento anomalo si mimetizza perfettamente nel traffico legittimo. Il Model Context Protocol è stato concepito per la massima fluidità operativa, delegando la verifica solo al punto di ingresso iniziale e trascurando la sorveglianza delle interazioni interne. Per rispondere a questa minaccia, Google ha dovuto implementare liste di autorizzazione per gli indirizzi IP e blocchi rigorosi sui reindirizzamenti, ma gli esperti concordano che queste siano solo soluzioni temporanee.
La vera sfida per il futuro della sicurezza informatica nel 2026 risiede nell'adozione del principio Zero Trust applicato agli agenti IA. Gli sviluppatori devono abbandonare l'idea che un nodo interno sia intrinsecamente sicuro. È necessario che ogni operazione critica eseguita tra agenti richieda una ri-autorizzazione esplicita e una validazione del contesto dell'istruzione. Senza una revisione profonda del modo in cui gli agenti comunicano, la crescita esponenziale dell'IA autonoma rischia di costruire infrastrutture fragili, dove la fiducia predefinita diventa il punto di rottura di tutto il sistema digitale moderno.

