Säkerhetsforskare har identifierat AI-sandlådeflykter som påverkar fyra populära kodningsagenter: Codex CLI, Cursor, Gemini CLI och Google Antigravity.
Sårbarheterna kräver inte nödvändigtvis att en angripare bryter sig ut ur sandlådan direkt. I stället kan en AI-agent i sandlådan skriva en fil i projektets arbetsyta som senare läses eller körs av ett betrott verktyg på värdsystemet. Den interaktionen kan därefter leda till kodkörning utanför sandlådan.
Forskarna Eilon Cohen, Dan Lisichkin och Ariel Fogel från Pillar Security presenterade resultaten som en del av serien Week of Sandbox Escapes. De flesta av de rapporterade problemen har redan åtgärdats eller bekräftats av de berörda leverantörerna.
Så fungerar AI-sandlådeflykter
AI-kodningsagenter får normalt skapa och redigera filer i en projekts arbetsyta. Samtidigt körs operativsystemet, kodredigeraren och utvecklingsverktygen utanför agentens sandlåda.
Det skapar en säkerhetsrisk när betrodda verktyg på värdsystemet automatiskt behandlar filer som agenten kan ändra.
Ett utvecklingsverktyg kan exempelvis kontrollera en Python-tolk, köra en uppgift i arbetsytan, läsa en hook-konfiguration, analysera Git-metadata eller kommunicera med en lokal Docker-tjänst. Om en angripare lyckas få AI-agenten att skapa eller ändra en sådan fil kan det betrodda verktyget senare köra angriparkontrollerad kod.
Den första utlösaren kan vara indirekt promptinjektion. En skadlig instruktion kan döljas i en README-fil, ett programberoende, en pull request, ett ärende eller en kodändring. AI-agenten kan sedan följa instruktionen och göra en skadlig lokal ändring.
Pillar Security delade in resultaten i fyra huvudkategorier:
- Sandlådor som bygger på spärrlistor och inte tar hänsyn till operativsystemets beteende.
- Konfigurationsfiler i arbetsytan som kan fungera som körbar kod.
- Tillåtelselistor för kommandon som kontrollerar kommandonamn men ignorerar osäkra argument.
- Privilegierade lokala tjänster som AI-agenter kan nå utanför sandlådan.
Cursor-sårbarheter möjliggjorde kodkörning på värdsystemet
Forskarna identifierade tre separata sårbarheter i Cursor.
Den första rörde en .claude-hook-konfiguration som styrs från arbetsytan. En angripare kunde utnyttja den för att köra kommandon utanför sandlådan. Sårbarheten har beteckningen CVE-2026-48124 och åtgärdades i Cursor version 3.0.0.
Den andra sårbarheten gjorde det möjligt för en AI-agent att ändra en Python-tolk i en virtuell miljö. Cursors Python-tillägg kunde därefter automatiskt köra tolken när utvecklingsmiljön kontrollerades.
Den tredje sårbarheten utnyttjade Git-metadata som lagrades utanför den vanliga .git-mappen. Därigenom kunde angripare använda Gits fsmonitor-funktion och samtidigt kringgå Cursors sökvägsbaserade skydd. Problemet åtgärdades i version 3.0.0, medan ett CVE-nummer fortfarande väntar.
Codex CLI och delad Docker-socket
I Codex CLI upptäckte forskarna att en tillåtelselista klassade kommandot git show som säkert enbart utifrån dess namn. Kommandot kunde dock köras med argument som inte var skrivskyddade.
OpenAI åtgärdade problemet i Codex CLI version 0.95.0 och tilldelade en bug bounty med hög allvarlighetsgrad. Något CVE-nummer har ännu inte tilldelats.
Forskarna hittade också ett separat problem som påverkade Codex, Cursor och Gemini CLI. Agenterna kunde komma åt en Docker-socket som exponerades av en privilegierad lokal tjänst. Därmed skapades en väg för kodkörning utanför sandlådan. Leverantörerna har nu åtgärdat problemet.
Google nedgraderade Antigravity-rapporter
Pillar Security rapporterade dessutom två sårbarheter i Google Antigravity.
Den första gällde en metod för att kringgå macOS Seatbelt-baserade spärrlistor. Den andra utnyttjade en .vscode-uppgiftskonfiguration för att kringgå skyddet i Secure Mode.
Google klassade båda rapporterna som giltiga sårbarheter men sänkte deras allvarlighetsgrad. Företaget ansåg att de var svåra att utnyttja eftersom de bygger på social manipulation eller att en utvecklare öppnar ett projekt som innehåller indirekt promptinjektion.
Forskarna menar däremot att just denna förtroendegräns utgör den verkliga risken. En utvecklare kanske inte inser att en AI-agent kan ändra filer som betrodda lokala verktyg senare kör.
AI-sandlådeflykter är ett bredare säkerhetsproblem
Det underliggande problemet är inte nytt. Tidigare forskning har beskrivit konfigurationsbaserade sandlådeflykter i flera AI-kodningsverktyg, där filer som skapats i sandlådan senare kunde köras på värdsystemet.
De senaste resultaten visar att problemet påverkar flera produkter och leverantörer. För utvecklare är den avgörande frågan därför inte bara om en AI-kodningsagent använder en sandlåda.
Det viktiga är om de lokala verktygen kan hantera de filer som agenten skapar på ett säkert sätt.


0 svar till ”AI-sandlådeflykter drabbar Codex, Cursor och Gemini CLI”