Sikkerhetsforskere har identifisert AI-sandkasseflukter som påvirker fire mye brukte kodeagenter: Codex CLI, Cursor, Gemini CLI og Google Antigravity.
Sårbarhetene krever ikke nødvendigvis at en angriper bryter ut av sandkassen direkte. I stedet kan en AI-agent i sandkassen skrive en fil i prosjektets arbeidsområde som senere leses eller kjøres av et betrodd verktøy på vertssystemet. Denne samhandlingen kan deretter føre til kodekjøring utenfor sandkassen.
Forskerne Eilon Cohen, Dan Lisichkin og Ariel Fogel fra Pillar Security offentliggjorde funnene som en del av serien Week of Sandbox Escapes. De fleste av de rapporterte problemene er allerede rettet eller bekreftet av de berørte leverandørene.
Slik fungerer AI-sandkasseflukter
AI-kodeagenter har vanligvis tillatelse til å opprette og redigere filer i et prosjekts arbeidsområde. Samtidig kjører operativsystemet, kodeeditoren og utviklingsverktøyene utenfor agentens sandkasse.
Dette skaper en sikkerhetsrisiko når betrodde verktøy på vertssystemet automatisk behandler filer som agenten kan endre.
Et utviklingsverktøy kan for eksempel kontrollere en Python-fortolker, kjøre en oppgave i arbeidsområdet, laste inn en hook-konfigurasjon, analysere Git-metadata eller kommunisere med en lokal Docker-tjeneste. Dersom en angriper får AI-agenten til å opprette eller endre en slik fil, kan det betrodde verktøyet senere kjøre kode kontrollert av angriperen.
Den første utløsende hendelsen kan være indirekte promptinjeksjon. En ondsinnet instruksjon kan skjules i en README-fil, en programvareavhengighet, en pull request, en sak eller en kodeendring. AI-agenten kan deretter følge instruksjonen og gjøre en skadelig lokal endring.
Pillar Security delte funnene inn i fire hovedkategorier:
- Sandkasser basert på blokkeringslister som ikke tar hensyn til operativsystemets oppførsel.
- Konfigurasjonsfiler i arbeidsområdet som kan fungere som kjørbar kode.
- Tillatelseslister for kommandoer som kontrollerer kommandonavnet, men overser usikre argumenter.
- Privilegerte lokale tjenester som AI-agenter kan få tilgang til utenfor sandkassen.
Cursor-sårbarheter muliggjorde kodekjøring på vertssystemet
Forskerne fant tre separate sårbarheter i Cursor.
Den første gjaldt en .claude-hook-konfigurasjon som styres fra arbeidsområdet. En angriper kunne misbruke denne til å kjøre kommandoer utenfor sandkassen. Sårbarheten har identifikatoren CVE-2026-48124 og ble rettet i Cursor versjon 3.0.0.
Den andre sårbarheten gjorde det mulig for en AI-agent å endre en Python-fortolker i et virtuelt miljø. Cursors Python-utvidelse kunne deretter automatisk kjøre fortolkeren under kontroll av utviklingsmiljøet.
Den tredje sårbarheten misbrukte Git-metadata som var lagret utenfor den vanlige .git-mappen. Dette gjorde det mulig å utnytte Gits fsmonitor-funksjon samtidig som Cursors banebaserte beskyttelse ble omgått. Problemet ble rettet i versjon 3.0.0, mens et CVE-nummer fortsatt er under behandling.
Codex CLI og delt Docker-socket
I Codex CLI oppdaget forskerne at en tillatelsesliste vurderte kommandoen git show som trygg kun basert på navnet. Kommandoen kunne imidlertid kjøres med argumenter som ikke var skrivebeskyttede.
OpenAI rettet problemet i Codex CLI versjon 0.95.0 og tildelte en bug bounty med høy alvorlighetsgrad. Det er ennå ikke tildelt noe CVE-nummer.
Forskerne fant også et eget problem som påvirket Codex, Cursor og Gemini CLI. Agentene kunne få tilgang til en Docker-socket eksponert av en privilegert lokal tjeneste. Dermed oppsto en vei til kodekjøring utenfor sandkassen. Leverandørene har siden rettet problemet.
Google nedgraderte Antigravity-rapportene
Pillar Security rapporterte også to sårbarheter i Google Antigravity.
Den første gjaldt en metode for å omgå macOS Seatbelt-baserte blokkeringslister. Den andre utnyttet en .vscode-oppgavekonfigurasjon for å omgå beskyttelsen i Secure Mode.
Google klassifiserte begge rapportene som gyldige sårbarheter, men nedgraderte alvorlighetsgraden. Selskapet mente de var vanskelige å utnytte fordi de er avhengige av sosial manipulering eller at en utvikler åpner et prosjekt som inneholder indirekte promptinjeksjon.
Forskerne mener derimot at nettopp denne tillitsgrensen er selve risikoen. En utvikler er kanskje ikke klar over at en AI-agent kan endre filer som betrodde lokale verktøy senere kjører.
AI-sandkasseflukter er et bredere sikkerhetsproblem
Det underliggende problemet er ikke nytt. Tidligere forskning har beskrevet konfigurasjonsbaserte sandkasseflukter i flere AI-kodeverktøy, der filer opprettet i sandkassen senere kunne kjøres på vertssystemet.
De nyeste funnene viser at problemet rammer flere produkter og leverandører. For utviklere er derfor det viktigste spørsmålet ikke bare om en AI-kodeagent har en sandkasse.
Det avgjørende er om de lokale verktøyene kan håndtere filene agenten oppretter på en sikker måte.


0 responses to “AI-sandkasseflukt rammer Codex, Cursor og Gemini CLI”