Sikkerhedsforskere har identificeret AI-sandbox-udbrud, der påvirker fire udbredte kodeagenter: Codex CLI, Cursor, Gemini CLI og Google Antigravity.
Sårbarhederne kræver ikke nødvendigvis, at en angriber bryder direkte ud af sandboxen. I stedet kan en AI-agent i sandboxen oprette en fil i et projekts arbejdsområde, som senere læses eller køres af et betroet værktøj på værtssystemet. Denne interaktion kan derefter føre til kodeafvikling uden for sandboxen.
Forskerne Eilon Cohen, Dan Lisichkin og Ariel Fogel fra Pillar Security offentliggjorde resultaterne som en del af serien Week of Sandbox Escapes. De fleste af de rapporterede problemer er allerede blevet rettet eller anerkendt af de berørte leverandører.
Sådan fungerer AI-sandbox-udbrud
AI-kodeagenter har normalt tilladelse til at oprette og redigere filer i et projekts arbejdsområde. Samtidig kører operativsystemet, kodeeditoren og udviklingsværktøjerne uden for agentens sandbox.
Det skaber en sikkerhedsrisiko, når betroede værktøjer på værtsmaskinen automatisk behandler filer, som agenten kan ændre.
Et udviklingsværktøj kan for eksempel kontrollere en Python-fortolker, køre en opgave i arbejdsområdet, indlæse en hook-konfiguration, analysere Git-metadata eller kommunikere med en lokal Docker-tjeneste. Hvis en angriber kan få AI-agenten til at oprette eller ændre en sådan fil, kan det betroede værktøj senere afvikle kode, som angriberen kontrollerer.
Den første udløsende faktor kan være indirekte promptinjektion. En ondsindet instruktion kan skjules i en README-fil, en softwareafhængighed, en pull request, et issue eller en kodeændring. AI-agenten kan derefter følge instruktionen og foretage en skadelig lokal ændring.
Pillar Security inddelte resultaterne i fire hovedkategorier:
- Sandboxe baseret på bloklister, som ikke tager højde for operativsystemets adfærd.
- Konfigurationsfiler i arbejdsområdet, der kan fungere som eksekverbar kode.
- Tilladelseslister for kommandoer, som kontrollerer kommandonavnet, men overser usikre argumenter.
- Privilegerede lokale tjenester, som AI-agenter kan få adgang til uden for sandboxen.
Cursor-sårbarheder muliggjorde kodeafvikling på værtssystemet
Forskerne fandt tre separate sårbarheder i Cursor.
Den første vedrørte en .claude-hook-konfiguration, der styres fra arbejdsområdet. En angriber kunne misbruge den til at udføre kommandoer uden for sandboxen. Sårbarheden har identifikationen CVE-2026-48124 og blev rettet i Cursor version 3.0.0.
Den anden sårbarhed gjorde det muligt for en AI-agent at ændre en Python-fortolker i et virtuelt miljø. Cursors Python-udvidelse kunne derefter automatisk afvikle fortolkeren under kontrol af udviklingsmiljøet.
Den tredje sårbarhed misbrugte Git-metadata, som var gemt uden for den normale .git-mappe. Dermed kunne Gits fsmonitor-funktion udnyttes, samtidig med at Cursors sti-baserede beskyttelse blev omgået. Problemet blev rettet i version 3.0.0, mens et CVE-nummer stadig afventer.
Codex CLI og delt Docker-socket
I Codex CLI opdagede forskerne, at en tilladelsesliste vurderede kommandoen git show som sikker alene ud fra navnet. Kommandoen kunne dog køres med argumenter, som ikke var skrivebeskyttede.
OpenAI rettede problemet i Codex CLI version 0.95.0 og tildelte en bug bounty med høj alvorlighedsgrad. Der er endnu ikke blevet tildelt et CVE-nummer.
Forskerne fandt også et separat problem, som påvirkede Codex, Cursor og Gemini CLI. Agenterne kunne få adgang til en Docker-socket, der var eksponeret af en privilegeret lokal tjeneste. Dermed opstod en vej til kodeafvikling uden for sandboxen. Leverandørerne har siden rettet problemet.
Google nedgraderede Antigravity-rapporterne
Pillar Security rapporterede desuden to sårbarheder i Google Antigravity.
Den første handlede om en metode til at omgå macOS Seatbelt-baserede bloklister. Den anden udnyttede en .vscode-opgavekonfiguration til at omgå beskyttelsen i Secure Mode.
Google klassificerede begge rapporter som gyldige sårbarheder, men nedgraderede deres alvorlighed. Virksomheden vurderede, at de var vanskelige at udnytte, fordi de afhænger af social engineering eller af, at en udvikler åbner et projekt, der indeholder indirekte promptinjektion.
Forskerne mener derimod, at netop denne tillidsgrænse er kernen i risikoen. En udvikler er måske ikke klar over, at en AI-agent kan ændre filer, som betroede lokale værktøjer senere afvikler.
AI-sandbox-udbrud er et bredere sikkerhedsproblem
Det underliggende problem er ikke nyt. Tidligere forskning har beskrevet konfigurationsbaserede sandbox-udbrud i flere AI-kodeværktøjer, hvor filer oprettet i sandboxen senere kunne afvikles på værtssystemet.
De seneste resultater viser, at problemet rammer flere produkter og leverandører. For udviklere er det afgørende spørgsmål derfor ikke blot, om en AI-kodeagent har en sandbox.
Det vigtigste er, om de lokale værktøjer kan håndtere de filer, agenten opretter, på en sikker måde.


0 svar til “AI-sandbox-udbrud rammer Codex, Cursor og Gemini CLI”