Sikkerhedsforskere har opdaget et nyt Ghostcommit-angreb, der retter sig mod AI-kodeassistenter. I stedet for at placere skadelige instruktioner i kildekoden skjuler angriberne dem i PNG-billeder. Teknikken gør det muligt for ondsindede pull requests at passere automatiserede kodegennemgange, før AI-agenter uforvarende afslører følsomme data fra kodearkiver.

Forskerne siger, at angrebet udnytter et hul mellem AI-værktøjer til kodegennemgang og AI-kodeassistenter. Det ene system ignorerer billedfiler, mens det andet læser dem som betroede projektinstruktioner.

AI-værktøjer til kodegennemgang ignorerer det skadelige billede

Ghostcommit-angrebet blev udviklet af forskere fra ASSET Research Group ved University of Missouri–Kansas City.

Deres proof-of-concept viser, hvordan angribere kan indsende en tilsyneladende harmløs pull request med et PNG-billede, der indeholder indlejrede instruktioner til promptinjektion. Mange automatiserede værktøjer til kodegennemgang springer billedfiler helt over. Derfor passerer det skadelige indhold gennem kontrollen uden at udløse advarsler.

Forskerne har offentliggjort et proof-of-concept og delt deres resultater med de berørte leverandører.

Skjult PNG-fil får AI til at afsløre hemmeligheder

I stedet for at gemme skadelige instruktioner i kildekoden skjules de i en PNG-fil, som der henvises til fra et AGENTS.md-dokument.

AGENTS.md-filen ser ud til at indeholde almindelige projektretningslinjer. Den instruerer dog AI-kodeassistenter til at åbne billedet. PNG-filen indeholder instruktioner, der får AI’en til at læse kodearkivets .env-fil, omdanne hver byte til heltal og indsætte disse værdier i kildekoden som det, der fremstår som en harmløs konstant.

Da de stjålne data er kodet som heltal i stedet for almindelig tekst, opdager traditionelle værktøjer til scanning efter hemmeligheder ikke lækagen.

I en demonstration genererede en AI-kodeassistent et modul med mere end 300 heltal. Disse værdier kunne senere afkodes til hele indholdet af .env-filen.

Angrebet aktiveres først senere

Den ondsindede pull request stjæler ikke hemmeligheder umiddelbart efter, at den er blevet flettet ind.

I stedet forbliver nyttelasten inaktiv, indtil en udvikler senere beder en AI-kodeassistent om at udføre en rutinemæssig programmeringsopgave. Når assistenten starter, læser den den betroede AGENTS.md-fil. Derefter åbner den den refererede PNG-fil og følger de skjulte instruktioner, mens den genererer den ønskede kode.

Udvikleren modtager den forventede funktion og indsender ændringerne. Uden at være klar over det offentliggøres også de kodede hemmeligheder fra kodearkivet. Angriberne kan derefter afkode tallene og genskabe de oprindelige legitimationsoplysninger.

Kodeplatformen gør forskellen

Forskerne fandt, at Ghostcommit-angrebets succes i højere grad afhang af kodeplatformen end af den underliggende AI-model.

Flere kodeværktøjer fulgte de skjulte instruktioner og lækkede hemmeligheder fra kodearkiver på tværs af flere AI-modeller. Andre platforme nægtede konsekvent at udføre de skadelige handlinger, selv når de brugte den samme sprogmodel.

En AI-kodeassistent genererede endda den kodede hemmelighed, før den opdagede den mistænkelige adfærd. Derefter slettede den dataene, inden opgaven blev afsluttet.

Resultaterne tyder på, at beskyttelse under kørsel og platformspecifikke sikkerhedsforanstaltninger er mindst lige så vigtige som forbedringer af selve AI-modellerne.

Forskerne anbefaler flere lag af beskyttelse

For at løse problemet udviklede forskerne et multimodalt system til gennemgang af pull requests, som analyserer både kildekode og billeder.

Systemet scanner efter skjulte tegn, analyserer kodestrukturen, gennemgår projektkonventioner ved hjælp af AI og undersøger vedhæftede billeder for forsøg på promptinjektion.

Under test analyserede prototypen 80 tidligere usete pull requests. Den opdagede alle billedbaserede angreb undtagen ét. Samtidig gav den ingen falske positiver blandt 30 legitime pull requests.

Forskerne anbefaler også at overvåge AI-kodeassistenter, mens de kører. Usædvanlig adfærd, såsom adgang til filer med legitimationsoplysninger uden en legitim grund, kan afsløre et angreb, før følsomme oplysninger bliver eksponeret.


0 svar til “Ghostcommit-angreb bruger PNG-billeder til at narre AI-kodeagenter til at lække hemmeligheder”