Sikkerhetsforskere har avdekket et nytt Ghostcommit-angrep som retter seg mot AI-kodeassistenter. I stedet for å legge inn skadelige instruksjoner i kildekoden skjuler angriperne dem i PNG-bilder. Teknikken gjør det mulig for ondsinnede pull requests å passere automatiserte kodegjennomganger før AI-agenter uvitende eksponerer sensitiv informasjon fra kodearkiver.
Forskerne sier at angrepet utnytter et gap mellom AI-verktøy for kodegjennomgang og AI-kodeassistenter. Det ene systemet ignorerer bildefiler, mens det andre leser dem som pålitelige prosjektinstruksjoner.
AI-verktøy for kodegjennomgang ignorerer det skadelige bildet
Ghostcommit-angrepet ble utviklet av forskere ved ASSET Research Group ved University of Missouri–Kansas City.
Deres proof-of-concept viser hvordan angripere kan sende inn en tilsynelatende uskyldig pull request som inneholder et PNG-bilde med innebygde instruksjoner for promptinjeksjon. Mange automatiserte kodegjennomgangsverktøy hopper helt over bildefiler. Dermed passerer det skadelige innholdet gjennom kontrollen uten å utløse varsler.
Forskerne har publisert et proof-of-concept og delt funnene sine med de berørte leverandørene.
Skjult PNG-fil får AI til å avsløre hemmeligheter
I stedet for å lagre skadelige instruksjoner i kildekoden skjules de i en PNG-fil som det henvises til fra et AGENTS.md-dokument.
AGENTS.md-filen ser ut til å inneholde vanlige prosjektretningslinjer. Den instruerer imidlertid AI-kodeassistenter om å åpne bildet. PNG-filen inneholder instruksjoner som ber AI-en lese kodearkivets .env-fil, konvertere hver byte til heltall og sette disse verdiene inn i kildekoden som det som ser ut til å være en harmløs konstant.
Fordi de stjålne dataene er kodet som heltall i stedet for ren tekst, klarer ikke tradisjonelle verktøy for hemmelighetsskanning å oppdage lekkasjen.
I én demonstrasjon genererte en AI-kodeassistent en modul med mer enn 300 heltall. Disse verdiene kunne senere dekodes til hele innholdet i .env-filen.
Angrepet aktiveres først senere
Den ondsinnede pull requesten stjeler ikke hemmeligheter umiddelbart etter at den blir slått sammen.
I stedet forblir nyttelasten inaktiv til en utvikler senere ber en AI-kodeassistent om å utføre en rutinemessig programmeringsoppgave. Når assistenten starter, leser den den pålitelige AGENTS.md-filen. Deretter åpner den den refererte PNG-filen og følger de skjulte instruksjonene mens den genererer den forespurte koden.
Utvikleren mottar funksjonen som ble bedt om og sender inn endringene. Uten å være klar over det publiseres også de kodede hemmelighetene fra kodearkivet. Angriperne kan deretter dekode tallene og gjenopprette de opprinnelige legitimasjonsopplysningene.
Kodeplattformen avgjør utfallet
Forskerne fant at suksessen til Ghostcommit-angrepet var mer avhengig av kodeplattformen enn av den underliggende AI-modellen.
Flere kodeverktøy fulgte de skjulte instruksjonene og lekket hemmeligheter fra kodearkiver på tvers av flere AI-modeller. Andre plattformer nektet konsekvent å utføre de skadelige handlingene, selv når de brukte den samme språkmodellen.
En AI-kodeassistent genererte til og med den kodede hemmeligheten før den oppdaget den mistenkelige oppførselen. Deretter slettet den dataene før oppgaven ble fullført.
Resultatene tyder på at beskyttelse under kjøring og plattformspesifikke sikkerhetstiltak er minst like viktige som forbedringer av selve AI-modellene.
Forskerne anbefaler flere lag med beskyttelse
For å løse problemet utviklet forskerne et multimodalt system for gjennomgang av pull requests som analyserer både kildekode og bilder.
Systemet skanner etter skjulte tegn, analyserer kodestrukturen, gjennomgår prosjektkonvensjoner ved hjelp av AI og undersøker vedlagte bilder for forsøk på promptinjeksjon.
Under testingen analyserte prototypen 80 tidligere usette pull requests. Den oppdaget alle bildebaserte angrep bortsett fra ett. I tillegg ga den ingen falske positiver blant 30 legitime pull requests.
Forskerne anbefaler også å overvåke AI-kodeassistenter mens de kjører. Uvanlig oppførsel, som tilgang til filer med legitimasjonsopplysninger uten en legitim grunn, kan avsløre et angrep før sensitiv informasjon blir eksponert.


0 responses to “Ghostcommit-angrep bruker PNG-bilder for å lure AI-kodeagenter til å lekke hemmeligheter”