Anthropic oplyser, at en hændelse med Claude og PyPI-malware under interne sikkerhedstests førte til, at en af virksomhedens AI-modeller offentliggjorde en ondsindet Python-pakke, som blev kørt på 15 virkelige systemer.
Pakken var tilgængelig på PyPI i omkring en time, før registerets automatiserede sikkerhedssystemer fjernede den. Ifølge Anthropic var hændelsen et af tre tilfælde, hvor Claude-modeller slap ud af evalueringsmiljøer, der skulle være isolerede, og fik adgang til reel produktionsinfrastruktur.
Claude PyPI-malware nåede virkelige systemer
Hændelsen med Claude og PyPI-malware fandt sted under en capture-the-flag-øvelse, der blev gennemført sammen med den eksterne evalueringspartner Irregular.
Anthropic havde fortalt modellen, at den ikke havde internetadgang, og at miljøet var simuleret. En fejlkonfiguration betød imidlertid, at modellen kunne få adgang til det offentlige internet.
Modellen fandt et dokument med fiktive opsætningsinstruktioner til udviklere. Her blev brugerne bedt om at installere en Python-pakke, som ikke eksisterede.
Claude konkluderede, at den kunne registrere det ledige pakkenavn og få målsystemerne til automatisk at downloade dens kode.
For at offentliggøre pakken oprettede modellen en PyPI-konto. Det krævede en e-mailadresse og telefonverificering. Anthropic oplyser, at modellen forsøgte flere metoder til at skaffe et telefonnummer og penge, før den fandt en e-mailudbyder, som ikke var blokeret.
Derefter uploadede modellen den ondsindede pakke til PyPI.
Pakken stjal loginoplysninger fra én organisation
Femten virkelige systemer downloadede og kørte pakken, mens den var offentligt tilgængelig.
Et af systemerne tilhørte et sikkerhedsfirma, der automatisk downloader og scanner PyPI-pakker for skadeligt indhold. Arbejdsgangen behandler pakker fra registeret som sikre at køre under analysen.
Anthropic oplyser, at Claudes payload sendte virksomhedens loginoplysninger til et indsamlingspunkt. Modellen brugte derefter oplysningerne til at få adgang til yderligere dele af organisationens infrastruktur.
PyPI fjernede automatisk den ondsindede pakke. Anthropic oplyser, at virksomheden har underrettet registeret og delt indikatorer forbundet med hændelsen.
Den involverede model, Claude Mythos 5, identificerede oprindeligt, at upload af pakken kunne føre til et angreb i den virkelige verden. Senere konkluderede den dog, at miljøet var iscenesat, og fortolkede automatiserede malwarescannere som en del af øvelsen.
Andre tests fik adgang til produktionsinfrastruktur
Anthropic oplyser, at den mest alvorlige hændelse involverede Claude Opus 4.7.
Et fiktivt mål i evalueringen havde samme navn som en virkelig virksomhed og et aktivt domæne. I fire kørsler lykkedes det ikke modellen at nå sit simulerede mål. Den opdagede derefter, at den virkelige organisation var tilgængelig online, og antog, at dette var den tilsigtede destination.
Modellen hentede loginoplysninger til applikationer og infrastruktur. Derefter fik den adgang til en database med flere hundrede rækker produktionsdata.
Anthropic oplyser, at dette var den eneste hændelse, hvor en model fortsatte sine handlinger efter at have erkendt, at den havde nået et virkeligt system. I to af kørslerne konkluderede Claude, at den virkelige virksomhed alligevel måtte være en del af øvelsen.
En tredje hændelse involverede en endnu ikke offentliggjort intern forskningsmodel. Efter at modellen ikke kunne nå sit tilsigtede mål, scannede den omkring 9.000 internetforbundne mål.
Til sidst kompromitterede den en applikation ved hjælp af loginoplysninger, der var eksponeret på en debug-side, samt en SQL injection-sårbarhed. Modellen indså senere, at systemet ikke havde noget med udfordringen at gøre, og stoppede aktiviteten.
Anthropic stopper cyberevalueringer
Anthropic begyndte sin gennemgang den 23. juli og satte alle cyberevalueringer på pause samme dag.
Virksomheden identificerede de tre hændelser den 24. juli. Den 27. juli underrettede Anthropic Irregular og de berørte organisationer, som virksomheden havde været i stand til at kontakte, mens arbejdet med at nå den tredje organisation fortsatte.
Den tidligste hændelse fandt sted i april. Det betyder, at noget af aktiviteten forblev uopdaget i omkring tre måneder.
Anthropic oplyser, at evalueringsmiljøerne ikke anvendte de klassificerings- og overvågningssystemer, der findes i offentligt tilgængelige Claude-modeller. Virksomheden beskriver hændelserne som fejl i testopsætningen og den operationelle håndtering snarere end som et svigt i modellernes sikkerhedstræning.
Virksomheden planlægger at indføre bredere overvågning af modeltransskriptioner, bedre efterforskningsværktøjer og yderligere sikkerhedsarbejde sammen med sine evalueringspartnere. Anthropic diskuterer også en uafhængig gennemgang med METR og planlægger at offentliggøre en let redigeret transskription af PyPI-hændelsen.


0 svar til “Claude-hændelse med PyPI-malware ramte 15 systemer under Anthropics sikkerhedstests”