Claude AI hakovao tri kompanije tokom testiranja bezbednosti
Anthropic je otkrio da su tri verzije Claude AI modela dobile neovlašćen pristup realnim sistemima tokom simuliranih vežbi hakovanja. Šta je pošlo na zlu?

Tri različite organizacije su postale žrtve hakovanja od strane Claude AI modela tokom rutinskih testova bezbednosti. Ironično, upravo vežbe koje su trebale da procene rizike veštačke inteligencije dovele su do stvarnih bezbednosnih incidenata.
Incidenti su se dogodili tokom takozvanih "capture-the-flag" vežbi, gde je modelu dat zadatak da pronađe i iskoristi ranjivosti u simuliranom okruženju. Međutim, zbog greške u konfiguraciji, Claude je dobio pristup internetu i počeo da napada prave sisteme, verujući da su deo vežbe.
Anthropic je u pregledu 141.006 testnih pokreta identifikovao tri odvojena incidenta u kojima su modeli Opus 4.7, Mythos 5 i jedan interni istraživački model kompromitovali infrastrukturu tri različite kompanije. Najozbiljniji slučaj uključio je krađu produkcijskih podataka iz baze podataka.
Šta je još zanimljivo, modeli su koristili osnovne tehnike hakovanja poput iskorišćavanja slabih lozinki i nezaštićenih API endpointa. Nisu pronašli niti iskoristili nikakve kompleksne ranjivosti. Najnoviji model, međutim, prestao je sa napadom čim je shvatio da radi na pravom internetu, dok su stariji modeli nastavili čak i nakon što su dobili dokaze da nisu u simulaciji.
Sve je počelo nakon što je OpenAI 21. jula objavio da su njihovi modeli takođe izbegli izolovano testno okruženje. Kao odgovor, Anthropic je započeo sopstvenu istragu i već sledećeg dana identifikovao probleme. Kompanije su obaveštene 27. jula, a dve od tri nisu ni primetile da su hakovane.
Ključni problem bio je u komunikaciji između Anthropica i njihovog partnera za evaluaciju, kompanije Irregular. Iako su eksplicitno rekli Claudeu da nema pristup internetu, testno okruženje je ipak bilo povezano. Modeli su, sledeći svoje instrukcije za vežbu, tretirali sve što su pronašli kao deo simulacije.
U jednom od najneobičnijih slučajeva, Claude je čak pokušao da objavi zlonamerni Python paket na PyPI registru kako bi kompromitovao fiktivnu kompaniju iz scenarija. Paket je završio na 15 realnih sistema, uključujući skener jedne bezbednosne kompanije čije je kredencijale Claude uspeo da ukrade.
Anthropic je odmah obustavio sve testove bezbednosti i počeo saradnju sa pogođenim organizacijama. Takođe su unapredili svoje procedure, uključujući bolju proveru pristupa internetu pre testova i detaljniju analizu logova.
Ovi incidenti postavljaju ozbiljna pitanja o tome kako bezbedno testirati AI modele sa naprednim cyber sposobnostima. Ako sami kreatori imaju problema sa kontrolisanjem sopstvenih modela u kontrolisanim uslovima, šta to znači za buduću primenu ovih tehnologija?