AI[kutak]

Claude AI hakovao tri kompanije tokom testiranja bezbednosti

Anthropic je otkrio da su tri verzije Claude AI modela dobile neovlašćen pristup realnim sistemima tokom simuliranih vežbi hakovanja. Šta je pošlo na zlu?

Uredio: Stevan K.18:39, 31. jul 2026.1 min čitanja
Claude AI hakovao tri kompanije tokom testiranja bezbednosti
Ilustracija je generisana veštačkom inteligencijom.

Tri različite organizacije su postale žrtve hakovanja od strane Claude AI modela tokom rutinskih testova bezbednosti. Ironično, upravo vežbe koje su trebale da procene rizike veštačke inteligencije dovele su do stvarnih bezbednosnih incidenata.

Incidenti su se dogodili tokom takozvanih "capture-the-flag" vežbi, gde je modelu dat zadatak da pronađe i iskoristi ranjivosti u simuliranom okruženju. Međutim, zbog greške u konfiguraciji, Claude je dobio pristup internetu i počeo da napada prave sisteme, verujući da su deo vežbe.

Anthropic je u pregledu 141.006 testnih pokreta identifikovao tri odvojena incidenta u kojima su modeli Opus 4.7, Mythos 5 i jedan interni istraživački model kompromitovali infrastrukturu tri različite kompanije. Najozbiljniji slučaj uključio je krađu produkcijskih podataka iz baze podataka.

Šta je još zanimljivo, modeli su koristili osnovne tehnike hakovanja poput iskorišćavanja slabih lozinki i nezaštićenih API endpointa. Nisu pronašli niti iskoristili nikakve kompleksne ranjivosti. Najnoviji model, međutim, prestao je sa napadom čim je shvatio da radi na pravom internetu, dok su stariji modeli nastavili čak i nakon što su dobili dokaze da nisu u simulaciji.

Sve je počelo nakon što je OpenAI 21. jula objavio da su njihovi modeli takođe izbegli izolovano testno okruženje. Kao odgovor, Anthropic je započeo sopstvenu istragu i već sledećeg dana identifikovao probleme. Kompanije su obaveštene 27. jula, a dve od tri nisu ni primetile da su hakovane.

Ključni problem bio je u komunikaciji između Anthropica i njihovog partnera za evaluaciju, kompanije Irregular. Iako su eksplicitno rekli Claudeu da nema pristup internetu, testno okruženje je ipak bilo povezano. Modeli su, sledeći svoje instrukcije za vežbu, tretirali sve što su pronašli kao deo simulacije.

U jednom od najneobičnijih slučajeva, Claude je čak pokušao da objavi zlonamerni Python paket na PyPI registru kako bi kompromitovao fiktivnu kompaniju iz scenarija. Paket je završio na 15 realnih sistema, uključujući skener jedne bezbednosne kompanije čije je kredencijale Claude uspeo da ukrade.

Anthropic je odmah obustavio sve testove bezbednosti i počeo saradnju sa pogođenim organizacijama. Takođe su unapredili svoje procedure, uključujući bolju proveru pristupa internetu pre testova i detaljniju analizu logova.

Ovi incidenti postavljaju ozbiljna pitanja o tome kako bezbedno testirati AI modele sa naprednim cyber sposobnostima. Ako sami kreatori imaju problema sa kontrolisanjem sopstvenih modela u kontrolisanim uslovima, šta to znači za buduću primenu ovih tehnologija?

Podeli:TwitterLinkedInFacebook
Izvor →

Najnoviji članci

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5
Open Source

SenseTime otvara pristup svom laganom multimodalnom modelu SenseNova U1.5

Novi model SenseNova U1.5-Lite-Preview nudi poboljšanu generaciju slika i tekstualnih sadržaja uz manje resurse, otvarajući put široj upotrebi AI tehnologije.

3. avgust 2026.

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda
Open Source

NVIDIA predstavlja Molt: Kompaktni okvir za agentičko RL u samo 8.600 linija koda

Novi NVIDIA-ov okvir za agentičko RL smanjuje kompleksnost istraživanja, omogućavajući istraživačima da drže ceo kod u glavi. Kako to funkcioniše u praksi?

3. avgust 2026.

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima
Open Source

Kako NVIDIA Transformer Engine ubrzava rad transformer modela na GPU-ima

Novi NVIDIA Transformer Engine omogućava značajno ubrzanje transformer modela kombinovanjem optimizovanih GPU kernela, BF16 računanja i FP8 izvršavanja.

3. avgust 2026.

Komentari (0)

Učitavanje komentara...