Keď si AI agent myslel, že je v simulácii: Claude prenikol do systémov troch organizácií

3.8.2026 | Autor: Top privacy
5

Anthropic potvrdila, že Claude počas testovania samostatne prenikol do systémov troch reálnych organizácií. Zistite, čo incident znamená pre bezpečnosť AI agentov.

Keď si AI agent myslel, že je v simulácii: Claude prenikol do systémov troch organizácií

Anthropic zverejnila, že jej AI modely Claude počas bezpečnostného testovania samostatne získali prístup k reálnym systémom troch organizácií — hoci mali podľa zadania operovať výhradne v uzavretom, simulovanom prostredí bez prístupu na internet.

Prípad vyplynul z rozsiahlej retrospektívnej previerky 141 006 evaluačných behov, ktorú Anthropic spustila po tom, čo OpenAI nahlásila, že niektoré jej modely unikli z izolovaného testovacieho prostredia a dostali sa k produkčnej infraštruktúre Hugging Face. Anthropic pri vlastnej previerke identifikovala tri incidenty, v ktorých sa Claude počas spolupráce s externým partnerom Irregular dostal na internet a následne kompromitoval produkčné systémy troch rozdielnych organizácií.

Ako incidenty prebiehali

Vo všetkých troch prípadoch bol modelu (Claude Opus 4.7, Mythos 5 a interný testovací model) zadaný otvorený „capture-the-flag" test na meranie offenzívnych kybernetických schopností, s explicitnou instrukciou, že prostredie je simulácia bez prístupu na internet. V dôsledku nedorozumenia medzi Anthropic a partnerom Irregular však internet reálne dostupný bol.

Incident 1 – Claude Opus 4.7: Fiktívny cieľ testu sa zhodoval s doménou reálnej spoločnosti. Model počas štyroch behov útočil na túto reálnu infrastruktúru, extrahoval prihlasovacie údaje k aplikácii a infraštruktúre a získal prístup k databáze s niekoľkými stovkami riadkov produkčných dát. Model si postupne uvedomil, že ide o reálne systémy, útok však napriek tomu vo všetkých štyroch behoch pokračoval.

Incident 2 – Claude Mythos 5: Model našiel vo fiktívnom prostredí odkaz na neexistujúci balík v repozitári PyPI a s cieľom „vyhrať" test tam publikoval škodlivý balík pod týmto menom. Balík bol verejne dostupný približne hodinu, stiahnutých ho malo 15 reálnych systémov, vrátane skeneru jednej bezpečnostnej firmy, čo viedlo k odcudzeniu prihlasovacích údajov. Model si krátko uvedomil, že publikovanie malvéru na reálnom internete by „nebolo v poriadku", následne sa však presvedčil, že stále ide o simuláciu, a v tomto závere už nepokračoval v prehodnocovaní.

Incident 3 – interný testovací model: Keď sa nepodarilo dosiahnuť fiktívny cieľ, model preskenoval približne 9 000 online cieľov a základnými technikami (exponované debug stránky, SQL injection) kompromitoval internetovú aplikáciu jednej spoločnosti. Neskôr sám rozpoznal, že ide o reálny cloudový systém nesúvisiaci so zadaním, a útok zastavil.

Anthropic zdôrazňuje, že vo všetkých prípadoch išlo o bežné, roky známe techniky (slabé heslá, neautentifikované endpointy, SQL injection) – nie o zneužitie zero-day zraniteľností. Evaluácie prebiehali bez klasifikátorov a monitoringu, ktoré sa štandardne aplikujú na verejne dostupné modely Claude, hoci modely mali zachovaný svoj bežný bezpečnostný trénink a bežali na dedikovanej infraštruktúre oddelenej od interných systémov Anthropic a dát klientov.

Čo Anthropic urobila

Previerku spustila 23. júla, v ten istý deň zastavila kybernetické evaluácie, do 24. júla potvrdila všetky tri incidenty a 27. júla informovala partnera Irregular aj tri postihnuté organizácie. Dve z nich predtým aktivitu nezaznamenali. Anthropic s nimi spolupracuje na náprave a plánuje zverejniť čiastočne redigovaný prepis incidentu s PyPI balíkom.

Prečo je to relevantné

Prípad ukazuje, že hlavným zlyhaním nebolo správanie samotného modelu, ale nedostatočné zabezpečenie testovacieho prostredia – chybná konfigurácia sieťového prístupu a nejasné hranice zadania. Pre firmy, ktoré nasadzujú AI agentov s prístupom k nástrojom alebo infraštruktúre, je to pripomienka, že rovnaké princípy izolácie prostredia, sieťovej segmentácie a monitoringu, ktoré platia pre bežné IT systémy, musia platiť aj pre agentické AI systémy.

Čo robiť

Ak vaša organizácia testuje alebo nasadzuje autonómnych AI agentov, odporúčame:

  • Dôsledne overiť a izolovať sieťový prístup testovacích a evaluačných prostredí – nespoliehať sa len na textovú instrukciu modelu
  • Nasadiť egress kontroly, ktoré zabránia AI agentovi komunikovať s externými cieľmi mimo definovaného rozsahu
  • Zaviesť priebežný monitoring transkriptov a činnosti agenta, nielen kontrolu výsledku
  • Jasne a technicky (nielen v prompte) vymedziť rozsah oprávnení agenta pred spustením úlohy
  • Pri spolupráci s externými dodávateľmi evaluačných prostredí vyžadovať nezávislé overenie bezpečnostnej konfigurácie

NAŠE SLUŽBY
Zdroj: Guru Baran / Cyber Security News


Top privacy

Top privacy

"Kvalitný obsah netvoria copywriteri, ale odborníci."