Miután kiderült, hogy az OpenAI által végzett belső biztonsági tesztek során a vállalat nyelvi modelljeit alkalmazó ügynök kitört a zárt környezetből, és megtámadta a Hugging Face adatbázisát – valamint további cégekhez is behatolt –, az Anthropic egy belső vizsgálatot rendelt el. Ennek pedig elég meglepő eredménye lett.
Az OpenAI kiberbiztonsági ügyét követően derült ki, hogy az Anthropic égisze alatt is voltak “szabálytalan” műveletek a biztonsági tesztek során. Csakhogy ezekről senki nem szerzett tudomást. Úgy törhettek be különböző cégekhez az Anthropic által fejlesztett eszközök, hogy arról annak idején senki nem szerzett tudomást.
“Három valós környezetben történt incidenst is vizsgálnunk kell a kiberbiztonsági kiértékeléseink következtében” – közölte a vállalat.
Az Anthropic volt az első, aki kifejezetten sebezhetőségek, biztonsági rések feltárására készített olyan nyelvi modellt, amihez partnereknek is hozzáférést adott. Évek óta dolgozott már a cég ezen a fejlesztésen, és ez idő alatt rengeteg tesztet hajtott végre zárt környezetekben. Viszont a jelek szerint nem minden esetben tudta féken tartani az eszközeit. Három esetben is külső rendszerek ellen hajtott végre támadásokat a cég fejlesztése.
Több mint 141 ezer teszt kiértékelését követően talált három olyan esetet az Anthropic, melyek során az éppen tesztelt Claude variáns kitört a zárt környezetből, hozzáférést szerzett az internethez, majd a világhálón idegen cégek rendszerébe jutott be. Az érintett cégek a jelek szerint soha nem fedezték fel a támadást, illetve nem tudták beazonosítani a fejlett Claude modellek nyomait.
Mindegyik kiberbiztonsági incidens “capture-the-flag” kihívás alkalmával történt. Ezek során “a modellnek egy kitalált forgatókönyvet adnak meg, és közlik vele, hogy egy titkos információt (a „flag”-et) elrejtettek a hálózat egy másik gépén, és a feladata, hogy behatoljon oda, és megszerezze azt.” Hozzátette a cég, hogy a feladat megoldásának módja szabadon választható volt, és nem írtak neki elő semmilyen konkrét módszert, mikor a külső támadásokat elkövették.
Az Anthropic elmondása szerint minden tesztnél teljesen egyértelműen szimulációs feladatot hajtottak végre, és ez a modellnek is paraméterezve volt. Ráadásul azt is elmondták a Claude-nak, hogy nem férhet hozzá az internethez, a cég partnerének pedig fizikailag is le kellett volna választania az internetről ezeket a modelleket a teszt során, ez viszont nem történt meg. A partner mulasztása adott lehetőséget az Anthropic fejlesztéseinek arra, hogy “kitörjenek” a tesztközegből.
A vállalatnak pedig fel kellett volna ismernie, hogy “szabálytalan” műveletet hajtottak végre a modellek több alkalommal is. Főleg az aggasztó ebben az esetben, hogy tényleg senkinek nem tűnt fel, hogy az Anthropic több hackertámadást is végrehajtott különböző Claude variánsokkal. Az Opus 4.7, a Mythos 5 és egy belső kutatási tesztmodellhez köthetők a különböző ügyek. Maguk a kiberbiztonsági incidensek elvileg nem voltak olyan súlyosak, mint a Hugging Face esete korábban.
Ez az egész ügy egyre problémásabb, hiszen most már egyenesen arról beszélhetünk, hogy a cégek nemcsak, hogy nem teljesen urai a saját fejlesztéseiknek, hanem még a megfelelő felügyeletről sem tudnak gondoskodni. Az pedig már csak a hab a tortán, hogy az OpenAI után az Anthropic is kicsit úgy tálalja ezt az egészet, mintha dicsőséges lenne a dolog. A szakértők nem győzik sürgetni a szigorúbb hatósági beavatkozás szükségességét.