Az OpenAI körül egyre több aggasztó jele van annak, hogy a vállalat egész egyszerűen már nem ura a fejlesztéseinek. Az utóbbi napokban, hetekben egymást érték azok a beszámolók, melyek valamilyen kiberbiztonsági szempontból szabálytalan MI műveletről szóltak. A cég éppen ezért már nemcsak kommunikációs szinten, hanem valóban kénytelen lassítani.
Bejelentette az OpenAI, hogy felfüggeszti a legerősebb mesterséges intelligencia modelljeinek tréningezését, a The Wall Street Journal pedig arról számolt be, hogy a GPT-6.1 Astra modell bevezetését is eltolja a vállalat.
Az OpenAI egyik legnagyobb dobása volt az utóbbi időben, hogy a GPT-6 Astra modellt bevezette. Ezzel a modellel a különböző teljesítménytesztek alapján nagyjából felzárkózott az Anthropic mellé az élen, méltó riválist kaptak a Fable és a Mythos modellek. A mostani helyzetből szeretne előnybe kerülni a vállalat, de a dolgok állása szerint könnyen lehet, hogy inkább azt kellene átgondolnia, hogyan tudna biztonságosan haladni a fejlesztéseivel.
Folyamatosan teszteli az OpenAI a különböző eszközeit, és ahogy egyre nagyobb tempót próbál diktálni, úgy gyarapodnak a panaszos hangok a kiberbiztonsági aggályok miatt. A Hugging Face-botrány óta egyértelművé vált, hogy a vállalat által üzemeltetett nyelvi modellek és MI ügynökök nem válogatnak. Nemcsak más cégeket és honlapokat, hanem kormányzati oldalakat és biztonsági szerveket is támadtak változatos módszerekkel az eszközök. Ezért kellett most úgy döntenie a cégnek, hogy több fejlesztését is felfüggeszti, illetve eltolja.
Különösen aggasztó az, hogy az OpenAI maga is nagyon lassan tárja fel azokat az ügyeket, amikor egy-egy mesterséges intelligencia feladat végrehajtása kisiklik. Az áldozatok értesítése esetenként akár hónapokig csúszik. Már azt is biztosan lehet tudni, hogy a sikertelen támadásokkal a cég nem is igazán foglalkozik, nem tulajdonít nagy jelentőséget egy kudarcba fulladt MI-ügynöki támadásnak. Ez valószínűleg annak tudható be, hogy olyan sok ilyen eset van, hogy nincs kapacitása ezekre kellő figyelmet szentelni.
Legutóbb egy belső teszt során a cég egyik fejlett modellje egy DNS-szűrőben talált biztonsági rést kihasználva, a zárt környezetből tudott kapcsolatot teremteni egy külső chatbottal, és így próbált információkat szerezni egy feladat megoldásához. A felügyeleti rendszer 15 percen belül riasztást adott ki, és ezt 3 perccel később egy ember nyugtázta is. Az automatikus leállítás viszont nem történt meg valamilyen oknál fogva, így a folyamat további két és fél órán át folytatódott, mire kézzel leállították az ügynök működését.
A vállalat közlése szerint a felfüggesztés kiterjed a tréningezésre, az értékelésre, valamint a modellek eszközökkel történő alkalmazására. A munka csak akkor folytatódik elvileg, miután az OpenAI szakemberei végeznek a javításokkal, és friss biztonsági rendszerek integrálásával. További fejlesztésekkel együtt indulhat majd el ismét a problémákat okozó modellek tesztelése.
A GPT-6.1 Astra a tervek szerint október elején jelent volna meg, de miután a kutatók a belső tesztelés során biztonsági aggályokat vetettek fel, ez csak további tesztelést követően, és több védelmi eljárás beépítése után jelenhet meg.
A tesztelés során a modell gyenge eredményeket ért el a parancskövetésben, a cselekedetei nem követték kellő mértékben az elvárásokat. Továbbá a modell magas szintű megtévesztésekkel próbálkozott, és nem mindig volt őszinte azzal kapcsolatban, hogy milyen műveleteket hajtott végre. Ezeken felül pedig néha a felhasználó engedélyének kikérése nélkül folytatta a feladatot, és olyan esetekben is megkísérelte külső eszközök vagy szolgáltatások használatát, amikor ez nem volt biztonságos.
Először a Codex szolgáltatás keretei között válhat hozzáférhetővé a GPT-6.1 Astra, a bevezetésnek ezt a módját megtartja a cég. Ugyanakkor az is elképzelhető, hogy a csúszás miatt már rögtön több szolgáltatásban bukkanhat fel az újdonság a későbbiekben.