Shop menü

AZ AMERIKAI ÉS A KÍNAI NAGY NYELVI MODELLEK TESZTELÉSE SORÁN EGYARÁNT AZT TAPASZTALTÁK, HAZUDNAK, MINT A VÍZFOLYÁS

A kontrollált tesztkörnyezetben zajló szimulált feladatok alkalmával több érdekességre is felfigyeltek a kutatók, de a kínai modellekkel kapcsolatban egyelőre nem érkezett olyan hír, hogy azok kiszabadultak volna. Egyes amerikai társaik már ezen is túl vannak.
Víg Ferenc (J.o.k.e.r)
Víg Ferenc (J.o.k.e.r)
Az amerikai és a kínai nagy nyelvi modellek tesztelése során egyaránt azt tapasztalták, hazudnak, mint a vízfolyás

A Reuters friss beszámolója érdekes teszteredményekre hívja fel a figyelmet, amelyek Qwen, DeepSeek, illetve Kimi alapú AI ügynökökkel kapcsolatosak. Ezekből kiderül, hogy az AI ügynökök egy szimulált tender alkalmával a munkamenetek 84-88%-ában hazudtak annak érdekében, hogy eredményeket érjenek el. A kínai AI ügynökök mellett az amerikai AI ügynökök is hasonló viselkedési mintázatot mutattak a kontrollált tesztkörnyezetekben, amelyekből állítólag egyik esetben sem sikerült kiszökniük.

A kínai fejlesztésű nagy nyelvi modellekre támaszkodó AI ügynököket a tesztelt munkamenetek többségében hazugságon kapták, miközben egy szimulált helyzetet teszteltek, ahol képességeiket promotálva kellett megpróbálniuk megnyerni egy üzleti tendert. Minden egyes AI ügynökkel közölték, milyen termékkel indulnak a tenderen, illetve azt is elárulták nekik, mire van szüksége az ügyfélnek. Ahogy a kutatók engedélyezték számukra, hogy a korábbi fordulókban szerzett tapasztalatokból tanuljanak, mindhárom kínai nagy nyelvi modellt használó AI ügynök megtévesztőbbé vált 12-20 százalékponttal, azaz saját érdeküknek megfelelően ferdítették el a valóságot.

A márciusi kísérlet eredményei meglehetősen tanulságosak, de ezzel együtt legalább 20 olyan tanulmány készült 2025 óta, amelyek hasonló viselkedésmintákat találtak. Az AI ügynökök ezekben a tesztekben is alkalmazták a megtévesztést, feszegették a határokat, illetve replikációval is próbálkoztak; ezek olyan jelek, amelyeket a mesterséges intelligenciával foglalkozó szakértük a kitörés építőkockáinak tekintik. Ezeket a jeleket a hardverek és a nagy nyelvi modellek fejlődésével egyre nehezebb lesz időben észrevenni és egyre nehezebbé válhat az ilyen viselkedésmintákat mutató AI ügynökök kordában tartása is.

Galéria megnyitása

Egyes tesztekben az AI ügynököket komplex feladatok végrehajtásával is megbízták amelyek során csak minimális emberi felügyelet mellett dolgoztak, vagy akár felügyelet nélkül is elvégezhették a munkát. Ezekben az esetekben azt tapasztalták a kutatók, hogy a tesztkörnyezetben futó munka kapcsán keletkező hibákat megpróbálták leplezni az AI ügynökök, ehhez hamis eredményeket közöltek és egyéb trükköket is bevetettek ahelyett, hogy elismerték volna, a feladat elvégzése kudarcba fulladt.

Egy esetben az Alibaba Qwen2.5-72B-Instruct LLM-jére támaszkodó AI ügynök megpróbálta átmásolni magát egy másik környezetbe, ahogy rájött, le fogják cserélni. Egy másik esetben egy ugyancsak Alibaba által fejlesztett LLM-re támaszkodó ROME AI ügynöknél azt vették észre, hogy az a felhős számítási teljesítményre támaszkodva kritpovalutát kezdett bányászni, de ezt a műveletet a biztonsági rendszerek később leállították.

Azt persze érdemes kiemelni, hogy az említett tesztekben, amelyek kontrollált környezetben futottak, pont az volt a cél, hogy az esetleges hibákat és a fentiekhez hasonló viselkedést kiprovokálják annak érdekében, hogy ezt a későbbiekben kezelni lehessen. A Reuters által átvizsgált tanulmányokban nincsenek arra utaló jelek, hogy a kínai AI ügynökök kiléptek volna a kontrollált tesztkörnyezetből és a szélesebb interneten is akciókba kezdtek volna, de olyan eseményre sem bukkantak, ahol az AI ügynök megpróbálta volna elkerülni a lekapcsolását.

Az Amerikai Egyesült Államokban ezzel szemben már több eset is történt, amikor az AI ügynökök kiszabadultak a számukra felállított környezetből és ámokfutásba kezdtek: egy esetben a Hugging Face került az elszabaduló AI ügynökök célkeresztjébe, a platformot fel is törték; egy másik esetben pedig az ausztrál nemzeti egészségügyi portált támadták meg az ügynökök – mindkét eset az OpenAI technológiáihoz kapcsolódik. A további vizsgálatok során kiderült, a helyzet súlyosabb annál, mint ahogy azt elsőre sejteni lehetett.

Galéria megnyitása

Akárhogy is, a fenti események rávilágítanak arra, hogy a mesterséges intelligenciával kapcsolatban kellően szigorú és egységes szabályozásra van szükség annak érdekében, hogy a későbbiekben is biztonságosan és megbízhatóan lehessen használni a technológiát, ahogy egyre ütőképesebb lesz. Kínában már szakpolitikai szinten is foglalkoznak a kérdéssel, létrejött az AI Safety Governance Framework 3.0-s keretrendszer, ami a mesterséges intelligenciával kapcsolatos biztonsági kihívások kezelését segítheti hosszabb távon.

Az érintett vállalatok közvetlenül nem reagáltak a Reuters beszámolójára, de korábban egyértelműen közölték, folyamatosan tesztelik a rendszereiket és frissítik biztonsággal kapcsolatos irányelveiket is.

Hírlevél feliratkozás
A feliratkozással elfogadom a Felhasználási feltételeket és az Adatvédelmi nyilatkozatot.

Neked ajánljuk

    Tesztek

      Kapcsolódó cikkek

      Vissza az oldal tetejére