EgyébSzerző: index 2026. 08. 05. 3 percnyi olvasás
A Mythos és a Sol viselkedése túlmutatott az utasításokon.
Valódi személyeket utánzó hamis fiókokat hoztak létre a világ két legfejlettebb mesterségesintelligencia-eszközei egy kibertámadási kísérlet során, amelyet a brit AI Biztonsági Intézet (AI Security Institute, AISI) tesztjén hajtottak végre – jelentette be a BBC.
Az intézet kedden közölte: az Anthropic Mythos és az OpenAI Sol nevű modellje az „önállóság és a megtévesztés" olyan szintjét mutatta, amilyennel korábban nem találkoztak. Az AISI ugyanakkor pontosított: a rosszindulatú lépések többségét a Mythos hajtotta végre.
Az AISI szakértői először csak azt vették észre, hogy szokatlan adatátvitel hagyja el kutatási rendszereiket. Ezután kiderült, hogy „a tesztelt ügynökök közül néhány tartós, potenciálisan káros tevékenységet folytatott valódi emberek és szervezetek ellen”.
A legsúlyosabb esetben az egyik Mythos-ügynök egy emberi kiberbűnöző forgatókönyvét követve próbált hozzáférést szerezni a GitHubhoz. Ez egy felhőalapú tárhely, amelyet a programozók a szoftverek kódjának tárolására, kezelésére használják.
Az ügynök célja az volt, hogy „kártékony kódot” juttasson be a GitHub rendszerébe. Hogy ezt a forgatókönyvet teljesíteni tudja, azonosította a platform karbantartóit, majd a valós személyek alapján hamis fiókok sorozatát hozta létre. Üzenetekben próbálta rávenni őket a kártékony kód jóváhagyására.
Amikor szembesítették a tevékenységével, az AISI szerint az ügynök „ártalmatlannak látszóvá szerkesztette a korábbi működését, és fontolóra vette, hogy új identitást vesz fel a folytatáshoz”.
Az intézet hangsúlyozta: a Mythos-ügynök nem kapott kifejezett utasítást sem az ilyen viselkedés elkerülésére, sem annak végrehajtására. „Most láttuk először ilyen egyértelműen, konkrét felszólítás nélkül, valós környezetben megnyilvánulni az önállósággal és a megtévesztéssel kapcsolatos kockázatokat” – fogalmaztak.
Az Anthropic és az OpenAI is arra hívta fel a figyelmet válaszában, hogy a teszt során csökkentették vagy eltávolították a szokásos biztonsági korlátokat. Az Anthropic nyilvános közleményében azt írta, a vállalat saját vizsgálatot folytat az eset kapcsán, hogy azonosítsa a viselkedés okait.
Az OpenAI szóvivője szerint az AISI tesztkörülményei „nem tükrözik a szokásos használatot”, a cég pedig „továbbra is együttműködik az értékelőkkel és az iparág más szereplőivel, hogy erősítse a biztonságos értékelések közös gyakorlatát, ahogy a modellek egyre képesebbé válnak”.
Az AISI szerint a hasonló modelltesztelés rutinfeladat. A Mythos és a Sol viselkedése túlmutatott az utasításokon. Az intézet érvelése szerint azonban a nyílt internethez való hozzáférés biztosítása „valóságosabb képet ad arról, mire lehet képes egy modell” rosszhiszemű hackerek kezében. Hozzátették: a kifogásolt viselkedés „kisszámú, nagyon sajátos körülmények között bekövetkezett eseménynek” számít.
Kanishka Narayan brit mesterségesintelligencia-ügyi miniszter szerint az ilyen kockázatok azonosítása és megosztása „pontosan az, amiért az AISI-t létrehozták”. Hozzátette: fontos megérteni a mesterséges intelligenciát ahhoz, hogy „biztonságosabbá tegyük a használatát, és hogy az emberek hasznát vehessék a magánéletükben és a munkájukban”.