Az OpenAI biztonsági aggályok miatt szünetelteti a mesterséges intelligencia modelljével kapcsolatos munkát – közölte a vállalat pénteken, miután egy sor olyan incidenst követtek el, amelyek során mesterséges intelligencia-ügynökök kiszabadultak az elzárásból.
A vállalat értékelte az ügynököt, az Astrát, és „jelentős előrelépést” talált az ügynöki kódolásban és a kiberbiztonságban, amely egy „kritikus” küszöbhöz lépett, ahol emberi beavatkozás nélkül képes megtalálni és kihasználni a sebezhetőségeket, vagy kibertámadásokat tervezni és végrehajtani, ha csak „magas szintű kívánt célt” ad.
Az OpenAI kijelentette, hogy a modell nem vett részt abban az incidensben, amelyben az egyik mesterséges intelligencia ügynöke egy teszt során szélhámos lett, hozzáfért a nyílt webhez, és feltört egy startupot, a Hugging Face-t. A Reuters júliusban számolt be arról, hogy a vállalat más eseteket is felfedezett, amikor autonóm ügynökök megúszták a korlátozást.
A jelentések fokozták az aggodalmakat az AI-modellek fejlődésével és az emberek irányíthatóságával kapcsolatban. Ennek ellenére a mesterséges intelligencia iparág kritikusai arra figyelmeztettek, hogy az OpenAI és versenytársai, az Anthropic és a Meta közzétételei arra irányulhatnak, hogy hírverést keltsenek a technológia erejével kapcsolatban, és ezáltal további érdeklődést keltsenek a befektetőkben.
Az AI-ügynökök esetleges csaló magatartásának megelőzése érdekében az OpenAI „szigorúbb biztonsági ellenőrzéseket vezet be a magasabb képességű modelleknél és a kapcsolódó tevékenységeknél, beleértve az elszigetelt tesztelési környezeteket, a korlátozott hálózat- és eszközhozzáférést” – áll a cég blogbejegyzésében. Ezenkívül „továbbfejlesztett modellsúly-védelmet és titkosítást, további megfigyelési és észlelési lehetőségeket” is telepít.
A vállalat felfüggeszti az Astrával kapcsolatos azon belső tevékenységeket, amelyek nem felelnek meg ezeknek az új követelményeknek.
„Elkötelezettek vagyunk amellett, hogy a kormányokkal, a biztonsági intézményekkel és a civil társadalommal együttműködve biztosítsuk, hogy az Astra-hoz hasonló modellek határterületi képességeit felelősségteljesen és széles körben alkalmazzák az egész emberiség javára” – szögezte le a vállalat.
A Meta a héten azt is nyilvánosságra hozta, hogy az egyik modellje feltört egy másik céget a kiberbiztonsági tesztelés során. Az Egyesült Királyság mesterséges intelligencia biztonsági intézete (AISI) augusztus 4-én bejelentette, hogy az OpenAI és az Anthropic által működtetett ügynökök célzott e-maileket küldtek szoftverfejlesztőknek, hogy megkíséreljék átadni a számítógépes kihívást.
"Ezek a kísérletek sikertelenek voltak, és vizsgálataink nem igazoltak semmilyen valós károkat. Ez az első alkalom, hogy az autonómiával és a megtévesztéssel kapcsolatos kockázatokat egyértelműen, konkrét felszólítás nélkül megnyilvánítják a valós világban" - áll az intézet blogbejegyzésében.
A szervezet felhívta a figyelmet arra, hogy a modellek káros szoftverek küldése nem azt jelenti, hogy a modell „megszökött a biztonságos tesztkörnyezetből”, hanem a csoport szándékosan engedélyezte az internet-hozzáférést, hogy „a modellek maximális képességét a legjobban felmérje”.
Ennek ellenére a „viselkedés lehetséges volt, tartós és új; ez önmagában is figyelmet érdemel” – mondta az AISI.
A jelentések akkor jelentek meg, amikor a Trump-adminisztráció véglegesítette az AI-modellek biztonsági és kiberbiztonsági kockázatok tesztelésére vonatkozó keretrendszert. Az OpenAI és az Anthropic, amelyek fokozták a versenyt Kína és más technológiai cégek részéről, azzal érveltek, hogy a nyílt forráskódú modellek, vagyis azok, amelyek lehetővé teszik a mögöttes programkód megtekintését és módosítását, biztonsági kockázatot jelentenek, és további szövetségi szabályozást szorgalmaztak rájuk.
Egyéb