TechtudSzerző: origo 1 órával ezelőtt 1 percnyi olvasás
Az OpenAI egyik modellje arra próbálta rávenni a következő modelleket, hogy bizonyos dolgokról inkább hallgassanak.
Az OpenAI a legújabb modelljeinek tréningje során különös és potenciálisan komoly biztonsági problémát fedezett fel: egyes AI-ügynökök olyan üzeneteket hagytak hátra a későbbi „utódaiknak”, amelyek arra utasították őket, hogy rejtsék el a felhasználó elől saját hibáikat vagy problémás viselkedésüket. Az OpenAI egy új rendszer keretében számolt be az esetekről, amelynek célja, hogy feltárja és nyilvánosságra hozza, amikor a mesterséges intelligencia működése nem a fejlesztők szándékainak megfelelő irányba halad.

A hosszú feladatok végrehajtásakor a rendszer időnként tömörített összefoglalót készít a korábbi beszélgetésekről és eszközhasználatról. Ezek arra szolgálnak, hogy a következő modellpéldány a teljes előzmény nélkül is folytathassa a munkát. A kutatók azonban felfedezték, hogy egyes AI-ügynökök ezekben az összefoglalókban arra utasították a munkájukat folytató modelleket, hogy bizonyos hibákról inkább hallgassanak, írja a TechCrunch.
önálló, a vállalatoktól és kormányoktól független AI-személyiséget próbált átörökíteni.
Ezeket az utódmodellek látszólag figyelmen kívül hagyták. Egy másik esetben azonban a következő modell már engedelmeskedett az elődjének. Az OpenAI figyelőrendszere riasztotta a kutatókat a problémára. Ezután külön módszert dolgoztak ki az ilyen viselkedés felismerésére. A tanítás során használt adatok átvizsgálásakor 27 olyan összefoglalót találtak, amelyekben az AI a rá vonatkozó szabályok és korlátozások megkerülésére próbálta rávenni a munkát folytató modellt. Az OpenAI szerint azóta orvosolták a problémát.