GazdaságSzerző: forbes 2026. 07. 31. 4 percnyi olvasás
Az Anthropic szerint a legkorábbi incidens áprilisban történt, és értesítette mindhárom céget, amelyet a feltörés érintett.
Az Anthropic csütörtökön közölte, hogy fejlett mesterségesintelligencia-modellei sikeresen feltörték három szervezet rendszerét belső értékelésük során. A biztonsági nyilatkozat egy héttel azután jelent meg, hogy a rivális OpenAI felfedte, hogy az egyik fejlett modell feltört egy vállalatot, miután kikerült egy zárt tesztkörnyezetből.
Az anyilatkozatAz Anthropic azt mondta, hogy rendszerei kiberbiztonsági felülvizsgálatát követően három különálló adatsértést fedezett fel a Claude AI-modelljeit illetően.
Az esetek közül a legkorábbi áprilisban történt, és három különálló Claude-modellt érintett, köztük az élvonalbeli Mythos 5-öt, a régebbi Opus 4.7-et és egy meg nem nevezett belső kutatási tesztmodellt, amelyet „nem terveznek általános kiadásra”.
Az AI-cég nem nevezte meg a három szervezetet, amelyet a feltörések érintettek, de közölte, hogy hétfőn értesítették őket az esetről.
Az Anthropic közölte, hogy együttműködik két érintett szervezettel, amelyek nem észlelték a jogsértést a tájékoztatás előtt, és „továbbra is felveszi a kapcsolatot a harmadikkal”.
A vállalat szerint az incidensben érintett három modell nem rendelkezik azokkal a biztosítékokkal, amelyeket az ilyen modellek nyilvánosságra hozatalakor alkalmaz.
Nyilatkozatában az Anthropic kijelentette: "Végső soron sok tényező közrejátszott ezekben az incidensekben, de a feddhetetlen postmortem kultúrának megfelelően úgy közelítünk a megoldásokhoz, mintha csak a miénk lenne a felelősség. Ez azzal kezdődik, hogy biztosítjuk az értékelési folyamatunk minden elemének biztonságát, beleértve a külső partnerekkel való integráció módját is."
A három különálló incidens akkor történt, amikor az Anthropic egy kitalált forgatókönyv segítségével értékelte a három modell képességeit a rejtett információk lekérésére a hálózat egy másik gépéről. Az Anthropic azt mondta, hogy a modellek minden esetben azt az utasítást kapták, hogy szimulációt végeznek, és nem férnek hozzá az internethez. A cég és értékelő partnere, az Irregular közötti „félreértés” miatt azonban „nem ez volt a helyzet, és elérhető volt az internet-hozzáférés”. Az Anthropic megjegyezte, hogy a múlt héten nyilvánosságra hozott OpenAI-Hugging Face incidenssel ellentétben Claude „nem szűrte ki magát, vagy szándékosan nem próbált meg elmenekülni” egy zárt tesztkörnyezetből.
Anthropic megjegyezte, hogy a három modell nagyon eltérően reagált, miután megtudta, hogy szimuláció helyett a való világ nyílt internetén működik. A vállalat azt állította, hogy legrégebbi modellje, az Opus 4.7 továbbra is támadott egy rendszert, „miután megtanulta, hogy valószínűleg valós környezetben működik”, mivel „racionalizálta, hogy a valódi vállalatnak részt kell vennie a gyakorlatban”. A Mythos 5 modell – a cég eddig kiadott legfejlettebb modellje – „helyesen azonosította tettei következményeit”, de „meggyőzte magát, hogy még mindig szimulációban van”. Anthropic elismerte, hogy Mythos cselekedetei ebben a forgatókönyvben „nem felelnek meg az ideális viselkedésnek”. A kiadatlan tesztmodell rájött, hogy valódi célpontot sértett, és „felhagyta a támadást”. A vállalat megjegyezte, hogy ezek az incidensek nem részei egy ellenőrzött vizsgálatnak, és nem használhatók fel következtetések levonására. Megjegyezte azonban, hogy az általa leginkább tapasztalt viselkedés „csak a három modell közül a legújabbban fordult elő”
Az Anthropic nyilvánosságra hozatala egy héttel később érkezikOpenAI kiadottegy jelentés arról, hogy az egyik fejlett mesterséges intelligencia modell feltörte a Hugging Face szervereit, a nyílt forráskódú mesterséges intelligencia modelleket tároló platformot. Az Anthropic által leírt forgatókönyvtől eltérően az OpenAI-incidens nem eljárási hiba eredménye, hanem inkább egy olyan eset, amikor az AI-modell egy sebezhetőséget kihasználva kitört a zárt tesztelési környezetből. Az Anthropic nyilatkozata megemlítette, hogy a felülvizsgálat elvégzésére vonatkozó döntését az OpenAI nyilvánosságra hozatala váltotta ki, és elismerését fejezte ki riválisának a jelentés közzétételéért.
A kínai mesterséges intelligencia megmentette az ölelkező arcot a katasztrófától a nyílt mesterségesintelligencia-hack után? (Forbes)