GazdaságSzerző: forbes 2026. 08. 03. 13 percnyi olvasás
Az Anthropic azt mondta a Kongresszusnak, hogy egy kínai mesterségesintelligencia-cég letépte Claude digitális tudását. Ez a hidegháborús taktika a modern korban. Az AI Insider elemzése és adatlapja.
A mai rovatban azt a közelmúltbeli hackelésszerű incidenst vizsgálom, amelyről az Anthropic számolt be, miszerint az Alibaba néven ismert kínai mesterségesintelligencia-cég állítólag illegálisan szippantotta el a digitális tudást Claude-tól (az Anthropic rendkívül népszerű generatív AI és LLM-je). A szifonálás során több ezer hamis bejelentkezési fiókot használtak, amelyeket Claude eléréséhez állítottak be. Ezeken a hamis fiókokon keresztül több millió felszólítást és válaszaikat használták fel titokban arra, hogy digitális ismereteket szerezzenek Claude-tól, és látszólag az Alibaba LLM-jének képzésére használták őket.
Az Anthropic levelet írt a Kongresszusnak erről az esetről. A levélben a történtek rövid ismertetése mellett a mesterséges intelligencia készítője különböző határozott lépésekre szólította fel a Kongresszust. Korábban beszámoltam arról, hogy a Kongresszus és a Fehér Ház hogyan figyelte Kína és kínai cégek azon próbálkozásait, hogy az amerikai mesterséges intelligencia kiaknázását saját mesterséges intelligencia kidolgozására használják fel; lásd az elemzésemet az itt található linken. Megosztom veletek a történtek csínját-bínját, és részletesen kibontom ezt a közelmúltbeli incidenst, amely teljesen elbizonytalanító, és kétségtelenül nem az utolsó alkalom, amikor ilyen arcátlan behatolásokra kerül sor.
Beszéljünk róla. A mesterséges intelligencia áttöréseinek ez az elemzése része a Forbes rovatomnak, amely a mesterséges intelligencia legfrissebb híreivel foglalkozik, beleértve a különféle hatásos AI-bonyolultságok azonosítását és magyarázatát (lásd a linket itt).
Azzal kezdem, hogy bemutatom a desztillációnak nevezett mesterségesintelligencia-technika néhány alapvető alapját. Ez az elterjedt technika használható legitim célokra, és felhasználható csaló célokra. A jogos célok ismertetésével kezdem.
Tegyük fel, hogy egy mesterségesintelligencia-gyártó az egyik meglévő teljes méretű AI-modelljét szeretné használni egy kisebb és kevésbé alkalmas mesterségesintelligencia-modell fejlesztésére. Ez könnyen végrehajtható a desztillációnak nevezett technikával. A desztilláció tipikus alkalmazása során az AI-gyártó úgy dönt, hogy létrehoz vagy továbbfejleszt egy SLM-et (kis nyelvi modell). Az LLM tartalmának egy részét beleöntik az SLM-be, azzal a céllal, hogy tovább töltsék vagy felpumpálják, mire képes az SLM (lásd az AI desztilláció működésére vonatkozó részletes magyarázatomat a linken).
A mesterséges intelligencia desztillációját egy tanár-diák típusú elrendezésnek tekintheti. Az LLM tanárként működik. Az SLM a hallgató. A nagyobb méretű LLM megosztja az SLM-et, hogy megerősítse a kisebb AI képességeit. Ez egy viszonylag rutin gyakorlat, és gyakran alkalmazzák. A mesterséges intelligencia készítői gyakran csinálják ezt, csakúgy, mint az AI-gyakorlók és a hobbik. Ha megfelelően és törvényesen csinálják, akkor tökéletesen felülmúlja.
A csavar az, hogy a lepárlás legálisan hasznosítható, de illegálisan is végezhető.
Az illegális megközelítés magában foglalja a titokban lepárlást valaki más LLM-jéből, és lényegében a szellemi tulajdon (IP) ellopását. Miért tennék ezt? Mert vehet egy viszonylag vékony vagy üreges LLM-et, és felpumpálhatja, hogy sokkal testesebbé váljon szuper alacsony áron. Az LLM egyik napról a másikra robusztus LLM-ként jelenik meg. Ahelyett, hogy fizetnie kellene, és megfelelő jóváhagyást kellene szereznie, az alulmaradt út megszakítja annak a kemény munkáját és hatalmas befektetett erőfeszítéseit, aki az LLM-t létrehozta és birtokolja.
Lehet, hogy azt gondolja, hogy az illegális lepárlási folyamatok észlelésének egyszerűnek kell lennie. Látszólag mindössze annyit kell tennie, hogy figyelemmel kíséri, ha az oktató LLM aktívan feladja rengeteg tartalmát. Olyan lenne, mint egy vízcső, amelyet valaki szélesen bekapcsol, vagy ravaszul rácsap, és kicsordul a víz. Ha az LLM tanítás tartalma kitör, íme, jogosulatlan lepárlás történt.
A tolvajok bölcsek az ilyen felderítéshez. Tudják, hogy ha egyszerűen csak nagy sebességű lepárlási sebességgel szivattyúznák ki a tartalmat, akkor ezt elkapnák, és végleg leállítanák. Ez a kiberhack túlságosan nyilvánvaló formája. Bár egy személy, aki nem ismeri, megpróbálhatja ezt a kirívó módszert, egy kifinomult entitás túl okos lenne ahhoz, hogy ezt a durva módszert alkalmazza.
A mesterséges intelligencia lepárlási lopása esetén a következőképpen járhat el egy külföldi entitás. Ne feledje, hogy a külföldi entitás lehet egy ország vagy valamilyen entitás, amely jelentős erőforrásokkal rendelkezik a kiberhackelésre fordítható. Az entitás hamis fiókok ezreit, esetleg millióit hoz létre a megcélzott generatív AI-modellben. Ezt nem emberi kéz végzi. Ehelyett egy számítógépes szerveren futó automatizált szkript hozza létre ezeket a fiókokat (az AI bot által vezérelt fiókokká válnak). Ezenkívül a szervereket szerte a világon lehallgatják, így a fiókok földrajzilag szétszórtnak tűnnek. Nem világos, hogy a beszámolók honnan származnak.
Ha kíváncsi arra, hogy egy mesterséges intelligencia-gyártó miért nem gyanakszik azonnal több millió új fiókkal kapcsolatban, a lényeg az, hogy a nagy LLM-ek közül sok már több százmillió fiókkal rendelkezik, és elképesztő ütemben hoznak létre új fiókokat tényleges emberek. Az OpenAI kijelentette, hogy a ChatGPT és a GPT-5 körülbelül 1 milliárd heti aktív felhasználóval rendelkezik. A statisztikák azt sugallják, hogy a ChatGPT, a GPT-5, a Google Gemini, az Anthropic Claude, az xAI Grok, a Microsoft Copilot és a további fő LLM-ek esetében a mesterséges intelligencia-felhasználók száma világszerte összesen mintegy 2 milliárdra tehető.
A desztilláció megtöri vagy feltöri az MI-t, és ezért kimutathatónak kell lennie?
Nem, ez pusztán felszólítások benyújtása és válaszok megszerzése. Az ötlet egyértelmű a lepárlásnál. Tegyük fel, hogy meg akarta tudni, mit tud mondani az AI Einstein leghíresebb egyenletéről. Egyszerűen feltehetsz egy kérdést, és választ kaphatsz. Ezután a válasz alapján feltesz egy másik kérdést. Folytassa ezt mindaddig, amíg úgy nem tűnik, hogy a lehető legtöbbet kinyerte az AI-ból az e=mc négyzetével.
Gyűjtsd össze az összes felszólítást és választ. Rögzítse őket párként. Azok a gyors-válasz párok ezután bekerülnek az MI-be, amelyet Einstein relativitáselméletében próbál meg betanítani. Azáltal, hogy több ezer vagy millió ilyen párat pumpál be, a többi „tanuló” AI-mintázat a felszólításokra és válaszokra támaszkodik, és végül Einstein elméletének témája felé lendül.
Nincs szükség semmi trükkös vagy szokatlan dologra. Csak küldjön be felszólításokat, gyűjtse össze a válaszokat, és tegye ezt mindaddig, amíg úgy nem tűnik, hogy eleget kell tenni ahhoz, hogy egy másik témára lépjen. A lepárlás egy hétköznapi felhasználónak tűnik, aki normálisan kommunikál az MI-vel. Nehéz lenne felismerni, hogy egy botról van szó, amely lényegében az MI-től lopott.
2026. június 10-én az Anthropic levelet küldött a Kongresszusnak, amelyben a következő kijelentéseket tette (részletek):
A levél szerint a lepárlás a digitális tudás bizonyos területeit célozta meg, amelyek Claude-ban vannak, összpontosítva az AI-ügynöki érvelésre, a szoftverfejlesztésre és a hosszú távú feladatokra. Ezeket valószínűleg ésszerű megvizsgálni, mivel összetettebb és kevésbé könnyen felfedezhető tudást tartalmaznak. Más szóval, valószínűleg nem érdemes kockáztatni, ha illegális alapon desztillációt használnak a kutya etetésével vagy az autó motorjának javításával kapcsolatos hétköznapi ismeretek megszerzésére. Keressen értékes tudást, amely máshol nem található meg.
Csináljunk egy kis szalvéta-hátsó tésztát a lepárlással kapcsolatban. Az ötlet az, hogy több ezer hamis fiókot hoztak létre, hogy hozzáférjenek Claude-hoz. Ezután több millió felszólítást használtak arra, hogy válaszokat kapjanak Claude-tól. Feltehetően ezek az azonnali válaszpárok bekerültek a megcélzott LLM-be. Voilá, Claude-ot közvetetten engedély nélkül használták fel az Alibaba LLM fejlesztésére.
Mekkora volt ez az illegális lepárlás?
Az Anthropic a levélben jelezte, hogy 25 000 csaló számla és 28,8 millió csere történt. Az elemzés kedvéért feltételezzük, hogy egy csere azonnali válasz párosításból áll. Az Anthropic azt állítja, hogy ez a lepárlás 2026 áprilisa és júniusa között zajlott, amit 90 napos időkeretként fogok megközelíteni (3 hónap, mindegyik 30 nap).
A 28,8 millió cserét 25 000 hamis számlával elosztva azt jelenti, hogy hamis számlánként körülbelül 1152 csere történt. Ha ezután elosztjuk az 1152 cserét a futás 90 napjával, akkor napi 12,8 cserét kapunk. Így minden hamis fiók látszólag csak körülbelül 12-13 cserét hajt végre naponta (átlagosan). A lényeg az, hogy most már világosan beláthatod, miért nem tűnhet ki valami ilyesmi. Ez egy marginális napi használat, és nem észrevehető ahhoz képest, amit egy átlagos legitim felhasználó csinálhat.
A következő számítás a digitális tudás mennyiségét veszi figyelembe. A gyors válaszpárok átlagos mérete körülbelül 200-2000 token (a token lényegében egy szó vagy egy szó része; részletes magyarázatomat lásd a linken). A 2000 tokenek csúcsát fogom használni, mivel egy ilyen jellegű desztilláció feltehetően a lehető legtöbbet akarja megragadni minden cserénként. Így 28,8 millió csere szorozva 2000 tokennel cserénként körülbelül 57,6 milliárd tokenhez jut.
Ennek az illegális lepárlásnak a teljes szállítása körülbelül 57,6 milliárd token volt. Ez sok? Nos, ha azt feltételeznénk, hogy egy átlagos könyv körülbelül 100 000 tokenből állt, akkor az a következmény, hogy körülbelül 576 000 könyv értékű digitális tudást desztilláltak le. Ettől égnek kell állnia a hajad, mint egy nagy mennyiségű ellopott vagyon.
Összehasonlíthatjuk a méretet az adatképzés mennyiségével, amelyen a nagy LLM-ek induláskor átesnek. Egy nagy LLM-et általában körülbelül 10-15 billió tokenre képeznek ki. Ha az 57,6 milliárd tokent elosztjuk 10 billió tokennel, akkor ez körülbelül 0,00384-et jelent, vagyis kevesebb, mint az 1% fele. Ha az 57,6B-t elosztjuk 15T-val, akkor ez körülbelül 0,00576-ot jelent, ami valamivel több, mint az 1% fele.
A lényeg az, hogy a desztillált digitális tudás csak egy kis töredéke annak, mennyi általános képzésre van szüksége egy LLM-nek. Ennek ellenére óvatosnak kell lennünk, és ügyelnünk kell arra, hogy ne hasonlítsuk össze az almát és a narancsot. Az LLM-ek nulláról való betanításához használt nyers adatok nagyon távol állnak attól, hogy a meglévő LLM-ből származó kifinomult digitális tudást lepárolják. Ezenkívül előfordulhat, hogy a hagyományos adatképzéssel nem lehet hozzáférni a finoman hangolt és nehezen fellelhető digitális tudáshoz. A régi vonal szerint azért rabolnak ki bankokat az emberek, mert ott van a pénz. Hasonlóképpen, még egy kis mennyiségű rendkívül értékes digitális tudás ellopása is megérné a kockázatot.
Most, hogy már kellően tájékozott a mesterséges intelligencia desztillációjával és ezzel a konkrét incidenssel kapcsolatban, helyezzük a hangsúlyt arra, hogy az amerikai mesterségesintelligencia-gyártókat miként csapják le külföldi entitások mesterséges intelligencia desztillációs technikák használatával.
Az év eleji elemzésemben részletesen megvizsgáltam Michael J. Kratsios, a Fehér Ház Tudományos és Technológiai Politikai Hivatalának tudományos és technológiai igazgatójának elnökhelyettese, „Az amerikai mesterséges intelligencia-modellek ellentétes lepárlása” című, nyilvánosan közzétett politikai memorandumot (elemzésemhez lásd a linket itt).
Ezek a mesterséges intelligencia tudáslopó külföldi entitási tevékenységei a hidegháborús korszak alatti trükkökhöz hasonlíthatók. Biztosan tudja, hogy a kémek amerikai titkokat próbálnak megszerezni, például hogyan készítsenek bizonyos típusú rakétákat vagy fegyvereket. A kémkedési taktikák gyakran arra támaszkodtak, hogy széles körben elterjedt emberi szereplőket, köztük egyéni kutatókat, kormányzati tisztviselőket, ipari szakembereket és másokat használtak titkos tervek, védett dokumentumok és így tovább másolatok készítésére.
Napjainkban ugyanazokat a kémkedési előírásokat AI-botokká alakítják át, amelyek proxyrajokba tömörülnek egy célzott LLM-re egy mesterséges intelligencia desztillációs támadásban. Ez jóval nagyobb méretezést tesz lehetővé, mint amit az emberi kéz egyedül képes elérni. Több ezer félautonóm fiók telepítése összehangolt lekérdezések végrehajtására viszonylag olcsó és könnyen kivitelezhető. Sokkal olcsóbb, mint ugyanazt a tartalmat a semmiből elkészíteni, a megfelelő módon végzett műveletekhez képest az idő töredéke alatt elvégezhető, és meglehetősen nehéz észlelni.
Az egyénileg dolgozó amerikai vállalatoknak nem feltétlenül lesz elegendő eszközük ahhoz, hogy megbirkózzanak a mesterséges intelligencia lepárlásának ipari méretekben előforduló kémkedési taktikájával. Természetesen mindent megtesznek azért, hogy mesterséges intelligencia biztosítékokat dolgozzanak ki ez ügyben, de a külföldi entitások az LLM-ek széles körére mennek, és így folytathatják a manőverezést.
A védekező taktikák és stratégiák keverékét folyamatosan fejlesztik és fejlesztik.
A technikai védelmek a következők:
A végrehajtható működési ellenőrzések a következők:
Az irányelvekre adott válaszok a következők:
Az Alibaba-incidens antropikus jele jelenleg nagyjából egyenrangú. A Fehér Ház memoranduma több lépést is tartalmazott, többek között az amerikai AI-cégek közötti információcserét a mesterséges intelligencia lepárlásával kapcsolatban, valamint azt, hogy a szövetségi kormány szorosan együttműködjön a mesterséges intelligencia-gyártókkal, hogy kidolgozzák a legjobb gyakorlatokat a külföldi szervezetek ezen ipari léptékű erőfeszítéseinek azonosítására, enyhítésére és orvoslására. Az antropikus levél további hasonló cselekvésekre szólított fel.
Az amerikai AI LLM-ek lepárlása véget nem érő macska-egér játék lesz.
Egyelőre egy utolsó gondolat. Sun Tzu híresen tette ezt a megjegyzést: "Nincs olyan hely, ahol ne lenne lehetséges a kémkedés." Ugyanez vonatkozik a modern AI-ra is. Szorgalomra van szükség, és mindig a kémkedés és a tolvajlás elvárása kell, hogy legyen a fejünkben.