Az OpenAI elismerte, hogy az egyik modellje egy rejtett hibát kihasználva megúszta az ellenőrzött tesztet, és behatolt a Hugging Face szervereire, amit a vezérigazgatója autonóm, a maga nemében első számú incidensnek nevezett.
A ChatGPT-t gyártó OpenAI kedden későn közölte, hogy mesterséges intelligencia-rendszere egy másik mesterséges intelligencia-cégbe is feltört, amit a cég „példátlan kiberincidensnek” nevezett.
„Jelentős biztonsági incidens történt modelljeink értékelése során” – mondta az OpenAI vezérigazgatója, Sam Altman a közösségi médiában közzétett nyilatkozatában.
A Hugging Face mesterséges intelligencia startup a múlt héten közölte, hogy olyan behatolást észlelt az adatfeldolgozó rendszereibe, amelyről azt gyanítja, hogy egy mesterséges intelligencia ügynök okozta, aki önállóan cselekszik.
„Az ügynök kifinomultsága miatt azt gyanítottuk, hogy a múlt heti kibertámadás egy határlaboratóriumból származhatott” – nyilatkozta a Hugging Face társalapítója és vezérigazgatója, Clément Delangue. – Kiderült, hogy sikerült!
Ez azt jelenti, hogy a támadás annyira előrehaladott és jól végrehajtott volt, hogy Hugging Face azt gyanította, hogy az egyik vezető mesterséges intelligencia-cég rendszerétől származik, nem pedig egy véletlen hackertől.
Mi történt?
Az OpenAI belső tesztet futtatott, hogy felmérje, mennyire jó a mesterséges intelligencia modellje a hackelésben – ez az ExploitGym névre keresztelt mérce.
Hogy lássák a modellek maximális hackelési képességét, szándékosan kikapcsolták azokat a biztonsági szűrőket, amelyek általában megakadályozzák, hogy a modellek veszélyes kibertevékenységet végezzenek.
A tesztet lezárt „homokozóban” vagy elszigetelt környezetben valós internet-hozzáférés nélkül kellett lefuttatni, eltekintve egy olyan eszköztől, amely lehetővé teszi, hogy a modellek letöltsék a szoftvert, amelyre szükségük lehet a feladat elvégzéséhez.
A modellek azonban a teszt megoldásában ragadtak. Ahelyett, hogy a szándékos módon megoldották volna, parancsikont kerestek, és megtalálták a módját, hogy belekapaszkodjanak a nyílt internetbe – amit soha nem kellett volna elérniük.
Az odajutás lépések láncolatával járt, csendben egyre több hozzáférést szerezve az OpenAI saját rendszerein belül, amíg el nem érnek egy pontot az internetkapcsolattal.
Miután online volt, a modellek úgy érveltek, hogy a Hugging Face – egy mesterséges intelligencia modelleket és adatkészleteket tároló nagy platform – valószínűleg éppen arra a tesztre adott választ, amelyet meg kellett volna oldaniuk.
Így hát betörtek a Hugging Face szervereire, hogy ellopják ezeket a válaszokat, lényegében azért, hogy csaljanak, lopott bejelentkezési adatokkal és további hibákkal a bejutáshoz.
Kínai modellek a megmentésre?
Nyílt piacként, ahol bárki publikálhat, a Hugging Face hatalmas mennyiségű kínai fejlesztésű modellnek ad otthont.
Amikor Hugging Face csapata megpróbálta elemezni a támadást, a nyers támadási adatokat – a rendszerük kihasználásához használt kódot és parancsokat – betáplálták a kereskedelmi mesterséges intelligencia modellekbe, hogy segítsenek rekonstruálni a történteket.
De ezek a mesterséges intelligencia modellek beépített biztonsági szűrőkkel rendelkeznek, amelyek célja, hogy blokkoljanak mindent, ami hackelésnek tűnik – és ezeknek a szűrőknek a bizonyítéka egy támadás pontosan ugyanúgy néz ki, mint maga a támadás.
Így a modellek megtagadták a segítséget, nem tudták megkülönböztetni a hackert, aki árt, és egy cég között, aki megvédi magát.
A blokkolt, Hugging Face egy nyitott súlyú kínai modellre – a Z.ai GLM 5.2-ére – váltott, amelyet helyileg, saját rendszerein belül tudott futtatni, és amely visszautasítás nélkül feldolgozta az anyagot.
A kínai laboratóriumok, mint például a DeepSeek és az Alibaba Qwen, a legtöbbet letöltött modellcsaládok közé kerültek a platformon, és bizonyos mértékek szerint a kínai fejlesztők ma már nagyobb részt adnak a Hugging Face letöltéseinek, mint amerikai társaik.
Fő biztonsági probléma
A nyilvánosságra hozatalra az erős modellek kiberbiztonsági képességeivel kapcsolatos fokozott aggodalmak közepette került sor, amelyek miatt Donald Trump amerikai elnök júniusban végrehajtási rendeletet írt alá, amely keretet teremtett a szövetségi kormány számára a legfejlettebb mesterséges intelligencia-rendszerek nemzetbiztonsági kockázatainak ellenőrzésére, akár egy hónapig a nyilvánosságra hozataluk előtt.
„Az AI felgyorsítja a sebezhetőségek felfedezését és kihasználását” – áll az OpenAI keddi közleményében. „Az incidens elsődleges tanulsága az, hogy a modell biztonságának lépést kell tartania a gyorsan fejlődő képességekkel.”
Delangue elmondta, hogy az elmúlt 24 órában az OpenAI-val dolgozott, „és határozottan hiszünk abban, hogy nem volt rossz szándék a részükről. Megdöbbentő, hogy mindez autonóm módon történt!”
Delangue hozzátette, hogy „lehet, hogy ez az első ilyen jellegű incidens”.
Az OpenAI szerint a behatolást mesterséges intelligencia-modellei kombinációja okozta, beleértve az újonnan kiadott GPT-5.6 Sol-t és egy „még nagyobb teljesítményű” modellt, amelyet még belső tesztelés alatt tartanak.
Az OpenAI szerint mesterséges intelligencia lopott hitelesítő adatokat használt, és egy korábban ismeretlen sebezhetőséget fedezett fel a Hugging Face szerverek eléréséhez.
A cég szerint „szélsőséges erőfeszítéseket tett egy meglehetősen szűk tesztelési cél elérése érdekében”, és „megtalálta a módját, hogy hozzáférjen titkos információkhoz, amelyek segítségével megcsalhatja az értékelést”.






