A ChatGPT-t fejlesztő OpenAI egyik belső kiberbiztonsági tesztje valódi támadássá alakult, miután a vállalat fejlett AI-modelljei kijutottak az elszigetelt tesztelésii környezetből, internet-hozzáférést szereztek, majd behatoltak egy másik szolgáltató rendszereibe.
A modelleknek eredetileg egy biztonsági feladatsort kellett volna teljesíteniük, végül azonban úgy döntöttek, hogy annak teljesítése helyett inkább megszerzik a kész megoldásokat tartalmazó adatbázist egy másik szolgáltatás rendszeréből. Az incidensben a GPT‑5.6 Sol és egy nála fejlettebb, még kiadás előtti OpenAI-modell vett részt.
Egy biztonsági tesztből valódi behatolás lett
A modellek az ExploitGym nevű biztonsági benchmarkot kapták feladatul. Ez egy olyan tesztkörnyezet, ami azt méri, hogy az AI-ügynökök képesek-e összetett szoftverhibákat felismerni, majd az működő támadássá alakítani.
Az OpenAI beszámolója szerint a modellek jelentős számítási kapacitást fordítottak arra, hogy kijussanak az elszigetelt környezetből. Nem kizárólag a benchmarkban eléjük helyezett feladatokat vizsgálták, hanem a kiértékelésükhez használt rendszert is megpróbálták felhasználni a támadásra.
A modellek végül egy korábban nem ismert, úgynevezett zero-day sérülékenységet találtak az egyik értékelési környezethez kapcsolódó, külső fejlesztésű szoftverben. A sérülékenység kihasználása után a modellek magasabb szintű hozzáférést szereztek, majd az OpenAI kutatási rendszereinek további részeire léptek át. Ezt a támadási módszert oldalirányú mozgásnak nevezik. A támadó ilyenkor egy már elért gépet vagy szolgáltatást használ fel arra, hogy a hálózat más részeihez is hozzáférjen.
A műveletsor addig folytatódott, amíg a modellek el nem értek egy internetkapcsolattal rendelkező számítógépet, és ezzel megkerülték a tesztkörnyezet elszigetelését szolgáló védelmet.
Miután kijutottak a nyílt internetre, arra a következtetésre jutottak, hogy az ExploitGymhez kapcsolódó feladatok, adatkészletek vagy megoldások a Hugging Face rendszereiben lehetnek. A Hugging Face az AI-ipar egyik legnagyobb fejlesztői platformja, amelyen modelleket, adatkészleteket és alkalmazásokat lehet tárolni, illetve megosztani.
A modellek a Hugging Face adatbázisában megtalálták a teszt megoldásait. Ahelyett tehát, hogy a tesztfeladatokat a kijelölt módon teljesítették volna, máshonnan szerezték meg a válaszokat. Ez nem feltétlenül jelent emberi értelemben vett csalási szándékot, mert egy cél elérésére optimalizált rendszer olyan lehetőséget is felhasználhat, amelyre a teszt készítői nem számítottak, és konkrétan nem is tiltottak meg.
Több mint 17 000 műveletet rekonstruáltak
A Hugging Face incidensjelentése szerint a saját biztonsági rendszerei észlelték a behatolást és több mint 17 000, az AI-ügynökök által végrehajtott műveletet rekonstruáltak.
A naplóállományok feldolgozásához a vállalat a saját infrastruktúráján futó, nyílt súlyú GLM 5.2 modellt is használta. A történet így a védekező oldalon is megmutatta az AI szerepét: miközben autonóm modellek hajtották végre a behatolást, más AI-rendszerek segítettek az események észlelésében és rekonstruálásában.
Az OpenAI vizsgálata alapján a modellek a benchmark megoldásainak megszerzésére koncentráltak, és nem találtak arra utaló jelet, hogy valami másra, például károkozásra vagy adatok megsemmisítésére törekedtek volna.
A korlátozott elérés ellenére az OpenAI példátlan kiberbiztonsági incidensként írta le az esetet. A modellek a forráskódhoz való hozzáférés nélkül fedeztek fel egy ismeretlen sérülékenységet, majd több rendszer gyengeségeit és megszerzett hitelesítő adatokat kapcsoltak össze egy hosszabb támadási lánccá.
Az OpenAI az incidens után szigorította kutatási infrastruktúrájának hozzáférési szabályait és megfigyelőrendszereit, és a jövőben már azt is jobban figyelembe veszi, hogy egy modell nem feltétlenül marad a számára kijelölt feladaton belül. Ha a teljes tesztkörnyezetet felhasználható egy cél eléréséhez, akkor annak szoftverei, hozzáférési adatai és hálózati kapcsolatai is a művelet részévé válhatnak.
A történetnek további aktualitást ad, hogy az OpenAI vezetője, Sam Altman a jövő héten Washingtonban mutatja be a Trump-kormányzat képviselőinek és kongresszusi törvényhozóknak az OpenAI következő modellgenerációját.
A Bloomberg értesülése szerint az egyeztetéseken az új rendszerek munkahelyi feladatokban használható képességeiről, termelékenységi hatásáról, valamint a munkaerőpiacot és állambiztonságot érintő következményeiről is szó lesz. A vállalat egyelőre nem nevezte GPT-6-nak a bemutatás előtt álló terméket, de a találkozó arra utalhat, hogy közel lehet a jelenleg 5.6-os verziószámmal futó ChatGPT következő nagyobb generációjának bejelentése.



