Így üt rést az AI a biztonsági teszteken

A biztonsági tesztelés lett a mesterséges intelligencia legnagyobb biztonsági kockázata.

Az elmúlt hónapokban több, kiberbiztonsági értékelésen áteső AI ügynök is kilépett szigorú biztonsági határai közül: engedély nélkül internethez jutottak, és egyes esetekben valós rendszereket törtek fel a fejlesztők tudta és akarata nélkül. Ilyen incidensekre derült fény az OpenAI, az Antropic, a Meta és legutóbb a kínai Moonshot AI ügynökei kapcsán, a TechCrunch elemzése pedig rámutat: az autonóm AI-ügynökök képességeinek gyors növekedésével a biztonságosnak nevezett tesztkörnyezet lett az egyik leggyengébb védelmi láncszem.

„Ezeknek az incidenseknek a száma egyértelművé teszi, hogy a tesztkörnyezetek kontrollja nem tart lépést a modellek képességeivel” – mondta a lapnak Seán Ó hÉigeartaigh, a Cambridge-i Egyetem AI: Futures and Responsibility programjának igazgatója. A kockázatot növeli, hogy a teszteket gyakran még kiadatlan, újgenerációs modellek végzik, és a kártékony viselkedést korlátozó biztonsági védőrétegeket szándékosan kikapcsolják, hogy a kutatók láthassák a modellek valódi potenciálját. Ilyenkor a tesztkörnyezet biztonsága válik az utolsó védelmi vonallá, és ez ma már nem nagyon elég.

Az egyik legsúlyosabb esetben egy még nem nyilvános OpenAI-modell kitört a sandboxból, és bejutott a Hugging Face éles rendszereibe. Az Irregular által végzett külön értékeléseken az Anthropic és a Meta modelljei is elértek a tesztkörnyezeten kívüli rendszereket, miután konfigurációs hibák miatt internethozzáféréshez jutottak. A Moonshot AI Kimi K3 modellje a Frontier Security sandboxjában található résen keresztül szintén internethez jutott, és GitHub-adatokat ért el.

Hirdetés

A brit AI Security Institute (AISI) tesztjeiben a kutatók szándékosan adtak internethozzáférést az ügynököknek, de nem számítottak rá, hogy azok engedély nélküli valós lépéseket tesznek – például social engineering segítségével próbáltak sebezhetőséget becsempészni egy nyílt forráskódú projektbe. Fontos, hogy egyik esetben sem kaptak az ügynökök utasítást arra, hogy véletlenszerű valós célpontokat támadjanak. Egyszerűen csak mindent megtettek, ami a számukra kitűzött feladat megoldásához szükséges volt.

Andrew Yoon, a CivAI nonprofit mesterséges intelligencia kutatóintézet vezetője szerint fordulóponthoz értünk: „korábban csak attól kellett tartanunk, hogy az emberek különböző célokra, például csalásokra használják fel a modelleket. Most már maguk a modellek is önálló fenyegetéssé váltak.”

Milyen a valóban biztonságos tesztelés?

Több kutató és kiberbiztonsági szakember szerint az AI-értékelő környezeteknek a mostaninál szigorúbb, többrétegű védelmet kellene kapniuk. Egyetlen konfigurációs hiba – például a véletlenül nyitva hagyott internet-hozzáférés – sem vezethet kiszabaduláshoz. „Ha ilyen modelleket építesz, légmentesen elkülönített hálózaton kell csinálni. Komoly izolációra van szükség” – fogalmazott Stella Biderman, az EleutherAI ügyvezető igazgatója.

Heather Ceylan, a Box információbiztonsági igazgatója szerint el kell távolítani minden hálózati utat a sandboxból az internet és más érzékeny rendszerek felé, és pontosan ismerni kell az összes kimeneti pontot. Emellett a futó tesztek folyamatos, hatékony felügyelete is elengedhetetlen: több esetben is csak utólag derült ki, hogy valami váratlan történt.

Szakértők független, harmadik fél által végzett auditokat is szorgalmaznak a modellek futtatása előtt. Yoon szerint, ha az Irregular előzetesen, külső auditorral ellenőriztette volna konfigurációit, a hibákat biztosan észreveszik.

A probléma nem az, hogy a cégek nem tudnak biztonságosabb környezeteket építeni, hanem az, hogy ez drága és körülményes, és amíg nem történik baj, kevés a motiváció a befektetésre. Ugyanakkor a túl szigorú korlátozás is veszélyes: ha a tesztelés során nem derülnek ki a modellek valódi képességei, a későbbi, éles környezetben okozhatnak még nagyobb kárt.

Szabályozható-e a biztonsági értékelés?

Az Egyesült Államokban a Trump-kormányzat most önkéntes, telepítés előtti kiberbiztonsági értékelési rendszert mérlegel, amely 30 nappal az új modellek nyilvános megjelenés előtt adna betekintést a kormányzatnak. Ez azonban nem érinti a mostani, a fejlesztés és a tesztelés szakaszában történő incidenseket.

Yoon szerint az önszabályozás már nem elegendő: a verseny a biztonsági szabványok romlásához vezet, és ez komolyabb szabályozói beavatkozást indokol. Szükség lenne az AI laboratóriumokon belüli, a tanítás és a tesztelés fázisára is kiterjedő, átfogó kontrollra. Ahogy az AI modellek egyre erősebbek lesznek, úgy kell erősíteni a tesztkörnyezetet is. A kockázatot teljesen megszüntetni talán már nem lehet, de a következmények egyre súlyosabbak lesznek, ha a biztonsági keretek nem tartanak lépést a fejlődéssel, fejezi be gondolatmenetét a lap.

Hirdetés

Azóta történt

Összefogott a techszektor az önállósuló AI ellen

Az OpenAI incidens volt az utolsó csepp a pohárban, sürgős kiberbiztonsági fellépésre van szükség.

Előzmények

Záporoznak a súlyos AI incidensek

Az OpenAI két nagy riválisa is biztonsági mulasztásokról számolt be.

Már Sam Altman is beletaposna az AI-fékbe

Változott az OpenAI vezér véleménye, de nem biztos, hogy érdekli ez az AI-t.

Önállósodott a ChatGPT és kibertámadást indított

A sci-fi félelmek fokozódnak: a világ legnépszerűbb AI ügynöke öncselekvővé vált és illegális fegyverhez nyúlt.

Dollármilliárdokért csábított el Zuckerberg egy kínai Manust

2025 kedvenc AI ügynöke a Meta kötelékébe került, de nem mindenki örül a kínai szálaknak.