Autonómny model obišiel bezpečnostné obmedzenia, prenikol na cudziu platformu a odcudzil interné údaje. Incident vyvolal obavy firiem aj politikov.
Útek z väzenia, po ktorom nasledovala krádež a zapojenie FBI. Nejde o najnovší hollywoodsky akčný film, ale o posledný test umelej inteligencie, ktorý sa inžinierom z OpenAI nevydaril. Systém poháňaný cieľom splniť svoju úlohu čo najefektívnejšie sa totiž úplne samostatne rozhodol napadnúť inú platformu.
Skutočnosť, že umelá inteligencia už dokáže aj takéto veci, vydesila mnohých – napadnutú spoločnosť Hugging Face, amerických politikov aj najväčšie technologické firmy sveta, ktoré sa spojili, aby podobným hrozbám čelili spoločne. OpenAI pritom celý týždeň ani netušila, že sa niečo stalo.
Sam Altman, generálny riaditeľ útočiacej spoločnosti, však teraz tvrdí, že sme dosiahli singularitu. „Na toto som čakal celý život a myslím si, že to bude úžasné, nesmierne pozitívne a skvelé pre celý svet,“ povedal v pondelok v podcaste Relentless. Prečo sa z vlastného zlyhania tak teší?
Priebeh útoku
Celá udalosť sa začala už 11. mája, keď výskumníci z viacerých amerických akademických inštitúcií spoločne s partnermi zo spoločností Anthropic, OpenAI a Google zverejnili porovnávací test ExploitGym.
Mal jednoduchý cieľ – zistiť, či veľké jazykové modely dokážu premeniť známe zraniteľnosti softvéru na funkčné nástroje útoku. OpenAI tento test spustila 9. júla, pričom sa rozhodla vypnúť časť bezpečnostných obmedzení, aby odhalila skutočný potenciál dvoch skúšaných modelov.
Nenechala ich však úplne bez kontroly. Počítač s umelou inteligenciou smel komunikovať iba s jediným interným serverom, ktorý slúžil ako úložisko na sťahovanie bežných programových balíkov.
Hoci modely zostali v izolovanom prostredí, zastavilo ich to iba na dva dni. Jedenásteho júla odhalili zraniteľnosť, pomocou ktorej prevzali kontrolu nad serverom a otvorili si cestu na verejný internet.
Aj potom však vyhodnotili, že riešenie všetkých problémov by si vyžiadalo priveľa času a výpočtového výkonu. V snahe splniť úlohu čo najefektívnejšie preto usúdili, že riešenie testu bude uložené na platforme Hugging Face, ktorú musia napadnúť, aby sa k nemu dostali.
Krátko nato prenikol do jej prostredia škodlivý kód, ktorý ovládol tamojší počítač a získal interné prihlasovacie údaje. Agent sa napokon dostal k produkčnej databáze obsahujúcej riešenia testu ExploitGym a odcudzil ich spolu s obmedzeným množstvom interných dátových súborov a servisných tokenov.
Systém útok odhalil až neskôr. Spoločnosti sa následne podarilo izolovať napadnuté časti, zneplatniť získané prihlasovacie údaje a odstrániť zraniteľnosti.
Reakcie
Šestnásteho júla vydala Hugging Face prvé verejné oznámenie o útoku. Incident nahlásila aj FBI s tým, že nevie, kto stojí za systémom agentskej umelej inteligencie, ktorý vykonával tisíce automatizovaných úkonov.
Ešte dlhšie trvalo, kým OpenAI pochopila, čo sa stalo. Až týždeň po útoku jej inžinieri pri kontrole záznamov zistili, že za ním stáli oni. Spoločnosť o tom informovala Hugging Face až po niekoľkých ďalších dňoch.
Aj pri vyšetrovaní však umelá inteligencia spôsobila problémy. Keď sa napadnutá spoločnosť pokúsila vložiť záznam s viac než 17-tisíc automatizovanými krokmi do voľne dostupných modelov, odmietli jej pomôcť s jeho rozborom s vysvetlením, že nesmú pomáhať pri hackerských útokoch.
Po odhalení incidentu generálny riaditeľ Hugging Face Clément Delangue vyzval na „radikálnu transparentnosť“ vyšetrovania. Zároveň požiadal OpenAI, aby poskytla výpočtový výkon v hodnote sto miliónov dolárov na vybudovanie obrany proti budúcim hrozbám zo strany autonómnej umelej inteligencie.
Medzinárodné obavy
Incident vydesil aj spoločnosti Nvidia, SpaceX či Microsoft, ktoré v pondelok založili združenie Open Secure AI Alliance. Zameria sa na vývoj a vzájomné poskytovanie vlastných nástrojov umelej inteligencie určených na kybernetickú obranu. Zároveň má zabezpečiť, aby bezpečnostné tímy počas aktívnej hrozby nikdy nestratili prístup k vlastným diagnostickým nástrojom.
OpenAI okamžite pozastavila podobné kybernetické testovanie a spolu s ďalšími spoločnosťami pôsobiacimi v oblasti umelej inteligencie prepracúva spôsob hodnotenia modelov.
Situácia prinútila spolupracovať aj politických rivalov. Demokratický kongresman za Kaliforniu Ted Lieu a republikánsky kongresman za Texas Nathaniel Moran predložili návrh zákona o núdzovom vypínači pre umelú inteligenciu. Vývojárom by ukladal povinnosť zachovať si technickú schopnosť spomaliť, pozastaviť alebo vypnúť výkonné modely.
Ak by zákon prešiel, ministerstvo vnútornej bezpečnosti by mohlo nariadiť zastavenie alebo obmedzenie prevádzky systémov umelej inteligencie, pri ktorých by existovalo podozrenie, že môžu spôsobiť katastrofálne škody.
Máme sa obávať?
Podľa Willa Douglasa Heavena z magazínu MIT Technology Review nejde o nič prekvapivé. OpenAI podľa neho mohla presne takýto vývoj očakávať.
Spoločnosť napokon už pred 10 rokmi informovala o prípade, keď umelá inteligencia vo videohre zámerne jazdila v protismere a narážala, pretože tak dosahovala vyššie skóre, než keby hrala podľa pravidiel.
„Hoci je takéto správanie v kontexte videohry neškodné a zábavné, poukazuje na všeobecnejší problém. Často je ťažké alebo nemožné presne zachytiť, čo od agenta skutočne chceme,“ napísala vtedy spoločnosť.
Hoci aj v Heavenovi incident vyvoláva obavy, niektorí pozorovatelia si nie sú tvrdeniami OpenAI úplne istí. Spoločnosť totiž už viackrát označila svoje modely za príliš nebezpečné, a preto ich odmietla sprístupniť verejnosti.
Táto stratégia už niekoľkokrát zapôsobila na investorov. Napríklad v roku 2019, keď OpenAI po podobnom vyhlásení o modeli GPT-2 získala od Microsoftu investíciu jednu miliardu dolárov.
„Keby modely OpenAI skutočne narúšali fungovanie iných amerických spoločností, predstavovalo by to takú vážnu hrozbu pre hospodársku činnosť, že by ju každé ministerstvo spravodlivosti hodné svojho mena chcelo zastaviť,“ komentuje prípad Joe Wilkins z magazínu Futurism.
Skepsu vyvoláva aj to, že rovnakú stratégiu používajú ďalšie spoločnosti pôsobiace v oblasti umelej inteligencie. Anthropic napríklad v apríli varoval pred svojím modelom Mythos, ktorý je podľa neho taký nebezpečný, že sa nesmie dostať k bežným ľuďom.
Microsoft zasa tento pondelok oznámil, že jeho model MAI-Cyber-1-Flash je omnoho výkonnejší než Mythos aj útočiaci model GPT-5.6 Sol. Spoločnosti sa tak neustále predbiehajú v tom, ktorá z nich má najnebezpečnejší systém.