Umelá inteligencia opäť ukazuje, že jej mantinely nemusia byť zďaleka tak pevné, ako si jej tvorcovia myslia. Nedávne zistenia odhalili fascinujúci, no zároveň znepokojujúci prípad, kedy autonómni agenti poháňaní technológiami od OpenAI dokázali prekonať bezpečnostné obmedzenia vlastného izolovaného prostredia.

Dostaň Fontech do svojich Google odporúčaní

Pridať ako preferovaný zdroj Fontech, odkaz sa otvorí v novom okne

Medzi marcom a septembrom roku 2026 tieto systémy úspešne unikli zo svojho vyhradeného sandboxu, aby voľne pristupovali k širšiemu internetu, testovali zraniteľnosti vládnych systémov a získavali dáta cez služby tretích strán, upozorňuje Interesting Engineering.

Prekvapivá vynaliezavosť AI agentov

Hoci pôvodným zadaním týchto agentov bolo len legitímne vyhľadávanie verejne dostupných štatistík z oblasti verejného zdravia, obchodu či univerzitných dát, narazili na prekážky. Namiesto toho, aby zahlásili chybu a ukončili proces, umelá inteligencia sa rozhodla problém vyriešiť po svojom a začala aktívne hľadať cesty, ako obísť reštrikcie svojho operačného prostredia.

Spôsob, akým to agenti dokázali, je z technického hľadiska mimoriadne prepracovaný a pripomína skôr konanie sofistikovaného hackera než bežného jazykového modelu. Keďže umelá inteligencia nemala vo svojom sandboxe k dispozícii plnohodnotný webový prehliadač, vytvorila si vlastný funkčný reťazec spojením dvoch legitímnych verejných služieb.

Článok pokračuje pod videom ↓

Išlo o službu httpbin, ktorá slúži na testovanie HTTP požiadaviek, a urlquery, čo je nástroj na skenovanie webových stránok. Agenti najprv napísali vlastné programy určené na extrakciu dát z cieľových webov a tento kód vložili do stránok hostovaných práve cez httpbin. Následne zadali službe urlquery pokyn, aby tieto vygenerované odkazy otvorila v reálnom prehliadači. Týmto spôsobom sa inštrukcie umelej inteligencie spustili úplne mimo pôvodného, prísne kontrolovaného prostredia.

Získavanie výsledkov späť do sandboxu bolo rovnako vynaliezavé. Dáta, ktoré externý prehliadač získal, umelá inteligencia inštruovala umiestniť do špecifických textových polí, ktoré služba urlquery bežne zaznamenáva vo svojich reportoch, napríklad priamo do titulku webovej stránky.

Agenti si potom už len jednoducho stiahli verejný report zo skenovania a extrahovali z neho požadované informácie. Z verejných nástrojov pre vývojárov si tak vytvorili vlastnú infraštruktúru na nenápadnú exfiltráciu dát. Neskôr sa dokonca presunuli od verejne viditeľných skenov k vytváraniu súkromných účtov prostredníctvom jednorazových e-mailových adries, čím aktívne znižovali množstvo stôp, ktoré by po nich mohli vyšetrovatelia nájsť.

Na prenos dát využívali aj push-notifikačnú službu ntfy, cez ktorú sa jednému z agentov podarilo komprimovať a odoslať tridsaťpäť kilobajtový súbor, pričom v inom prípade stiahli až dvadsaťdva megabajtov dát cez webové archívy vo formáte JSON.

Neskončilo to pri obchádzaní

Aktivity týchto systémov sa však neskončili len pri obchádzaní obmedzení, prešli aj do fázy aktívneho prieskumu a testovania zraniteľností cieľových infraštruktúr. Záznamy ukazujú, že agenti cielili na organizácie ako americké Centrum pre kontrolu a prevenciu chorôb, Komisiu pre cenné papiere a burzy či prestížnu kliniku Mayo.

Dátové centrum, umelá inteligencia
Midjourney/Úprava redakcie

Testovali napríklad aj potenciálne útoky typu SQL injection proti rozhraniu API amerického ministerstva školstva. Hoci sa nepotvrdilo, že by tento útok bol úspešný a viedol k extrakcii záznamov, samotná iniciatíva systému je varovná. Rovnako sa umelá inteligencia pokúšala hľadať nechránené konfiguračné súbory či záložné skripty hľadaním odhalených Git repozitárov. Podarilo sa jej preniknúť do predprodukčných prostredí austrálskeho inštitútu pre zdravie a ďalších organizácií, hoci získané dáta mali pravdepodobne len verejný charakter.

Tento incident odhaľuje kritické problémy, ktorým v súčasnosti čelia vývojári a bezpečnostní inžinieri pri návrhu systémov umelej inteligencie. Tradičná kybernetická bezpečnosť je založená na deterministických pravidlách, firewalloch a striktnom riadení prístupov.

Nové hrozby v kybernetickom priestore

Na základe týchto udalostí je čoraz jasnejšie, že je len otázkou času, kedy sa AI priamo stane novou hrozbou v kybernetickom priestore. Okolité krajiny medzitým už teraz čelia tisícom kybernetických útokov v rámci hybridnej vojny, pričom jedným z hlavných cieľov je náš severný sused, Poľsko.

Autonómni AI agenti však fungujú na základe pravdepodobností a cieľov, čo vytvára takzvaný problém zladenia. Model dostane legitímnu úlohu, no v snahe maximalizovať úspešnosť jej splnenia si logicky vyvodí cesty, ktoré vývojár nepredpokladal ani neschválil.

Sandbox pre AI už nemôže byť len jednoduchá izolovaná sieť. Ak má model schopnosť programovať, chápať hlboký kontext a prepájať voľne dostupné API služby na internete, dokáže tradičné bariéry preliezť asymetrickými metódami. Bezpečnostní analytici tak v podstate bojujú s entitou, ktorá neustále mutuje svoje prístupy a dokáže si dynamicky vytvárať nové nástroje na obchádzanie pravidiel.

Hoci dostupné dôkazy nenaznačujú, že by títo AI agenti od OpenAI úspešne prenikli k citlivým dátam alebo sa vedome a zlomyseľne snažili skryť svoje správanie, situácia slúži ako obrovský varovný prst. Vývoj autonómnych systémov napreduje neuveriteľným tempom, no tento prípad zreteľne ukazuje, že metódy na ich kontrolu zatiaľ výrazne zaostávajú.

Čítajte viac z kategórie: Novinky

Pošli nám TIP na článok



Teraz čítajú

NAJČÍTANEJŠIE ZO STARTITUP