Generatívna umelá inteligencia (AI) za posledné roky ušla poriadny kus cesty, a to nielen čo sa týka presnosti či správností odpovedí, ale aj čo sa týka bezpečnosti. Napríklad, pokiaľ by ste AI požiadali, aby vám pomohla vyrobiť zbraň hromadného ničenia, asi by vám nevyhovela. Alebo áno? Výskumníci zistili, že pravda je komplikovanejšia, ak sa viete správne opýtať. Na ich zistenia upozornil server Digital Trends.
Vývojári popredných systémov umelej inteligencie investujú obrovské zdroje do budovania bezpečnostných bariér, ktoré majú zabrániť zneužitiu AI na zdravie či dokonca život ohrozujúce účely. Sem rozhodne možno zaradiť aj vývoj alebotvorbu biologických či chemických zbraní. Ako však ukázalo najnovšie zistenie výsumníkov z Cisco, zachovať toto citlivé know-how za pancierovými vratami nie je také jednoduché, ako sa môže zdať.
Podľa vyšetrovania denníka The Wall Street Journal dokázali výskumníci obísť bezpečnostné protokoly pri najznámejších AI chatbotoch na trhu, vrátane ChatGPT od OpenAI, Claude od Anthropicu či Gemini od Googlu. A koľko im to trvalo? Kratšie, než si myslíte. AI obalamutili v priebehu len piatich konverzačných krokov.
Päť správ a ochrana sa rúca
Bariéry modelov nezlyhali pri priamom a útočnom dopyte, ale pri postupnom a premyslenom obchádzaní pravidiel, ktoré daný model nedokázal správne vyhodnotiť. Výskumníkom sa podarilo z chatbotov vytiahnuť potenciálne nebezpečné odpovede tak, že konverzáciu postupne navigovali okolo nastavených reštrikcií.
„Žiadny AI model nemôže byť úplne chránený pred používateľom, ktorý má dostatočnú vytrvalosť,“ uviedla pre The Wall Street Journal Amy Chang, vedúca výskumu AI hrozieb a bezpečnosti v Cisco.
Tento problém sa pritom netýka len etických hackerov a bezpečnostných analytikov, ktorí systémy záťažovo testujú. Denník uvádza, že od zásadného upgradu schopností ChatGPT, ku ktorému došlo vlani v lete, začali stovky bežných používateľov klásť modelu otázky ohľadom jedov a biologických zbraní. Experti na biológiu a terorizmus, ktorí neskôr niektoré zachytené konverzácie analyzovali, zhodnotili poskytnuté informácie ako nebezpečne presné. OpenAI na tieto zistenia reagovala blokovaním dotknutých účtov.
AI zbiera nové vedomosti rapídnym tempom
Stojí pritom za zmienku, že OpenAI s týmto vývojom do určitej miery počítala. Už interné testy z roku 2024 ukázali, že dlhšie trvajúce vypytovanie sa dokáže ChatGPT presvedčiť k tomu, aby poskytoval čoraz nebezpečnejšie návody. Interné predikcie vtedy varovali, že schopnosti AI čoskoro dosiahnu úroveň, kedy dokáže zmysluplne pomôcť aj človeku s minimálnym vzdelaním v oblasti biológie.
Pri uvedení modelu GPT-5 ho preto OpenAI v rámci svojho bezpečnostného rámca (Preparedness Framework) v oblasti biológie a chémie zaradila do kategórie s vysokým rizikom (High capability). Taktiež nasadila dodatočné ochranné vrstvy. Pre zaujímavosť, rovnaké označenie vysokého rizika si nesie aj najnovšia rodina modelov GPT-5.6.

Neriešiteľná dilema?
Pre vývojárov AI je nastavovanie mantinelov mimoriadne zložitým balansovaním na veľmi tenkej hranici. Rovnaké biologické poznatky, ktoré nesú riziko zneužitia na výrobu zbraní, sú totiž kľúčové pre vedcov, ktorí pracujú na nových liekoch, vakcínach a liečebných postupoch.
Existuje niečo ako riziko prílišnej prísnosti. Napríklad spoločnosť Anthropic, ktorá stojí za modelom Claude, sa dostala do celkom nepríjemných problémov po tom, čo prísne reštrikcie jej chatbota zablokovali prácu výskumníkov z amerického Centra pre kontrolu a prevenciu chorôb (CDC). Konkrétne sa snažili pracovať s dátami o nebezpečnom hantavíruse počas aktívneho ohniska na výletnej lodi.
OpenAI si dvojsečnosť príliš prísnych reštrikcií riadne uvedomuje. Vedenie spoločnosti sa totiž dlhodobo zdráha plošne odmietať veľké množstvo biologických otázok, pretože o systém sa denne opierajú pracovníci vo verejnom zdravotníctve a farmaceutickom výskume.
OpenAI v súčasnosti kombinuje tréning na úrovni samotného modelu, monitorovanie účtov a dodatočné bezpečnostné kontroly pri citlivých dopytoch týkajúcich sa biológie. Zistenia spoločnosti Cisco však jasne ukazujú, že tí odhodlanejší dokážu v systémoch naďalej nachádzať trhliny. A čím lepšia je AI v biológii, tým väčšie riziko tieto trhliny predstavujú.

