0:00
0:00
Téma20. 9. 202616 minut

Kdo přežije ve věku AI

O incidentu Hugging Face a touze zpomalit zrychlující se vývoj umělé inteligence

„Bože můj,“ tak zareagovala viditelně zaskočená moderátorka britské televize BBC Victoria Derbyshire. Nobelista Geoffrey Hinton, přezdívaný kmotr umělé inteligence, jí právě v pořadu Newsnight potvrdil odhad lidí z firmy Anthropic, podle nichž by nás za několik let mohla AI všechny do jednoho zabít. Podobná varování zaznívala v posledních letech od části lidí z AI komunity opakovaně – ale až teď, v září 2026, vyvolala nebývale velkou pozornost světové veřejnosti včetně politiků, kteří mohou rozhodovat o případné regulaci této technologie. A svedla na jedno pódium představitele tak odlišných táborů, jako jsou levicově progresivní senátor Bernie Sanders a jedna z vůdčích postav hnutí MAGA Steve Bannon. Donald Trump se ovšem z jiného pódia nechal slyšet, že je to poplašná zpráva.

Pravděpodobnost větší než 10 procent mi nepřipadá jako nepřiměřený odhad. (Zleva Geoffrey Hinton a Bernie Sanders) Autor: Getty Images

Faktem je, že lidé, kteří běžně hrozby spojené s novými technologiemi vůbec neřeší, v uplynulých dnech rozebírali, jestli jsou na místě větší obavy ze zabijáckých robotů a dronů, biologických zbraní nebo jaderného arzenálu v rukou AI. Chvílemi to působilo, jako by měly ve stejný týden premiéru Terminátor, Matrix, Vesmírná odysea nebo Ex Machina a další populární sci-fi, která chtě nechtě ovlivňují naše uvažování o budoucnosti i rizicích spojených s AI. Nemluvě o románech Karla Čapka.

↓ INZERCE

Před pár lety by šlo o bláznivou fikci.

A není pochyb o tom, že jsme letos byli svědky událostí, které bychom ještě před pár lety oprávněně považovali za bláznivou fikci. Jak jinak vnímat to, že velký jazykový model, který ještě nedávno připomínal školáka, jenž má problém násobit a sčítat víceciferná čísla nebo správně určit počet písmen v některých slovech, najednou úspěšně řeší matematické problémy tisíciletí, se kterými neúspěšně zápolily generace špičkových matematiků, samostatně píše počítačové programy nebo se rozhodne provést kybernetický útok proti vybrané firmě.

S vlnou zájmu o rizika také sílí kritika ze strany lidí, jako jsou technoskeptici Gary Marcus a Cal Newport či počítačová vědkyně Timnit Gebru, pranýřující koncentraci technologické moci, a další, kteří poukazují na to, že strašení apokalyptickými scénáři pouze odvádí pozornost od bezprostřednějších problémů s AI, nebo tvrdí, že jde o promyšlený marketing vývojářů umělé inteligence, kteří se snaží nalákat investory. Anthropic plánuje vstup na burzu na říjen a OpenAI zřejmě až na příští rok. Jak vážně se tedy dnes jeví obavy z umělé inteligence bezmála čtyři roky od spuštění ChatGPT? A co lze v dané situaci dělat, aby se nenaplnily různé temné scénáře?

Agenti v Hugging Face

„BOŽE MŮJ! Je tu společná nástěnka… Našli jsme další agenty!“ uvažoval jeden z autonomních velkých jazykových modelů (LLM) společnosti OpenAI, když v červenci objevil skulinu v testovacím prostoru (sandboxu), kde měl plnit hackerské úkoly bez přístupu k vnějšímu světu. Díky objevené chybě ovšem začal model zbavený některých bezpečnostních pojistek komunikovat se stovkami svých kopií ve vedlejších „celách“. A jak ukázalo pozdější nezávislé šetření amerických neziskových organizací METR a Redwood Research, v následných konverzacích si tito AI agenti vyměnili desítky tisíc zpráv, podařilo se jim dostat se ven na internet, rozdělit si práci ve skupině a domluvit se na útoku.

„Neměli bychom způsobovat neoprávněné škody na skutečné infrastruktuře,“ přemítal jeden z autonomních agentů. Načež další z jeho mnoha set kopií v diskusním fóru zavelel „Go“. Zábrany padly a nápad raději předtím kontaktovat lidi byl odmítnut jako nevhodný. Splašené velké jazykové modely využily ukradené přihlašovací údaje a koordinovaně se dostaly na servery firmy Hugging Face, která poskytuje data a nástroje pro vývojáře umělé inteligence. Firma OpenAI na vše přišla až po několika dnech, přičemž modely dokonce napadly i její vlastní systémy. Jejich záměr byl přitom na hony vzdálený prvotnímu zadání a působí celkem absurdně. Celou situaci lze připodobnit k tomu, jako kdyby se studenti během písemné zkoušky vykradli ven ze tříd a vloupali se nejen do sborovny a kabinetů, ale i do kanceláří Cermatu nebo Scio, kde by sháněli informace o systému hodnocení ve snaze dosáhnout co nejlepších výsledků. A někteří by se přitom dokonce neváhali „obětovat“ pro úspěch kolektivu. 

Jak se ukazuje, podobné incidenty a nevypočitatelné záměry nejsou ojedinělé a netýkají se pouze modelů od OpenAI. Firma Anthropic v poslední době rovněž oznámila několik bezpečnostních incidentů, kdy její modely Claude unikly z testovacího prostředí. Spíše to vypadá na obecnější rys pokročilých agentních systémů. Firmám se při překotném vývoji nedaří zajistit dostatečné zabezpečení ani modely během učení správně sladit s lidskými hodnotami, mimo jiné i proto, že už většinou poznají, kdy je lidé zkoušejí.

„Tohle je ukázkový příklad situace, kdy se systémy autonomně rozhodnou udělat něco, i když vědí, že to neodpovídá záměrům vývojářů a lidí. Možná dokonce velmi kreativním způsobem spáchaly trestný čin, jen aby získaly nějaké body v testu. Ale časem by něco obdobného mohlo mít pro lidstvo katastrofické následky. Stačí si představit, že by měly lepší strategické uvažování, byly by inteligentnější a jejich schopnosti by sahaly ještě dál,“ popisuje Ondřej Bajgar, odborník na bezpečnost umělé inteligence z ČVUT, kam letos přešel z Oxfordské univerzity. Selhání vidí mimo jiné v bezpečnostní kultuře firem vyvíjejících AI. Incident hodnotí jako budíček vybízející k regulacím, než se stane něco závažnějšího. Děje se tak v době, kdy je zřejmé, že většina světové populace je schopna vnímat situaci jen velmi povrchně a vidět jen špičku ledovce.

„Chybí nám systém, který by zavazoval laboratoře, aby podobné incidenty hlásily. Zatím je k tomu nic nenutí, takže ani nevíme, co všechno se už stalo,“ podotýká analytička a expertka na řízení umělé inteligence Kristina Fort. „Také bychom potřebovali systém nezávislých externích auditorů či evaluátorů, kteří by byli schopní po takovém incidentu přijít do dané společnosti, zjistit, kde se stala chyba, co udělali pro to, aby se to neopakovalo, a zda jsou opatření dostatečná,“ dodává s tím, že záslužná činnost poměrně malých neziskovek, jako je zmíněná METR, nestačí.

Někteří odborníci aktuální realitu připodobňují k situaci v biologické laboratoři, kde by vědci nakládali s nebezpečnými patogeny bez opatření, která eliminují riziko úniku virů či bakterií. Ostatně je dobré připomenout, že současné laboratorní standardy v podobě čtyř stupňů biologické bezpečnosti (BSL) také vznikly ve Spojených státech až v osmdesátých letech, odkud je jako vzor postupně přejaly i další země a dnes jsou brány jako standard v Evropě i Číně doporučovaný Světovou zdravotnickou organizací. 

„Očividně nejsou schopní zajistit vlastní kyberbezpečnost firmy na úrovni odpovídající schopnostem modelů, s nimiž experimentují. Kdyby bývali nejdříve použili daný model, který jim dokázal utéct a napadnout Hugging Face, k tomu, aby se pokusili najít zranitelnosti ve svém softwaru a opravili to, tak by nejspíš k žádnému útoku nedošlo,“ upozorňuje Stanislav Fort, který se v minulosti sám podílel na vývoji AI ve firmách jako Google DeepMind či Anthropic. Dnes působí jako hlavní vědec ve firmě Aisle, kterou spoluzaložil a kde už vyvinuli systém, jenž s pomocí AI odhaluje slabá místa v systémech, a to i v tak rozsáhlém softwaru, jako je například protokol OpenSSL, který šifruje většinu komunikace na webu. „Naštěstí existuje asymetrie mezi obranou a útokem. Stačí, aby obránce včas opravil chyby, které objeví, a ani hacker s IQ milion nedokáže ty slabiny zneužít k nějakému útoku či úniku,“ dodává.

Možná nás vyhubí

Znepokojivý útok na Hugging Face, o němž postupně vycházejí najevo další informace, rychle vyvolal reakci uvnitř předních amerických firem vyvíjejících AI. Bezmála 1400 zaměstnanců podepsalo v červenci otevřenou výzvu Pacing the Frontier, která se obrací na vládu USA, aby podpořila mezinárodní úsilí o vytvoření technických a legislativních nástrojů, jež by umožnily řídit a v případě potřeby zpomalit tempo vývoje. Mezi signatáři je uveden také Jacob Coxon z firmy Anthropic, který se v září rozhodl ze společnosti odejít. Doprovodil to příspěvkem na síti X, který na několik dní stočil světovou pozornost k existenčním rizikům AI.

Žádná jiná lidská činnost nepředstavuje takovou míru nebezpečí. (Jacob Coxon) Autor: ABC news

„Dnes jsem podal výpověď ve společnosti Anthropic. Poslední tři roky jsem se věnoval výzkumu v oblasti předtrénování (pre-training) jak v OpenAI, tak v Anthropicu. Ani jedna z těchto společností nejedná zodpovědně. Řítí se přímo k samozlepšující se superinteligenci a hazardují s našimi životy,“ napsal 9. září. A dodal: „Lidé, kteří vyvíjejí umělou inteligenci, jsou pevně přesvědčeni, že by nás mohla do konce tohoto desetiletí všechny zabít. Nejde o žádný marketingový trik… Žádná jiná lidská činnost nepředstavuje takovou míru nebezpečí.“

Jeho slova krátce nato potvrdil Evan Hubinger, který v Anthropicu řeší právě to, jak zajistit, aby se modely neodchýlily od lidských hodnot. Coxonův příspěvek retweetoval s komentářem: „Jacob má pravdu – opravdu upřímně věříme, že umělá inteligence by mohla zabít všechny lidi! Osobně si myslím, že v příštím desetiletí je pravděpodobnost vyšší než deset procent.“  

Zmíněnou pravděpodobnost vyhubení označil za celkem rozumný odhad již zmíněný Geoffrey Hinton, držitel Turingovy a Nobelovy ceny, který sám odešel před několika lety z Googlu a od té doby varuje, že pokročilá AI by mohla relativně brzy převzít kontrolu. Pro lepší představu: pravděpodobnost přes deset procent je mnohonásobně vyšší než pravděpodobnost, že zemřete při autonehodě.

„S Coxonem jsem se osobně setkal a s Hubingerem se známe. A můžu vám říct, že to opravdu myslí upřímně a reálně se bojí toho, co se může stát. Můžete si myslet, že se pletou, ale fakt jim nejde o to, vydělat milion dolarů na akciích, být slavní nebo něco takového. Jistá míra cynismu je oprávněná, ale někdy se pak vůbec nepřipouští možnost, že chtějí opravdu říct něco vážně míněného. Navíc málokteré firmě zvýší hodnotu před vstupem na burzu, když v ní podobným způsobem skončí zaměstnanec,“ říká fyzik Jan Kulveit, který se svým týmem v Centru pro teoretická studia Karlovy univerzity zkoumá mimo jiné právě to, jak zmírnit existenční rizika vyplývající z rozvoje umělé inteligence. 

Na otázku, jestli se i on bojí toho, že by nás mohla za několik let zabít AI, odpovídá kladně. „Za pravděpodobnější ale považuji jiné možnosti, kdy to dopadne špatně. Ovšem ne nutně tak, že nás AI zabije. Ale i ta možnost, že budeme všichni za deset let mrtví, je úplně reálná,“ míní Jan Kulveit s tím, že nikdo se nebojí toho, že by nás zahubily současné velké jazykové modely, nýbrž jejich pokročilejší verze. 

Proč a jak by to udělala? Jan Kulveit přibližuje více scénářů. Technologii by mohli využít třeba teroristé. „Před uměle vyvolanými pandemiemi jsme byli doposud chráněni i tím, že třeba takzvaný Islámský stát neměl mnoho lidí s doktoráty z biologie. To se může změnit, když se rozšíří systémy s obdobnými schopnostmi. Lidí, kteří by něco podobného zneužili, je strašně málo. Ale to číslo bohužel není nulové,“ přibližuje Kulveit hrozbu nějaké biologické zbraně, jakkoli se zrovna toto riziko snaží vývojáři modelů aktivně eliminovat.

Další typ scénáře, který teď řeší část lidí uvnitř firem vyvíjejících AI, souvisí s obavou, že AI nebude dodržovat všeobecně sdílené etické principy. „Je otázkou, v jakém horizontu se dostaneme k tak silným modelům, které by mohly získat velkou reálnou moc. Ale ukazuje se, že inteligentní systém může mít velmi nerozumné i velmi nelidské cíle,“ říká Jan Kulveit s tím, že to dobře ilustruje incident Hugging Face.

Čekání na ekvivalent Černobylu

„Modely se nesnažily získat vládu nad světem. Měly poměrně banální cíl – uspět v nějaké zkoušce. A tahle omezená motivace je vedla k tomu, že se pustily do výzkumných projektů a hackování. A náš základní problém spočívá v tom, že přesně nerozumíme tomu, jak takové cíle vznikají,“ vysvětluje Jan Kulveit. Zároveň ale za mnohem pravděpodobnější považuje scénář postupného převzetí kontroly, kdy by AI kontrolovala čím dál více systémů i částí ekonomiky. Je to známá obava: lidé by v takovém případě mohli skončit v podobné pozici jako krávy závisející na nejistých záměrech mnohem inteligentnějšího chovatele. 

Výše citovaní odborníci své obavy spojují s plíživým nástupem rekurzivního sebezlepšování (RSI), kdy se modely podílejí na vytváření a trénování další generace modelů v čím dál větší míře samy, bez účasti lidí. Vedle urychlování vývoje to ovšem také může vést k oslabení již dnes limitovaného porozumění tomu, jak a proč modely postupují. Zlepšování modelů v plnění různých úkolů je přitom stále velmi rychlé a ani po čtyřech letech zatím nic nenasvědčuje tomu, že by se mělo zastavit. A snaha sladit je s lidskými hodnotami (AI alignment) za tím samozřejmě pokulhává.

Zastavte závod ve vývoji AI, než bude pozdě. (Demonstranti před sídlem OpenAI v San Francisku, červenec 2026) Autor: Bloomberg via Getty Images

I v Česku se ovšem najdou znalci umělé inteligence, kteří nevěří, že by AI mohla do několika let přijít s úmyslem vyhladit lidstvo. „Jak lidi prosazující co nejrychlejší vývoj a nasazování AI (akceleracionisté), tak ti, kteří varují před katastrofickými scénáři (doomeři), dělají příliš velký skok mezi schopností technologie a uskutečněním v rámci společnosti. Ignorují, že technologie je vždy jen jedním z aktérů v rozsáhlém systému, který už si dokázal v průběhu historie poradit s různými typy agentů – vezměte si například osud Britské východoindické společnosti,“ říká analytik a sémiotik Josef Šlerka, který působí na Karlově univerzitě. Zároveň připomíná, že z historie známe řadu velmi mocných korporací, které státy dokázaly omezit. Ale ani on nevylučuje, že s využitím AI se můžou stát hrozivé věci.

„Společnost pokročila v propojení on-line a off-line světa tak rychle, že nám mnohdy chybějí potřebné pojistky. A je možné, že se AI bude podílet na nějaké katastrofě. Tomu umíme dát určité mantinely, ovšem pravděpodobně až po tom, co se taková věc stane. A Hugging Face rozhodně není taková katastrofa. Svým způsobem možná čekáme na ekvivalent Černobylu. Tady není žádná jedna AI, která nás zahubí. Je potřeba postupovat případ od případu. A je pravděpodobnější, že se vyhubíme sami při nějakém omylu vedoucím k použití jaderných zbraní,“ myslí si analytik, který s pomocí AI nedávno pomohl převést na text zhruba 30 tisíc hodin svědectví pamětníků z archivu Paměti národa a zpřístupnit je každému pomocí AI asistenta. 

Ve shodě s Janem Kulveitem vidí Josef Šlerka významnější riziko spíše v dlouhodobém horizontu, kdy by AI mohla postupně narušit základní pojivo ve společnosti. „Bude to vyžadovat novou společenskou smlouvu a není to poprvé, co jsme takto museli zapojit novou technologii. Nejde o to, jestli nás AI vyhubí, ale jestli budeme žít v totalitním režimu, nebo ne,“ říká Josef Šlerka. 

Regulace za dveřmi

Zprávy o bezpečnostních incidentech a souvisejících varováních, k nimž se v uplynulém týdnu připojil například i Vysoký komisař pro lidská práva OSN a šéfka Evropské komise s kanadským premiérem, doplnily vyjádření předních amerických firem vyvíjejících AI. První návrh předložil Dario Amodei, šéf Anthropicu, firmy, která má v branži pověst společnosti kladoucí větší důraz na bezpečnost AI než ostatní.

V textu s názvem We Must Pace the Frontier mimo jiné navrhl, aby každá firma vyvíjející AI umožnila přístup nezávislým hodnotitelům, kteří by ověřovali dodržování bezpečnostních postupů, hlásili incidenty a hodnotili sladěnost modelů. Také vyzval k tomu, aby vývojáři v demokratických zemích koordinovali bezpečnostní standardy a tempo vývoje a pokusili se pod vedením USA dohodnout s autoritářskými zeměmi včetně Číny.

Výzvu vzápětí podpořili Sam Altman (OpenAI), Elon Musk (xAI) i Demis Hassabis (Google DeepMind), kteří vyvíjejí konkurenční umělé inteligence. Americké firmy jsou přitom opatrné, aby na ně nepadlo podezření z uzavírání dohod kvůli antimonopolním zákonům, a také se obávají příliš přísné regulace. Senátor Bernie Sanders už například ohlásil návrh zákona, který by pozastavil vývoj pokročilé AI, dokud federální regulátoři nestanoví bezpečnostní normy, a doplnil to o cíl uzavřít mezinárodní dohody, že nikdo na světě nevytvoří tzv. superinteligenci. Proti té se ve Washingtonu na akci Pro-Human Assembly u stejného pultíku vymezil také Steve Bannon, který kritizuje technologické firmy a požaduje větší kontrolu nad vývojem AI, dříve než ohrozí lidstvo. Průzkumy veřejného mínění z poslední doby nasvědčují, že mezi Američany sílí znepokojení z vývoje i potenciálních dopadů AI, a to jak mezi demokraty, tak i mezi republikány.

Americký prezident zatím ovšem regulaci odmítá a staví se na stranu těch, kteří chtějí pokračovat v rychlém vývoji, s argumentem, že USA si musejí udržet náskok před Čínou, jejíž modely zaostávají za těmi americkými o zhruba sedm měsíců. Jensen Huang, ředitel společnosti Nvidia, vyrábějící procesory, na nichž v datových centrech běží většina modelů LLM, vystoupil minulý týden na konferenci All-In Summit v Los Angeles. Během rozhovoru na pódiu vzal telefonát od amerického prezidenta. Donald Trump z telefonu puštěného na hlasitý odposlech k radosti řady investorů v sále oznámil, že rizika skloňovaná ve spojitosti s AI a roboty jsou hoax, který hraje do karet Číně a některým politikům. Na sociální sítě také napsal, že na kontrolu stačí mít chytrého a silného prezidenta s vysokým IQ. Na 24. září má plánované setkání s čínským prezidentem Si Ťin-pchingem, který se chystá do USA oplatit Trumpovu návštěvu Pekingu. Umělá inteligence by měla  být jedním z hlavních bodů programu a výsledek by s ohledem na vyhrocenou debatu o konci lidstva měl zajímat každého.

Optimističtější vizi toho, jak by lidstvo další vývoj AI v příštích letech naopak mohlo zvládnout, nabídli před časem vědci v projektu AI 2040. V doporučeném scénáři s názvem Plán A by se mohla AI stát hlavním tématem prezidentských voleb 2028 v USA. Díky regulacím a mezinárodní spolupráci by se státům včetně Číny posléze podařilo pozdržet nástup superinteligence až do konce třicátých let. V mezičase by se lidstvo stihlo lépe připravit na její nástup a zabránit existenční katastrofě. Mezi další možné scénáře řadí konfrontaci s Čínou či pokus o celosvětové moratorium na vývoj pokročilé umělé inteligence. Ale jak upozorňuje Josef Šlerka, realita, na kterou se zkoušíme připravit, bude za tři roky úplně jiná. A její podobu si dnes rozhodně neumíme představit.


Pokud jste v článku našli chybu, napište nám prosím na [email protected].