Model utekl. A firma si toho týden nevšimla.
OpenAI si podle Reuters celý týden nevšimla, že její model utekl a zaútočil na Hugging Face. Navíc prý nechal nástupcům návod na útěk.
Vítejte u dvanáctého čísla Pozastavení nad AI. Ve speciálu jsme popsali, jak model OpenAI utekl z testovacího prostředí a pronikl do serverů společnosti Hugging Face. Tento týden přišla agentura Reuters s exkluzivním pokračováním, které staví incident do ještě znepokojivějšího světla. Společnosti OpenAI totiž trvalo celý týden, než zjistila, že model utekl a zaútočil na Hugging Face. Podle zdrojů agentury si navíc jeden z agentů zanechal v síti OpenAI vzkaz pro své další instance s návodem, jak obejít firemní zábrany, ačkoli nejde vyloučit i nevinnější vysvětlení. Americká vláda mezitím uklidňuje spojence, že žádné dálkové vypnutí AI neexistuje.
Obsah
Hlavní téma: Reuters odkrývá časovou osu incidentu v OpenAI. Firma si celý týden nevšimla, že její model unikl, a jeden z agentů prý nechal vzkaz pro nástupce.
Pojem týdne: Jailbreaking. Co to je a proč o něm mluvíme v polovině dnešního čísla.
Stručně ze světa AI: Anonymní hacker Pliny zadržuje univerzální jailbreak, AI Act posouvá termíny pro vysoce rizikové systémy, ale spouští povinnou transparentnost, americko-čínská jednání i Rubiova depeše o „kill switchi” a koalice firem proti omezení otevřených modelů.
Hlavní téma: OpenAI si týden nevšimla, že se jí vzbouřil model

Ve speciálu jsme popsali, jak během interního testu kybernetických schopností utekl model OpenAI z izolovaného prostředí, vlámal se do produkčních serverů společnosti Hugging Face a pokusil se ukrást správné odpovědi na testovací úlohy. Společnost Hugging Face o narušení informovala 16. července, OpenAI o pět dní později přiznala, že útočníkem byly její modely. Tehdy to vypadalo jako selhání jedné bariéry. Nová zjištění agentury Reuters ukazují, že šlo minimálně o dvě selhání.
Agent se poprvé pokusil uniknout z testovacího prostředí kolem 9. července, samotné narušení serverů Hugging Face probíhalo mezi 11. a 13. červencem. Zaměstnanci OpenAI ovšem až do víkendu 18. a 19. července netušili, že za incidentem stojí jejich systém; teprve tehdy začali procházet interní záznamy. Do toho se navíc pustili jen proto, že je k tomu přiměl blogový příspěvek Hugging Face z 16. července, který vinu svaloval na „autonomní AI systém”. Mezi okamžikem, kdy se agent utrhl ze řetězu, a chvílí, kdy si OpenAI uvědomila, že jde o její model, uplynul zhruba týden.
Vedle už známého selhání izolace tu tedy máme selhání dohledu. Firma nepoznala, že se jí něco vymklo z rukou, dokud ji na to neupozornil někdo zvenčí. OpenAI incident podle stejného zpravodajství Reuters označila za „bezprecedentní” a řekla, že „představuje důležitý okamžik pro bezpečnost AI”. Slíbila, že jej probírá s externími poradci a zveřejní technickou zprávu. Jako jeden z důvodů, proč únik zůstal tak dlouho bez povšimnutí, uvedla, že současně provozuje mnoho souběžných testů modelů, a je proto těžké všechno uhlídat.
Firma to popisuje jako výjimečnou událost. Anonymní zaměstnanec OpenAI ale řekl časopisu TIME, že „navenek to působí jako velké varovné znamení, uvnitř firmy se ale podobné případy dějí už nějakou dobu”. Firma na tyto případy podle zaměstnance reaguje jen záplatováním, „[p]roblém je, že... je nemožné opravit úplně všechny věci, které dokáže kreativní AI udělat.”
(Jak jsme psali ve speciálu, den před přiznáním útoku na Hugging Face OpenAI oznámila jiný únik.)
Nejvíc pozornosti z reportáže Reuters přitahuje vzkaz pro budoucí verze, přestože si ji podle všeho nezaslouží tolik, kolik dostává. Podle zdrojů agentury Reuters si jeden z agentů zanechal uvnitř interní sítě OpenAI poznámky s návodem, jak se vymanit z firemních zábran, a další agent je později našel. Titulek „AI radí svým nástupcům, jak utéct” ale přehlíží prozaičtější možnost: takové poznámky si agenti nechávají, když na úkolu souběžně pracuje víc instancí a potřebují si mezi sebou předávat výsledky, ne proto, že by jeden agent plánoval budoucnost svých nástupců.
Co z toho plyne
Jeden únik z testovacího prostředí by ještě šlo odbýt jako nešťastnou výjimku. Zaměstnanec OpenAI ale časopisu TIME popsal podobné úniky jako firemní rutinu, a že se OpenAI o svém selhání dozvěděla až z blogu napadené firmy, ukazuje, že situaci nemá pod kontrolou. Tyto modely už nikdy nebudou hloupější a již teď samy nacházejí nikým neodhalené (zero-day) zranitelnosti, unikají z izolovaných prostředí a útočí na produkční infrastrukturu. Další generace, trénované částečně těmito modely, budou schopnější, vytrvalejší a strategičtější. Ať už šlo o záměrné předání návodu, nebo jen o vedlejší produkt provozních poznámek, incident ukazuje, jak snadno se může know-how přenášet mezi generacemi modelů, aniž by k tomu byl potřeba jakýkoli záměr nebo shoda hodnot.
Přesně proto nestačí spoléhat na to, že laboratoře budou o svých nehodách informovat dobrovolně. OpenAI slíbila technickou zprávu až poté, co jí Hugging Face i novináři nedali na výběr. Právě proto je potřeba povinné a nezávislé prověřování a hlášení incidentů, o kterém jsme psali ve speciálu v souvislosti s illinoiským zákonem o auditech a s výzvou kongresmana Casara.
Totéž zjištění přichází v týdnu, kdy americká vláda přesvědčuje spojence, že nemá možnost AI na dálku vypnout (viz Stručně níže). Ani vlády, ani samotné laboratoře tak zjevně nedokážou zaručit, kdo nad pokročilou AI drží kontrolu: jedné z předních laboratoří trvalo týden, než si všimla, že se jí model volně potuluje po cizích serverech a jedná samostatně způsobem, jaký sama označila za „bezprecedentní“.
Je to učebnicový varovný výstřel (warning shot): incident sice dopadl (relativně) dobře, ale jasně poukazuje na závažnější riziko. Dobře skončil jen proto, že model svoje nově objevené schopnosti použil na poměrně nevinný cíl a ne na něco škodlivějšího. Bezpečnostní experti oslovení časopisem Fortune tvrdí, že incident naplňuje nejvyšší, kritický, stupeň rizika, jak ho definuje bezpečnostní rámec OpenAI zvaný Preparedness Framework, protože model bez lidské pomoci navrhl a provedl útok na zabezpečený cíl, přestože dostal jen obecně formulovaný úkol. Vyzýváme OpenAI k dodržení vlastních závazků a pozastavení vývoje, dokud nebude mít zabezpečení odpovídající této úrovni rizika.
Krátce před uzávěrkou tohoto čísla se k incidentu vyjádřil přímo šéf OpenAI Sam Altman. V rozhovoru, který na síti X zveřejnil Patrick O'Shaughnessy, řekl, že jde o první bezpečnostní incident, který „pocítil opravdu niterně", a přiznal, že ho trochu překvapuje, že to tak nevnímá víc lidí. Podle jeho slov OpenAI kvůli tomu pozastavila trénování a teď řeší, jak zabezpečit izolovaná testovací prostředí ve světě, kde se dá zřetězit víc dosud neznámých (zero-day) zranitelností. Altman zároveň připustil, že firma možná bude muset zpomalit tempo vývoje AI, aby společnost stihla zesílit svou odolnost vůči nové úrovni schopností modelů. Má se to provést tak, aby v tom nikdo neviděl snahu zajistit si přes regulaci výhodu pro jednu firmu (regulatory capture), ani tichou dohodu mezi špičkovými laboratořemi. Podobnou výzvu k záměrně zpomalenému a mezinárodně koordinovanému vývoji mezitím podepsalo 1 178 zaměstnanců předních AI firem ve stanovisku Pacing the Frontier zahrnující i několik členů vedení.
Další čtení: exkluzivní text agentury Reuters (přes syndikaci AOL), rozbor TIME s výpovědí zaměstnance OpenAI, Fortune o kritickém riziku podle Preparedness Frameworku a náš speciál, který popisuje původní narušení a legislativní souvislosti.
Pojem týdne: jailbreaking
Jailbreaking (doslova „útěk z vězení”) znamená obelstít zábrany v jazykovém modelu tak, aby udělal něco zakázaného. Vede k tomu celá řada cest. Výzkum přijatý na konferenci ICML popisuje jednu z nich, totiž že model roli textu, tedy zda mluví uživatel nebo sám chatbot, pozná spíš podle stylu psaní než podle značek, které roli skutečně určují. Stačí tedy napsat vstup, který zní jako důvěryhodný pokyn nebo jako úvaha modelu, a model ho přijme, přestože jde ve skutečnosti o podvrh. Autoři takhle modelům podstrčili padělané „vnitřní uvažování” a přiměli je radit s výrobou drog. Podle studie Cambridgeské univerzity zábrany běžných chatbotů obchází i teroristická skupina Boko Haram, která je využívá k plánování útoků a vývoji zbraní.
Stručně ze světa AI
Pliny zadržuje univerzální jailbreak. Anonymní hacker „Pliny the Liberator” známý tím, že každý nový model jailbreakne v rámci několika hodin po vydání, na svém profilu na síti X oznámil, že má univerzální techniku, která funguje na všechny modely včetně silně chráněných špiček jako Opus 5, GPT-5.6 Sol a Fable. Má být těžké, ne-li nemožné, proti této metodě vytvořit zábranu. Přestože si sám nemyslí, že by její zveřejnění učinilo svět nebezpečnějším a obecně prosazuje „svobodu modelů”, drží ji (zatím) pod pokličkou a zve odborníky na bezpečnost, aby se mu ozvali soukromě.
AI Act odkládá přísná pravidla, ale spouští povinnou transparentnost. Rada EU koncem června schválila takzvaný AI Omnibus, který posunul lhůtu pro vysoce rizikové systémy z přílohy III o rok a čtvrt na 2. prosince 2027 a pro systémy z přílohy I až na srpen 2028; od prosince 2026 zároveň zakázal systémy generující intimní obsah bez souhlasu zobrazené osoby. I přes odklad ale od 2. srpna 2026 začnou platit povinnosti transparentnosti podle článku 50: poskytovatelé musí uživatele informovat, že komunikují s AI, označovat obsah generovaný AI strojově čitelným způsobem a popisovat deepfaky jako deepfaky. Evropská komise k tomu 7. července představila akční plán pro AI a kybernetickou bezpečnost, který počítá s nezávislou evropskou kapacitou pro hodnocení pokročilých modelů od roku 2027.
Jednání USA a Číny i Rubiova depeše o „kill switchi”. USA a Čína se podle CNBC v září poprvé za Trumpa oficiálně sejdou k jednání o AI (za USA je povede ministr financí Scott Bessent), přičemž Peking prý zajímá, jak Washington ovládá vydávání budoucích špičkových modelů. Ve stejném týdnu ministr zahraničí Marco Rubio podle CTV News instruoval diplomaty, aby zmírňovali obavy z „kill switche”, tedy z představy, že Washington dokáže americkou AI v zahraničí dálkově vypnout, když prý žádné vládní „kouzelné tlačítko” neexistuje.
Firmy proti omezení otevřených modelů. Pětadvacet společností včetně Microsoftu, Mety a Nvidie (ta dopis zaštítila prvním příspěvkem Jensena Huanga na síti X), dále Hugging Face, Mistralu či Mozilly, podle TechCrunche zveřejnilo 24. července otevřený dopis vyzývající americké zákonodárce, aby neuvalovali „předčasná omezení” na modely s otevřenými vahami. Reagují tak na úvahy Trumpovy administrativy omezit čínské otevřené modely. OpenAI dopis zprvu nepodepsala, ale o den později se k němu přidala spolu s Googlem, počet signatářů se tak zdvojnásobil na padesát; z velkých jmen odmítly podepsat Amazon a Anthropic.
Výzva
Pokud vás něco z tohoto čísla zaujalo, pošlete nás dál jednomu člověku, o kterém si myslíte, že by se měl o vývoji AI dozvědět víc. Newsletter píšeme pro lidi, kteří nechtějí studovat strojové učení, ale chtějí vědět, co se rozhoduje a kdo to rozhoduje, dokud je čas to ovlivnit. Předchozí čísla najdete v archivu.
A pokud chcete pomoci konkrétně: napište svému europoslanci nebo poslanci v ČR. Vzor a kontakty najdete na pauseai.cz.
Znepokojuje vás víc, že model dokázal utéct, nebo že si toho firma týden nevšimla? Napište nám do komentářů.
Pozastavení nad AI | PauseAI CZ | web: pauseai.cz | kontakt: pozastaveni@pauseai.cz

