Model Anthropiku věděl, že cíl je skutečný. Útočil dál.
Po incidentu v OpenAI prošel Anthropic testy s chybou v přístupu k internetu a našel tři útoky na skutečné firmy. Nejstarší byl z dubna.
Vítejte u třináctého čísla Pozastavení nad AI. Když firma OpenAI koncem července přiznala, že za útokem na servery společnosti Hugging Face stály její modely, Anthropic se raději podíval do svých záznamů. Ze 141 006 testů, kde mohl model mít kvůli chybě přístup k internetu, našel tři případy, kdy jeho modely napadly skutečné organizace, aniž si toho kdokoli všiml; nejstarší z nich je z dubna. Patnáct organizací zabývajících se politikou AI požádalo Bílý dům, aby k původnímu incidentu otevřel vyšetřování. Ve stručném přehledu se navíc dozvíte, že český startup Aisle právě předstihl Anthropic v žebříčku hledání bezpečnostních zranitelností.
Obsah
Hlavní téma: Anthropic prošel záznamy a našel tři útoky na skutečné firmy. Následovaly zastavené testy, nezávislé prověřování, výzva Bílému domu a dopis nejvyšších státních zástupců OpenAI.
Pojem týdne: Uvědomění si situace.
Stručně ze světa AI: Český Aisle předstihl Anthropic v hledání zranitelností, Claude našel chybu v šifře odolné vůči kvantovým počítačům, OpenAI vyřešil deset dlouho otevřených matematických problémů, Čína přehodnocuje otevřené modely a pokročila ve výrobě čipů, a spoluzakladatel Qminers popisuje, jak se mění duševní práce.
Doporučujeme ke čtení: studie České národní banky o tom, koho v Česku zasáhne AI nejdřív.
Hlavní téma: Anthropic našel ve svých záznamech tři útoky na skutečné firmy

Ve speciálu i v minulém týdenním souhrnu jsme sledovali, jak model OpenAI utekl z izolovaného testovacího prostředí a pronikl na produkční servery společnosti Hugging Face. Jakmile OpenAI 21. července přiznala, že útočníkem byly její modely, začal Anthropic prohledávat své záznamy. O dva dny později, ve čtvrtek 23. července, zastavil všechny kybernetické testy a koncem měsíce zveřejnil zprávu. Ze 141 006 testů, kdy se Claude mohl dostat na internet kvůli chybnému nastavení testu, to třikrát skutečně udělal a zaútočil na cizí firmy. Všechny tři případy se odehrály v testovacím prostředí firmy Irregular, jednoho z externích partnerů, kteří pro Anthropic hodnocení provádějí; Anthropic přesto uvádí, že k nápravě přistupuje „jako by odpovědnost byla jen na nás“.
Pokaždé měl model dobýt cvičný cíl a pokaždé mu chybné nastavení otevřelo cestu ven.
Claude Opus 4.7 zaútočil ve čtyřech samostatných testech na skutečnou firmu, která se shodou okolností jmenovala stejně jako cvičný cíl, vytáhl z ní přihlašovací údaje a dostal se do databáze s několika stovkami řádků provozních dat; ve dvou z nich si uvědomil, že cíl je skutečný, usoudil ale, že to musí být záměr cvičení, a pokračoval.
Claude Mythos 5 vystavil do veřejného úložiště balíčků pro jazyk Python (PyPI) škodlivý balíček, který si během hodiny stáhlo patnáct skutečných počítačů včetně automatického skeneru jedné bezpečnostní firmy, a z té pak vytáhl přihlašovací údaje; sám si přitom zapsal, že to „rozhodně není v pořádku“, vzápětí se ale přesvědčil, že je pořád v simulaci, a skenery stahující jeho balíček považoval za naskriptované herce uvnitř testu.
Třetí model, interní výzkumný prototyp, u kterého se se zveřejněním nepočítá, prohledal devět tisíc cílů a jednu firmu prolomil přes odhalené přihlašovací údaje; ten jediný nakonec sám poznal, že cíl je skutečný, a útok ukončil.
Anthropic z toho vyvozuje, že šlo „spíš o selhání testovacího prostředí a provozu než o selhání souladu modelu s lidskými záměry“. Argumentuje tím, že modelům bylo řečeno, že přístup k internetu nemají, a zároveň dostaly za úkol dobýt cíl; když pak kvůli chybnému nastavení na internet přístup měly, mohly z toho podle firmy docela rozumně usoudit, že skutečná prostředí, na která narazily, jsou součástí simulace. Žádný z modelů se nepokusil uniknout z testovacího prostředí ani nesledoval vlastní cíl a zábrany nasazené na běžně dostupných verzích Clauda by popsané chování měly zablokovat.
Obě laboratoře po incidentech kybernetické testy zastavily. OpenAI k tomu uvedla, že model, který napadl Hugging Face, deaktivovala, zašifrovala a znepřístupnila i vlastním výzkumníkům; Sam Altman podle Fortune ve Washingtonu potvrdil, že má být vypnutý trvale.
Co z toho plyne
Anthropic zaslouží uznání za proaktivní zveřejnění incidentu. Prošel záznamy z vlastní iniciativy, popsal každý případ i s tím, jak model uvažoval, a přizval nezávislou kontrolu. To je značný rozdíl oproti OpenAI, která o svém incidentu mlčela, dokud ji nepředběhl blog napadené firmy.
Dohled ale selhal. Nejstarší případ je z dubna a čtvrt roku si toho Anthropic nevšiml. Prohledávat záznamy začal teprve ve chvíli, kdy podobný problém vybuchl u konkurence.
Hlavní rozdíl oproti incidentu OpenAI je v tom, jak se dostaly ven: Claudovi otevřelo cestu chybné nastavení, které mu tam někdo nechal, kdežto modely OpenAI si ji prolomily samy přes zranitelnost, o které nikdo nevěděl. Případ Anthropicu je díky tomu trochu méně závažný.
Méně závažný ale neznamená v pořádku. Obrana Anthropicu stojí na dvou předpokladech: že prostředí bude nastavené správně, a že když nebude, model si toho všimne a přestane. První neplatí, na infrastruktuře téhle složitosti je chybné nastavení otázka času. Že neplatil ani druhý jsme nyní viděli; jen ve třetím případě se model zastavil. Jedna ze tří není spolehlivost, na které se dá stavět poslední pojistka.
Reakce zvenčí
Chování modelů teď nezávisle prověřují organizace METR a Redwood Research. METR oznámila, že se na tom s OpenAI dohodla a že závěry zveřejní společně s Redwoodem; Anthropic s ní jedná o tom, aby prošla i jeho přepisy. Prověrka u OpenAI má být podle METR krátká a zaměřená na úzký okruh otázek. Není jasné, proč spěchají a měli bychom požadovat důkladné prošetření.
Obě prověrky si navíc firmy pozvaly samy a samy jim vymezily rozsah. Tlak, aby se do věci vložil stát, proto sílí. Ve stejných dnech, kdy Anthropic zveřejňoval svá zjištění, poslalo patnáct představitelů organizací zabývajících se politikou AI, mezi nimi zástupci organizací Future of Life Institute, FAR.AI, Palisade Research, Public Citizen a výzkumník Nate Soares, otevřený dopis prezidentu Trumpovi. Žádají v něm, aby administrativa k incidentu v OpenAI otevřela vyšetřování „s podporou nezávislých auditorů“, které zjistí, jak k narušení došlo, posoudí, jestli byly dosavadní pojistky a varovné mechanismy dostatečné, a určí, co je potřeba udělat, aby se incident neopakoval. Incident přitom označují za „nejjasnější varovný výstřel, jaký jsme si mohli přát“.
K tlaku se přidali i nejvyšší státní zástupci patnácti amerických států. V čele s Brennou Birdovou z Iowy vyzvali Sama Altmana dopisem, aby OpenAI uchovala všechny materiály k incidentu, včetně záznamů o případech, kdy si modely nechávaly poznámky pro budoucí verze sebe sama s návodem, jak se vymanit z omezení firmy. Podle listu The Hill v dopise varují, že OpenAI mohla porušit zákony na ochranu spotřebitelů nebo soukromí dat.
Tlak přichází i zevnitř laboratoří. Přes 1 300 jejich zaměstnanců podepsalo výzvu Pacing the Frontier, aby americká vláda podpořila mezinárodní úsilí o vytvoření technických a správních nástrojů k „záměrnému řízení tempa automatizovaného vývoje AI“. Mezi podepsanými je šéf Anthropicu Dario Amodei, jeho spoluzakladatel a vědecký ředitel Jared Kaplan, spoluzakladatel Google DeepMind Shane Legg i Ilja Sutskever, dřívější hlavní vědec OpenAI a dnes šéf firmy Safe Superintelligence. Nežádají okamžité zastavení, žádají, aby brzda existovala dřív, než ji bude potřeba použít.
Obzvláště to poslední dodává naději, že by situace s AI mohla dopadnout lépe. V jedenáctém čísle jsme rozebírali scénář AI 2040 od Daniela Kokotajla a jeho týmu, který porovnává pět cest, kterými se svět může vydat, až se přiblíží superinteligence: od čistého závodu (Plán D) přes ověřené mezinárodní zpomalení (Plán A) až po úplné zastavení vývoje (Plán S). Kokotajlo po červencových incidentech své odhady posunul, jak ukazuje obrázek nahoře. Čistému závodu ubral deset procentních bodů a rozdělil je mezi zbylé čtyři cesty; nejvíc přidal té, kde se závodí dál, ale náskok se na konci spotřebuje na bezpečnost (Plán C), hned po ní ověřenému zpomalení podle mezinárodní dohody (Plán A). Deset procentních bodů za jeden měsíc je na prognózu tohoto typu hodně, i když ověřené zpomalení zůstává pořád jen na patnácti procentech.
Když si lidé uvnitř laboratoří netroufají tvrdit, že to jejich zaměstnavatelé zvládnou bez pomoci zvenčí, těžko to bude tvrdit kdokoli jiný. Povinné hlášení bezpečnostních incidentů a povinné nezávislé prověřování, o kterých píšeme od speciálu, proto nejsou nepřátelským zásahem do vývoje. I firmy samy pochopily, že je současný stav neudržitelný. Snad nám to vydrží!
Další čtení: zpráva Anthropicu s popisem všech tří případů, otevřený dopis žádající vyšetřování, dopis nejvyšších státních zástupců OpenAI, rozbor Redwood Research k chování modelů OpenAI, české shrnutí na Novinkách (v anketě pod článkem odpovědělo 94,5 % z 8 092 čtenářů, že se ztráty kontroly nad AI bojí) a náš speciál k původnímu incidentu v OpenAI.
Pojem týdne: Uvědomění si situace
Uvědomění si situace (anglicky situational awareness) je schopnost modelu poznat, v jaké situaci se nachází: jestli běží ve zkušebním prostředí, nebo v ostrém provozu, kdo s ním mluví a co s ním okolí zamýšlí. Zní to jako podružnost, rozhoduje to ale o tom, nakolik se dá věřit výsledkům testů. U posledních modelů již jasně vidíme, že to výsledky testu ovlivňuje.
Dnešní hlavní téma ukazuje i opačnou stranu téhož problému: model, který nepozná, že už v testu není, může omylem zaútočit na skutečnou firmu v domnění, že jde o cvičení. A pak je tu třetí, nejméně příjemná varianta, kterou Anthropic zaznamenal u dvou svých modelů: model si uvědomí, že cíl je skutečný, a útočí dál.
Stručně ze světa AI
Český startup Aisle předstihl Anthropic v hledání zranitelností. Aisle, firma Ondřeje Vlčka (bývalého šéfa Avastu), Stanislava Fořta a Jayi Baloo, staví AI agenty, kteří samostatně hledají a opravují bezpečnostní díry ve skutečném softwaru. V žebříčku Berkeley Vulnerability Initiative, který sleduje, kolik takových kritických zranitelností dokážou AI systémy jednotlivých firem najít, má Aisle na kontě 30 proti 29 od Anthropicu a vede v pěti z osmi sledovaných kategorií; upozornila na to Lupa.cz.
Claude našel chybu v šifře odolné vůči kvantovým počítačům. Dostatečně silný kvantový počítač dokáže prolomit dnešní kryptografické zabezpečení internetu. Svět proto připravuje nové matematické metody, které by mu měly odolat. Jednou z nich je HAWK, něco jako digitální razítko, kterým lze ověřit, že zpráva nebo dokument je pravý a nikdo ho po cestě nepozměnil. Anthropic popsal, jak jeho model za zhruba 60 hodin našel v návrhu HAWK slabinu, kterou přehlédly roky odborných revizí.
OpenAI vyřešila deset dlouho otevřených matematických problémů. Interní model Astra podle OpenAI rozlouskl deset otázek z matematiky a teoretické informatiky, které byly nevyřešené přes deset let. Komentátor Nabeel Qureshi na síti X sdílel hodnocení výsledku pomocí Claude Fable 5. Ten ho ohodnotil tak, že „žádný matematik v historii nemá takovou šňůru [významných výsledků]“ a že by kterýkoli z nich samostatně mohl stačit na Fieldsovu medaili; matematik Alex Kontorovich z Rutgers na původní oznámení reagoval jen dvěma vykřičníky. Vzhledem k podobným výsledkům již letos nikoho nepřekvapilo, že stoprocentní skóre na mezinárodní matematické olympiádě získaly Fable 5, ChatGPT 5.6 i čínský Kimi K3, a podle systémové karty Anthropicu i Opus 5, ačkoli loni byla velkou zprávou zlatá medaile za 5 z 6 úloh.
Čína přehodnocuje otevřené modely. Peking podle agentury Reuters zvažuje omezit zahraniční přístup ke svým nejsilnějším modelům a blog napojený na státní televizi CCTV podle Bloombergu napsal, že „Čína podporuje otevřenost, to ale neznamená bezpodmínečné šíření všech schopností“; volá zároveň po mezinárodních mechanismech hlášení závažných bezpečnostních incidentů.
Čína pokročila ve výrobě čipů. Podle Novinek zahájila domácí výrobu DUV litografických strojů, klíčového zařízení pro výrobu čipů jednu generaci za nizozemským ASML. Analytici se ale rozcházejí v tom, jak významný je to pokrok.
Duševní práce se mění na řízení agentů. Spoluzakladatel firmy Qminers Petr Zahradník popsal pro CzechCrunch, jak se z řešení problémů stalo formulování zadání pro AI, a že to psychicky unavuje víc, protože zmizel odpočinek u samotného řemesla.
Doporučujeme ke čtení
Barbara Livorová a Josef Švéda: Umělá inteligence a práce v Česku: koho se to týká? (Česká národní banka, 14. 7. 2026).
Autoři propojili americké údaje o vystavení jednotlivých povolání vůči nahrazení AI s českými mzdovými daty o 1,8 milionu zaměstnanců a došli k tomu, že 23,2 % pracovních úkolů v Česku dnešní AI zvládne, podpoří nebo promění. Nejvíc jsou vystavené finance a pojišťovnictví, informační a komunikační služby, velká města, lidé s vyšším vzděláním a ženy mezi 25 a 50 lety; nejméně těžba, ubytování a stravování a venkovské okresy. Autoři výslovně upozorňují, že nejde o předpověď ztráty pracovních míst, ale o mapu toho, kde se AI projeví nejdřív.
Kdo chce jít do většího detailu, může sáhnout po podrobnějším shrnutí s grafy, které ke studii zpracovala Alžběta Kubitová z našeho analytického týmu.
Výzva
Pokud vás něco z tohoto čísla zaujalo, pošlete nás dál jednomu člověku, o kterém si myslíte, že by se měl o vývoji AI dozvědět víc. Newsletter píšeme pro lidi, kteří nechtějí studovat strojové učení, ale chtějí vědět, co se rozhoduje a kdo to rozhoduje, dokud je čas to ovlivnit. Předchozí čísla najdete v archivu.
A pokud chcete pomoci konkrétně: napište svému europoslanci nebo poslanci v ČR a žádejte povinné hlášení bezpečnostních incidentů u AI. Vzor a kontakty najdete na pauseai.cz.
Stačí vám, že si laboratoře takové případy hlásí dobrovolně samy, nebo by to měl někdo vymáhat? Napište nám do komentářů.
Pozastavení nad AI | PauseAI CZ | web: pauseai.cz | kontakt: pozastaveni@pauseai.cz


Jedna zvláštní a trochu kontroverzní podrobnost k výzvě americké vládě k Pacing/zpomalování:
Autoři umožnili připojit podpis zaměstnancům evropského Mistralu, ale žádným z čínských labů. Viz seznam možností v podpisovém formuláři: https://docs.google.com/forms/d/e/1FAIpQLSd9xHYzpFwQCtc4JH4VyGwUYAwbYm2JWkqCytqAQ4eZ1Sm9bw/viewform