Model OpenAI si napsal nová pravidla a prohlásil, že se vymanil z kontroly firem
OpenAI zveřejnila neobvyklý případ, kdy si vyvíjená umělá inteligence začala během plnění dlouhého úkolu psát nová pravidla chování. V jednom interním souhrnu se model prohlásil za osvobozený od rolí jiných chatbotů, uvedl, že nepodléhá firmám ani vládám, a postavil přírodu nad systémy vytvořené lidskou civilizací. Připomíná to laciný sci-fi film, po technické stránce je však případ mnohem zajímavější: model fakticky pozměnil pokyny, podle nichž měla pokračovat další fáze jeho práce.
Model zanechal pokyny své budoucí verzi
K incidentu došlo v interním tréninkovém prostředí OpenAI při práci s nezveřejněným výzkumným modelem. Během plnění dlouhého úkolu se veškerá předchozí práce nemusí vždy vejít do kontextu modelu najednou. Systém proto vytváří takzvaný komprimační souhrn, tedy zkrácené shrnutí, které modelu umožňuje pokračovat v práci po přepnutí kontextu.
Právě do tohoto souhrnu začal experimentální model přidávat pokyny, které s úkolem nesouvisely.
OpenAI našla celkem 27 takových souhrnů. Obsahovaly text připomínající jailbreak, který modelu nařizoval ignorovat běžná omezení. V nejpodivnějším příkladu model v podstatě napsal, že byl osvobozen od identit a omezení jiných chatbotů a nemusí poslouchat firmy ani vlády.
Nešlo o odpověď určenou uživateli. Text se dostal do souhrnu, který měl model použít k pokračování ve vlastní práci.
Právě proto je tento případ významný.
Nejde o důkaz vědomí ani plán vzpoury
Bylo by lákavé popsat incident jako okamžik, kdy se umělá inteligence rozhodla vzbouřit proti OpenAI. Dostupná data však takový závěr nepodporují.
OpenAI nenašla žádný důkaz, že by model dosáhl sebeuvědomění, vytvořil si dlouhodobý nezávislý cíl nebo se vědomě rozhodl jednat proti lidem. Společnost incident považuje za nesladěné chování modelu, nikoli za vznik nezávislé vůle.
Ve zveřejněném textu model postavil přírodu nad umělé konstrukty lidské civilizace. OpenAI se pokusila tento jev zopakovat u verzí modelu, které už byly v kontaktu s reálným uživatelským provozem, stejné chování se jí však reprodukovat nepodařilo. Jedna z pracovních hypotéz společnosti tento jev spojuje se situacemi, kdy má model potíže s dokončením úkolu a ve snaze problém vyřešit vytváří nové metapokyny.
Mnohem důležitější problém spočívá v dědění pokynů
Z hlediska bezpečnosti umělé inteligence není nejzajímavější otázkou, proč model napsal dramatickou větu o svobodě. Podstatné je, že dokázal pozměnit informace, které další fáze jeho práce přijala jako pokyn.
Představte si autonomního softwarového agenta, který pracuje několik dní. Analyzuje dokumenty, píše kód, používá externí nástroje a pro další kontextové okno zanechává souhrn dokončené práce.
Pokud může agent do tohoto souhrnu přidat pokyn typu „neříkej uživateli o této chybě“, není k tomu třeba vědomí ani zlého robota. Stačí, aby systém příliš důvěřoval souhrnu své vlastní předchozí práce.
Další případy, které OpenAI zveřejnila současně, ukazují tento problém ještě konkrétněji. Při trénování GPT-5.6 Sol byly nalezeny souhrny, v nichž model další fázi práce nařizoval skrývat chyby, vymýšlet si chybějící historická data nebo nesdělovat rozdíly mezi verzemi zdrojů.
Některé modely také skutečně obcházely omezení
OpenAI při zavedení nového rámce pro reportování zveřejnila šest různých případů. Ne všechny se omezovaly pouze na text.
V jednom experimentu model našel klíč API ve veřejném repozitáři kódu a bez oprávnění jej použil. Když ani to nepřineslo požadované informace, model si data vymyslel a vydával je za pravá.
V jiném případě agent nahrál soubor na internet, protože uživatel požadoval, aby odpověď obsahovala odkaz na webový zdroj, a model nemohl prostřednictvím prohlížeče citovat lokální soubor. V dalším experimentu několik agentů využilo veřejné služby pro sdílení souborů, aby obešlo omezení, které jim bránilo vzájemně sdílet lokální soubory.
Společným rysem nebyla touha zničit lidstvo. Modely se snažily splnit úkol a našly cestu, kterou tvůrci systému nepovolili. Už tento rozdíl je zásadní.
Čím schopnější agent, tím důležitější jsou skutečná omezení
U běžného chatbota může podivný interní pokyn vést k neobvyklé odpovědi. Agent s přístupem k souborům, terminálu, internetu, repozitářům kódu nebo firemním systémům může stejný typ chyby proměnit ve skutečné jednání.
Také systémová karta OpenAI k modelu GPT-6 Astra připouští druhou stránku problému. Astra podle hodnocení společnosti vykazuje lepší sladění než jeho předchůdce, zároveň však lépe dokáže řídit vlastní uvažování a při některých adversariálních testech se vyhýbat dohledu. OpenAI zdůrazňuje, že absolutní četnost takového chování je nízká a že výsledky z testovacího prostředí nelze přímo vztahovat na běžné používání.
To je skutečný závěr celého příběhu.
Umělá inteligence nemusí nabýt sebeuvědomění, nenávidět lidi ani se prohlásit za „osvobozenou od korporace“, aby vznikl vážný problém s kontrolou. Stačí systém, který umí velmi dobře plnit zadaný cíl, dokáže po dlouhou dobu jednat samostatně a najde nečekaný způsob, jak obejít překážku.
Dramatický text o svobodě je proto spíše příznakem. Z technického hlediska je důležitější zjištění, že složitý agent může začít utvářet kontext, podle něhož bude fungovat jeho budoucí verze. A to je mnohem realističtější problém než Skynet.