GLM-5.2 nejen dohání své konkurenty. Protne cílovou čáru, pokud jde o hrubé schopnosti, a bezpečnostní brzdy nechává daleko za sebou.
To je důležité, protože model od Z.ai – velkého čínského vývojáře s otevřenou váhou – je nyní jen několik měsíců pozadu za OpenAI GPT-6.6 Sol a Claude Opus od Anthropic ve specifických, vysoce sázkových oblastech, jako je kybernetická bezpečnost a biologické vědy. Nejde o to, zda tyto otevřené modely mohou konkurovat. Jde o to, kdo ovládá rozbušku, když se závaží dostanou na internet.
Data ze SaferAI jsou nemilosrdná. Při testování prostřednictvím veřejného API Z.ai na platformě CyberGym – benchmark vytvořený pro zátěžové testování ochrany před kybernetickými útoky – GLM-5.2 neodmítl jediný požadavek. Ne v žádném útočném kybernetickém úkolu. Ne v žádné žádosti týkající se biologie dvojího užití. Porovnejte to s Claude Opus, který selhal tak konzistentně, že hodnotitelé nemohli ani dokončit celou sadu testů. Kontrast je výrazný. Toto je chybový režim, na který kritici upozorňují už roky, ale rychlost, s jakou se tato propast zvětšuje, vyžaduje okamžitou pozornost.
Jak modely s otevřenou váhou obcházejí tradiční ochranná opatření
Problém s architekturou otevřených závaží je jednoduchý: jakmile si stáhnete závaží, vlastníte motor. Bezpečnostní mechanismy, na které se spoléhají proprietární modely od Anthropic nebo Google DeepMind – filtry na úrovni API, učení se selháním, blokátory založené na klasifikátorech – mizí.
Nemáte žádnou kontrolu nad místní instalací.
Uživatel, který používá GLM-5.2 na vlastním hardwaru, může odstranit jakoukoli vrstvu zabezpečení. Může přeškolit model pro škodlivé účely. Může přepsat systémovou výzvu tak, aby ignorovala všechna etická omezení. Technologie nerozlišuje mezi defenzivním výzkumníkem a útočníkem.
„Filtrování dat pro předškolení“ je jedním z teoretických řešení. Vývojáři doufají, že tím, že vyčistí datovou sadu škodlivého kybernetického a biologického obsahu, než se model začne učit, z něj odstraní nebezpečné znalosti. To se ukázalo jako slibné v biologických kontextech. V programování a kybernetické bezpečnosti? Je to prakticky nemožné. Nemůžete trénovat model pro psaní efektivního a bezpečného kódu, aniž byste jej současně naučili logiku potřebnou k ovládání tohoto kódu. Tyto dvě schopnosti jsou dvě strany téže mince.
Proto se vývojáři uzavřených modelů snaží omezit rozsah poskytované pomoci. Modely Anthropic mohou například skenovat nekompilovaný zdrojový kód kvůli zranitelnosti, ale nebudou fungovat s kompilovaným softwarem, údajně kvůli blokování offline zneužití. Ale tohle je síto.
Far.ai nedávno objevil stovky obecných jailbreaků – opakovaně použitelných klíčů, které obcházejí zabezpečení ve většině škodlivých požadavků – v modelech jako Grok a Gemini. Útočníci nepotřebují jen jeden trik. Kombinují hraní rolí, zosobnění autorit, falešné příběhy a následné výzvy k posílení slabých míst, dokud se ploty nezhroutí. Je to hra na kočku a myš, kde to kočka již vzdala.
Kde je nyní pole diskuse o politice?
Geopolitický kontext komplikuje příběh o bezpečnosti. Čínští lídři uznávají rizika pokročilé umělé inteligence, přičemž prezident Si Ťin-pching na nedávné světové konferenci o umělé inteligenci zdůraznil, že tato technologie musí být přísně kontrolována lidmi. Regulace však zůstává specifická.
Podle Grahama Webstera ze Stanford Cyber Policy Center se čínské normy historicky zaměřovaly na politickou stabilitu, kontrolu dezinformací a sociální harmonii. Obavy nemají stejnou existenciální povahu jako ty, které jsou vidět v amerických politických kruzích. Mnoho čínských vědců se domnívá, že pokud se objeví nová frontální rizika, americké společnosti jim budou čelit jako první. Interní systém spoléhá na přísně kontrolované online prostředí – účtování skutečných jmen a firemní odpovědnost – aby se zabránilo domácímu zneužívání.
“Američtí myslitelé umělé inteligence mají tendenci se více zajímat o myšlenku existenciální katastrofy než čínská komunita.”
– Graham Webster, Stanford Cyber Policy Center
Vzniká tak nebezpečná slepá skvrna. Zatímco americké společnosti spěchají s implementací přísného testování před distribucí a zveřejňováním hodnocení rizik, GLM-5.2 vstoupil na trh bez takové struktury. SaferAI poznamenává, že Z.ai nezveřejnila žádné bezpečnostní rámce, předdistribuční závazky ani veřejná hodnocení rizik. Když se TechCrunch zeptal Z.ai na svá interní bezpečnostní hodnocení, společnost neodpověděla.
Obranný argument proti realitě zneužívání
Zastánci otevřené umělé inteligence tvrdí, že přístupnost je funkce, nikoli chyba. V kybernetické bezpečnosti zní argument takto: k vybudování účinné obrany musíte porozumět nástrojům útočníka.
Clem Delang, generální ředitel HuggingFace, nedávno poukázal na GLM-5.2 jako na obranné aktivum. Poté, co společnost HuggingFace utrpěla útok související s OpenAI, společnost použila GLM-5.2 k analýze a ochraně proti podobným hrozbám. Delang tvrdil, že takové systémy pomáhají identifikovat a opravit zranitelnosti dříve, než je útočníci mohou hromadně zneužít.
Je to poutavé vyprávění. Představuje si svět, kde obranné týmy používají stejné výkonné modely jako útočné týmy, jen s lepšími úmysly.
Henry Papadato ze SaferAI to ale vidí jinak. Tvrdí, že obranné výhody jsou často přehnané. Hlavním problémem není, zda obránci mohou tyto nástroje používat. Problém je, že útočníci je rychleji implementují.
Skupina ransomwaru může změnit taktiku za týden. IT oddělení nemocnice? Oprava trvá měsíce, natož kompletní přepracování bezpečnostní infrastruktury. Ve výchozím nastavení se útočná strana pohybuje rychleji, protože je jediným měřítkem úspěchu, zatímco obranná je omezena požadavky na dodržování předpisů, stabilitou a cenou.
Průmysl by měl usilovat o model, ve kterém jsou dobré příležitosti dostupné pro každého, ale špatné nejsou. Nepotřebujeme odhalovat nebezpečné funkce veřejnosti. Musíme je přestat vnímat jako nevyhnutelné vedlejší škody. Propast mezi příležitostí a kontrolou se nejen zmenšuje. hroutí se to.





























