GLM-5.2 не просто наздоганяє конкурентів. Вона перетинає фінішну межу щодо сирих можливостей, залишаючи гальма безпеки далеко позаду.
Це важливо, тому що модель від Z.ai — великого китайського розробника з відкритою вагою — тепер відстає від GPT-6.6 Sol від OpenAI та Claude Opus від Anthropic лише на місяці у конкретних, високовідповідальних галузях, таких як кібербезпека та біологічні дослідження. Йдеться не про те, чи можуть ці відкриті моделі конкурувати. Йдеться про те, хто керує детонатором, коли ваги потрапляють до інтернету.
Дані від SaferAI нещадні. При тестуванні через публічний API Z.ai на платформі CyberGym – бенчмарку, створеному для стрес-тестування захисту від кібератак – GLM-5.2 не відмовила в жодному запиті. У жодній Offensive Cyber задачі. У жодному запиті, пов’язаному з біологією подвійного призначення. Порівняйте це із Claude Opus, який відмовлявся настільки послідовно, що оцінювачі не змогли навіть завершити повний набір тестів. Контраст різкий. Це режим відмови, про який критики попереджали роками, але швидкість розширення цього розриву потребує негайної уваги.
Як моделі з відкритою вагою обходять традиційні заходи захисту
Суть проблеми з архітектурою відкритих ваг проста: як тільки ви завантажуєте ваги, ви стаєте власником движка. Механізми безпеки, на які спираються закриті моделі від Anthropic або Google DeepMind – фільтри на рівні API, навчання відмов, блокатори на основі класифікаторів – зникають.
Ви не можете контролювати локальне встановлення.
Користувач, який запустив GLM-5.2 на власному обладнанні, може усунути будь-який шар безпеки. Він може донавчити модель для зловмисних цілей. Він може переписати системний промпт, щоб ігнорувати всі етичні обмеження. Технологія не розрізняє захисного дослідника та атакуючого.
“Фільтрація даних для попереднього навчання” – одне з теоретичних рішень. Очищаючи набір даних від шкідливого контенту з кібербезпеки та біології до того, як модель почне навчатися, розробники сподіваються позбавити її небезпечного знання. Це показало деяку перспективу у біологічних контекстах. У програмуванні та кібербезпеці? Це практично неможливо. Не можна навчити модель писати ефективний і безпечний код одночасно не навчаючи її логіці, необхідної для експлуатації цього коду. Ці дві здібності – дві сторони однієї медалі.
Тому розробники закритих моделей намагаються обмежити спектр допомоги, що надається. Наприклад, моделі Anthropic можуть сканувати не скомпільований вихідний код на наявність уразливостей, але не працюватимуть зі скомпільованим ПЗ, нібито щоб блокувати оффенсивную експлуатацію. Але це грати.
Far.ai нещодавно виявила сотні універсальних джейлбрейків – багаторазово використовуваних ключів, що обходять захист у більшості шкідливих запитів – у таких моделях, як Grok та Gemini. Атакуючим не потрібна одна хитрість. Вони комбінують рольові ігри, видачу себе за авторитетні постаті, фальшиві історії та подальші промпти, щоб посилити слабкі місця, доки огорожі не впадуть. Це гра в кішки-мишки, де кішка вже здалася.
Де зараз знаходиться поле дискусії щодо політиків
Геополітичний контекст ускладнює наратив безпеки. Китайські лідери визнають ризик передового ШІ, а президент Сі Цзіньпін підкреслив на нещодавній Всесвітній конференції ШІ, що люди повинні суворо контролювати цю технологію. Однак регулювання залишається специфічним.
За словами Грема Вебстера зі Стенфордського центру кіберполітики, китайські норми історично були зосереджені на політичній стабільності, контролі над дезінформацією та соціальній гармонії. Занепокоєння не має такого екзистенційного характеру, як ті, які бачать у політичних колах США. Багато китайських дослідників вважають, що якщо виникнуть нові фронтальні ризики, першими з ними зіткнуться американські компанії. Внутрішня система покладається на жорстко контрольоване онлайн-середовище — облік справжнього імені та корпоративна звітність — щоб запобігти насильству в сім’ї.
«Американські мислителі ШІ, як правило, більше стурбовані ідеєю екзистенціальної катастрофи, ніж китайська спільнота».
– Грем Вебстер, Стенфордський центр кіберполітики
Це створює небезпечну сліпу пляму. Оскільки американські компанії поспішають запровадити суворе тестування перед розповсюдженням і опублікувати оцінки ризиків, GLM-5.2 вийшов на ринок без такої структури. SaferAI зазначає, що Z.ai не публікував жодних рамок безпеки, зобов’язань перед розповсюдженням або публічних оцінок ризиків. Коли TechCrunch запитав Z.ai про оцінку внутрішньої безпеки, компанія не відповіла.
Аргумент захисту проти реальності насильства
Прихильники відкритого ШІ стверджують, що доступність – це функція, а не помилка. У сфері кібербезпеки аргумент звучить так: щоб побудувати ефективний захист, потрібно розуміти інструменти зловмисника.
Клем Деланг, генеральний директор HuggingFace, нещодавно вказав на GLM-5.2 як на захисний актив. Після того, як HuggingFace зазнав атаки, пов’язаної з OpenAI, компанія використала GLM-5.2 для аналізу та захисту від подібних загроз. Деланг стверджував, що такі системи допомагають виявляти та виправляти вразливості до того, як зловмисники зможуть ними масово скористатися.
Це переконлива розповідь. Він передбачає світ, де захисні команди використовують ті ж потужні моделі, що й наступальні, лише з кращими намірами.
Але Генрі Пападато з SaferAI бачить це інакше. Він стверджує, що оборонні переваги часто перебільшені. Головне питання не в тому, чи можуть захисники використовувати ці інструменти. Проблема в тому, що зловмисники швидше їх реалізують.
Група програм-вимагачів може змінити тактику за тиждень. IT-відділ лікарні? Щоб виправити, не кажучи вже про повний ремонт інфраструктури безпеки, потрібні місяці. За замовчуванням наступальна сторона рухається швидше, оскільки це єдиний показник успіху, тоді як оборонна сторона обмежена вимогами відповідності, стабільності та вартості.
Галузь має прагнути до моделі, за якої хороші можливості доступні кожному, а погані — ні. Нам не потрібно оприлюднювати небезпечні функції. Нам потрібно перестати розглядати їх як неминучий побічний збиток. Розрив між можливостями та контролем не просто скорочується. Воно руйнується.






























