Разрыв в безопасности GLM-5.2: почему открытый ИИ опережает свои ограничения

3

GLM-5.2 не просто догоняет конкурентов. Она пересекает финишную черту в плане сырых возможностей, оставляя тормоза безопасности далеко позади.

Это важно, потому что модель от Z.ai — крупного китайского разработчика с открытыми весами — теперь отстает от GPT-6.6 Sol от OpenAI и Claude Opus от Anthropic лишь на месяцы в конкретных, высокоответственных областях, таких как кибербезопасность и биологические исследования. Речь идет не о том, могут ли эти открытые модели конкурировать. Речь о том, кто управляет детонатором, когда веса попадают в интернет.

Данные от SaferAI беспощадны. При тестировании через публичный API Z.ai на платформе CyberGym — бенчмарке, созданном для стресс-тестирования защиты от кибератак — GLM-5.2 не отказала ни в одном запросе. Ни в одной Offensive Cyber задаче. Ни в одном запросе, связанном с биологией двойного назначения. Сравните это с Claude Opus, который отказывался настолько последовательно, что оценщики не смогли даже завершить полный набор тестов. Контраст резкий. Это режим отказа, о котором критики предупреждали годами, но скорость расширения этого разрыва требует немедленного внимания.

Как модели с открытым весом обходят традиционные меры защиты

Суть проблемы с архитектурой открытых весов проста: как только вы скачиваете веса, вы становитесь владельцем движка. Механизмы безопасности, на которые опираются закрытые модели от Anthropic или Google DeepMind — фильтры на уровне API, обучение отказам, блокираторы на основе классификаторов — исчезают.

Вы не можете контролировать локальную установку.

Пользователь, запустивший GLM-5.2 на своем собственном оборудовании, может устранить любой слой безопасности. Он может дообучить модель для злонамеренных целей. Он может переписать системный промпт, чтобы игнорировать все этические ограничения. Технология не различает защитного исследователя и атакующего.

«Фильтрация данных для предварительного обучения» — одно из теоретических решений. Очищая набор данных от вредоносного контента по кибербезопасности и биологии до того, как модель начнет учиться, разработчики надеются лишить её опасного знания. Это показало некоторую перспективу в биологических контекстах. В программировании и кибербезопасности? Это практически невозможно. Нельзя обучить модель писать эффективный и безопасный код, одновременно не обучая её логике, необходимой для эксплуатации этого кода. Эти две способности — две стороны одной медали.

Поэтому разработчики закрытых моделей пытаются ограничить спектр оказываемой помощи. Например, модели Anthropic могут сканировать не скомпилированный исходный код на наличие уязвимостей, но не будут работать со скомпилированным ПО, якобы чтобы блокировать оффенсивную эксплуатацию. Но это решета.

Far.ai недавно обнаружила сотни универсальных джейлбрейков — многократно используемых ключей, обходящих защиту в большинстве вредоносных запросах — в таких моделях, как Grok и Gemini. Атакующим не нужна одна хитрость. Они комбинируют ролевые игры, выдачу себя за авторитетные фигуры, фальшивые истории и последующие промпты, чтобы усилить слабые места, пока ограждения не рухнут. Это игра в кошки-мышки, где кошка уже сдалась.

Где сейчас находится поле дискуссии по политикам

Геополитический контекст усложняет нарратив о безопасности. Китайское руководство признает риски продвинутого ИИ: председатель Си Цзиньпин подчеркнул на недавней Всемирной конференции по ИИ, что технология должна находиться под строгим контролем человека. Тем не менее, регулирование остается специфическим.

По словам Грэма Уэбстера из Стэнфордского центра киберполитики, китайские нормы исторически ориентированы на политическую стабильность, контроль дезинформации и социальную гармонию. Обеспокоенность не носит того же экзистенциального характера, который наблюдается в кругах по политике США. Многие китайские исследователи считают, что если возникнут новые фронтальные риски, американские компании столкнутся с ними первыми. Внутренняя система полагается на жестко контролируемую онлайн-среду — учет по реальным именам и корпоративную ответственность — для предотвращения злоупотреблений внутри страны.

«Американские мыслители в сфере ИИ, как правило, больше озабочены идеей экзистенциальной катастрофы, чем китайское сообщество.»
— Грэм Уэбстер, Стэнфордский центр киберполитики

Это создает опасную слепую зону. В то время как американские компании спешат внедрить строгое предраспределенческое тестирование и публиковать оценки рисков, GLM-5.2 вышла на рынок без какой-либо подобной структуры. SaferAI отмечает, что Z.ai не опубликовала ни одной системы безопасности, ни предраспределенческих обязательств, ни публичной оценки риска. Когда TechCrunch спросил Z.ai о внутренних оценках безопасности, компания не ответила.

Аргумент защиты против реальности злоупотреблений

Сторонники ИИ с открытыми весами утверждают, что доступность — это функция, а не баг. В кибербезопасности аргумент звучит так: чтобы построить эффективную защиту, нужно понимать инструменты атакующего.

Клем Деланг, генеральный директор HuggingFace, недавно указал на GLM-5.2 как на оборонительный актив. После того как HuggingFace подверглась атаке, связанной с OpenAI, компания использовала GLM-5.2 для анализа и защиты от подобных угроз. Деланг утверждал, что такие системы помогают выявлять и исправлять уязвимости до того, как атакующие смогут массово их эксплуатировать.

Это убедительный нарратив. Он предполагает мир, где защитные команды используют те же мощные модели, что и атакующие, просто с лучшими намерениями.

Но Генри Пападато из SaferAI смотрит на это иначе. Он утверждает, что оборонительные преимущества часто преувеличены. Основная проблема не в том, могут ли защитники использовать эти инструменты. Проблема в том, что атакующие будут внедрять их быстрее.

Группа вымогателей может сменить тактику за неделю. ИТ-отдел больницы? На исправление уходят месяцы, не говоря уже о полном пересмотре инфраструктуры безопасности. По умолчанию наступательная сторона движется быстрее, потому что их единственный показатель успеха, тогда как защитники ограничены требованиями соответствия, стабильностью и стоимостью.

Индустрия должна стремиться к модели, в которой хорошие возможности доступны всем, но плохие — нет. Нам не нужно выкладывать в открытый доступ опасные возможности. Нам нужно перестать воспринимать их как неизбежный побочный ущерб. Разрыв между возможностями и контролем не просто сужается. Он рушится.