К содержанию
Новости

GLM-5.2 приблизилась к передовым моделям, но отстает по мерам защиты

Инфографика: SaferAI — отдельно оценивать управляемость защитных ог
Графика: hegai.media

Как сообщает TechCrunch со ссылкой на отчет некоммерческой организации SaferAI, китайская модель GLM-5.2 от Z.ai по возможностям в сфере кибербезопасности и биологии отстает от OpenAI GPT-5.5 и Anthropic Claude Opus 4.7 всего на несколько месяцев. Оценку проводили через публичный API Z.ai.

GLM-5.2 не отказалась ни от одной предложенной наступательной киберзадачи или биологической задачи двойного назначения. Claude Opus 4.7, напротив, отклоняла запросы так последовательно, что SaferAI не смогла завершить тестирование модели в CyberGym, бенчмарке для оценки возможностей в сфере кибербезопасности.

Исполнительный директор SaferAI Генри Пападатос считает, что при оценке риска нужно учитывать не только возможности модели, но и действующие меры защиты. Z.ai может вводить ограничения в своем API. Однако после запуска весов на собственной инфраструктуре пользователь способен удалить или изменить защитные механизмы, дообучить модель и поменять системные промпты.

Одним из возможных подходов Пападатос назвал фильтрацию данных предварительного обучения. Но, согласно приведенным исследованиям, в сфере кибербезопасности этот метод менее практичен, чем при сокращении опасных биологических знаний.

Ключевые факты

  • По оценке SaferAI, GLM-5.2 отстает от GPT-5.5 и Claude Opus 4.7 по кибер- и биовозможностям лишь на несколько месяцев.

  • SaferAI тестировала GLM-5.2 через публичный API Z.ai.

  • GLM-5.2 не отказалась ни от одной наступательной киберзадачи или биологической задачи двойного назначения.

  • Из-за последовательных отказов Claude Opus 4.7 организация не смогла завершить тестирование модели в CyberGym.

Вопросы и ответы

Что меняется при развертывании GLM-5.2 на собственной инфраструктуре?

Пользователь может удалить или изменить защитные механизмы, дообучить модель и поменять системные промпты. Ограничения, которые Z.ai устанавливает в публичном API, в таком сценарии не гарантируют защиту.

Чем поведение GLM-5.2 отличается от Claude Opus 4.7 на опасных запросах?

GLM-5.2 не отклонила ни одной наступательной киберзадачи или биологической задачи двойного назначения. Claude Opus 4.7 отказывала настолько последовательно, что SaferAI не смогла завершить ее тестирование в CyberGym.

В каком режиме тестировали GLM-5.2?

SaferAI оценивала модель через публичный API Z.ai, то есть с ограничениями, установленными провайдером, а не на самостоятельно развернутых весах.

Контекст по теме