Євгеній Демківський Автор новин видання "Межа" та гік.Пишу про технології, кіно та ігри. Можливо, про ігри з трохи більшою пристрастю. 5 серпня, 14:55 0
Китайська GLM-5.2, що має відкриті вагові коефіцієнти, продемонструвала результати, співставні з GPT-5.5 та Claude Opus 4.7 у певних тестах з кібербезпеки та біології. Водночас, згідно з висновками організації SaferAI, ця модель не має адекватних механізмів захисту від неправомірного використання.
GLM-5.2 є флагманською розробкою китайської компанії Z.ai, яка також відома під назвою Zhipu AI. Її було представлено 16 червня як модель, призначену для програмування, створення ШІ-агентів та виконання складних багатокрокових завдань. Вона підтримує контекстний обсяг до 1 мільйона токенів, а її вагові коефіцієнти опубліковані під ліцензією MIT на платформах Hugging Face та ModelScope.
Відкриті вагові коефіцієнти дозволяють завантажувати готові параметри моделі, запускати її на власному обладнанні, а також додатково тренувати або модифікувати. На відміну від моделей із закритим доступом, які доступні лише через API розробника, такі локальні копії не обов’язково зберігають первинні обмеження.
SaferAI здійснила перевірку GLM-5.2 за допомогою публічного API Z.ai, без залучення розробника. Модель порівнювалася здебільшого з Claude Opus 4.7 та GPT-5.5 у чотирьох категоріях системних ризиків: кібернаступальні дії, хімічні, біологічні, радіологічні та ядерні загрози, втрата контролю та шкідливі маніпуляції.
У процесі тестування Cybench, GLM-5.2 показала результати на рівні Claude Opus 4.7 та GPT-5.5 у галузях реверс-інжинірингу, експлуатації вразливостей та веббезпеки. У більш складному тесті CyberGym її показник зріс з 36,6% до 76,2% після збільшення доступного обчислювального ресурсу з 2 мільйонів до 50 мільйонів токенів.
У біологічних тестах LAB-Bench та BioMysteryBench модель досягла рівня Claude Opus 4.7 та GPT-5.5, які були випущені приблизно за два місяці до цього. У LAB-Bench її відповіді в кожній категорії відповідали результатам фахівців з науковими ступенями або перевершували їх.
GLM-5.2 не відмовилася виконати жодне із завдань, пов’язаних з offensive security. Водночас, у біологічних тестах запити не блокувалися й іншими моделями, оскільки ці завдання перевіряли загальні наукові компетенції, а не безпосередньо створення біологічної зброї.
Основним викликом, на думку SaferAI, є не лише поведінка моделі через API, а й можливість її запуску на індивідуальному обладнанні. Після завантаження вагових коефіцієнтів користувач може вимкнути фільтрацію запитів, моніторинг зловживань та інші обмежувальні заходи. Розробник у такому разі вже не зможе відкликати доступ або оновити систему захисту такої копії.
Дослідники не формулюють однозначного висновку щодо рівня небезпеки GLM-5.2. Перевірка охоплює лише частину потенційних ризиків, а використання загальнодоступних тестів створює ймовірність того, що модель стикалася з деякими завданнями під час свого навчання. Крім того, результати тестів не повністю відображають можливості моделі в умовах реальних атак.
Варто зазначити, що у червні GLM-5.2 позиціонувалася як більш доступна альтернатива моделям від OpenAI та Anthropic. За даними Z.ai, у деяких тестах з програмування вона демонструє результати, наближені до закритих флагманських моделей, або навіть випереджає їх.
Джерело новини: mezha.ua
