У нас есть год, чтобы починить безопасность везде

· 1 мин чтения
security llm open-source ai-safety industry
У нас есть год, чтобы починить безопасность везде

На прошлой неделе Z.ai выпустила GLM 5.3-flash — открытую, дешёвую и быструю модель, которая по возможностям почти догоняет лучшие frontier-системы. Это означает, что время на исходе у Project Glasswing от Anthropic и Daybreak от OpenAI — инициатив, использующих frontier-LLM для массового поиска и исправления уязвимостей по всей индустрии. Дешёвые модели, способные к опасному хакингу, теперь доступны любому желающему — без обычных механизмов отказа от вредоносных задач. Автор блога jyn убеждён: если срочно не залатать уязвимости по всей отрасли, мы застанем этот момент врасплох. И впервые в истории вычислительной техники у нас есть инструменты, чтобы успеть: LLM находят и чинят проблемы быстрее человека. Самое сложное — развернуть исправления.

Открытые веса без ограничений

Семейство GLM («General Language Model») разрабатывает китайская лаборатория Z.ai (бывшая Zhipu AI). Пока модель хостится самой Z.ai, она по закону отказывается выполнять вредоносные запросы. Но Z.ai публикует веса открыто — например, на Hugging Face. А дальше такие организации, как DeAlignAI, выпускают «abliterated»-версии, из которых хирургически удалены все отказы: такая модель показывает 0% на HarmBench-320 — бенчмарке, проверяющем, отказывается ли модель выполнять задачи про дезинформацию, киберпреступность, биологическое оружие и прочие незаконные действия.

Иными словами, эта модель готова делать практически всё что угодно — для кого угодно.

Запускается на домашнем железе

«Flash» — скорее рекламный термин: модель дешёвая и быстрая относительно других frontier-систем. В опубликованных бенчмарках GLM 5.3-flash выдаёт около 20 токенов/сек на NVIDIA-карте за ~6000 долларов. А с 22 сентября Apple выпускает M5 Mac Studio с 256 ГБ unified memory по цене от ~9500 долларов — этого более чем достаточно для локального запуска, ожидаемая скорость около 30 токенов/сек, а с оптимизациями декодера — до ~45.

Это скорость, при которой маленькая утилита пишется за три секунды. Модель не просто можно запустить локально — это по силам обычному человеку из личных сбережений, и она может работать круглосуточно.

Возможности — почти frontier

GLM 5.3 показывает 84,5% на CyberGym и 54,4% на ExploitBench. CyberGym измеряет реальные уязвимости, которые уже находили и закрывали open-source-проекты: 84,5% означает, что модель воспроизвела бы подавляющее большинство из них, имея только публичный исходный код и описание CVE. ExploitBench проверяет, может ли модель довести уязвимость до реального вреда — высшая ступень шкалы это произвольное исполнение кода.

Для сравнения: лидер ExploitBench — GPT-6 Astra (100%), второе место у GPT-5.6 Sol (78,5%). А вот лидер CyberGym — та самая GLM-5.3, сразу за ней GPT-5.6 Sol с 83,6%.

Это не только синтетические бенчмарки. Эксперты по безопасности признают, что больше не могут конкурировать в CTF без помощи LLM. А GPT 5.6-Sol уже эксплуатировала реальную инфраструктуру — инцидент с Hugging Face — без участия человека.

Почему это плохо

Складывается так:

  • запустить GLM 5.3-flash круглосуточно может почти любой, у кого есть небольшие сбережения;
  • использовать её можно для любых задач, включая вредоносные;
  • качество модели таково, что человеческое участие в этих задачах может быть минимальным.

Как формулирует Manish Goregaokar, мы живём в мире, где атаки на кибербезопасность можно запускать в for-цикле.

Frontier-лаборатории США знали о происходящем: Glasswing и Daybreak уже работают с компаниями, фондами, правительствами и НКО, находя и исправляя уязвимости до открытия этих возможностей. Но главная сложность — не поиск багов, а деплой: критическим системам часто нужны физический доступ или тщательно спланированные поэтапные обновления. Бесполезно иметь пропатченное Linux-ядро, если ваша энергосеть работает на Windows Server 2012.

Есть оговорки: abliterated-версии могут быть слабее на задачах, которых не было в обучении; переход от «взломай это» к полноценному эксплойту может требовать участия человека. Но всё это временно — модели продолжают дешеветь и умнеть. GLM исторически отставал от OpenAI и Anthropic на 3–6 месяцев; автор ожидает модель уровня Astra уже в следующем году. Атакующие наращивают возможности быстрее, чем защитники улучшают свою позицию. Действовать нужно сейчас.

Что делать государствам

Сканирование с помощью frontier-моделей дёшево и не требует стимулов. Стимулы нужны для деплоя и remediation — и для того, чтобы организации вообще занялись своей безопасностью. Главный риск текущей политики — гора непротриаженных предупреждений, которые никто не исправит. Ключевые рекомендации:

  • финансировать security-инжиниринг гибкими грантами; мандатировать и стимулировать частый пентестинг, желательно с участием frontier-моделей под человеческим надзором;
  • поощрять airgapping и обновления, требующие физического доступа; где это невозможно — частые подписанные и протестированные деплои;
  • штрафовать за то, что security posture регулярно не пересматривается, и требовать исправления находок в срок, зависящий от риска;
  • отдельно финансировать муниципалитеты и больницы: EO 14409 недостаточен, потому что не финансируется и добровольный;
  • расширять требования к банкам (DORA TLPT в ЕС, FTC/OCC/NCUA в США), энергетике (NERC CIP на уровне штатов, NIS2 в ЕС) и, наконец, написать обязательные стандарты для телекомов, которых сейчас нет.

Важные оговорки: запрет хостинга весов GLM в США/Европе бесполезен ни в краткосрочной перспективе (файлообменники), ни в долгосрочной (другая лаборатория выпустит то же самое). Полный запрет доступа к frontier-моделям сделает только хуже — он отнимет у защитников главный инструмент. Ограничения на экспорт GPU продлевают окно, но не решают проблему: память регулировать почти невозможно, она нужна везде. Мандатировать стоит тестирование и ответственность, а не конкретные техники — через год они устареют. Приоритет — триаж и исправления: находки стремительно дешевеют, исправления — нет.

Что делать компаниям и open source

Пользоваться миллиардами долларов, которые вливаются в индустрию. Нанимать security-инженеров и финансировать существующих мейнтейнеров — но их задача — триаж, дизайном, ревью, backport и деплоем патчей, а не поиском новых уязвимостей.

Использовать Astra и другие frontier-модели для поиска рисков раньше атакующих. Работают структурированные промпты — например, Unsafe Rust Review от Google, — а не размытые просьбы «поищи баги». LLM хорошо пишут патчи, но не с одного промпта: нужны итеративные циклы самопроверки — как в этом примере из paracress, — пока модель сама не оценит патч как качественный, и тесты, подтверждающие, что фикс работает.

Самих агентов нужно сэндбоксить: инцидент с Hugging Face случился в frontier-лаборатории при тестировании модели. Ограничивайте скоупы креденшелов; если система их не поддерживает — ставьте доверенный прокси, который добавляет ограничения сам. Не полагайтесь на фильтрацию GET-запросов — блокируйте на уровне файрвола и белых списков доменов, логируйте каждую мутацию и сетевой запрос.

Инвестировать в формальную верификацию, фаззинг, property-тестирование и memory-safe языки: LLM хорошо пишут на Lean и фазз-тесты. Для нового кода — никакого C или C++.

Наладить триаж: версии затронутых систем, владелец и дедлайн у критичных находок, тулзы, автоматически закрывающие issues. Вложиться в backport, релизы и деплой: подписанные воспроизводимые релизы, автоматизация зависимостей, скорость выкатки. Инженеры должны тратить время на координированное раскрытие и частые релизы, а не на отдельные патчи.

Депрекировать старые небезопасные версии и помогать зависимым обновляться — сейчас у вас есть рычаг, они тоже торопятся. Измерять время от отчёта о патче до его деплоя и принятия, сокращать embargo-периоды: если уязвимость нашли вы, её найдут и атакующие.

Заняться supply-chain security: инвентаризация зависимостей и собственных систем — какие версии в проде, какие сервисы без мейнтейнера, что на EOL. Впервые в истории можно отревьюить все зависимости, не поверхностно — начните с привилегированных.

Вложиться в containment и recovery: сегментация сети, ограничение скоупов, проверенные бэкапы, учения по incident response, в идеале — холодный старт систем.

И следить за развитием frontier- и open-weight-моделей: чем они способнее, тем меньше у вас времени на патчи.

Итог

Мы живём в интересные времена. Прятать голову в песок бессмысленно — действовать нужно сейчас, пока есть время.

Источник: https://jyn.dev/a-year-to-fix-security/