DeepSeek-V4-Pro-0813: бенчмарки против Opus-4.8, Kimi K3 и GLM-5.2

· 2 мин чтения
deepseek benchmarks models llm coding
DeepSeek-V4-Pro-0813: бенчмарки против Opus-4.8, Kimi K3 и GLM-5.2

DeepSeek-V4-Pro-0813 — официальный (не превью) релиз открытой модели DeepSeek-V4-Pro для кодинга и агентных задач. Он приходит на смену более ранней версии DeepSeek-V4-Pro (Preview) и добавляет модуль спекулятивного декодирования DSpark для ускорения инференса. Судя по model card, 0813 обыгрывает превью по всем заявленным бенчмаркам и попадает в один класс производительности с закрытыми фронтирными моделями — Opus-4.8, а также GLM-5.2, Kimi K3 и Fable-5.

Сводная таблица бенчмарков

Model card DeepSeek сравнивает новую модель с конкурентами по набору knowledge-, coding- и agentic-тестов. Цифры ниже — извлечены именно из неё; где пара «модель/бенчмарк» не публиковалась, таблица оставляет пропуск.

Бенчмарк V4 Pro 0813 Opus-4.8 Kimi K3 GLM-5.2 Fable-5
Terminal Bench 2.1 87.9 85.0 88.3 81.0 88.0
HLE (без инструментов) 42.7 49.8 — — 53.3
HLE (с инструментами) 60.0 57.9 56.0 — 63.0
NL2Repo 61.5 69.7 — — —
Cybergym 83.3 78.3 80.0 — —
DeepSWE 62.7 — 67.5 46.2 70.0
Toolathlon-Verified 74.1 — 76.5 — —
Agents' Last Exam 25.7 — 27.6 — —
AutomationBench Public 31.8 27.2 30.8 — —
DSBench-Hard 67.2 71.7 выше 0813* — —
DSBench-FullStack — — выше 0813* — 77.2

* по DSBench-Variant'ам Kimi K3 уверенно обгоняет DeepSeek, но точных цифр в статье нет.

Против Opus-4.8: победы делят по типу задач

Сравнение с Opus-4.8 даёт чёткий паттерн. Opus держит лидерство там, где нужны широкие знания и репозиторный кодинг: HLE без инструментов (49.8 против 42.7), NL2Repo (69.7 против 61.5), DSBench-Hard (71.7 против 67.2). Зато DeepSeek-V4-Pro-0813 обгоняет на терминальных и автоматизационных задачах: Terminal Bench 2.1 (87.9 против 85.0), Cybergym (83.3 против 78.3), AutomationBench Public (31.8 против 27.2).

Самый интересный крос-сюрприз — HLE с инструментами: 60.0 против 57.9. То есть DeepSeek проигрывает Opus по базовым знаниям без инструментов, но при разрешённых инструментах выходит вперёд — по-видимому, интеграция tool use компенсирует разрыв в базовом reasoning.

Против Kimi K3 и GLM-5.2

Куда теснее оппозиция у Kimi K3 — это самый близкий конкурент по всей таблице: большинство разрывов в пределах нескольких пунктов. Kimi выигрывает Terminal Bench 2.1 (88.3 против 87.9), DeepSWE (67.5 против 62.7), Toolathlon-Verified (76.5 против 74.1), Agents' Last Exam (27.6 против 25.7) и оба DSBench-варианта. DeepSeek отвечает на HLE с инструментами (60.0 против 56.0), Cybergym (83.3 против 80.0) и AutomationBench Public (31.8 против 30.8). Вывод из статьи: выбор между ними зависит только от конкретной задачи.

GLM-5.2 отстаёт почти везде, где фигурирует: 81.0 на Terminal Bench 2.1 (против 87.9 у DeepSeek) и 46.2 на DeepSWE (против 62.7). Для Cybergym у GLM-5.2 в model card вообще нет оценки.

Fable-5 (с fallback) — джокер. У неё самые высокие HLE-результаты из всех (53.3 без инструментов, 63.0 с ними) и лидерство на DeepSWE (70.0) и DSBench-FullStack (77.2). Но по NL2Repo, Agents' Last Exam и AutomationBench у неё нет опубликованных значений, так что полную картину по ней построить нельзя.

Превью → 0813: заголовки растут там, где их не ждут

Разница между превью и полным релизом настолько велика, что авторы называют её не инкрементальным патчем, а явным улучшением:

  • Terminal Bench 2.1: 72.1 → 87.9;
  • DeepSWE: 12.8 → 62.7 — рост более чем в четыре раза;
  • Cybergym: 52.7 → 83.3;
  • HLE без инструментов: 37.7 → 42.7 — улучшение есть, но скромное.

Паттерн очевиден: превью было заметно слабее именно в длинных агентных сценариях с инструментами, и релиз 0813 целенаправленно закрыл эту слабость. Сама model card формулирует это как «улучшения особенно заметны в production-окружениях» — оценки на agentic-бенчмарках растут куда быстрее, чем на чистых knowledge-тестах.

DSpark: спекулятивное декодирование без отдельного draft-модели

Обычно спекулятивное декодирование использует маленькую «черновую» (draft) модель, которая предлагает несколько следующих токенов, а большая модель проверяет их одним проходом вместо поштучной генерации. Отличие DSpark в том, что он не требует отдельного чекпойнта draft-модели — веса target и draft находятся в одном файле.

Включение — один конфигурационный флаг:

  • vLLM: --speculative-config с "method": "dspark" и числом спекулятивных токенов на шаг;
  • SGLang: --speculative-algorithm DSPARK — тоже без указания отдельного пути к draft-модели.

Результат — заметное операционное упрощение: командам не нужно поддерживать, версионировать и синхронизировать два чекпойнта только ради ускорения генерации.

Как читать цифры: категории и оговорки

  • HLE (Humanity's Last Exam) — широкий тест reasoning и знаний, оценивается с инструментами и без; разрыв между оценками показывает, насколько модель опирается на инструменты, а не на внутренние знания.
  • Terminal Bench 2.1 — выполнение задач внутри терминала, прокси реального developer-воркфлоу.
  • NL2Repo — перевод естественно-языковых требований в рабочие изменения на уровне репозитория.
  • Cybergym — кибербезопасность: анализ уязвимостей и эксплуатация в контролируемых средах.
  • DeepSWE — качество software-engineering-агента на реалистичных задачах исправления багов и внедрения фич.
  • Toolathlon-Verified и AutomationBench — многошаговое использование инструментов и автоматизационные пайплайны.
  • Agents' Last Exam — агентный аналог HLE, длинные агентные решения.
  • DSBench-FullStack / DSBench-Hard — внутренние тесты DeepSeek для full-stack и сложных coding-agent задач; воспроизвести их вне харнеса DeepSeek нельзя.

Важная оговорка по методологии: для coding-agent задач DeepSeek-V4-Pro-0813 оценивалась в «минимальном режиме» собственного DeepSeek Harness на max reasoning effort с параметрами temperature = 1.0, top_p = 0.95. Выбор харнеса, уровня reasoning и сэмплинга заметно влияет на числа, поэтому сравнение с самоотчётами других лабораторий стоит читать с поправкой на это.

Практические детали: лицензия, железо, параметры

  • 0813 в названии — это дата-штамп чекпойнта, как у других релизов DeepSeek-V4-Pro (превью и Flash).
  • Лицензия — MIT, распространяется и на код репозитория, и на веса модели.
  • Железо — пример в model card описывает 4-GPU-узел на GB300 с FP8 KV-cache и expert parallelism, но есть отдельные рецепты для vLLM и SGLang под другие конфигурации.
  • Reasoning effort — три уровня: low, high и max. При high и max рекомендуется максимальная выходная длина 384K токенов.

Практический итог: командам, уже гоняющим DeepSeek-V4-Pro (Preview) в production coding-пайплайнах, есть прямой смысл обновиться — дельты по агентным бенчмаркам это оправдывают. Тем, кто выбирает модель с нуля против Opus-4.8 или Kimi K3, важно смотреть на тип задач: V4 Pro 0813 конкурентна на терминальной и автоматизационной работе, но уступает на задачах с глубокими знаниями без доступа к инструментам.

Источник: https://www.mindstudio.ai/blog/deepseek-v4-pro-0813-benchmarks