DeepSeek-V4-Pro-0813: бенчмарки против Opus-4.8, Kimi K3 и GLM-5.2

· 2 мин чтения
deepseek benchmarks models llm coding
DeepSeek-V4-Pro-0813: бенчмарки против Opus-4.8, Kimi K3 и GLM-5.2

DeepSeek-V4-Pro-0813 — официальный (не превью) релиз открытой модели DeepSeek-V4-Pro для кодинга и агентных задач. Он приходит на смену более ранней версии DeepSeek-V4-Pro (Preview) и добавляет модуль спекулятивного декодирования DSpark для ускорения инференса. Судя по model card, 0813 обыгрывает превью по всем заявленным бенчмаркам и попадает в один класс производительности с закрытыми фронтирными моделями — Opus-4.8, а также GLM-5.2, Kimi K3 и Fable-5.

Сводная таблица бенчмарков

Model card DeepSeek сравнивает новую модель с конкурентами по набору knowledge-, coding- и agentic-тестов. Цифры ниже — извлечены именно из неё; где пара «модель/бенчмарк» не публиковалась, таблица оставляет пропуск.

Бенчмарк V4 Pro 0813 Opus-4.8 Kimi K3 GLM-5.2 Fable-5
Terminal Bench 2.1 87.9 85.0 88.3 81.0 88.0
HLE (без инструментов) 42.7 49.8 53.3
HLE (с инструментами) 60.0 57.9 56.0 63.0
NL2Repo 61.5 69.7
Cybergym 83.3 78.3 80.0
DeepSWE 62.7 67.5 46.2 70.0
Toolathlon-Verified 74.1 76.5
Agents' Last Exam 25.7 27.6
AutomationBench Public 31.8 27.2 30.8
DSBench-Hard 67.2 71.7 выше 0813*
DSBench-FullStack выше 0813* 77.2

* по DSBench-Variant'ам Kimi K3 уверенно обгоняет DeepSeek, но точных цифр в статье нет.

Против Opus-4.8: победы делят по типу задач

Сравнение с Opus-4.8 даёт чёткий паттерн. Opus держит лидерство там, где нужны широкие знания и репозиторный кодинг: HLE без инструментов (49.8 против 42.7), NL2Repo (69.7 против 61.5), DSBench-Hard (71.7 против 67.2). Зато DeepSeek-V4-Pro-0813 обгоняет на терминальных и автоматизационных задачах: Terminal Bench 2.1 (87.9 против 85.0), Cybergym (83.3 против 78.3), AutomationBench Public (31.8 против 27.2).

Самый интересный крос-сюрприз — HLE с инструментами: 60.0 против 57.9. То есть DeepSeek проигрывает Opus по базовым знаниям без инструментов, но при разрешённых инструментах выходит вперёд — по-видимому, интеграция tool use компенсирует разрыв в базовом reasoning.

Против Kimi K3 и GLM-5.2

Куда теснее оппозиция у Kimi K3 — это самый близкий конкурент по всей таблице: большинство разрывов в пределах нескольких пунктов. Kimi выигрывает Terminal Bench 2.1 (88.3 против 87.9), DeepSWE (67.5 против 62.7), Toolathlon-Verified (76.5 против 74.1), Agents' Last Exam (27.6 против 25.7) и оба DSBench-варианта. DeepSeek отвечает на HLE с инструментами (60.0 против 56.0), Cybergym (83.3 против 80.0) и AutomationBench Public (31.8 против 30.8). Вывод из статьи: выбор между ними зависит только от конкретной задачи.

GLM-5.2 отстаёт почти везде, где фигурирует: 81.0 на Terminal Bench 2.1 (против 87.9 у DeepSeek) и 46.2 на DeepSWE (против 62.7). Для Cybergym у GLM-5.2 в model card вообще нет оценки.

Fable-5 (с fallback) — джокер. У неё самые высокие HLE-результаты из всех (53.3 без инструментов, 63.0 с ними) и лидерство на DeepSWE (70.0) и DSBench-FullStack (77.2). Но по NL2Repo, Agents' Last Exam и AutomationBench у неё нет опубликованных значений, так что полную картину по ней построить нельзя.

Превью → 0813: заголовки растут там, где их не ждут

Разница между превью и полным релизом настолько велика, что авторы называют её не инкрементальным патчем, а явным улучшением:

  • Terminal Bench 2.1: 72.1 → 87.9;
  • DeepSWE: 12.8 → 62.7 — рост более чем в четыре раза;
  • Cybergym: 52.7 → 83.3;
  • HLE без инструментов: 37.7 → 42.7 — улучшение есть, но скромное.

Паттерн очевиден: превью было заметно слабее именно в длинных агентных сценариях с инструментами, и релиз 0813 целенаправленно закрыл эту слабость. Сама model card формулирует это как «улучшения особенно заметны в production-окружениях» — оценки на agentic-бенчмарках растут куда быстрее, чем на чистых knowledge-тестах.

DSpark: спекулятивное декодирование без отдельного draft-модели

Обычно спекулятивное декодирование использует маленькую «черновую» (draft) модель, которая предлагает несколько следующих токенов, а большая модель проверяет их одним проходом вместо поштучной генерации. Отличие DSpark в том, что он не требует отдельного чекпойнта draft-модели — веса target и draft находятся в одном файле.

Включение — один конфигурационный флаг:

  • vLLM: --speculative-config с "method": "dspark" и числом спекулятивных токенов на шаг;
  • SGLang: --speculative-algorithm DSPARK — тоже без указания отдельного пути к draft-модели.

Результат — заметное операционное упрощение: командам не нужно поддерживать, версионировать и синхронизировать два чекпойнта только ради ускорения генерации.

Как читать цифры: категории и оговорки

  • HLE (Humanity's Last Exam) — широкий тест reasoning и знаний, оценивается с инструментами и без; разрыв между оценками показывает, насколько модель опирается на инструменты, а не на внутренние знания.
  • Terminal Bench 2.1 — выполнение задач внутри терминала, прокси реального developer-воркфлоу.
  • NL2Repo — перевод естественно-языковых требований в рабочие изменения на уровне репозитория.
  • Cybergym — кибербезопасность: анализ уязвимостей и эксплуатация в контролируемых средах.
  • DeepSWE — качество software-engineering-агента на реалистичных задачах исправления багов и внедрения фич.
  • Toolathlon-Verified и AutomationBench — многошаговое использование инструментов и автоматизационные пайплайны.
  • Agents' Last Exam — агентный аналог HLE, длинные агентные решения.
  • DSBench-FullStack / DSBench-Hard — внутренние тесты DeepSeek для full-stack и сложных coding-agent задач; воспроизвести их вне харнеса DeepSeek нельзя.

Важная оговорка по методологии: для coding-agent задач DeepSeek-V4-Pro-0813 оценивалась в «минимальном режиме» собственного DeepSeek Harness на max reasoning effort с параметрами temperature = 1.0, top_p = 0.95. Выбор харнеса, уровня reasoning и сэмплинга заметно влияет на числа, поэтому сравнение с самоотчётами других лабораторий стоит читать с поправкой на это.

Практические детали: лицензия, железо, параметры

  • 0813 в названии — это дата-штамп чекпойнта, как у других релизов DeepSeek-V4-Pro (превью и Flash).
  • Лицензия — MIT, распространяется и на код репозитория, и на веса модели.
  • Железо — пример в model card описывает 4-GPU-узел на GB300 с FP8 KV-cache и expert parallelism, но есть отдельные рецепты для vLLM и SGLang под другие конфигурации.
  • Reasoning effort — три уровня: low, high и max. При high и max рекомендуется максимальная выходная длина 384K токенов.

Практический итог: командам, уже гоняющим DeepSeek-V4-Pro (Preview) в production coding-пайплайнах, есть прямой смысл обновиться — дельты по агентным бенчмаркам это оправдывают. Тем, кто выбирает модель с нуля против Opus-4.8 или Kimi K3, важно смотреть на тип задач: V4 Pro 0813 конкурентна на терминальной и автоматизационной работе, но уступает на задачах с глубокими знаниями без доступа к инструментам.

Источник: https://www.mindstudio.ai/blog/deepseek-v4-pro-0813-benchmarks