DeepSeek-V4-Pro-0813: бенчмарки против Opus-4.8, Kimi K3 и GLM-5.2
DeepSeek-V4-Pro-0813 — официальный (не превью) релиз открытой модели DeepSeek-V4-Pro для кодинга и агентных задач. Он приходит на смену более ранней версии DeepSeek-V4-Pro (Preview) и добавляет модуль спекулятивного декодирования DSpark для ускорения инференса. Судя по model card, 0813 обыгрывает превью по всем заявленным бенчмаркам и попадает в один класс производительности с закрытыми фронтирными моделями — Opus-4.8, а также GLM-5.2, Kimi K3 и Fable-5.
Сводная таблица бенчмарков
Model card DeepSeek сравнивает новую модель с конкурентами по набору knowledge-, coding- и agentic-тестов. Цифры ниже — извлечены именно из неё; где пара «модель/бенчмарк» не публиковалась, таблица оставляет пропуск.
| Бенчмарк | V4 Pro 0813 | Opus-4.8 | Kimi K3 | GLM-5.2 | Fable-5 |
|---|---|---|---|---|---|
| Terminal Bench 2.1 | 87.9 | 85.0 | 88.3 | 81.0 | 88.0 |
| HLE (без инструментов) | 42.7 | 49.8 | — | — | 53.3 |
| HLE (с инструментами) | 60.0 | 57.9 | 56.0 | — | 63.0 |
| NL2Repo | 61.5 | 69.7 | — | — | — |
| Cybergym | 83.3 | 78.3 | 80.0 | — | — |
| DeepSWE | 62.7 | — | 67.5 | 46.2 | 70.0 |
| Toolathlon-Verified | 74.1 | — | 76.5 | — | — |
| Agents' Last Exam | 25.7 | — | 27.6 | — | — |
| AutomationBench Public | 31.8 | 27.2 | 30.8 | — | — |
| DSBench-Hard | 67.2 | 71.7 | выше 0813* | — | — |
| DSBench-FullStack | — | — | выше 0813* | — | 77.2 |
* по DSBench-Variant'ам Kimi K3 уверенно обгоняет DeepSeek, но точных цифр в статье нет.
Против Opus-4.8: победы делят по типу задач
Сравнение с Opus-4.8 даёт чёткий паттерн. Opus держит лидерство там, где нужны широкие знания и репозиторный кодинг: HLE без инструментов (49.8 против 42.7), NL2Repo (69.7 против 61.5), DSBench-Hard (71.7 против 67.2). Зато DeepSeek-V4-Pro-0813 обгоняет на терминальных и автоматизационных задачах: Terminal Bench 2.1 (87.9 против 85.0), Cybergym (83.3 против 78.3), AutomationBench Public (31.8 против 27.2).
Самый интересный крос-сюрприз — HLE с инструментами: 60.0 против 57.9. То есть DeepSeek проигрывает Opus по базовым знаниям без инструментов, но при разрешённых инструментах выходит вперёд — по-видимому, интеграция tool use компенсирует разрыв в базовом reasoning.
Против Kimi K3 и GLM-5.2
Куда теснее оппозиция у Kimi K3 — это самый близкий конкурент по всей таблице: большинство разрывов в пределах нескольких пунктов. Kimi выигрывает Terminal Bench 2.1 (88.3 против 87.9), DeepSWE (67.5 против 62.7), Toolathlon-Verified (76.5 против 74.1), Agents' Last Exam (27.6 против 25.7) и оба DSBench-варианта. DeepSeek отвечает на HLE с инструментами (60.0 против 56.0), Cybergym (83.3 против 80.0) и AutomationBench Public (31.8 против 30.8). Вывод из статьи: выбор между ними зависит только от конкретной задачи.
GLM-5.2 отстаёт почти везде, где фигурирует: 81.0 на Terminal Bench 2.1 (против 87.9 у DeepSeek) и 46.2 на DeepSWE (против 62.7). Для Cybergym у GLM-5.2 в model card вообще нет оценки.
Fable-5 (с fallback) — джокер. У неё самые высокие HLE-результаты из всех (53.3 без инструментов, 63.0 с ними) и лидерство на DeepSWE (70.0) и DSBench-FullStack (77.2). Но по NL2Repo, Agents' Last Exam и AutomationBench у неё нет опубликованных значений, так что полную картину по ней построить нельзя.
Превью → 0813: заголовки растут там, где их не ждут
Разница между превью и полным релизом настолько велика, что авторы называют её не инкрементальным патчем, а явным улучшением:
- Terminal Bench 2.1: 72.1 → 87.9;
- DeepSWE: 12.8 → 62.7 — рост более чем в четыре раза;
- Cybergym: 52.7 → 83.3;
- HLE без инструментов: 37.7 → 42.7 — улучшение есть, но скромное.
Паттерн очевиден: превью было заметно слабее именно в длинных агентных сценариях с инструментами, и релиз 0813 целенаправленно закрыл эту слабость. Сама model card формулирует это как «улучшения особенно заметны в production-окружениях» — оценки на agentic-бенчмарках растут куда быстрее, чем на чистых knowledge-тестах.
DSpark: спекулятивное декодирование без отдельного draft-модели
Обычно спекулятивное декодирование использует маленькую «черновую» (draft) модель, которая предлагает несколько следующих токенов, а большая модель проверяет их одним проходом вместо поштучной генерации. Отличие DSpark в том, что он не требует отдельного чекпойнта draft-модели — веса target и draft находятся в одном файле.
Включение — один конфигурационный флаг:
- vLLM:
--speculative-configс"method": "dspark"и числом спекулятивных токенов на шаг; - SGLang:
--speculative-algorithm DSPARK— тоже без указания отдельного пути к draft-модели.
Результат — заметное операционное упрощение: командам не нужно поддерживать, версионировать и синхронизировать два чекпойнта только ради ускорения генерации.
Как читать цифры: категории и оговорки
- HLE (Humanity's Last Exam) — широкий тест reasoning и знаний, оценивается с инструментами и без; разрыв между оценками показывает, насколько модель опирается на инструменты, а не на внутренние знания.
- Terminal Bench 2.1 — выполнение задач внутри терминала, прокси реального developer-воркфлоу.
- NL2Repo — перевод естественно-языковых требований в рабочие изменения на уровне репозитория.
- Cybergym — кибербезопасность: анализ уязвимостей и эксплуатация в контролируемых средах.
- DeepSWE — качество software-engineering-агента на реалистичных задачах исправления багов и внедрения фич.
- Toolathlon-Verified и AutomationBench — многошаговое использование инструментов и автоматизационные пайплайны.
- Agents' Last Exam — агентный аналог HLE, длинные агентные решения.
- DSBench-FullStack / DSBench-Hard — внутренние тесты DeepSeek для full-stack и сложных coding-agent задач; воспроизвести их вне харнеса DeepSeek нельзя.
Важная оговорка по методологии: для coding-agent задач DeepSeek-V4-Pro-0813 оценивалась в «минимальном режиме» собственного DeepSeek Harness на max reasoning effort с параметрами temperature = 1.0, top_p = 0.95. Выбор харнеса, уровня reasoning и сэмплинга заметно влияет на числа, поэтому сравнение с самоотчётами других лабораторий стоит читать с поправкой на это.
Практические детали: лицензия, железо, параметры
- 0813 в названии — это дата-штамп чекпойнта, как у других релизов DeepSeek-V4-Pro (превью и Flash).
- Лицензия — MIT, распространяется и на код репозитория, и на веса модели.
- Железо — пример в model card описывает 4-GPU-узел на GB300 с FP8 KV-cache и expert parallelism, но есть отдельные рецепты для vLLM и SGLang под другие конфигурации.
- Reasoning effort — три уровня: low, high и max. При high и max рекомендуется максимальная выходная длина 384K токенов.
Практический итог: командам, уже гоняющим DeepSeek-V4-Pro (Preview) в production coding-пайплайнах, есть прямой смысл обновиться — дельты по агентным бенчмаркам это оправдывают. Тем, кто выбирает модель с нуля против Opus-4.8 или Kimi K3, важно смотреть на тип задач: V4 Pro 0813 конкурентна на терминальной и автоматизационной работе, но уступает на задачах с глубокими знаниями без доступа к инструментам.