Гонка ИИ приняла неловкий оборот: DeepSeek отдал сжатие KV-кэша, а Anthropic и OpenAI молча им воспользовались

· 1 мин чтения
inference deepseek llm opinion
Гонка ИИ приняла неловкий оборот: DeepSeek отдал сжатие KV-кэша, а Anthropic и OpenAI молча им воспользовались

Если читать новости последних недель, можно решить, что китайские лаборатории загнали западные в угол. Картина обратная привычной. Западные компании громко жалуются, что у них воруют модели. А сами в тот же момент тихо берут чужие инженерные решения — и выпускают поверх них свои лучшие модели.

Про варварство дистилляции

Anthropic неделями не выпускает очередную статью о том, что китайские лаборатории дистиллируют их модели и превращают это в угрозу человечеству.

Зачем им это говорить? Так выгодно. Такие заявления заранее готовят почву, чтобы позже ограничить эти модели законом и регуляторами. Сначала публично назвать проблему, потом попросить ограничения — удобная схема.

Дистилляция здесь — это когда модель поменьше учат на ответах модели побольше. Ученик дешевле, ведёт себя как учитель.

Но дни бездумной дистилляции, похоже, прошли. Новая игра — перенимать чужие успехи. Только автор этого текста специально пишет «внедрять», а не «красть», как это любят делать в Anthropic.

И вот тут важная деталь: китайцы свои рецепты раздают почти даром.

Сжатие KV-кэша

Самый свежий случай — оптимизация сжатия KV-кэша от DeepSeek. Её скопировали, не сказав ни слова благодарности.

Сначала разберёмся, что это за кэш. Когда модель отвечает, она помнит всё, что прочитала за этот раз. Всё прочитанное лежит в памяти видеокарты — это и есть KV-кэш. Для длинных сессий такая память становится одной из самых тяжёлых статей расходов. А кодинг-агент — это как раз длинная сессия: он час читает файлы, а потом ещё час правит их.

DeepSeek сжал эту память примерно в 437 раз против своей первой версии. Сколько памяти нужно на миллион токенов:

Версия KV-кэш на 1 млн токенов
DeepSeek-V1 389,12 ГБ
DeepSeek-V3.2 48,07 ГБ
DeepSeek-V4-Flash 3,51 ГБ
DeepSeek-V4.1-Flash 890 МБ

То есть меньше на 99,77 процента. Прежние 389 гигабайт превратились в 890 мегабайт.

Чтобы читать эти цифры, нужно сначала понять три строчки в прайс-листе любой модели. Ввод — цена текста, который вы отправили. Запись в кэш — цена того, чтобы модель этот текст запомнила. Чтение из кэша — цена того, чтобы модель потом вернулась к нему. Чем длиннее контекст и чем больше повторных обращений к нему, тем важнее вторая и третья строчки. В агентном кодинге повторных обращений к одному файлу очень много: агент прочитал файл, поправил две строчки и снова его открыл.

Дорожка была длинной. DeepSeek первым выпустил архитектуру MLA — она сжала кэш примерно в 15 раз. Потом пришли Compressed Sparse Attention и Heavily Compressed Attention. В версии V4.1-Flash ко всему этому добавили CSA2, повторное использование кэша между слоями, причинно-следственный кодировщик-декодировщик и хранение кэша в FP4. В итоге на один токен уходит всего 890 байт.

Почему на этом так сильно выигрывают

Причина простая: обслуживать модель с длинным контекстом почти целиком упирается в память видеокарты под кэш. Чем меньше кэш, тем дешевле каждый запрос.

Посмотрим, что случилось с ценами. Все цифры — за миллион токенов.

Модель Ввод Запись в кэш Чтение из кэша
Claude Opus 5 $5 $6,25 $0,50
Claude Opus 5.5 $4 $5 $0,20
Скидка −20% −20% −60%
Модель Ввод Запись в кэш Чтение из кэша
GPT-5.6 Sol $5 $6,25 $0,50
GPT-6.1 Sol $2 $2,50 $0,10
Скидка −60% −60% −80%

У Anthropic чтение кэша подешевело на 60 процентов. У OpenAI — на 80 процентов, если считать от цен GPT-5.6 Sol на конец июля.

Обратите внимание, где именно скидка. Запись в кэш тоже подешевела, но не так резко. А вот чтение кэша обвалилось сильнее всего. И это прямое доказательство, что оптимизации дошли до обычной работы моделей, а не остались в эксперименте.

Тихое «спасибо»

Выходит, западные ИИ-компании сейчас отчаянно зарабатывают на обслуживании моделей.

Причина понятна. Ограничения на доступ к современным видеокартам заставили китайские лаборатории поставить оптимизацию производительности на первое место. И это видно в результатах — не в словах, а в цифрах выше.

Автор текста не понимает, зачем китайцы раздают такое бесплатно. Но факт есть факт: обе компании — Anthropic и OpenAI — выпустили модели верхнего уровня. В их основе лежат именно эти оптимизации.

И да, похоже, им самим немного неловко из-за копирования. Поэтому Claude Opus 5.5 и GPT-6.1 Sol вышли тихо, почти без анонса.

Отзывы пользователей про работу моделей отличные. По качеству они не сильно отстают от флагманов — Claude Fable 5.1 и GPT-6 Astra.

Что из этого следует

Получается такая картина. Китайские лаборатории выбросили спасательный круг убыточным западным лабораториям. И никто не понимает, зачем они это сделали.

В этом и весь смысл истории. Публичные обвинения в краже моделей и тихое заимствование чужих оптимиций идут параллельно. Первые нужны, чтобы позже получить регуляторные ограничения. Вторые нужны, чтобы удержать цену обслуживания модели на уровне, при котором её вообще можно продавать.

Два совершенно разных мотива — и одно и то же действие. Собственно, это и делает гонку неудобной.

Источник: https://insufferable.dev/posts/the-ai-race-just-got-awkward/