Модели тупеют нарочно: почему лаборатории меняют знания на рассуждения
Счёт в математических бенчмарках продолжает расти, а вычислений на токен тратится всё меньше. GLM-5.2 набирает 99,2% на AIME 2026, активируя около 40 миллиардов параметров на токен. Qwen3.5 — 91,3% при 17 миллиардах активных параметров, DeepSeek V4-Flash обходится 13 миллиардами. Для сравнения: GPT-4 в 2023 году, по слухам, гонял порядка 280 миллиардов активных параметров и с трудом решал задачи AIME. Если смотреть только на математику и код, складывается вывод, что модели глупеют задом наперёд — на каждый параметр они становятся умнее с абсурдной скоростью. Автор разбирается, что на самом деле происходит: лаборатории сознательно меняют мировые знания на навыки рассуждений.
Разумные — да, знающие — нет
На бенчмарках рассуждений прогресс очевиден. Но задайте той же модели простой фактический вопрос — и картина переворачивается. На SimpleQA, бенчмарке фактических знаний без доступа к инструментам, лидирует Gemini 2.5 Pro с результатом 53%: лучшее, что можно купить за деньги, всё ещё не отвечает на половину вопросов. Маленькие модели и вовсе проваливаются: Artificial Analysis фиксирует у Qwen3.5 4B и 9B уровень галлюцинаций 80–82% на своём knowledge-бенчмарке. Неизвестный факт — а это большинство фактов — модель просто выдумывает. Спросите 9B-модель о годе рождения малоизвестного математика XIX века — получите уверенный, правдоподобный и неверный ответ.
Параметры дешевеют не бесплатно. Лаборатории разменивают знания о мире на способность рассуждать, и этот размен — не побочный эффект, а осознанное проектное решение.
Зачем были нужны триллионы параметров
Факты занимают место. Исследования ёмкости знаний (самые чистые замеры — в серии работ «Physics of Language Models») дают порядок двух бит фактических знаний на параметр. Если модель должна знать год рождения каждого малоизвестного персонажа Википедии, население каждой нидерландской коммуны и порядок аргументов каждой функции каждого npm-пакета — за это платят весами. Именно поэтому frontier-модели доросли до триллионов параметров.
Рассуждения сжимаются куда лучше фактов, потому что это небольшой набор процедур, применяемых снова и снова: разбей задачу на части, отслеживай промежуточное состояние, проверяй себя, откатывайся при неудачном шаге. Дистилляция и RL на верифицируемых задачах переносят эти процедуры в маленькие модели на удивление хорошо. Phi-4 на 14 миллиардов параметров, обученная в основном на синтетических «учебниковых» данных, сильна в математике и слаба в тривиа — это точный слепок её обучающей выборки. Раньше такой перекос считали ограничением синтетического подхода. Теперь похоже, что это и была цель.
Уцелевшие знания имеют характерную форму: модели-генералисты знают понемногу почти обо всём и почти ничего — вглубь. Спросите про PostgreSQL — модель знает, что это, чем он хорош и как примерно работает MVCC. Но какая версия добавила конкретную фичу планировщика — снова выдумка. Это правильный слой для хранения в весах: широта позволяет модели понять, о чём вопрос, что искать и правдоподобен ли источник. Глубина дёшево достаётся извне и дорого хранится — её и выбрасывают.
Факты гниут, процедуры — нет
Frontier-обучение занимает месяцы и стоит сотни миллионов долларов, и в момент его завершения факты внутри модели начинают устаревать. Меняются API библиотек, цены, работодатели людей; половина того, что модель 2024 года «знала» про экосистему JavaScript, устарела до её релиза. У каждого факта, запечённого в веса, есть срок годности, а единственный способ обновить его — новое обучение.
Процедуры не портятся. Алгебра работала в 1970 году так же, как сейчас; то же верно для разбиения задачи на шаги или обнаружения противоречия между двумя источниками. Модель, состоящая в основном из процедур и лишь слегка нагруженная фактами, стареёт иначе: её дата среза знаний значит куда меньше, потому что текущее состояние мира и не должно было жить в весах. Это лучший аргумент за весь подход: дорогой и медленный артефакт (обученная модель) отцепляется от того, что меняется ежедневно (истина).
Знания переезжают в harness
Если модель ничего не знает, знать должен кто-то другой — и это harness: retrieval по базе знаний, вызовы инструментов, веб-поиск, файловая система с документацией. Модель привносит рассуждения, а всё, о чём она рассуждает, поставляется в рантайме.
Агенты уже так работают. Кодинг-агенту не нужно помнить API вашей зависимости наизусть: он грепает node_modules или читает документацию перед вызовом, и ответ привязан к версии, реально установленной у вас, а не к той, что доминировала в обучающих данных. Recall, который раньше был фиксированной ценой каждого прямого прохода, превратился в lookup по требованию.
Frontier-модель на вашей GPU
Автор прогнозирует: через пару лет по этой траектории появится модель с рассуждениями frontier-уровня, работающая на одной потребительской видеокарте. Вычислительная половина уже почти готова — DeepSeek V4-Flash рассуждает на ~13 миллиардах активных параметров. Что не влезает, так это остальные 271 миллиард параметров в экспертах, а слои экспертов — это в основном хранилище фактов. Выбросьте знания — и общий размер сожмётся к активному: модель на 20–40B в 4-битной квантизации влезет в 24 ГБ карту, которую ставят в игровые ПК с 2022 года.
Подвох: знать она будет немного. На «голый» фактический вопрос без инструментов правильное поведение — сказать «не знаю» и пойти посмотреть. В паре с приличным harness это покрывает большую часть того, ради чего сегодня используют frontier-модели, — локально, без оплаты за токены и без утечки данных с машины.
Что это делает с галлюцинациями
Самое перспективное следствие — влияние на галлюцинации. Пока факт живёт в весах, неверный факт невозможно найти и исправить: веса нельзя погрепать, нельзя задиффить с прошлым месяцем, а правка одной ошибки через fine-tune может сломать что угодно ещё. Модель выдаёт неверный факт с той же беглой уверенностью, что и верный, и проверить его не по чему.
Когда факт живёт вне модели, у неверного ответа появляется адрес. Модель ссылается на документ — документ можно открыть. Если документ неверен — правьте документ, и каждый следующий запрос получит исправление, что на год быстрее следующего цикла обучения. Retrieval не даёт нуля: модель может неверно прочитать источник или сшить два источника неправильно. Но утверждение со ссылкой проверяемо, а утверждение из весов — нет. Неверный факт в базе знаний — обычный баг данных, который мы уже умеем трассировать, чинить и покрывать регрессионным тестом.
В финальной версии этого будущего модельная карточка перестаёт указывать дату среза знаний: то, что осталось в весах, стареет годами, а не неделями. Модель просто получает текущее состояние мира в рантайме — так же, как процессор получает программу.