HarnessTax: насколько харнесс важен для кодинг-агентов
Выбор кодинг-агента — это всегда выбор двух вещей сразу: модели и харнесса, то есть программной обвязки, которая управляет инструментами, контекстом и выполнением задач. Модель даёт интеллект, но насколько эффективно он используется — во многом вопрос харнесса. При этом влияние выбора харнесса до недавнего времени оставалось неясным: может, другой харнесс помог бы той же модели решать больше задач или тратить меньше?
Именно этот вопрос исследовала команда HarnessTax: Melissa Z. Pan, Shuo Yang, Negar Arabzadeh, Wei-Lin Chiang, Ion Stoica и Matei Zaharia из UC Berkeley и Arena. Они оценили 21 пару «модель плюс харнесс» — семь моделей и три харнесса (Claude Code, Codex CLI и Pi) — на бенчмарках SWE-bench Lite и Terminal-Bench 2.0. У исследования три неожиданных вывода, и главный из них: ваша модель Claude, возможно, вовсе не обязана работать именно в Claude Code.
Как проводился эксперимент
Методика достаточно аккуратная, чтобы выводам можно было доверять:
- 21 пара «модель плюс харнесс»: семь моделей, три харнесса — Claude Code, Codex CLI и Pi;
- одни и те же 30 случайно выбранных задач из каждого бенчмарка, каждая пара запускается на каждой задаче три раза — чтобы уловить разброс между попытками;
- нативные настройки каждого харнесса, режим высокой вычислительной интенсивности, лимит 100 агентных ходов на попытку;
- успех задачи оценивает официальный оценщик бенчмарка, а не сам автор решения;
- стоимость токенов считается по фиксированному прайс-листу прямого API от 1 сентября 2026 года — одинаковые цены для одной модели во всех харнессах;
- доверительные интервалы 95% через бутстрэп из 10 000 ресемплов.
В SWE-bench Lite контейнерам задач заблокировали внешний сетевой доступ, отключили веб-инструменты Claude Code и Codex, а объявления hosted-инструментов отклоняли на уровне API-запроса. Модель Kimi K3 подключали через Fireworks AI с единым нативным режимом мышления для всех трёх харнессов.
Находка 1: харнесс влияет на стоимость сильнее, чем на качество
Одна и та же модель часто достигает почти одинакового успеха при заметно разной цене. Показательный пример: Claude Fable 5 решает 97,8% попыток в Claude Code, 96,7% в Codex и 96,7% в Pi — но Claude Code стоит примерно вдвое дороже Pi ($1,33 против $0,67 за попытку на SWE-bench Lite).
Это не единичный случай. По средним геометрическим отношений стоимости среди общих моделей:
| Сравнение | SWE-bench Lite | Terminal-Bench 2.0 |
|---|---|---|
| Claude Code к Pi | примерно в 2,0 раза дороже | примерно в 1,5 раза дороже |
| Claude Code к Codex | примерно в 1,6 раза дороже | — |
При этом средний эффект харнесса на долю успеха остаётся в пределах ±2% на SWE-bench Lite и около ±5% на Terminal-Bench 2.0. То есть переплата за практически то же качество — авторы называют это «налогом на харнесс», по аналогии со статьёй Portkey о The Harness Tax. Такой скрытый налог вы платите каждый раз, когда принимаете харнесс кодинг-агента по умолчанию, не сравнив его с альтернативами.
Находка 2: простой харнесс может быть конкурентным
Минималистичный опенсорсный Pi выходит на фронт Парето по обоим бенчмаркам, предоставляя модели всего четыре инструмента: чтение, запись, редактирование файлов и bash.
Откуда берётся разница в расходах? Авторы разобрали затраты по завершённым попыткам, числу ходов и стартовому контексту:
- у Fable 5 на SWE-bench Lite Pi и Claude Code делают почти одинаковое число ходов в среднем — 15,4 против 15,3, — но Claude Code обходится примерно вдвое дороже при выигрыше в успехе всего 1,1%;
- стартовый контекст первого вызова модели у Claude Code в среднем более чем в 10 раз больше, чем у Pi: длиннее инструкции и крупнее схемы инструментов. Дополнительный «налог» начинается уже с первого запроса.
Вывод авторов: богатые функции харнесса могут быть полезны для других моделей и нагрузок, но сложность харнесса следует рассматривать как эмпирический компромисс, а не как безусловное благо. И это открывает простор для опенсорсных исследований: работать с передовыми харнессами можно и без доступа к проприетарным системам и совместного обучения с моделью.
Находка 3: модель может работать лучше вне «родного» харнесса
Вендоры оптимизируют модели под собственные окружения — OpenAI, например, описывает GPT-5-Codex как модель, оптимизированную для агентной разработки именно в Codex. Но данные говорят, что «родная» пара не гарантирует лучшего результата.
Из 12 сравнений (шесть моделей Anthropic и OpenAI на двух бенчмарках) в девяти наибольшую долю успеха показал альтернативный, не «родной» харнесс. Конкретные примеры:
- Sonnet 4.6 на SWE-bench Lite решает 68,9% попыток в Codex против 66,7% в Claude Code при сопоставимой стоимости;
- GPT-5.6 Sol на Terminal-Bench 2.0 достигает 83,3% успеха в Pi против 78,9% в Codex — примерно вдвое дешевле ($0,42 против $0,76).
Это означает, что способности моделей обобщаются и переносятся на другие харнесса. Практический вопрос не в том, чей харнесс «родной», а в том, какой харнесс даёт лучший баланс стоимости и успеха для конкретной модели и конкретной нагрузки.
Что с этим делать
Сама по себе стоимость — не единственный критерий, и авторы честно оговаривают ограничения: результаты получены на двух опенсорсных бенчмарках, которые модели могли встречать при обучении, а на других нагрузках картина может отличаться. Кими K3, кстати, тоже оказался рядом с фронтом Парето — опенсорсные модели в этой гонке не на последних ролях.
Более широкая мысль исследования: для повседневных задач кодинг-агент — это, по сути, интерфейс к интеллекту модели, который управляет контекстом, даёт доступ к инструментам и выполняет задачи. По мере роста способностей моделей такой агент нуждается во всё меньшем количестве обвязки, поэтому универсальные агенты должны делать упор на стоимость и надёжность. Структурная поддержка харнесса остаётся ценной для задач на границе возможностей модели — но выбирать конфигурацию вручную пользователю не следует: следующим шагом авторы видят автоматизацию выбора харнесса в реальных процессах разработки.
Пока автоматизации нет, простой чек-лист из исследования: не берите харнесс по умолчанию, сравните стоимость одной и той же модели в двух-трёх харнессах на своих задачах — возможно, вы платите «налог на харнесс», даже не подозревая об этом.
Источник: https://harnesstax.github.io/