AA-AgentPerf-Local: как скорость локального ИИ-агента зависит от железа

· 1 мин чтения
benchmarks inference local-llm ai-agents gpu
AA-AgentPerf-Local: как скорость локального ИИ-агента зависит от железа

Artificial Analysis открыла инструмент AA-AgentPerf-Local. Он измеряет, с какой скоростью локальный ИИ-агент работает на конкретном железе — на ноутбуке или на рабочей станции. Вместе с инструментом команда опубликовала первые результаты для четырёх систем: NVIDIA DGX Spark, AMD Ryzen AI Halo, MacBook Pro M5 Pro и GeForce RTX 5090. Код и данные лежат на GitHub, поэтому любой может повторить тест у себя.

Обычный тест скорости инференса отвечает на один вопрос: сколько токенов в секунду выдаёт модель. Но агент работает иначе. За одну сессию он десятки раз отправляет серверу растущий кусок диалога, ждёт ответ, вызывает инструмент и снова отправляет диалог. Скорость здесь зависит не только от самого декодирования, но и от того, как быстро система проглатывает входящий контекст. AA-AgentPerf-Local воспроизводит именно этот сценарий на настоящих записанных сессиях агента.

Как устроен тест

В стандартном наборе 8 записанных агентных задач и 168 ходов модели. Правила простые:

  • каждый запрос несёт в себе весь диалог с начала сессии, как это делает настоящий агент. Поэтому контекст дорастает примерно до 56 тысяч токенов;
  • каждый ход генерирует ровно столько токенов, сколько было записано. Значит, все системы делают одинаковую работу, и их можно честно сравнивать;
  • вызов инструментов по умолчанию пропускается — так тест измеряет чистую скорость инференса. При желании можно вернуть записанные задержки инструментов или выполнять их живьём на CPU.

На старте команда измеряет один агент, которому доступна вся система. Позже обещают добавить мультиагентные сценарии и случаи, когда агент работает вместе с другими процессами.

Железо и модели

Первые четыре системы подобраны так, чтобы закрыть разные платформы, объёмы памяти и пропускные способности.

Система Память Платформа
NVIDIA DGX Spark 128 ГБ CUDA
AMD Ryzen AI Halo 128 ГБ ROCm
MacBook Pro M5 Pro 64 ГБ Metal
NVIDIA GeForce RTX 5090 32 ГБ CUDA

В планах — другие ноутбуки на x86 и профессиональные карты вроде RTX PRO 6000 Blackwell.

Модели на старте: Qwen3.5-9B, Qwen3.8-27B, Qwen3.6-35B-A3B и Ling 3.0 Flash (124B всего, 5B активных). Все четыре прогоняются в 4-битной квантизации — так ближе к реальным условиям локального запуска. Набор моделей будет меняться по мере выхода новых моделей с открытыми весами. Кроме них, инструмент умеет тестировать любой OpenAI-совместимый сервер инференса: можно проверить свою модель и свою конфигурацию.

Конфигурации запуска

Выбор конфигурации меняет результат сильнее, чем можно ожидать. Среда выполнения, квантизация и спекулятивное декодирование сильно влияют на скорость. Там, где для пары «система и модель» уже была опубликована готовая конфигурация, её использовали. Остальные собрали сами. Во всех 14 конфигурациях включено спекулятивное декодирование — MTP, DFlash или DSpark. Все 14 выложены в репозитории и на отдельной странице конфигураций.

Что показали первые результаты

Наблюдение Что именно измерено
Скорость сильно зависит от числа активных параметров Qwen3.6-35B-A3B (3B активных) была самой быстрой на каждой системе — в 2,5–3,3 раза быстрее плотной Qwen3.8-27B
Но одних активных параметров мало Ling 3.0 Flash (124B всего, 5B активных) отставала от Qwen3.5-9B на всём железе, которое её тянет, хотя активных параметров у неё почти вдвое больше
GeForce RTX 5090 — самая быстрая система Для каждой модели, что в неё влезает, время выполнения больше чем в 3,5 раза короче, чем у остальных
Разгадка — пропускная способность памяти 1792 ГБ/с у RTX 5090 против 256–307 ГБ/с у систем с единой памятью
DGX Spark против Ryzen AI Halo Стартовая цена у обоих — $4000, объём памяти одинаковый, пропускная способность близкая. Spark быстрее в 1,4–1,7 раза на трёх моделях из четырёх, на Qwen3.5-9B — ничья. Разрыв в 7% по пропускной способности этого не объясняет: у Spark больше вычислений в низкой точности, а CUDA зрелее
MacBook Pro M5 Pro Единственный ноутбук в тесте. На Qwen3.6-35B-A3B и Qwen3.8-27B отстаёт от Ryzen AI Halo всего на 2–9%, на Qwen3.5-9B — на 21%. У него самая большая пропускная способность из трёх систем с единой памятью — 307 ГБ/с

Когда запрос идёт от одного человека, скорость декодирования упирается в пропускную способность памяти — модель постоянно читает веса. Поэтому RTX 5090 с 1792 ГБ/с так далеко впереди. По Qwen3.8-27B картина та же: скорость декодирования на трёх системах с единой памятью примерно одинаковая, а у RTX 5090 — больше чем в 5 раз выше.

Подробные цифры по каждому прогону лежат в интерактивных таблицах и графиках на странице результатов. В тексте статьи приведены только те числа, что перечислены выше.

Чтение входящего контекста всё ещё съедает время

Агентные траектории отдают из кэша KV от 73% до 93% токенов запроса. Казалось бы, чтение входящих данных должно быть почти бесплатным. Но нет: один только префилл — чтение новой части запроса на каждом ходе — занимал ощутимую долю общего времени. Для Qwen3.8-27B это 22–41%.

Это видно и на уровне одной сессии: даже при 93% попаданий в кэш на llama.cpp на сессию приходится около 196 тысяч новых входных токенов против 31 тысячи выходных.

Разница между системами здесь отчётливо видна. Когда инструмент возвращает большой файл, агент может молчать перед ответом до 24 секунд на Ryzen AI Halo и до 39 секунд на MacBook Pro. На GeForce RTX 5090 это около двух секунд. Сильнее всего от префилла страдают системы с малыми вычислениями на единицу пропускной способности — Ryzen AI Halo и, возможно, MacBook Pro (её показатели FLOP/s не опубликованы).

Спекулятивное декодирование даёт основной прирост

Спекулятивное декодирование стоит во всех самых удачных конфигурациях на сегодня. Для Qwen3.8-27B оно поднимает скорость декодирования примерно на 30–120% выше потолка, который задаёт одна только пропускная способность памяти.

Цена вопроса

Большинство систем сейчас стоят заметно дороже стартовой цены. По текущим рыночным ценам все четыре типа железа тем дороже, чем быстрее заканчивают работу. MacBook Pro M5 Pro с 64 ГБ — самый доступный, а система на GeForce RTX 5090 — намного самая дорогая. Страница результатов по умолчанию показывает стартовые цены, но цену можно ввести вручную.

Что дальше

Команда обещает регулярно обновлять инструмент и страницу результатов. В планах:

  • больше популярного железа и моделей;
  • более полный набор конфигураций для локального запуска;
  • сторонние движки инференса, например Inco Splash, который сейчас тестируется;
  • таблицы результатов, отправленные пользователями;
  • таблицы с живым вызовом инструментов на CPU;
  • мультиагентные сценарии.

Как попробовать

Источник: https://artificialanalysis.ai/articles/aa-agentperf-local