Что на самом деле происходит при вызове LLM API

· 1 мин чтения
llm api inference latency infrastructure
Что на самом деле происходит при вызове LLM API

Вы нажимаете Enter, и ответ начинает струиться — токен за токеном, меньше чем за секунду. На следующий день та же модель, тот же промпт — и три секунды тишины. Дело не в вашем Wi-Fi.

Физический путь одного API-запроса к LLM — это история, которая начинается в здании, которое вы никогда не посетите, проходит по кабелю на дне океана и заканчивается на GPU, который до вашего запроса обрабатывал чужой.

Путь одного запроса

Ваш промпт покидает устройство, идёт через провайдера, попадает в подводный оптоволоконный кабель, пересекает океан, прибывает в дата-центр, маршрутизируется на нужный сервер, ждёт освобождения GPU, обрабатывается — и ответ возвращается тем же путём.

Каждый из этих шагов стоит времени. И некоторые шаги стоят больше в зависимости от того, где на планете вы находитесь.

Что такое дата-центр

Дата-центр — это здание размером с несколько футбольных полей, заполненное серверами. Серверы — это компьютеры без экранов в металлических стойках. Тысячи таких машин работают 24/7.

Каждый поиск в Google, каждое сообщение в WhatsApp, каждое YouTube-видео касается сервера в таком здании. Дата-центру нужны три вещи: электричество, охлаждение и связь с интернетом через оптоволокно.

Нигерия имеет 17 дата-центров. США — более 5 500. Этот разрыв имеет значение.

Латентность: физика, о которой вас не предупредили

Латентность — это время, за которое данные проходят от точки A до точки B и обратно. Она ограничена физикой: данные движутся по оптоволокну примерно на две трети скорости света. Ускорить нельзя — можно только сократить расстояние.

Лагос — Лондон: примерно 5 000 километров. Минимальное время пинг-понга только из-за расстояния — около 50 миллисекунд. Добавьте маршрутизацию, заторы, обработку — и вы получаете 100–150 мс до того, как запрос достиг сервера. Затем модели нужно «подумать». Затем ответ идёт обратно.

Большинство разработчиков в Нигерии обращаются к LLM-серверам в us-east-1 (Вирджиния) или eu-west (Ирландия, Франкфурт). Каждый запрос несёт 100–200 мс географической задержки до начала инференса.

Инференс: что GPU делает на самом деле

Когда ваш промпт поступает на сервер, он не обрабатывается как поисковый запрос. Модель прогоняет промпт через миллиарды математических операций, слой за слоем, предсказывая наиболее вероятный следующий токен. Затем следующий. Затем следующий. Каждый токен генерируется последовательно.

Токен — это примерно три четверти слова. «Привет» — один токен. «Инфраструктура» — два. Более длинный промпт требует больше вычислительных ресурсов на входе, более длинный ответ — на выходе.

GPU: почему именно это железо

CPU спроектирован для общих задач — быстро делать что-то одно. GPU изначально создавался для видеоигр: тысячи маленьких ядер, способных выполнять множество вычислений одновременно. Эта параллельная архитектура идеально подходит для LLM-инференса — одни и те же математические операции над миллиардами параметров одновременно.

Один high-end GPU для LLM-инференса — Nvidia H100 — стоит около $30 000. Дата-центр, обслуживающий frontier-модели, имеет их тысячами.

Когда вы вызываете LLM API, ваш запрос направляется на один из таких GPU. Если GPU занят другим запросом, ваш ждёт. Это то, что на самом деле enforce'ят рейт-лимиты: физическую ёмкость железа.

Холодный старт: почему первый запрос медленнее

Вы замечали: первый запрос после паузы занимает заметно больше времени. Это холодный старт.

Модели огромны. Frontier-модель может весить сотни гигабайт весов — чисел, кодирующих знания модели. Веса должны быть загружены в память GPU. Если запросов не было какое-то время, система могла частично выгрузить модель.

Первый запрос ждёт загрузки модели обратно. Последующие попадают на уже разогретую модель и ощущаются быстрее. Serverless-развёртывания LLM особенно подвержены этому: платите меньше при низкой нагрузке, но пользователи чувствуют первый запрос после затишья.

Почему это важно для регионов за пределами США и Европы

17 дата-центров Нигерии работают почти полностью на дизельных генераторах. Национальная сеть даёт в среднем четыре часа электричества в сутки. Это дорого — и это причина, по которой локальная облачная инфраструктура не масштабировалась.

Следствие для разработчика: каждый вызов LLM API идёт на сервер не в Нигерии, не в Западной Африке, часто даже не на континенте. Вы платите латентностью за это расстояние на каждом запросе, для каждого пользователя.

Это не проблема софта. Это проблема географии и инфраструктуры.

Что с этим делать

Стримьте ответ. Не ждите полного ответа перед показом. Стриминг токенов по мере поступления делает восприятие более быстрым, даже когда фактическая скорость не меняется.

Кешируйте агрессивно. Если вы вызываете один и тот же промпт многократно, кешируйте ответ. Инференс дорог, латентность дорога — кеш устраняет и то и другое.

Выбирайте правильную модель. 70-миллиардная модель медленнее и дороже 7-миллиардной. Для классификации, экстракции, короткой генерации — меньшей модели достаточно, и она отвечает значительно быстрее.

Картина в целом

Африка обеспечивает менее 1% мировых мощностей дата-центров при 18% населения планеты. Разрыв между цифровым спросом континента и принадлежащей ему инфраструктурой — вот откуда берётся латентность, зависимость и извлечение ценности вовне.

Знание, что это проблема физики, а не кода, меняет то, куда вы смотрите. Скорее всего, дело не в вашем коде — это здание где-то, работающее на дизеле.

Источник: https://dev.to/dannwaneri/what-actually-happens-when-you-call-an-llm-api-28l6