FreeLLMAPI — 7,4 млрд бесплатных токенов в месяц за одним OpenAI-совместимым API

· 2 мин чтения
free-tier model-routing openai-compatible api-gateway llm
📂 Исходный код на GitHub

Самостоятельно размещаемый маршрутизатор, объединяющий бесплатные тарифы 34 LLM-провайдеров в один OpenAI-совместимый эндпоинт с шифрованием ключей, фейловером и самообновляемым каталогом моделей.

FreeLLMAPI — 7,4 млрд бесплатных токенов в месяц за одним OpenAI-совместимым API

FreeLLMAPI — 7,4 млрд бесплатных токенов в месяц за одним OpenAI-совместимым API

Практически каждая серьёзная AI-лаборатория сегодня даёт бесплатный тариф: несколько миллионов токенов в месяц, несколько тысяч запросов в день. По отдельности каждый такой тариф — игрушка. Но если сложить их вместе, получается около 7,4 млрд токенов в месяц рабочего инференса через 635 бесплатных эндпоинтов от 34 провайдеров. FreeLLMAPI — открытый (лицензия MIT) маршрутизатор, который превращает эту кучу разрозненных бесплатных тарифов в один локальный OpenAI-совместимый API: настраиваете ключи — и любой OpenAI-клиент работает со всем пулом сразу.

Зачем это нужно

Проблема ручной сборки бесплатных тарифов очевидна: 34 разных SDK, 34 разных лимита, 34 места, где запрос может упасть. FreeLLMAPI схлопывает всё это в один эндпоинт /v1. Указываете любую OpenAI-совместимую библиотеке на свой локальный сервер — и запросы прозрачно маршрутизируются между провайдерами, чьи ключи вы добавили.

Ландшафт бесплатных тарифов меняется каждую неделю: провайдеры запускают модели, снимают их с поддержки и меняют квоты без предупреждения. FreeLLMAPI отслеживает всё это самостоятельно — маршрутизатор дважды в день подтягивает подписанный каталог моделей с freellmapi.co, так что ваша установка обновляется без git pull.

Поддерживаемые провайдеры

Среди 34 провайдеров — Google, Groq, Cerebras, OpenCode Zen, Mistral, OpenRouter, Cloudflare, Cohere, Z.ai (Zhipu), NVIDIA, HuggingFace, ModelScope (Qwen3, DeepSeek V4, GLM-5) и ещё 22 бесплатных провайдера.

Кроме того, есть провайдер типа custom: на странице Keys можно указать chat-, embedding-, image- или audio-модели на любом OpenAI-совместимом эндпоинте — llama.cpp, LM Studio, vLLM, локальный Ollama или удалённый шлюз.

Полный актуальный каталог с лимитами по каждой модели, размерами контекста и месячными бюджетами бесплатных токенов живёт на freellmapi.co/models.

Совместимость с CLI-агентами

FreeLLMAPI работает практически со всеми инструментами для AI-кодинга: Claude Code, Codex CLI, Gemini CLI, Aider, Cline, Roo Code, Continue, OpenCode, Goose, Qwen Code, Kilo Code, Crush, Cursor, Zed, JetBrains AI, DeepSeek Harness, AtomCode — плюс любые OpenAI-совместимые клиенты, Anthropic SDK, Gemini SDK и Ollama-приложения.

Большинство настраиваются одной командой — есть 15 генераторов конфигов (setup-claude, setup-codex, setup-aider и другие), которые подтягивают живой каталог моделей, делают резервную копию существующего конфига и ничего не перезаписывают:

npx freellmapi setup-claude --url http://localhost:3001 --api-key <unified-key>
Агент Настройка Base URL
Claude Code setup-claude root
Codex CLI setup-codex /v1
Cline setup-cline /v1
Continue setup-continue /v1
Aider setup-aider /v1
OpenCode setup-opencode /v1
Goose setup-goose /v1
Qwen Code setup-qwen /v1 или нативный /v1beta
Cursor гайд setup-cursor публичный URL /v1

Для Claude Code и Codex есть ещё и лаунчеры с нулевой персистентностью (freellmapi launch, freellmapi launch-codex) — креды внедряются только в дочерний процесс и не попадают в конфиги. Zed и JetBrains AI подключаются через опциональную эмуляцию Ollama, а Gemini CLI говорит на своём нативном протоколе через /v1beta.

Ключевые возможности

  • Все OpenAI-поверхности: /v1/chat/completions, /v1/responses (нужно Codex CLI), /v1/completions (автодополнение в редакторах), генерация изображений, видео и речи, транскрипция, /v1/embeddings и /v1/models — со стримингом и без.
  • Anthropic Messages API: эндпоинт /v1/messages говорит на проводном формате Anthropic, так что Claude Code и официальные Anthropic SDK работают с бесплатным пулом напрямую.
  • Нативные Gemini и Ollama: Gemini CLI использует /v1beta (generateContent, стриминг, подсчёт токенов), опциональная эмуляция Ollama обслуживает Zed, JetBrains и другие клиенты локальных моделей.
  • Fusion (мультимодельный синтез): виртуальная модель fusion рассылает промпт параллельно панели разнообразных бесплатных моделей, а judge-модель синтезирует из черновиков один ответ.
  • Tool calling и структурированные выводы: OpenAI-совместимые tools проходят через провайдеры туда-обратно (текстовые вызовы инструментов «спасаются» в настоящие tool_calls), поддерживаются response_format, seed, logprobs, штрафы и остальные параметры сэмплирования.
  • Умная маршрутизация, шесть стратегий: живые скоры скорости/способностей/надёжности ранжируют вашу цепочку; при 429/5xx автоматический фейловер переключается на следующую модель с кулдаунами и ротацией ключей.
  • Единые модели и профили: одна и та же модель у нескольких провайдеров схлопывается в одну запись со строгим фейловером внутри группы; именованные профили fallback-цепочек (coding chain, vision chain) переключаются из дашборда или прямо в запросе через auto:<profile>.
  • Учёт лимитов по ключам: счётчики RPM/RPD/TPM/TPD для каждой пары (платформа, модель, ключ) обучаются заявленным потолкам провайдеров, чтобы маршрутизация всегда оставалась под всеми капами.
  • Sticky-сессии: разговор держится на одной модели 30 минут; опциональная компактная «заметка о передаче контекста» сохраняет связность нити при переключении посреди чата.
  • Сжатие промптов (опционально): конвейер может дедуплицировать промпты, фильтровать вывод инструментов, схлопывать повторяющийся JSON и подрезать устаревший контекст.
  • Шифрование ключей: ключи провайдеров шифруются AES-256-GCM в SQLite и расшифровываются в памяти на каждый запрос; приложения видят только единый bearer-токен freellmapi-….
  • Админ-дашборд: React UI для управления ключами, перестроения цепочки, playground'а и аналитики p50/p95/TTFT за окна от 24 часов до 90 дней; тёмная/светлая темы и 60 языков интерфейса (включая русский).
  • MCP-сервер: агенты могут через /mcp узнавать доступные модели, здоровье провайдеров и текущую стратегию маршрутизации; бескопизводный OpenAPI-вьюер живёт на /v1/docs.
  • Работает где угодно на Node 20+: Windows, macOS, Linux-серверы и даже одноплатники на ARM вроде Raspberry Pi — около 40 МБ RSS в простое.

Установка

Самый быстрый путь — one-liner (нужен Docker; скрипт создаёт ~/freellmapi, генерирует ключ шифрования, тянет образ и запускает контейнер):

curl -fsSL https://freellmapi.co/install.sh | bash

Дальше открываете http://localhost:3001, добавляете ключи провайдеров на странице Keys, настраиваете порядок Fallback Chain и забираете единый API-ключ — его вы и указываете в своих OpenAI SDK.

Есть и нативное десктоп-приложение (macOS .dmg и Windows .exe в релизах): весь маршрутизатор с дашбордом живёт в трее, а стеклянный поповер показывает живую статистику запросов. Для Android есть экспериментальный гайд по Termux.

Использование API

from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:3001/v1",
    api_key="freellmapi-your-unified-key",
)

resp = client.chat.completions.create(
    model="auto",  # let the router pick; or S3, S4, a profile, or a model id
    messages=[{"role": "user", "content": "Summarise the fall of Rome in one sentence."}],
)
print(resp.choices[0].message.content)
print("Routed via:", resp.headers.get("x-routed-via"))

Каждый ответ несёт заголовок X-Routed-Via: <platform>/<model>, чтобы видеть, какой провайдер реально обслужил запрос.

Каталог моделей и Premium

Каталог сейчас отслеживает 34 провайдера, 474 семейства моделей и 635 бесплатных эндпоинтов (584 chat, 41 embeddings, 7 transcription, 3 video) — суммарно ~7,4 млрд токенов бесплатного тарифа в месяц. Каждое скачивание каталога проверяется по закреплённому Ed25519-ключу, а ваши собственные настройки (включение/отключение моделей, кастомные провайдеры) никогда не перезаписываются.

Бесплатные установки получают тот же подписанный каталог, но из месячного снапшота: новая модель добирается до них через 30 дней после появления в живой ленте. Premium за $19/год (или $49 разово) включает живую ленту — обновления квот и фиксы приходят в тот же день. Сам маршрутизатор остаётся полностью бесплатным и MIT-лицензированным; каталог-сервер не видит ни промптов, ни ответов, ни ключей провайдеров.

Ограничения

Честные trade-offs стекинга бесплатных тарифов: никаких frontier-моделей, переменная латентность, отсутствие SLA. А ещё эффективный «интеллект» эндпоинта проседает к вечеру, когда топовые модели вычерпывают дневные квоты, — и сбрасывается в полночь UTC. Прежде чем строить на этом что-то серьёзное, авторы рекомендуют прочитать полный список ограничений в документации по архитектуре.

Источник: https://github.com/tashfeenahmed/freellmapi