llmfit — подбор LLM-моделей под ваше железо

· 1 мин чтения
llm local-llm hardware cli model-selection
📂 Исходный код на GitHub

Терминальный инструмент, который подбирает локальные LLM-модели под вашу систему: определяет RAM, CPU, GPU и ранжирует модели по четырём осям — качество, скорость, fit по памяти и контекст. TUI + CLI, поддержка Ollama, llama.cpp, MLX, Docker и MoE-архитектур.

llmfit — подбор LLM-моделей под ваше железо

llmfit — терминальный инструмент, который отвечает на вопрос «какая LLM-модель реально будет работать на моей машине?». Утилита определяет характеристики вашей системы (RAM, CPU, GPU и бэкенд), затем оценивает каждую модель из своего каталога по четырём измерениям — качество, скорость, влезание в память и контекст — и говорит, какие модели будут работать хорошо именно у вас. Одна команда, сотни моделей и провайдеров.

Инструмент написан на Rust и распространяется под лицензией MIT. Поставляется с интерактивным TUI (режим по умолчанию) и классическим CLI-режимом. Поддерживает multi-GPU, MoE-архитектуры, динамический выбор квантизации, оценку скорости и локальные runtime-провайдеры: Ollama, llama.cpp, MLX, Docker Model Runner и LM Studio.

Как это работает

llmfit определяет ваше железо (RAM, CPU, GPU/VRAM, бэкенд) и оценивает каждую модель из каталога по четырём осям:

  • Memory fit — влезает ли модель в вашу память
  • Estimated speed — ожидаемая скорость генерации
  • Quality — качество модели
  • Context — длина контекста

Оценки скорости строятся на модели пропускной способности памяти, подкреплённой реальными замерами и сообществом. Каждая оценка поставляется вместе со своими исходными данными: команда llmfit info показывает, какие допущения стоят за числом и как проверить их на своей машине.

Установка

Доступно сразу несколько способов установки:

Homebrew (рекомендуется, готовый бинарник):

brew install AlexsJones/llmfit/llmfit

uv / pip:

uv tool install -U llmfit

Быстрая установка:

curl -fsSL https://llmfit.axjns.dev/install.sh | sh

Без sudo бинарник ставится в ~/.local/bin:

curl -fsSL https://llmfit.axjns.dev/install.sh | sh -s -- --local

Другие варианты: Scoop на Windows (scoop install llmfit), MacPorts (port install llmfit), Docker/Podman, а также сборка из исходников через cargo build --release.

Использование

llmfit          # интерактивный TUI: ваше железо, все модели, ранжированные по fit

TUI показывает ваши характеристики сверху и каждую модель, оценённую по четырём осям. В TUI доступны планирование, симуляция, загрузка моделей, community-лидерборд и бенчмаркинг.

Для скриптов, агентов и классического терминального вывода:

llmfit fit                    # таблица всех моделей, ранжированная по fit
llmfit recommend --json       # топ-выборки в JSON (для агентов и скриптов)
llmfit info "<model>"         # анализ одной модели: оценка fit, допущения, команды проверки
llmfit bench                  # реальные замеры tok/s/TTFT против вашего провайдера
llmfit doctor                 # отчёт по определению железа (для баг-репортов)

Пример с Docker

docker run ghcr.io/alexsjones/llmfit

Эта команда выводит JSON от llmfit recommend. Результат можно дополнительно обработать через jq:

podman run ghcr.io/alexsjones/llmfit recommend --use-case coding | jq '.models[].name'

Для интерактивного TUI в Docker используется флаг --tui:

docker run --rm -it ghcr.io/alexsjones/llmfit --tui

Бенчмаркинг и обмен результатами

Ключевая особенность — измеримый бенчмаркинг. Вы скачиваете модель, запускаете её на своём железе и замеряете реальные tok/s. Результаты сохраняются локально и заменяют оценочные цифры в таблице fit для вашего железа. Свой замер можно отправить в проект как PR прямо из TUI — без CLI gh и без сторонних аккаунтов.

Каждый принятый замер попадает в следующий релиз: любой пользователь с идентичным железом видит измеренные значения ещё до того, как запустит бенчмарк самостоятельно.

Связанные проекты

  • sympozium — управление агентами в Kubernetes
  • llmserve — простой TUI для сервинга локальных LLM: выбираете модель, выбираете бэкенд, сервите
  • llama-panel — нативное macOS-приложение для управления локальными llama-server

Альтернатива

Если нужен другой подход — llm-checker, Node.js CLI с интеграцией Ollama, который не оценивает, а реально запускает и бенчмаркает модели на вашем железе. Подходит, если у вас уже стоит Ollama и нужны реальные замеры. Ограничение: не поддерживает MoE-архитектуры — все модели считаются плотными, поэтому оценки памяти для Mixtral или DeepSeek-V3 отражают общее число параметров, а не меньший активный поднабор.

Резюме

llmfit решает практическую проблему: как не выкачать модель, которая не влезет в память. Детектирует железо, ранжирует сотни моделей по четырём осям, показывает допущения каждой оценки и позволяет измерить реальную скорость на своей машине. Rust-бинарник, MIT-лицензия, готов к использованию в скриптах и агентах через llmfit recommend --json.

Источник: https://github.com/AlexsJones/llmfit