llmfit — подбор LLM-моделей под ваше железо
📂 Исходный код на GitHubТерминальный инструмент, который подбирает локальные LLM-модели под вашу систему: определяет RAM, CPU, GPU и ранжирует модели по четырём осям — качество, скорость, fit по памяти и контекст. TUI + CLI, поддержка Ollama, llama.cpp, MLX, Docker и MoE-архитектур.
llmfit — терминальный инструмент, который отвечает на вопрос «какая LLM-модель реально будет работать на моей машине?». Утилита определяет характеристики вашей системы (RAM, CPU, GPU и бэкенд), затем оценивает каждую модель из своего каталога по четырём измерениям — качество, скорость, влезание в память и контекст — и говорит, какие модели будут работать хорошо именно у вас. Одна команда, сотни моделей и провайдеров.
Инструмент написан на Rust и распространяется под лицензией MIT. Поставляется с интерактивным TUI (режим по умолчанию) и классическим CLI-режимом. Поддерживает multi-GPU, MoE-архитектуры, динамический выбор квантизации, оценку скорости и локальные runtime-провайдеры: Ollama, llama.cpp, MLX, Docker Model Runner и LM Studio.
Как это работает
llmfit определяет ваше железо (RAM, CPU, GPU/VRAM, бэкенд) и оценивает каждую модель из каталога по четырём осям:
- Memory fit — влезает ли модель в вашу память
- Estimated speed — ожидаемая скорость генерации
- Quality — качество модели
- Context — длина контекста
Оценки скорости строятся на модели пропускной способности памяти, подкреплённой реальными замерами и сообществом. Каждая оценка поставляется вместе со своими исходными данными: команда llmfit info показывает, какие допущения стоят за числом и как проверить их на своей машине.
Установка
Доступно сразу несколько способов установки:
Homebrew (рекомендуется, готовый бинарник):
brew install AlexsJones/llmfit/llmfit
uv / pip:
uv tool install -U llmfit
Быстрая установка:
curl -fsSL https://llmfit.axjns.dev/install.sh | sh
Без sudo бинарник ставится в ~/.local/bin:
curl -fsSL https://llmfit.axjns.dev/install.sh | sh -s -- --local
Другие варианты: Scoop на Windows (scoop install llmfit), MacPorts (port install llmfit), Docker/Podman, а также сборка из исходников через cargo build --release.
Использование
llmfit # интерактивный TUI: ваше железо, все модели, ранжированные по fit
TUI показывает ваши характеристики сверху и каждую модель, оценённую по четырём осям. В TUI доступны планирование, симуляция, загрузка моделей, community-лидерборд и бенчмаркинг.
Для скриптов, агентов и классического терминального вывода:
llmfit fit # таблица всех моделей, ранжированная по fit
llmfit recommend --json # топ-выборки в JSON (для агентов и скриптов)
llmfit info "<model>" # анализ одной модели: оценка fit, допущения, команды проверки
llmfit bench # реальные замеры tok/s/TTFT против вашего провайдера
llmfit doctor # отчёт по определению железа (для баг-репортов)
Пример с Docker
docker run ghcr.io/alexsjones/llmfit
Эта команда выводит JSON от llmfit recommend. Результат можно дополнительно обработать через jq:
podman run ghcr.io/alexsjones/llmfit recommend --use-case coding | jq '.models[].name'
Для интерактивного TUI в Docker используется флаг --tui:
docker run --rm -it ghcr.io/alexsjones/llmfit --tui
Бенчмаркинг и обмен результатами
Ключевая особенность — измеримый бенчмаркинг. Вы скачиваете модель, запускаете её на своём железе и замеряете реальные tok/s. Результаты сохраняются локально и заменяют оценочные цифры в таблице fit для вашего железа. Свой замер можно отправить в проект как PR прямо из TUI — без CLI gh и без сторонних аккаунтов.
Каждый принятый замер попадает в следующий релиз: любой пользователь с идентичным железом видит измеренные ✓ значения ещё до того, как запустит бенчмарк самостоятельно.
Связанные проекты
- sympozium — управление агентами в Kubernetes
- llmserve — простой TUI для сервинга локальных LLM: выбираете модель, выбираете бэкенд, сервите
- llama-panel — нативное macOS-приложение для управления локальными llama-server
Альтернатива
Если нужен другой подход — llm-checker, Node.js CLI с интеграцией Ollama, который не оценивает, а реально запускает и бенчмаркает модели на вашем железе. Подходит, если у вас уже стоит Ollama и нужны реальные замеры. Ограничение: не поддерживает MoE-архитектуры — все модели считаются плотными, поэтому оценки памяти для Mixtral или DeepSeek-V3 отражают общее число параметров, а не меньший активный поднабор.
Резюме
llmfit решает практическую проблему: как не выкачать модель, которая не влезет в память. Детектирует железо, ранжирует сотни моделей по четырём осям, показывает допущения каждой оценки и позволяет измерить реальную скорость на своей машине. Rust-бинарник, MIT-лицензия, готов к использованию в скриптах и агентах через llmfit recommend --json.
Источник: https://github.com/AlexsJones/llmfit