Strata — большая языковая модель на домашнем компьютере

· 2 мин чтения
local-llm llm inference quantization hardware
📂 Исходный код на GitHub

Движок локального запуска Qwen3.8-Flash-Next на любом бытовом железе: установка в один клик для Windows и Linux, распределение работы между GPU, CPU, RAM и SSD, API, совместимый с OpenAI и Anthropic, опциональный разбор картинок. Лицензия MIT.

Strata — большая языковая модель на домашнем компьютере

Strata — это локальный движок для запуска больших языковых моделей на обычном игровом компьютере. Он берёт модель Qwen3.8-Flash-Next на 125 миллиардов параметров и размещает её в памяти, которой обычно хватает только серверу. Никакой отправки данных наружу: всё считается на вашей машине.

Проект выпущен под лицензией MIT. Установка занимает один скрипт. Дальше модель отвечает через локальный HTTP-сервис, к которому подключаются ваши приложения и агенты для написания кода.

Что внутри

Обычно модель такого размера требует сервера с сотнями гигабайт видеопамяти. Strata решает эту задачу иначе: он раздаёт работу на всю машину сразу.

Авторы объясняют это через кухню. То, чем пользуешься постоянно, лежит на столе. Остальное ждёт в кладовке.

В основе модели лежит команда из 24 576 маленьких специалистов, которых авторы называют экспертами. На каждое слово нужны только десять из них. Дальше начинается разделение:

  • Видеокарта хранит несколько тысяч самых востребованных экспертов.
  • Оперативная память хранит их все.
  • Процессор параллельно работает с остальными.
  • SSD хранит большую таблицу соответствий.

Поверх этого есть ещё приём «угадал и проверил». Маленький помощник предполагает следующие несколько слов, а большая модель проверяет все варианты разом и оставляет правильные. Ответ получается тот же, но на 1,6–1,8 раза быстрее. Длинные тексты читаются крупными кусками, до 8 192 токенов за раз, со скоростью больше 1 000 токенов в секунду.

Подробное описание есть в документации по принципу работы, а все числа с расчётами — в разделе подробностей. Есть и научная работа.

Требования к железу

Что нужно Требования
Видеокарта NVIDIA GeForce RTX 20, 30, 40 или 50 серии, либо AMD Radeon RX 7900 XT/XTX, RX 7800 XT/7700 XT, RX 9060 XT, RX 9070/9070 XT, Radeon AI PRO R9700 или серии RX 6800/6900. Нужно от 12 ГБ видеопамяти
Оперативная память От 32 ГБ. 64 ГБ позволяют запустить любой размер модели
Место на диске Около 80 ГБ свободного места. Лучше SSD — первый запуск будет заметно быстрее
Система Windows 10/11 или Linux и свежий драйвер от NVIDIA или AMD

Остальное делает установщик. Две или три видеокарты умеют работать вместе, это описано в разделе про несколько GPU.

Слабые карты тоже пробовали — сообщество собрало рабочие варианты для старых видеокарт и для Intel Arc на Linux с сборкой из исходников. Процессоры без AVX2 работают, но медленно. Полный список требований — в инструкции по установке.

Установка

Можно поручить всё AI-ассистенту. Отправьте Claude Code, Cursor, Codex или GitHub Copilot такой запрос:

Set up Strata on this PC for me: https://github.com/Niko1221/Strata - follow docs/AI_SETUP.md in that repository.

Подробности этого сценария — в инструкции для ИИ. Через MCP-сервер Strata можно ставить, запускать и останавливать прямо из агента.

Ручной путь простой. Скачайте архив репозитория и распакуйте, либо склонируйте репозиторий. Дальше:

  • Windows: двойной клик по START-HERE.bat.
  • Linux: запуск ./setup.sh в папке Strata.

Шаги одинаковые для NVIDIA и AMD. Установщик сам находит карту и ставит подходящий движок. Затем он задаёт три вопроса: какую модель и какого размера взять, сколько контекста нужно (это сколько текста модель держит в голове) и читать ли картинки. На каждый вопрос можно просто нажать Enter и получить рекомендованный ответ. После этого скачивается модель, около 70 ГБ, и запускается. Если загрузка оборвалась, запустите скрипт ещё раз — продолжение с места остановки.

Браузер откроет приложение по адресу http://127.0.0.1:8080.

Важный момент: пока модель стартует, компьютер может зависнуть на 1–3 минуты, в первый раз дольше. Strata загружает в оперативную память 35–55 ГБ и часть её блокирует под видеокарту. Это нормально. Не закрывайте окно, в нём видно, что происходит.

В следующий раз снова запустите START-HERE.bat или ./setup.sh. Модель поднимется сразу, ничего не скачивая дважды. Закрытие окна останавливает её. Обновление без запуска — UPDATE.bat на Windows и ./update.sh на Linux.

Какую модель выбрать

Установщик рекомендует вариант по вашей оперативной памяти. Одна и та же модель выходит в нескольких размерах: чем сильнее сжатие, тем быстрее работа и тем слабее модель.

Оперативная память Рекомендация Почему
32 ГБ Coder влезает в 32 ГБ, версия заточена под код. На карте с 24 ГБ заработают также Q2_0 и IQ2_XS
48 ГБ IQ2_XS или Q2_0 крупные размеры уже не помещаются, Q2_0 самый быстрый
64 ГБ IQ2_XS, либо IQ3_XXS или IQ3_S влезают все размеры; IQ3_S лучший и самый медленный
от 96 ГБ IQ3_S или UD-IQ4_XS от Unsloth место для крупных размеров и всех остальных программ

Отдельно стоит сказать про варианты:

  • Coder — версия для кода, из которой удалили половину экспертов. По замерам авторов она набирает 91% результата полной модели в SWE-bench Verified и помещается в 32 ГБ RAM. Вне кода она слабее, включая китайский и другие языки с иероглифами. Для таких задач берут Q2_0, IQ2_XS или IQ3_S, где сохранены все эксперты.
  • Swift 1.5 — доработанная модель, которая думает заметно меньше времени перед ответом. Ответ приходит раньше при примерно том же качестве.
  • UD-IQ4_XS от Unsloth — версия примерно в 4 бита, по качеству между IQ3_S и UD-Q4_K_XL. Скачивается 94 ГБ. Если оперативной памяти меньше 80 ГБ, часть модели читается с SSD во время ответа, поэтому работа медленнее. Помогает NVMe SSD.
  • UD-Q4_K_XL от Unsloth (экспериментально) — ближе всего к полной модели. Но большую часть приходится читать с SSD, и на ПК с 64 ГБ скорость ответа всего 7–8,5 токена в секунду.

Размеры, объём загрузок и правила выбора описаны в списке моделей.

Использование

В браузере по адресу http://127.0.0.1:8080 есть Chat, живой Monitor с состоянием модели и нагрузкой на GPU, CPU и RAM, а также About с настройками и адресами.

Для приложений и агентов нужно добавить провайдер, совместимый с OpenAI, с базовым адресом http://127.0.0.1:8080/v1. Подойдёт любой ключ и любое имя модели. Для приложений на API Anthropic адрес другой: http://127.0.0.1:8080/v1/messages, а для Claude Code достаточно переменной ANTHROPIC_BASE_URL=http://127.0.0.1:8080. Codex CLI и другие клиенты OpenAI Responses API используют /v1/responses.

Дополнительные настройки:

  • Размышление переключается между off, low, medium и high в меню чата или через параметр reasoning effort в приложении. Off — самый быстрый, high — лучше для сложных задач.
  • Картинки включаются ответом «да» на вопрос «Images?» при установке. Дальше в чате есть кнопка Picture, в приложениях картинки прикладываются как обычно. Карты AMD читают изображения на Linux через процессор, на Windows пока не могут.
  • Доступ с телефона или с другого ПК включается так: START-HERE.bat --setup --host 0.0.0.0 --api-key <секрет>. Ключ обязателен.
  • Параллельные запросы: по умолчанию Strata отвечает на один запрос, остальные ждут. Параметр "parallel": 2 в файле настроек включает несколько одновременных ответов. На карте с 12 ГБ каждый ответ станет медленнее. Подробности — в описании пакетной обработки.
  • Длинные запросы: первое сообщение чата Strata читает полностью, примерно минута на 30 000 токенов. Дальнейшие сообщения начинают обрабатываться за секунды.

Скорость

Замеры сделаны на двух обычных игровых ПК. Токен — примерно три четверти слова.

Размер NVIDIA RTX 5070 (12 ГБ), Ryzen 5 7600, 64 ГБ RAM AMD RX 9070 XT (16 ГБ), Ryzen 9 3900X, 47 ГБ RAM
Q2_0 94 токена/с 60 токенов/с
IQ2_XS 79 токенов/с 52 токена/с
IQ3_XXS 62 токена/с —
IQ3_S 53 токена/с —
Coder 55 токенов/с 44 токена/с

Скорость чтения запроса выше: 2 650 токенов/с на NVIDIA и 1 160 токенов/с на AMD для размера Q2_0. Полные таблицы — в деталях замеров, результаты сообщества — в отдельном файле. Чем больше видеопамять на карте, тем быстрее: на RTX 3090 с 24 ГБ стоит ожидать около 100–140 токенов в секунду.

Если что-то пошло не так

  • Компьютер завис при первом запуске. Это нормально, пока грузится модель. Ждите и не закрывайте окно. Если через десять минут всё ещё тишина, перезагрузите ПК, закройте лишние программы или возьмите размер поменьше.
  • Загрузка остановилась. Запустите START-HERE.bat или ./setup.sh снова, продолжение пойдёт с места остановки.
  • Всё тормозит, мигает индикатор диска или появилось сообщение, что движок неожиданно остановился. Не хватает свободной оперативной памяти. Закройте другие программы, браузеры много едят, или возьмите размер поменьше: Q2_0 или IQ2_XS.
  • Порт 8080 уже занят. Strata уже запущена. Найдите её окно.

Другие проблемы и решения собраны в разборе неполадок. Если не помогло, откройте issue и приложите лог strata-<модель>.log из папки Strata.

Лицензия

Код Strata открыт под лицензией MIT, файл лежит в репозитории. У отдельных частей и у самой модели есть свои лицензии, список — в разделе про лицензии.

Модель Qwen3.8-Flash-Next сделана командой Qwen. Сжали её в GGML-форматы ISTA-DASLab, UkisAI (версия Swift 1.5) и Unsloth. В движке используются части llama.cpp и ggml.

Источник: https://github.com/Niko1221/Strata