Khoj — персональный AI-мозг с поиском по вашим документам

· 1 мин чтения
rag self-hosted llm ai-agents semantic-search
📂 Исходный код на GitHub

Khoj — персональный AI-ассистент с открытым кодом. Индексирует документы, ищет ответы в интернете, создаёт своих агентов и автоматизации. Работает с локальными и облачными LLM, поддерживает самостоятельное размещение.

Khoj — персональный AI-мозг с поиском по вашим документам

Khoj — это персональный AI-ассистент с открытым кодом. Авторы называют его «вторым мозгом». Идея простая: программа индексирует ваши документы и дополнена поиском по интернету. Когда вы задаёте вопрос, она отвечает с опорой на эти знания. В чате можно использовать любую модель — локальную или облачную: GPT, Claude, Gemini, Llama, Qwen, Mistral, DeepSeek. Khoj масштабируется от приложения на личном компьютере до облачного корпоративного решения.

Зачем нужен второй мозг

Обычный чат-бот знает только то, что было в его обучающих данных. Ваши заметки, отчёты и рабочие документы ему недоступны. Khoj решает эту проблему. Вы загружаете свои файлы в систему, она их индексирует и использует как базу знаний. Дальше вы просто спрашиваете: «Что мы решили по проекту X в марте?» — и получаете ответ со ссылками на ваши документы.

Проект построен на подходе RAG (Retrieval-Augmented Generation). Это значит, что перед генерацией ответа система сначала находит подходящие фрагменты в ваших данных, а потом передаёт их модели как контекст. Такой способ заметно снижает количество выдумок: модель опирается на реальные тексты, а не только на память обучения.

Ключевые возможности

Список функций из README репозитория:

  • Чат с любой LLM. Поддерживаются облачные модели (GPT, Claude, Gemini, DeepSeek) и локальные (Llama 3, Qwen, Gemma, Mistral).
  • Ответы из ваших документов. Читает PDF, Markdown, Word, org-mode, изображения и данные из Notion.
  • Поиск по интернету. Ассистент дополняет ваши файлы свежей информацией из сети.
  • Семантический поиск. Быстрый поиск по базе документов по смыслу, а не по точному совпадению слов.
  • Свои агенты. Можно создать агента с собственной базой знаний, характером, моделью и набором инструментов под конкретную роль.
  • Автоматизации. Повторяющиеся исследования можно поставить на расписание. Результаты приходят письмами или уведомлениями — как персональная рассылка.
  • Генерация изображений и голос. Ассистент умеет рисовать картинки, озвучивать ответы и принимать речь на вход.
  • Открытый код и самостоятельное размещение. Khoj всегда можно развернуть на своём сервере или компьютере.

Полный список возможностей собран в документации.

Доступ с любых устройств

Один и тот же ассистент доступен из разных мест. Это одна из сильных сторон проекта:

  • веб-интерфейс в браузере — app.khoj.dev;
  • плагины для Obsidian и Emacs — заметки можно искать прямо из редактора;
  • настольное приложение и мобильный клиент;
  • WhatsApp — можно писать ассистенту как обычному собеседнику.

Интеграции с Obsidian и Emacs выделяют проект среди похожих: заметки ищутся прямо из редактора, без переключения в отдельное приложение.

Свои агенты и автоматизации

В Khoj можно собирать отдельных агентов. Каждый агент получает:

  • свою базу знаний — набор документов, к которому он привязан;
  • собственный характер (persona) — стиль общения и роль;
  • выбранную модель чата;
  • набор инструментов.

Пример: агент «Аналитик» с доступом к отчётам компании и строгим тоном ответов. Или агент «Исследователь», который по расписанию изучает тему в интернете и присылает сводку на почту. Автоматизации решают типовую задачу: то, что раньше требовало ручного поиска каждый день, теперь происходит само.

Пошаговое руководство по созданию агентов есть в блоге проекта.

Как развернуть у себя

Самостоятельное размещение — базовый сценарий для Khoj. Варианты такие:

  • Docker. Основной способ. Репозиторий содержит docker-compose.yml, запуск сводится к одной команде. Так можно поднять сервис на домашнем сервере или VPS.
  • Полностью локальная работа. С локальной LLM ассистент работает без интернета и не отправляет данные наружу. Это важно для личных заметок и рабочих документов.
  • Облако проекта. Если не хочется ничего настраивать, есть готовый сервис app.khoj.dev. Регистрация бесплатная.

Инструкция по установке — в документации по настройке.

Приватность и локальные модели

Для многих главный вопрос — куда уходят данные. У Khoj здесь продуманная архитектура. Сами документы хранятся на вашей стороне. При работе через облачные модели в API уходит только текст запроса и найденные фрагменты. Если этого мало, подключите локальную LLM. Тогда весь цикл — индексация, поиск, генерация ответа — останется на вашем компьютере. Такой режим подходит для личных дневников, рабочих документов и любых данных, которые нельзя передавать наружу.

Качество поиска и состояние проекта

Команда публикует результаты бенчмарков по поиску и рассуждениям. По их данным, Khoj показывает сильные результаты на современных тестах поиска. Стоит иметь в виду: это оценки самой команды, но методику можно проверить по ссылке.

Несколько фактов о проекте:

  • написан на Python;
  • лицензия — AGPL-3.0, код полностью открыт;
  • около 37 тысяч звёзд на GitHub и активное сообщество;
  • есть платная корпоративная версия — облако, локальный контур или гибрид.

Недавно команда представила Pipali — открытого AI-коллегу, который работает на вашем компьютере. Это отдельный проект от тех же авторов, и он продолжает идею персонального AI.

Кому подойдёт Khoj

Проект полезен в нескольких случаях:

  • у вас накопилась большая база заметок (Obsidian, Emacs, Markdown) и нужен поиск с ответами по смыслу;
  • вы хотите личного ассистента на своей модели и без отправки данных в чужое облако;
  • нужны повторяющиеся исследования по расписанию с доставкой на почту;
  • вы ищете открытую альтернативу закрытым «вторым мозгам», которую можно развернуть самому.

Если задача ближе к разработке, посмотрите раздел решений на сайте — там собраны инструменты именно для работы с кодом.

Источник: https://github.com/khoj-ai/khoj