Skill Seekers — превращает документацию и репозитории в AI-скиллы за минуты

· 3 мин чтения
agent-skills mcp cli rag documentation scraping
📂 Исходный код на GitHub

CLI и MCP-сервер для превращения документации, GitHub-репозиториев, PDF и видео в структурированные знания для AI-скиллов и RAG. 18 типов источников, 22 целевых формата, AI-улучшение через 68 воркфлоу-пресетов, MCP-сервер на 40 инструментов. Python 3.10+, MIT, 14.9k звёзд.

Skill Seekers — превращает документацию и репозитории в AI-скиллы за минуты

Skill Seekers — open-source CLI, который превращает любые источники знаний в готовые AI-скиллы. Документация, GitHub-репозитории, PDF, EPUB, Jupyter-ноутбуки, презентации, видео и вики — всего 18 типов источников — собираются в структурированные активы для AI-скиллов (Claude, Gemini, OpenAI), RAG-пайплайнов (LangChain, LlamaIndex, Pinecone) и AI-ассистентов (Cursor, Windsurf, Cline). Подготовил один раз — экспортируй в любой из 22 целевых форматов.

Установка и быстрый старт

pip install skill-seekers

# Создать скилл из любого источника
skill-seekers create https://docs.djangoproject.com/

# Упаковать для конкретной AI-платформы
skill-seekers package output/django --target claude

После второй команды вы получаете output/django-claude.zip, готовый к использованию. Агента для улучшения можно выбрать: --agent kimi или кастомную команду через --agent-cmd.

Что умеет создавать

Три главных сценария:

  1. Скилл из источникаcreate принимает GitHub-репозиторий (skill-seekers create facebook/react), локальную кодовую базу, PDF, DOCX, EPUB, ноутбук, OpenAPI-спецификацию, PPTX, AsciiDoc, HTML, RSS, man-страницу, видео с YouTube/Vimeo, а также Confluence, Notion и экспорт чатов Slack/Discord.

  2. AI-сканирование проекта — команда scan заставляет AI-агента прочитать манифесты, README, Dockerfile/CI и примеры импортов, после чего выдаёт по одному конфигу на обнаруженный фреймворк:

skill-seekers scan ./my-react-app --out ./configs/scanned/
# → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json

skill-seekers create ./configs/scanned/react.json

Если для обнаруженного стека нет готового пресета, AI генерирует свежий конфиг, который можно опубликовать в community registry.

  1. MCP-сервер — для Claude Code, Cursor, Windsurf, VS Code + Cline и IntelliJ IDEA:
python -m skill_seekers.mcp.server_fastmcp                    # stdio
python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765

Всего MCP-сервер предоставляет 40 инструментов в 10 модулях. Достаточно сказать ассистенту: «Package and upload the React skill».

Целевые форматы

LLM-платформы (12): claude · gemini · openai · minimax · opencode · kimi · deepseek · qwen · openrouter · together · fireworks · markdown

RAG и векторные БД (8): langchain · llama-index · haystack · chroma · faiss · weaviate · qdrant · pinecone

Другое (2): atlas (платформа Atlas Cloud) · ibm-bob

Как это работает

graph LR
    A[Documentation Website] --> B[Skill Seekers]
    B --> C[Scraper]
    B --> D[AI Enhancement]
    B --> E[Packager]
    C --> F[Organized References]
    D --> F
    F --> E
    E --> G[AI Skill .zip]
    G --> H[Upload to AI Platform]

Пять шагов: Scrape (извлечение всех страниц, сначала проверяется llms.txt) → Categorize (разбивка на темы: API, гайды, туториалы) → Enhance (AI пишет полный SKILL.md с примерами) → Package (упаковка в артефакт под платформу) → Upload (загрузка в AI-платформу).

Ключевые возможности

Скрапинг документации

Трёхуровневое обнаружение для JavaScript SPA-сайтов: sitemap.xmlllms.txt → рендеринг через headless-браузер. Автоматическое распознавание llms.txt ускоряет работу в 10 раз. Умная категоризация тем и «снисходительный» HTML-парсер, который не падает на битой разметке.

Анализ кодовой базы (C3.x)

Три потока: анализ кода (AST, паттерны проектирования, тесты), документации (README, docs/, wiki) и сообщества (issues, PR, метаданные). Пайплайн C3.x добавляет 10 детекторов GoF-паттернов на 9 языках, извлечение примеров из тестов, AI-написанные how-to гайды и обзоры архитектуры. Три пресета глубины:

skill-seekers create ./my-project --preset quick          # 1–2 мин, поверхностно
skill-seekers create ./my-project --preset standard       # сбалансировано (по умолчанию)
skill-seekers create ./my-project --preset comprehensive  # глубоко, исчерпывающе

AI-улучшение

Каждый AI-вызов проходит через один транспорт в API-режиме (Anthropic, Google Gemini, OpenAI, Moonshot/Kimi, MiniMax) или локальном режиме (Claude Code, Kimi Code, Codex, Copilot, OpenCode, кастомные агенты — без затрат на API). Глубина задаётся через --enhance-level 0-3, всего 68 воркфлоу-пресетов.

Видео

YouTube, Vimeo и локальные файлы. Трёхуровневый фолбэк транскриптов (субтитры → YouTube Transcript API → локальный Whisper) плюс опциональное визуальное извлечение, которое OCR-ит код с кадров. Требует skill-seekers[video] / [video-full].

Мульти-источники

Один конфиг может объединить документацию, GitHub, PDF и видео в единый актив знаний с детекцией конфликтов и попарным синтезом между источниками.

Установка скиллов в агентов

install-agent автоматически ставит скилл в 19 AI-агентов: Claude Code (~/.claude/skills/), Cursor, VS Code/Copilot, Amp, Goose, OpenCode (~/.opencode/skills/), Windsurf, Roo Code, Cline, Aider, Continue, Kimi Code, IBM Bob и другие.

skill-seekers install-agent output/react/ --agent cursor
skill-seekers install-agent output/react/ --agent all      # все обнаруженные агенты
skill-seekers install-agent output/react/ --agent cursor --dry-run

Загрузка в Claude

export ANTHROPIC_API_KEY=sk-ant-...
skill-seekers package output/react/ --upload   # упаковать + загрузить
skill-seekers upload output/react.zip          # загрузить существующий zip

Без API-ключа: упакуйте и загрузите output/react.zip вручную на claude.ai/skills.

Качество, синхронизация и масштаб

  • Quality scoring с гейтомskill-seekers quality output/react/ --threshold 7 блокирует публикацию скиллов ниже порога
  • Детекция изменений — отслеживание изменений в документации с пере-скрапингом по расписанию и уведомлениями
  • Стриминговая загрузка — для очень больших наборов документации (10K–40K+ страниц)
  • Инкрементальные обновления — без повторного полного парсинга

Производительность

Размер документации Время Результат
Малый (< 100 страниц) 5–10 мин ~2 MB
Средний (100–500 страниц) 15–30 мин ~10 MB
Большой (500–2,000 страниц) 30–60 мин ~40 MB
Огромный (10K–40K+ страниц) Используйте stream

По заявлению авторов, это в 99% быстрее ручной подготовки данных: дни превращаются в 15–45 минут, а файлы SKILL.md выходят на 500+ строк с примерами и гайдами.

Архитектура

8 основных модулей + 5 утилит (~200 классов):

Модуль Назначение
CLICore Git-подобный диспетчер команд, автоопределение источников
Scrapers 18 экстракторов типов источников на общем слое сборки
Adaptors 22 формата выходных платформ за одним ABC SkillAdaptor
Analysis C3.x-пайплайн анализа кодовой базы, 10 детекторов GoF-паттернов
Enhancement Улучшение через AI-транспорт AgentClient
Packaging Упаковка, загрузка и установка скиллов
MCP FastMCP-сервер (40 инструментов, 10 модулей)
Sync Детекция изменений и уведомления

Диагностика

skill-seekers doctor          # диагностика установки и окружения
skill-seekers sync-config     # детекция дрейфа конфигов

Экосистема

Skill Seekers — мультирепозиторный проект: ядро Skill_Seekers, веб-сайт и документация skillseekersweb, реестр конфигов skill-seekers-configs, GitHub Action skill-seekers-action, плагин для Claude Code skill-seekers-plugin и Homebrew-тап homebrew-skill-seekers.

Лицензия — MIT. 14.9k звёзд на GitHub.

Источник: https://github.com/yusufkaraaslan/Skill_Seekers