Skill Seekers — превращает документацию и репозитории в AI-скиллы за минуты
📂 Исходный код на GitHubCLI и MCP-сервер для превращения документации, GitHub-репозиториев, PDF и видео в структурированные знания для AI-скиллов и RAG. 18 типов источников, 22 целевых формата, AI-улучшение через 68 воркфлоу-пресетов, MCP-сервер на 40 инструментов. Python 3.10+, MIT, 14.9k звёзд.
Skill Seekers — open-source CLI, который превращает любые источники знаний в готовые AI-скиллы. Документация, GitHub-репозитории, PDF, EPUB, Jupyter-ноутбуки, презентации, видео и вики — всего 18 типов источников — собираются в структурированные активы для AI-скиллов (Claude, Gemini, OpenAI), RAG-пайплайнов (LangChain, LlamaIndex, Pinecone) и AI-ассистентов (Cursor, Windsurf, Cline). Подготовил один раз — экспортируй в любой из 22 целевых форматов.
Установка и быстрый старт
pip install skill-seekers
# Создать скилл из любого источника
skill-seekers create https://docs.djangoproject.com/
# Упаковать для конкретной AI-платформы
skill-seekers package output/django --target claude
После второй команды вы получаете output/django-claude.zip, готовый к использованию. Агента для улучшения можно выбрать: --agent kimi или кастомную команду через --agent-cmd.
Что умеет создавать
Три главных сценария:
-
Скилл из источника —
createпринимает GitHub-репозиторий (skill-seekers create facebook/react), локальную кодовую базу, PDF, DOCX, EPUB, ноутбук, OpenAPI-спецификацию, PPTX, AsciiDoc, HTML, RSS, man-страницу, видео с YouTube/Vimeo, а также Confluence, Notion и экспорт чатов Slack/Discord. -
AI-сканирование проекта — команда
scanзаставляет AI-агента прочитать манифесты, README, Dockerfile/CI и примеры импортов, после чего выдаёт по одному конфигу на обнаруженный фреймворк:
skill-seekers scan ./my-react-app --out ./configs/scanned/
# → react.json, vite.json, tailwind.json, jest.json, my-react-app-codebase.json
skill-seekers create ./configs/scanned/react.json
Если для обнаруженного стека нет готового пресета, AI генерирует свежий конфиг, который можно опубликовать в community registry.
- MCP-сервер — для Claude Code, Cursor, Windsurf, VS Code + Cline и IntelliJ IDEA:
python -m skill_seekers.mcp.server_fastmcp # stdio
python -m skill_seekers.mcp.server_fastmcp --transport http --port 8765
Всего MCP-сервер предоставляет 40 инструментов в 10 модулях. Достаточно сказать ассистенту: «Package and upload the React skill».
Целевые форматы
LLM-платформы (12): claude · gemini · openai · minimax · opencode · kimi · deepseek · qwen · openrouter · together · fireworks · markdown
RAG и векторные БД (8): langchain · llama-index · haystack · chroma · faiss · weaviate · qdrant · pinecone
Другое (2): atlas (платформа Atlas Cloud) · ibm-bob
Как это работает
graph LR
A[Documentation Website] --> B[Skill Seekers]
B --> C[Scraper]
B --> D[AI Enhancement]
B --> E[Packager]
C --> F[Organized References]
D --> F
F --> E
E --> G[AI Skill .zip]
G --> H[Upload to AI Platform]
Пять шагов: Scrape (извлечение всех страниц, сначала проверяется llms.txt) → Categorize (разбивка на темы: API, гайды, туториалы) → Enhance (AI пишет полный SKILL.md с примерами) → Package (упаковка в артефакт под платформу) → Upload (загрузка в AI-платформу).
Ключевые возможности
Скрапинг документации
Трёхуровневое обнаружение для JavaScript SPA-сайтов: sitemap.xml → llms.txt → рендеринг через headless-браузер. Автоматическое распознавание llms.txt ускоряет работу в 10 раз. Умная категоризация тем и «снисходительный» HTML-парсер, который не падает на битой разметке.
Анализ кодовой базы (C3.x)
Три потока: анализ кода (AST, паттерны проектирования, тесты), документации (README, docs/, wiki) и сообщества (issues, PR, метаданные). Пайплайн C3.x добавляет 10 детекторов GoF-паттернов на 9 языках, извлечение примеров из тестов, AI-написанные how-to гайды и обзоры архитектуры. Три пресета глубины:
skill-seekers create ./my-project --preset quick # 1–2 мин, поверхностно
skill-seekers create ./my-project --preset standard # сбалансировано (по умолчанию)
skill-seekers create ./my-project --preset comprehensive # глубоко, исчерпывающе
AI-улучшение
Каждый AI-вызов проходит через один транспорт в API-режиме (Anthropic, Google Gemini, OpenAI, Moonshot/Kimi, MiniMax) или локальном режиме (Claude Code, Kimi Code, Codex, Copilot, OpenCode, кастомные агенты — без затрат на API). Глубина задаётся через --enhance-level 0-3, всего 68 воркфлоу-пресетов.
Видео
YouTube, Vimeo и локальные файлы. Трёхуровневый фолбэк транскриптов (субтитры → YouTube Transcript API → локальный Whisper) плюс опциональное визуальное извлечение, которое OCR-ит код с кадров. Требует skill-seekers[video] / [video-full].
Мульти-источники
Один конфиг может объединить документацию, GitHub, PDF и видео в единый актив знаний с детекцией конфликтов и попарным синтезом между источниками.
Установка скиллов в агентов
install-agent автоматически ставит скилл в 19 AI-агентов: Claude Code (~/.claude/skills/), Cursor, VS Code/Copilot, Amp, Goose, OpenCode (~/.opencode/skills/), Windsurf, Roo Code, Cline, Aider, Continue, Kimi Code, IBM Bob и другие.
skill-seekers install-agent output/react/ --agent cursor
skill-seekers install-agent output/react/ --agent all # все обнаруженные агенты
skill-seekers install-agent output/react/ --agent cursor --dry-run
Загрузка в Claude
export ANTHROPIC_API_KEY=sk-ant-...
skill-seekers package output/react/ --upload # упаковать + загрузить
skill-seekers upload output/react.zip # загрузить существующий zip
Без API-ключа: упакуйте и загрузите output/react.zip вручную на claude.ai/skills.
Качество, синхронизация и масштаб
- Quality scoring с гейтом —
skill-seekers quality output/react/ --threshold 7блокирует публикацию скиллов ниже порога - Детекция изменений — отслеживание изменений в документации с пере-скрапингом по расписанию и уведомлениями
- Стриминговая загрузка — для очень больших наборов документации (10K–40K+ страниц)
- Инкрементальные обновления — без повторного полного парсинга
Производительность
| Размер документации | Время | Результат |
|---|---|---|
| Малый (< 100 страниц) | 5–10 мин | ~2 MB |
| Средний (100–500 страниц) | 15–30 мин | ~10 MB |
| Большой (500–2,000 страниц) | 30–60 мин | ~40 MB |
| Огромный (10K–40K+ страниц) | Используйте stream |
— |
По заявлению авторов, это в 99% быстрее ручной подготовки данных: дни превращаются в 15–45 минут, а файлы SKILL.md выходят на 500+ строк с примерами и гайдами.
Архитектура
8 основных модулей + 5 утилит (~200 классов):
| Модуль | Назначение |
|---|---|
| CLICore | Git-подобный диспетчер команд, автоопределение источников |
| Scrapers | 18 экстракторов типов источников на общем слое сборки |
| Adaptors | 22 формата выходных платформ за одним ABC SkillAdaptor |
| Analysis | C3.x-пайплайн анализа кодовой базы, 10 детекторов GoF-паттернов |
| Enhancement | Улучшение через AI-транспорт AgentClient |
| Packaging | Упаковка, загрузка и установка скиллов |
| MCP | FastMCP-сервер (40 инструментов, 10 модулей) |
| Sync | Детекция изменений и уведомления |
Диагностика
skill-seekers doctor # диагностика установки и окружения
skill-seekers sync-config # детекция дрейфа конфигов
Экосистема
Skill Seekers — мультирепозиторный проект: ядро Skill_Seekers, веб-сайт и документация skillseekersweb, реестр конфигов skill-seekers-configs, GitHub Action skill-seekers-action, плагин для Claude Code skill-seekers-plugin и Homebrew-тап homebrew-skill-seekers.
Лицензия — MIT. 14.9k звёзд на GitHub.