Hands-On AI Engineering — практика AI-проектов
📂 Исходный код на GitHubКоллекция практических AI-проектов: OCR, RAG, агенты и другие AI-применения
Hands-On AI Engineering — практика AI-проектов
Коллекция из 60+ готовых AI-проектов от сообщества AI Engineering. Каждый проект — это полный рабочий код с инструкциями по запуску: от мультиагентных исследовательских систем до OCR-распознавания рецептов и RAG-пайплайнов с графовым поиском. Все проекты адаптированы для реальных задач и используют OpenAI, Anthropic, Google, Mistral, а также open-source модели через Ollama.
Сборник ориентирован на практиков: каждый проект можно запустить, поэкспериментировать и адаптировать под собственные задачи. Никаких теоретических описаний — только рабочий код с зависимостями и документацией.
Категории проектов
AI Agents
Более 35 агентов для автоматизации задач: финансовый анализ, исследование документов, планирование путешествий, брендинг, код-ревью, поддержка клиентов, новостные дайджесты, кадровый анализ, маршрутизация запросов.
Выделим наиболее интересные:
- Multi-Agent Research Assistant with Memory — четверо агентов (Planner, Research, Writer, Critic) работают с общей памятью на базе Actian VectorAI DB. Ищет ответы в PDF, научных статьях, руководствах и транскриптах, самооценка через Criticfeedback loop, работает полностью локально на Ollama с BGE-эмбеддингами. Результаты сохраняются между сессиями.
- Agentic RAG — система на LangGraph, которая проверяет релевантность контекста перед генерацией ответа. Если контекст недостаточен — автоматически перезапрашивает запрос и повторяет поиск, пока не получит проходящую валидацию выборку.
- Self-Evolving Code Review Agent — ревьюер кода, который учится на обратной связи инженеров без переобучения модели. Использует LangGraph для оркестрации и Actian VectorAI DB для хранения накопленных знаний о командных конвенциях.
- Deep Research Assistant — исследовательский агент на LangChain Deep Agents с веб-поиском Liner. Ответы приходят полностью цитированными с указанием источников.
- Eagle Eye — агент для ревью GitHub PR через MCP-сервер GitHub и Telegram. Получает diff, выполняет структурированный анализ с оценкой серьёзности, публикует отзыв после подтверждения пользователем.
- Multi-Agent Financial Analyst — команда специализированных агентов для комплексного финансового анализа: сбор данных, фундаментальный анализ, технические индикаторы, итоговый отчёт.
- Daily AI News Digest — автоматический ежедневный дайджест из 92 технических блогов, курируемых Карпати. MiniMax M2.7 оценивает статьи за последние 24 часа и выдаёт 3 самых значимых в Telegram.
- Browser Automation Agent — принимает инструкции на естественном языке и автономно управляет браузером через browser-use.
- CartMate — AI Customer Support Agent — агент поддержки интернет-магазина с памятью на базе Mem0 и Mistral Small 4. Запоминает клиентов и продолжает диалог с того места, где закончил.
OCR
Четыре проекта для извлечения данных из документов и изображений:
- AI Receipt and Expense Tracker — распознаёт чеки и ведёт расходы в SQLite. Gemma 4 E2B vision через llama-cpp-python, полностью офлайн после первого запуска.
- Image-to-Structured-Data Extractor — конвертирует изображения в валидированный JSON с Mistral Large 3 и библиотекой Instructor.
- LaTeX Formula OCR — извлекает формулы из изображений и PDF в LaTeX с локальной vision-моделью.
- Medical Prescription Digitizer — оцифровывает рукописные или напечатанные рецепты в структурированный вывод с реальной валидацией названий лекарств через RxNorm.
Audio
Три проекта для работы со звуком:
- Music Explorer — чат с любым аудиофайлом или YouTube-видео через Gemini 3 Flash: транскрибация, анализ эмоций, идентификация инструментов, временные метки.
- Multilingual Audio Translator — загрузите или запишите аудио на любом языке, получите транскрибацию через faster-whisper, перевод через Gemini и озвучку обратно через Kokoro TTS.
- Customer Support Voice Agent — голосовой агент для приёма звонков, построенный на Telnyx AI Assistant Builder и FastAPI с инъекцией контекста в каждый вызов.
Multimodal
Шесть проектов, совмещающих зрение, видео и язык:
- Multimodal RAG — индексирует текст, URL, PDF, изображения, аудио и видео в общий ChromaDB. Ретривал через Gemini Embedding 2, генерация ответов через Gemini 3 Flash с передачей реальных URI файлов как источников.
- Video Understanding Agent — суммаризирует YouTube-видео в главы, ключевые выводы и список действий через Gemini Flash.
- GLM-OCR Pro — структурированное извлечение документов с GLM-OCR через Ollama, превращает изображения и PDF в форматированный Markdown локально.
- Medical Document Parser — извлекает структурированный клинический профиль из медицинских PDF и изображений с Gemma 4 vision.
RAG Applications
Одиннадцать систем Retrieval-Augmented Generation для AI-приложений:
- Vision RAG — мультимодальный RAG для обработки и запроса визуального контента.
- GraphRAG Knowledge System — строит локальный граф знаний из загруженных документов с Mistral Small 4 и NetworkX. Поддерживает запросы на уровне сущностей и тематические запросы.
- Hybrid RAG System — параллельно индексирует документы в граф знаний и векторное хранилище. Mistral Small 4 отвечает с контекстом из обоих каналов ретривала.
- HyDE RAG — пайплайн с Hypothetical Document Embeddings: Gemini 3 Flash генерирует гипотетические ответы, Gemini Embedding 2 усредняет эмбеддинги для более точного поиска в ChromaDB.
- RAG Agent with Database Routing — маршрутизует запросы к трём специализированным базам Qdrant (продукты, поддержка, финансы) через агента Agno. При отсутствии релевантных документов переключается на веб-поиск через LangGraph ReAct.
- Rock Music RAG — кастомная база рок-музыки из Wikipedia. Добавляйте любые группы, задавайте вопросы по всем и получайте ответы с источниками на базе BM25-поиска и Gemma 4.
- YouTube Transcript RAG — чат с любым YouTube-видео: Whisper транскрибирует, ChromaDB индексирует, Mistral Small 4 отвечает с привязкой к временным меткам.
- Reasoning RAG — задавайте вопросы по любому веб-источнику и получайте цитированные ответы с пошаговым трассированием рассуждений через Gradio.
- Clinical RAG with ADE — высокоточный клинический RAG с LandingAI ADE для визуального парсинга документов и Mistral Large для обоснованного рассуждения.
Fine-Tuning
- Text-to-SQL Inventory Specialist — дообученная Qwen3.5-2B для Natural Language → SQL запросов к розничным базам данных. Задавайте вопросы на английском и получайте ответы, подкреплённые SQL через Gradio.
Технологии
Проекты используют широкий стек: LangChain, LangGraph, CrewAI, smolagents, AG2, ChromaDB, Qdrant, NetworkX, Firecrawl, Ollama, DuckDuckGo, и множество моделей — Mistral Small/Large, Gemma 4, Gemini 3 Flash, DeepSeek V4, Qwen3.6, MiniMax M2.5/M2.7, GLM-5.1, O3-Mini.
Быстрый старт
Клонируйте репозиторий:
git clone https://github.com/Sumanth077/Hands-On-AI-Engineering.git
cd Hands-On-AI-Engineering
Каждый проект — отдельная папка внутри категории. Перейдите в нужную и следуйте инструкциям в README:
cd ai_agents/research_assistant_with_memory
pip install -r requirements.txt
cp .env.example .env # добавьте ключи API
python main.py
Требования: Python 3.10+, ключи API (OpenAI, Anthropic, Mistral — в зависимости от проекта), или Ollama для полностью локальных запусков.
Структура репозитория
Hands-On-AI-Engineering/
├── ai_agents/ # 35+ агентов
├── OCR/ # распознавание документов
├── audio/ # обработка звука
├── multimodal/ # мультимодальные проекты
├── rag_apps/ # RAG-системы
├── fine_tuning/ # дообучение моделей
└── CONTRIBUTING.md # руководство по контрибуции
Лицензия
MIT — свободное использование и модификация. Проект активно поддерживается сообществом AI Engineering, приветствуются контрибуции.