Книга «AI Agents in Depth»: принципы и инженерная практика AI-агентов
📂 Исходный код на GitHubОткрытая книга «AI Agents in Depth»: 10 глав и 109 экспериментов о принципах и инженерной практике AI-агентов. Переведена на 15 языков, включая русский.
«AI Agents in Depth» — открытая книга о том, как устроены AI-агенты. Её автор — Bojie Li, инженер и исследователь. Книга выросла из китайского оригинала, а теперь переведена сообществом на 15 языков, включая русский. Весь текст, все схемы и все 109 сопутствующих экспериментов лежат в открытом доступе под лицензией Apache 2.0. Проект попадал в GitHub Trending как проект дня.
Главная формула
Книга строится вокруг одной формулы: Агент = LLM + контекст + инструменты.
LLM здесь — «мозг», который умеет рассуждать. Контекст — всё, что модель реально видит при каждом шаге: история диалога, системные инструкции, описания инструментов. Инструменты — «руки и органы чувств», которые связывают языковую модель с внешним миром: поиск, файлы, браузер, API.
Из формулы следует главный тезис книги. Когда базовая модель уже выбрана, самый сильный рычаг повышения качества агента — не смена модели, а системная инженерия вокруг неё. Автор называет это harness-инженерией. Именно harness определяет, что агент видит, что он может сделать и как он проверяет результат.
Десять глав
Каждая глава раскрывает свой элемент формулы и опирается на практические проекты. Русские версии глав лежат прямо в репозитории:
| Глава | Тема | О чём |
|---|---|---|
| 1. Введение в ИИ-агенты | Основы | Формула агента, harness-инженерия, парадигма «модель как агент» |
| 2. Инженерия контекста | Контекст | KV Cache, промпт-инжиниринг, Agent Skills, сжатие контекста |
| 3. Память пользователя и база знаний | Знания | Кросс-сессионная память, RAG, структурированные индексы, графы знаний |
| 4. Инструменты | Действия | Протокол MCP, инструменты восприятия и исполнения, активный поиск инструментов |
| 5. Кодинг-агент и генерация кода | Код | Архитектура продакшн-кодинг-агента; код как «инструмент, создающий новые инструменты» |
| 6. Взаимодействие | Интерфейсы | Асинхронные и событийные системы, голос, Computer Use, робототехника |
| 7. Оценка агентов | Метрики | Среды оценки, метрики, статистическая значимость, выбор решений по данным оценки |
| 8. Постобучение модели | Обучение | Предобучение, SFT и RL; когда выбирать SFT, а когда RL |
| 9. Непрерывная эволюция агентов | Развитие | Обучение на собственных траекториях: обновление знаний, инструкций и параметров |
| 10. Мультиагентное взаимодействие | Команды | Разделение труда, общение и изоляция контекста, эмерджентные «общества агентов» |
Порядок глав неслучаен. Сначала автор собирает одиночного агента: контекст, память, инструменты, код. Потом учит его измерять себя, дообучать модель и расти на своих ошибках. В конце агент перестаёт быть одиночкой и начинает работать в команде себе подобных.
109 практических экспериментов
Книга не читается «вхолостую»: к каждой главе приложены проекты. Их три типа: готовые к запуску, воспроизведение известных работ и дизайн-задания. Всего наберётся 109 экспериментов — от простого цикла агента в первой главе до постобучения моделей в восьмой.
Для запуска нужен Python 3.11–3.13. Зависимости ставятся по главам из корня репозитория. Рекомендуемый способ — пакетный менеджер uv с файлом блокировки:
uv sync --locked --extra ch1
uv run python chapter1/context/main.py
Подходит и обычный pip, но он не использует lock-файл:
python -m pip install -e ".[ch1]"
Для экспериментов, которые обращаются к моделям, понадобится хотя бы один API-ключ. Большинство экспериментов читают ключи из файла .env в корне репозитория. Локальный Ollama подключается только там, где это явно разрешено в README эксперимента.
Как читать книгу
Порог входа ниже, чем кажется. Нужны четыре вещи:
- умение читать и менять Python-код средней сложности;
- опыт с LLM-продуктами вроде ChatGPT или Claude;
- знакомство хотя бы с одним AI-инструментом для программирования: Claude Code, Codex, Cursor;
- базовые инженерные навыки: командная строка, Git, JSON, REST API.
Глубокой математики и машинного обучения почти не требуется. Исключение — глава 8 про постобучение.
Автор советует не ограничиваться чтением. Правильный цикл такой: прочитать принципы из главы, закрыть книгу и реализовать систему с нуля с помощью кодинг-агента, а потом сравнить поведение своей версии с ожиданиями. В конце каждой главы есть вопросы для размышления, к ним подготовлены эталонные ответы.
Показательна и философия проекта: весь сопутствующий код книги сгенерирован кодинг-агентами по тексту книги. Автор честно говорит, что не читает его построчно. Человек отвечает за архитектуру, ключевые компоненты и приёмку. AI пишет код, гоняет тесты и правит баги. Это и есть практика, которую книга пропагандирует.
Итоговый проект
Лучший способ закрепить материал — собрать собственного кодинг-агента уровня Claude Code или Codex. Для рабочего прототипа хватает глав 1–5. Главы 7 и 9 добавят набор задач для оценки и улучшение на неудачных примерах. Глава 8 затронет саму модель. Главы 6 и 10 дополнят агента голосом, управлением компьютером и работой в команде.
Автор рекомендует начать с малого: соберите для своего агента оценочный набор из десятка-полутора задач. Дальше улучшайте систему, разбирая конкретные провалы.
Русский перевод и форматы
Читать можно тремя способами:
- онлайн на сайте книги — с переключением языков, подсветкой и заметками;
- PDF на русском — лучшая вёрстка для офлайна;
- EPUB на русском — для читалок.
Ссылки ведут на свежую сборку ветки main. Русский перевод — вклад сообщества, поэтому он может немного отставать от китайского оригинала. Точка входа для русскоязычного читателя — русская версия README с оглавлением и инструкциями.
У книги есть продолжение: AI Infra Book о том, что находится под агентами — хранение параметров и контекста, исполнение вычислений, работа ускорителей.
Лицензия и вклад
Книга и код распространяются под лицензией Apache 2.0. Проект открыт для вклада: правки текста, улучшения экспериментов, новые иллюстрации и переводы. Китайская версия считается первоисточником; правки вносятся в неё, а переводы синхронизируются после слияния.
Источник: https://github.com/bojieli/ai-agent-book