Code with Claude Workshops — учебные материалы Anthropic по сборке агентов

· 1 мин чтения
claude agents skills mcp evaluation
📂 Исходный код на GitHub

Материалы воркшопов Anthropic Code with Claude: девять практических занятий по Claude Managed Agents, Skills, MCP, eval-циклам и мультиагентной композиции. Репозиторий не поддерживается и не принимает контрибуции. Apache-2.0.

Code with Claude Workshops — учебные материалы Anthropic по сборке агентов

Anthropic опубликовала репозиторий Code with Claude Workshops — сборник материалов воркшопов, которые компания проводила под брендом Code with Claude. Это не готовые инструменты, а практические учебные занятия: каждое — законченный сценарий, по которому можно вживую собрать агента, прокачать его и проверить результат. Репозиторий помечен как не поддерживаемый и не принимает контрибуции, но материалы остаются отличной отправной точкой для знакомства с Claude Managed Agents, Skills и MCP.

Все воркшопы крутятся вокруг одной платформы — Claude Managed Agents (управляемые агенты Anthropic), поверх которой добавляются Skills, MCP-серверы и eval-циклы. Ниже — девять занятий, каждое со своей темой.

Пять минут на главное: карта воркшопов

Воркшоп Чему учит Ключевая идея
rightmodel Выбор модели SKILL для аудита eval-набора и подбора модели под quality-per-dollar
agent-decomposition Декомпозиция Разбить 400-строчный промпт на skills + код + callable_agents с эвалами
how-we-claude-code Продуктовый воркфлоу Интервью → спецификация → дизайн → React-приложение с DOM-контрактом
ship-your-first-managed-agent Первый агент Оживить Streamlit-дашборд через 7 функций Claude Managed Agents API
agent-battle Соревнование 45-минутный конкурс конфигурации агента, который ведёт игрового бота
agents-that-remember Память От «золотой рыбки» к «коллеге»: memory store + Dreaming Service
eval-driven-agent-development Эвалы Шесть вариантов агента против 10-задачного набора с двухслойным грейдером
production-ready-agent Продакшен Координатор + 4 параллельных research-агента на M&A-кейсе
research-desk Исследовательский отдел SEC-агент с субагентами, кастомным тулом, Skills и памятью

rightmodel — выбор модели

Воркшоп Picking the Right Model учит выбирать модель по данным, а не по ощущениям. Через SKILL для Claude Code вы аудируете существующий LLM eval-набор и прогоняете его по разным моделям и параметрам инференса — extended thinking и effort. Цель — найти конфигурацию с лучшим соотношением quality-per-dollar и quality-per-second: то есть не просто самую точную модель, а наиболее выгодную по цене и по скорости в вашем конкретном сценарии.

agent-decomposition — композиция мультиагентных систем

Compose Multi-Agent Systems with Skills and MCP — занятие по декомпозиции. Берётся агент инвентаризации на 400-строчном промпте, и его логика разносится по трём слоям: skills, исполнение кода и callable_agents на платформе Claude Managed Agents. Ключевой момент — каждый шаг декомпозиции проверяется эвалами, так что рефакторинг не ухудшает качество.

how-we-claude-code — продуктовый воркфлоу

Это трёхфазный разбор того, как Anthropic сама ведёт разработку с ИИ:

  1. Интервью → спецификация — перевод интервью со стейкхолдером в техническое ТЗ.
  2. Четыре расходящихся дизайна — несколько разных направлений дизайна, собранных как статические HTML.
  3. Vite + React приложение — компоненты которого эмитят машинно-читаемый DOM-контракт, чтобы агент или CI могли верифицировать их в рантайме.

Особенно интересен третий пункт: контракт DOM позволяет агенту (или CI) автоматически проверять, что интерфейс собран правильно.

ship-your-first-managed-agent — первый агент

Занятие для первого знакомства. Даётся Streamlit-дашборд инцидентов с панелью SRE-агента (офлайн). Вы оживляете его, реализуя семь небольших функций в agent.py — каждая это один вызов Claude Managed Agents API. После этого агент может грепать 70-тысячестрочный лог в своей песочнице, вызывать локальные инструменты и называть «плохой» коммит, из-за которого всё упало.

agent-battle — соревнование

Agent Battle — это 45-минутный конкурс. Нужно настроить Claude Managed Agent — системный промпт, skills, MCP-серверы, модель — так, чтобы он через MCP управлял локальным игровым ботом. Побеждает тот, у кого больше алмазов; при равенстве — кто потратил меньше токенов. Быстрый цикл --eval позволяет тестировать изменения конфигурации примерно за 30 секунд, не дожидаясь 5-минутного полного прогона.

agents-that-remember — память

Воркшоп про память агента. Вы стартуете с Managed Agent'ом, который заметно «забывчив» между сессиями, и наслаиваете примитивы памяти один за другим: сначала memory store для персистентности между сессиями, затем Dreaming Service для консолидации прошлых транскриптов. За 45 минут агент проходит путь «от золотой рыбки до коллеги».

eval-driven-agent-development — разработка через эвалы

Занятие про то, чтобы каждое изменение промпта было измерено, а не «на глаз». Итерируется агент, который генерирует PPTX-презентации, через шесть вариантов: naive → visual → typography → palette → density → QA-loop. Каждый вариант оценивается против набора из 10 задач двухслойным грейдером: программные метрики .pptx XML + LLM-как-судья по отрендеренным слайдам.

production-ready-agent — Deal Desk

Deal Desk — это чат-интерфейс поверх мультиагентной исследовательской команды для M&A. Координатор делегирует задачи четырём параллельным research-субагентам, читает уроки прошлых сделок из memory store, выходит в Linear через MCP и выдаёт оценённую инвестиционную тезу. Пока всё это происходит, интерфейс стримит каждое событие и каждый разрешённый вызов инструмента — наглядная демонстрация прозрачности агентной работы.

research-desk — исследовательский отдел

Финальный, самый насыщенный воркшоп. Собирается исследовательский отдел по SEC-филингам на Claude Managed Agents за self-hosted Next.js-консолью. Сначала вы сами подключаете «голого» агента, затем продвигаете его (версионное обновление) до руководителя исследований, который раздаёт аналитикам сессии по тикерам через кастомный тул, который ваш сервер выполняет. В комплекте — субагенты-специалисты, Skill edgartools, оценка результатов, общий memory store и еженедельный меморандум.

С чего начать

Логичный путь — начать с ship-your-first-managed-agent для базовых вызовов API, затем пройти agent-decomposition (структура) и eval-driven-agent-development (как измерять качество). После этого production-ready-agent и research-desk дадут полную картину мультиагентной композиции. Если же ваша задача — выбор модели, начните с rightmodel.

Репозиторий распространяется под лицензией Apache 2.0.

Источник: https://github.com/anthropics/cwc-workshops