SigNoz — open-source платформа наблюдаемости с поддержкой ИИ-агентов

· 1 мин чтения
observability opentelemetry monitoring llm mcp
📂 Исходный код на GitHub

Открытая платформа наблюдаемости на OpenTelemetry: APM, логи, метрики, трейсы, мониторинг Kubernetes. Включает LLM-observability, MCP-сервер и agent skills для кодинг-агентов.

SigNoz — open-source платформа наблюдаемости с поддержкой ИИ-агентов

SigNoz — это open-source платформа наблюдаемости (observability). Она собирает логи, метрики, трейсы, алерты и дашборды в одном инструменте. Платформа построена на стандарте OpenTelemetry и позиционируется как открытая альтернатива Datadog и New Relic. Проект активный: больше 32 тысяч звёзд на GitHub, основной язык — TypeScript, лицензия — MIT. Исключение — каталог ee с корпоративными функциями, у него своя лицензия.

Ключевая идея SigNoz в том, что все сигналы о приложении живут в одном месте и связаны между собой. Из графика задержек можно перейти к трейсам, из трейса — к логам и ошибкам. Вместо связки из пяти отдельных систем получается один инструмент с общей базой данных.

Что умеет SigNoz

  • APM — задержки, частота ошибок, пропускная способность, Apdex, ключевые эндпоинты, вызовы баз данных и внешних сервисов (документация).
  • Логи — приём, поиск и агрегация через визуальный конструктор запросов. Логи связаны с трейсами и метриками (документация).
  • Метрики и дашборды — сборка дашбордов через Query Builder, PromQL или ClickHouse SQL (документация).
  • Инфраструктура — кластеры Kubernetes, поды, ноды, CPU, память, диск и сеть на уровне хоста (документация).
  • Распределённая трассировка — flamegraphs, водопады спанов, span events, фильтры и аналитика трейсов (документация).
  • Trace Funnels — воронки по трейсам. Показывают, на каком шаге запросы отваливаются или переходят в ошибки (документация).
  • Исключения и алерты — сбор ошибок (exceptions) и алерты.
  • Интеграции — поддержка OpenTelemetry, Prometheus, Kubernetes, облачных провайдеров, SDK для языков, фреймворков, баз данных и LLM-инструментов.

APM и трассировка на практике

Классический сценарий: пользователь жалуется, что страница грузится медленно. В SigNoz вы открываете APM-дашборд сервиса и видите, выросла ли задержка, на каких эндпоинтах и в каких версиях. Дальше переходите к трейсу конкретного запроса: водопад спанов показывает, где запрос стоял дольше всего — в очереди, в базе данных или во внешнем вызове. От спана можно перейти к логам за тот же отрезок времени и увидеть точную ошибку.

Если проблема не в одном запросе, а в сценарии, помогают trace funnels. Вы строите воронку из шагов и видите, где именно пользователи отваливаются: на оплате, на отправке формы или на первом запросе.

Привязки к SigNoz нет. Приложение размечается через OpenTelemetry SDK, а телеметрия уходит в любой совместимый бэкенд. Если завтра вы решите сменить платформу, код менять не придётся.

LLM-observability

Отдельное направление — наблюдаемость за ИИ-приложениями. SigNoz трассирует LLM-приложения и RAG-пайплайны: промпты, ответы, вызовы инструментов, расход токенов, задержки и стоимость. Всё это живёт рядом с обычной телеметрией приложения и инфраструктуры.

Это закрывает типичную боль команд, которые строят продукт на LLM. Модель ломается по разным причинам: из-за ошибки в коде, из-за неудачного промпта, из-за лимитов у провайдера. Искать все три в одной системе удобнее, чем прыгать между логами приложения и счётчиком токенов у API-провайдера. Подробнее — в документации по LLM-observability.

Наблюдаемость для ИИ-агентов

Самое интересное для тех, кто разрабатывает с агентами: SigNoz описывает себя как платформа «для команды и их ИИ-агентов». В ней есть три механизма для этого.

  • MCP-сервер. SigNoz предоставляет MCP-сервер, который подключает телеметрию к кодинг-агентам. Агент в Claude Code или Cursor может сам посмотреть трейсы и логи продакшена, найти ошибку и предложить исправление — не выходя из редактора.
  • Agent skills. У SigNoz есть готовые скиллы для кодинг-агентов. Они учат агента правильно ставить вопросы к телеметрии и разбирать инциденты.
  • Noz. Встроенный ИИ-помощник внутри SigNoz. Он разбирает инциденты, настраивает алерты и собирает дашборды с учётом продакшен-контекста. Доступен только в облачной версии (документация).

Смысл простой: чем больше кода пишут агенты, тем важнее, чтобы они видели последствия своих правок. Продакшен-телеметрия — честный источник обратной связи, и MCP-сервер делает его доступным агенту.

Одна база данных вместо стека

SigNoz хранит логи, метрики и трейсы в одной колоночной СУБД ClickHouse. Она рассчитана на high-cardinality и high-volume нагрузки — именно те, что характерны для телеметрии: миллионы уникальных комбинаций меток и большой поток событий.

Для запросов это даёт три способа работы с данными: визуальный конструктор, PromQL для привычных метрик и обычный SQL по ClickHouse. Когда готовых дашбордов не хватает, можно написать запрос на SQL и собрать из него свой виджет.

Как развернуть

Вариантов три.

  1. SigNoz Cloud — управляемый сервис. 30 дней бесплатно, дальше тариф от $49 по использованию. Без привязки цены к числу хостов и пользователей.
  2. Enterprise — облако, BYOC или self-hosted с комплаенсом (SOC 2 Type II, HIPAA), RBAC, управлением приёмом данных и выбором региона.
  3. Community — бесплатная версия для своей инфраструктуры: Docker, Kubernetes, Linux или Foundry.

Данные при развёртывании у себя остаются у вас. Это важно для команд, которым нельзя отправлять телеметрию во внешний сервис.

Сравнение со знакомыми инструментами

Команда SigNoz честно описывает, откуда обычно приходят пользователи:

  • Prometheus — если нужны только метрики, его хватает. SigNoz добавляет логи, трейсы, дашборды и алерты с общим контекстом.
  • Jaeger — умеет только распределённую трассировку. SigNoz добавляет метрики, логи, аналитику трейсов и переходы от трейса к логам.
  • Elastic — по бенчмарку команды, при приёме логов SigNoz требует на 50% меньше ресурсов.
  • Loki — в том же бенчмарке Loki упирался в лимит стримов при росте числа меток, а SigNoz проиндексировал все ключи тестового набора.

Итог

SigNoz — зрелая открытая платформа наблюдаемости с активным сообществом. Она подходит в двух сценариях. Первый — уйти от дорогих закрытых систем с непредсказуемыми тарифами и держать телеметрию у себя. Второй — вы строите ИИ-приложения и агентов, которым нужен доступ к продакшену. Во втором случае особенно интересны LLM-observability, MCP-сервер и agent skills: агент получает контекст реального продакшена и чинит баги быстрее.

Источник: https://github.com/SigNoz/signoz