SigNoz — open-source платформа наблюдаемости с поддержкой ИИ-агентов
📂 Исходный код на GitHubОткрытая платформа наблюдаемости на OpenTelemetry: APM, логи, метрики, трейсы, мониторинг Kubernetes. Включает LLM-observability, MCP-сервер и agent skills для кодинг-агентов.
SigNoz — это open-source платформа наблюдаемости (observability). Она собирает логи, метрики, трейсы, алерты и дашборды в одном инструменте. Платформа построена на стандарте OpenTelemetry и позиционируется как открытая альтернатива Datadog и New Relic. Проект активный: больше 32 тысяч звёзд на GitHub, основной язык — TypeScript, лицензия — MIT. Исключение — каталог ee с корпоративными функциями, у него своя лицензия.
Ключевая идея SigNoz в том, что все сигналы о приложении живут в одном месте и связаны между собой. Из графика задержек можно перейти к трейсам, из трейса — к логам и ошибкам. Вместо связки из пяти отдельных систем получается один инструмент с общей базой данных.
Что умеет SigNoz
- APM — задержки, частота ошибок, пропускная способность, Apdex, ключевые эндпоинты, вызовы баз данных и внешних сервисов (документация).
- Логи — приём, поиск и агрегация через визуальный конструктор запросов. Логи связаны с трейсами и метриками (документация).
- Метрики и дашборды — сборка дашбордов через Query Builder, PromQL или ClickHouse SQL (документация).
- Инфраструктура — кластеры Kubernetes, поды, ноды, CPU, память, диск и сеть на уровне хоста (документация).
- Распределённая трассировка — flamegraphs, водопады спанов, span events, фильтры и аналитика трейсов (документация).
- Trace Funnels — воронки по трейсам. Показывают, на каком шаге запросы отваливаются или переходят в ошибки (документация).
- Исключения и алерты — сбор ошибок (exceptions) и алерты.
- Интеграции — поддержка OpenTelemetry, Prometheus, Kubernetes, облачных провайдеров, SDK для языков, фреймворков, баз данных и LLM-инструментов.
APM и трассировка на практике
Классический сценарий: пользователь жалуется, что страница грузится медленно. В SigNoz вы открываете APM-дашборд сервиса и видите, выросла ли задержка, на каких эндпоинтах и в каких версиях. Дальше переходите к трейсу конкретного запроса: водопад спанов показывает, где запрос стоял дольше всего — в очереди, в базе данных или во внешнем вызове. От спана можно перейти к логам за тот же отрезок времени и увидеть точную ошибку.
Если проблема не в одном запросе, а в сценарии, помогают trace funnels. Вы строите воронку из шагов и видите, где именно пользователи отваливаются: на оплате, на отправке формы или на первом запросе.
Привязки к SigNoz нет. Приложение размечается через OpenTelemetry SDK, а телеметрия уходит в любой совместимый бэкенд. Если завтра вы решите сменить платформу, код менять не придётся.
LLM-observability
Отдельное направление — наблюдаемость за ИИ-приложениями. SigNoz трассирует LLM-приложения и RAG-пайплайны: промпты, ответы, вызовы инструментов, расход токенов, задержки и стоимость. Всё это живёт рядом с обычной телеметрией приложения и инфраструктуры.
Это закрывает типичную боль команд, которые строят продукт на LLM. Модель ломается по разным причинам: из-за ошибки в коде, из-за неудачного промпта, из-за лимитов у провайдера. Искать все три в одной системе удобнее, чем прыгать между логами приложения и счётчиком токенов у API-провайдера. Подробнее — в документации по LLM-observability.
Наблюдаемость для ИИ-агентов
Самое интересное для тех, кто разрабатывает с агентами: SigNoz описывает себя как платформа «для команды и их ИИ-агентов». В ней есть три механизма для этого.
- MCP-сервер. SigNoz предоставляет MCP-сервер, который подключает телеметрию к кодинг-агентам. Агент в Claude Code или Cursor может сам посмотреть трейсы и логи продакшена, найти ошибку и предложить исправление — не выходя из редактора.
- Agent skills. У SigNoz есть готовые скиллы для кодинг-агентов. Они учат агента правильно ставить вопросы к телеметрии и разбирать инциденты.
- Noz. Встроенный ИИ-помощник внутри SigNoz. Он разбирает инциденты, настраивает алерты и собирает дашборды с учётом продакшен-контекста. Доступен только в облачной версии (документация).
Смысл простой: чем больше кода пишут агенты, тем важнее, чтобы они видели последствия своих правок. Продакшен-телеметрия — честный источник обратной связи, и MCP-сервер делает его доступным агенту.
Одна база данных вместо стека
SigNoz хранит логи, метрики и трейсы в одной колоночной СУБД ClickHouse. Она рассчитана на high-cardinality и high-volume нагрузки — именно те, что характерны для телеметрии: миллионы уникальных комбинаций меток и большой поток событий.
Для запросов это даёт три способа работы с данными: визуальный конструктор, PromQL для привычных метрик и обычный SQL по ClickHouse. Когда готовых дашбордов не хватает, можно написать запрос на SQL и собрать из него свой виджет.
Как развернуть
Вариантов три.
- SigNoz Cloud — управляемый сервис. 30 дней бесплатно, дальше тариф от $49 по использованию. Без привязки цены к числу хостов и пользователей.
- Enterprise — облако, BYOC или self-hosted с комплаенсом (SOC 2 Type II, HIPAA), RBAC, управлением приёмом данных и выбором региона.
- Community — бесплатная версия для своей инфраструктуры: Docker, Kubernetes, Linux или Foundry.
Данные при развёртывании у себя остаются у вас. Это важно для команд, которым нельзя отправлять телеметрию во внешний сервис.
Сравнение со знакомыми инструментами
Команда SigNoz честно описывает, откуда обычно приходят пользователи:
- Prometheus — если нужны только метрики, его хватает. SigNoz добавляет логи, трейсы, дашборды и алерты с общим контекстом.
- Jaeger — умеет только распределённую трассировку. SigNoz добавляет метрики, логи, аналитику трейсов и переходы от трейса к логам.
- Elastic — по бенчмарку команды, при приёме логов SigNoz требует на 50% меньше ресурсов.
- Loki — в том же бенчмарке Loki упирался в лимит стримов при росте числа меток, а SigNoz проиндексировал все ключи тестового набора.
Итог
SigNoz — зрелая открытая платформа наблюдаемости с активным сообществом. Она подходит в двух сценариях. Первый — уйти от дорогих закрытых систем с непредсказуемыми тарифами и держать телеметрию у себя. Второй — вы строите ИИ-приложения и агентов, которым нужен доступ к продакшену. Во втором случае особенно интересны LLM-observability, MCP-сервер и agent skills: агент получает контекст реального продакшена и чинит баги быстрее.
Источник: https://github.com/SigNoz/signoz