Перейти к содержимому

Мониторинг сбора данных

  • Логи пода metrics-collector: должны содержать строки pods sent, workloads sent, workers sent с ненулевым числом каждые 30 секунд.
  • Pod в состоянии Running. CrashLoopBackOff — признак проблемы.
  • Исходящий доступ из кластера до https://api.opsman.ai — агент работает на push, входящие соединения ему не нужны.

Косвенный индикатор здоровья — объём новых метрик. В консоли на Dashboard должны появляться свежие данные. Если за последние 15 минут нет обновлений от кластера — сигнал.

Для облачных источников состояние синхронизации видно в Cluster list — индикатор показывает здоровье ingest за последние 7 дней.

Агент пишет JSON-логи в stdout — они собираются штатным стеком вашего кластера (Loki / ELK / Datadog).

В логах ищите:

  • error / fatal — ошибки.
  • ingest — события отправки данных.
  1. Проверьте под metrics-collector в своём кластере: kubectl -n opsman logs deploy/metrics-collector --tail=100.
  2. Нет логов «pods sent» — значит агент не отправляет. Причины: Prometheus недоступен, нет egress до API, неверный токен.
  3. Проверьте доступность API из кластера: curl -sf https://api.opsman.ai/healthz.
  1. Откройте Cluster list и посмотрите индикатор синхронизации источника.
  2. Типовые причины: у сервисного аккаунта отозвали роли, истёк или удалён ключ доступа, изменился биллинг-аккаунт.
  3. Перепроверьте credentials в Settings → Integrations.
  1. Settings → Notifications → Test для каждого бота.
  2. Для Telegram — проверьте, что бот не выкинут из чата.
  3. Для email — проверьте адрес в профиле и spam-папку.

Если агент отправляет данные, а в консоли их нет — напишите в [email protected], приложив имя компании, идентификатор кластера и выдержку из логов агента. Подробнее — Troubleshooting.