Skip to content

监控与告警 ​

起监控栈 ​

bash
docker compose -f docker/docker-compose.yml --profile monitoring up -d
# Grafana: http://localhost:3001(密码 GRAFANA_PASSWORD,默认 admin)

Prometheus 抓取 api 与 tracker 指标;Grafana 预置 FluxTorrent 看板(docker/grafana-flux-dashboard.json)。

指标端点 ​

端点门禁
api /metricsANN_METRICS_TOKEN(未配置返回 404,防匿名抓取)
tracker /metrics同上

预置告警(docker/monitoring/alerts.yml) ​

告警含义第一反应
DLQ 积压announce 消费死信堆积看 worker 日志与「运行日志」页死信原因
5xx 比率api 错误率docker logs flux-api 最近错误栈
tracker Redis 降级tracker 连不上 Redis检查 redis 容器/密码
Stream 积压announce 流消费滞后worker 是否存活;游标卡住看 flux:announce:cursor
连接池耗尽PG 连接不够查慢查询(dbstats);必要时调池大小

日常巡检 ​

  • curl localhost:8080/api/v1/health(建议 uptime 监控每分钟打点);
  • 后台「运行日志」页(runtime_logs 落库,自动清理)看 job 失败;
  • 慢查询:compose 已开 pg_stat_statements + log_min_duration_statement=300ms,后台 ?tool=dbstats 直接看热点。