OBSERVABILIDADE · GRAFANA · PROMETHEUS

NOC Monitoring Lab

Laboratório reproduzível de observabilidade para contexto ISP/NOC, com métricas sintéticas, inventário, checks, alertas e status page em Docker Compose.

01 — CONTEXTO

Problema

Falar de monitoramento, incidentes e observabilidade sem um ambiente reproduzível enfraquece a evidência. Em operações de NOC, dashboards, alertas e histórico precisam existir em um fluxo testável, mesmo quando não se pode usar dados de produção.

02 — SOLUÇÃO

O que construí

Montei um laboratório local com Docker Compose que sobe Prometheus, Grafana, Loki, PostgreSQL, exporters e dois serviços Python próprios: um simulador de equipamentos ISP e um worker que executa checks sintéticos e grava histórico. A stack provisiona dashboards, alerta por regras compatíveis com as métricas geradas e expõe uma status page pública de demonstração.

03 — FLUXO

Arquitetura

  1. 01Equipamentos simulados
  2. 02Simulator e exporters
  3. 03Prometheus e Loki
  4. 04Worker de checks
  5. 05PostgreSQL
  6. 06Grafana e status page

04ENGENHARIA

Decisões de construção

  • Gerar dados totalmente sintéticos para demonstrar latência, perda, sinal óptico e estado de equipamentos sem tocar em ativos reais.
  • Provisionar dashboards, datasources e alertas por código para que o ambiente possa ser recriado do zero com comportamento previsível.
  • Separar simulador, worker de checks e status page para representar coleta, persistência e comunicação operacional como partes diferentes do sistema.

05REALIDADE

Desafios

  • Manter o schema do banco compatível com o worker de checks e com o inventário provisionado.
  • Evitar dashboards e regras que pareçam reais, mas apontem para métricas inexistentes ou serviços não configurados.
  • Construir uma demonstração honesta para recrutadores sem copiar telas, equipamentos ou incidentes da operação real.

06 — RESPONSABILIDADE

Segurança e limites

  • Todo o laboratório usa equipamentos fictícios, nomes genéricos e dados de demonstração.
  • Credenciais ficam restritas ao `.env.example`; não existem tokens externos nem integrações com produção.
  • A stack expõe apenas serviços do laboratório local e documenta claramente que Grafana e banco usam senhas de desenvolvimento.

07 — ESTADO REAL

Resultado atual

O projeto agora pode ser validado por configuração, testes e build dos serviços principais, sem depender de topologia real ou credenciais externas. Ele fecha a lacuna entre interesse em NOC e evidência prática de observabilidade aplicada.

08EVOLUÇÃO

O que aprendi

  • Observabilidade confiável exige que métricas, alertas, banco e documentação falem a mesma língua; drift entre essas camadas quebra a demonstração rapidamente.
  • Mesmo um laboratório simples fica mais convincente quando provisionamento, status page e inventário são reproduzíveis sem cliques manuais.

09CONTINUIDADE

Próximos passos

  • Gerar screenshots reais dos dashboards e incluir uma walkthrough curta da stack em funcionamento.
  • Adicionar ingestão de logs sintéticos no Loki para demonstrar correlação entre métricas e eventos.
  • Expandir o inventário com assets, incidentes e checks históricos consultáveis por API.