OBSERVABILIDADE · GRAFANA · PROMETHEUS
NOC Monitoring Lab
Laboratório reproduzível de observabilidade para contexto ISP/NOC, com métricas sintéticas, inventário, checks, alertas e status page em Docker Compose.
01 — CONTEXTO
Problema
Falar de monitoramento, incidentes e observabilidade sem um ambiente reproduzível enfraquece a evidência. Em operações de NOC, dashboards, alertas e histórico precisam existir em um fluxo testável, mesmo quando não se pode usar dados de produção.
02 — SOLUÇÃO
O que construí
Montei um laboratório local com Docker Compose que sobe Prometheus, Grafana, Loki, PostgreSQL, exporters e dois serviços Python próprios: um simulador de equipamentos ISP e um worker que executa checks sintéticos e grava histórico. A stack provisiona dashboards, alerta por regras compatíveis com as métricas geradas e expõe uma status page pública de demonstração.
03 — FLUXO
Arquitetura
- 01Equipamentos simulados
- 02Simulator e exporters
- 03Prometheus e Loki
- 04Worker de checks
- 05PostgreSQL
- 06Grafana e status page
04 — ENGENHARIA
Decisões de construção
- Gerar dados totalmente sintéticos para demonstrar latência, perda, sinal óptico e estado de equipamentos sem tocar em ativos reais.
- Provisionar dashboards, datasources e alertas por código para que o ambiente possa ser recriado do zero com comportamento previsível.
- Separar simulador, worker de checks e status page para representar coleta, persistência e comunicação operacional como partes diferentes do sistema.
05 — REALIDADE
Desafios
- Manter o schema do banco compatível com o worker de checks e com o inventário provisionado.
- Evitar dashboards e regras que pareçam reais, mas apontem para métricas inexistentes ou serviços não configurados.
- Construir uma demonstração honesta para recrutadores sem copiar telas, equipamentos ou incidentes da operação real.
06 — RESPONSABILIDADE
Segurança e limites
- Todo o laboratório usa equipamentos fictícios, nomes genéricos e dados de demonstração.
- Credenciais ficam restritas ao `.env.example`; não existem tokens externos nem integrações com produção.
- A stack expõe apenas serviços do laboratório local e documenta claramente que Grafana e banco usam senhas de desenvolvimento.
07 — ESTADO REAL
Resultado atual
O projeto agora pode ser validado por configuração, testes e build dos serviços principais, sem depender de topologia real ou credenciais externas. Ele fecha a lacuna entre interesse em NOC e evidência prática de observabilidade aplicada.
08 — EVOLUÇÃO
O que aprendi
- Observabilidade confiável exige que métricas, alertas, banco e documentação falem a mesma língua; drift entre essas camadas quebra a demonstração rapidamente.
- Mesmo um laboratório simples fica mais convincente quando provisionamento, status page e inventário são reproduzíveis sem cliques manuais.
09 — CONTINUIDADE
Próximos passos
- Gerar screenshots reais dos dashboards e incluir uma walkthrough curta da stack em funcionamento.
- Adicionar ingestão de logs sintéticos no Loki para demonstrar correlação entre métricas e eventos.
- Expandir o inventário com assets, incidentes e checks históricos consultáveis por API.