Para que serve a observabilidade?
Ela responde por que um sistema se comporta como se comporta a partir dos sinais que ele emite (métricas, logs, traces e perfis), sem publicar código novo para descobrir.
Observabilidade faz parte do DevOps?
Sim. Não dá para ser dono de como o software roda sem vê-lo rodar. No nosso trabalho, ela fica com o SRE: instrumentação, alertas e as correções que vêm depois.
Quais são as 3 principais ferramentas de observabilidade?
Não fazemos ranking de fornecedores. O que já operamos em produção: VictoriaMetrics, Loki, Tempo, Pyroscope e Grafana na MPI, e OpenTelemetry para o Google Cloud na Autonomah.
O que significa um alerta testado até disparar?
Provocamos a condição de falha de propósito e verificamos que o alerta chega. Um alerta que nunca disparou é uma suposição, não um controle.
Quanto custa Fundamentos de SRE e observabilidade?
US$ 5.000 por 2 semanas, preço fixo: métricas, logs e traces conectados, 3 SLOs definidos, alertas testados até disparar e um runbook.
O SRE ainda está em alta?
Vendemos SRE porque os sistemas em produção continuam precisando dele: na MPI, o trabalho cobriu alertas, autoscaling, armazenamento de logs, falhas de falta de memória e custo.
Quanto custa um SRE por hora?
Nossas tarifas publicadas: US$ 55–60 para Líder ou Arquiteto, 45–50 Sênior, 35–40 Pleno e 30 Júnior, com mínimo de 6 meses em staff augmentation (alocação de profissionais).
O que Fundamentos de SRE e observabilidade muda para o negócio
Cada entregável, nos termos que um CEO ou um conselho perguntam:
- Métricas, logs e traces conectados: quando o produto fica lento ou falha, seu time vê onde e por quê, em vez de adivinhar.
- 3 SLOs definidos: três metas escritas de quão confiável o produto precisa ser, para que "o app cai demais" vire um número que você acompanha.
- Alertas testados até disparar: seu time fica sabendo de uma falha por um alerta, não por um cliente, e cada alerta foi disparado de propósito para mostrar que chega.
- Um runbook: os primeiros passos escritos para cada alerta, para que quem estiver de plantão aja sem depender de quem construiu o sistema.
- Na MPI, relatórios grandes que estouravam a memória foram diagnosticados e corrigidos, e o scale down deixou de interromper de uma vez a maioria dos relatórios em execução.
Quais são os quatro pilares da observabilidade?
A observabilidade costuma ser descrita por métricas, logs e traces, com profiling contínuo muitas vezes somado como quarto sinal. As métricas mostram que algo mudou, os logs mostram o que aconteceu, os traces mostram onde uma requisição gastou seu tempo e os perfis mostram qual código usou CPU ou memória. Na MPI, cada sinal tem seu próprio armazenamento (VictoriaMetrics, Loki, Tempo, Pyroscope), lidos juntos no Grafana.
Na Autonomah, a telemetria vai por OpenTelemetry para o Google Cloud, com um registro de custo por chamada e cada deploy em produção verificado para rodar o build exato que foi testado.
Na Nyravorn, um jogo online, ensaiamos backup e restore, e scripts de smoke test verificam que os dados dos jogadores sobrevivem a um reinício do servidor.
SRE é só DevOps?
Não. DevOps é uma forma de trabalhar que une construir e operar software; SRE é uma disciplina de engenharia específica dentro dessa ideia, focada em quão confiável é a produção. O engenheiro DevOps costuma ser dono do caminho até a produção: pipelines e infraestrutura como código. O SRE cuida do que acontece depois: sinais, alertas, incidentes, capacidade e recuperação. Na MPI fazemos as duas coisas para a mesma plataforma.
A IA vai substituir o SRE? No nosso trabalho, o engenheiro dirige e as ferramentas de IA assistem: nosso líder de plataforma na MPI trabalha assim. Os alertas continuam sendo testados até disparar e as correções continuam sendo verificadas no sistema em execução.
Uma alternativa open source ao Datadog
O OpenTelemetry coleta métricas, logs e traces uma única vez, e armazenamentos open source como Mimir, Loki e Tempo, lidos no Grafana, os guardam sem licença comercial por host. Em uma empresa norte-americana de serviços de transporte, tirar métricas e logs de um APM comercial reduziu o gasto com observabilidade em cerca de US$ 5.000 por mês, e os dashboards passaram de 18 para 135. O trabalho passa a ser configuração e manutenção, em vez de assinatura.