Grafana ou Datadog: custo, lock-in e OpenTelemetry

Datadog cobra por host e por evento, Grafana por volume de dados, e o OpenTelemetry vem primeiro nos dois.

7 min de leitura

Três fontes de dados alimentam um nó OpenTelemetry que pode enviar a um painel aberto ou a uma caixa fechada de fornecedor

Escolha o Datadog se você quer um fornecedor só operando tudo e aceita uma fatura por host e por evento que cresce junto com a sua infraestrutura. Escolha o Grafana, em servidor próprio ou no Grafana Cloud, se prefere pagar por volume de dados e deixar a saída aberta. Nos dois casos, instrumente primeiro com OpenTelemetry: assim o backend continua sendo uma decisão reversível.

Nós operamos a stack de código aberto do Grafana para clientes. Num projeto para uma empresa americana de serviços de transporte, tirar métricas e logs de um APM comercial (a ferramenta que mede o desempenho das aplicações) reduziu o gasto com observabilidade em uns US$ 5.000 por mês. É o dado de um projeto. O critério com que ordenamos esses custos está no texto O que é FinOps. Abaixo, como eu decidiria para um time de 20 a 200 engenheiros.

Qual é a diferença real entre Grafana e Datadog?

O Datadog é um produto SaaS único: agentes, armazenamento, painéis, alertas, APM e uma lista longa de módulos, tudo operado e faturado por ele, produto a produto. Você não opera nada.

O nome Grafana cobre duas coisas que costumam ser confundidas. Uma é um conjunto de projetos de código aberto que você pode rodar: Grafana para painéis, Loki para logs, Tempo para traces, Mimir para métricas, Pyroscope para profiling. A outra é o Grafana Cloud, a versão gerenciada pela Grafana Labs, com preço por uso. Também dá para combinar: um armazenamento compatível com Prometheus operado pelo seu time e o Grafana só para as telas, que foi o que fizemos na plataforma de um cliente.

As opções são três: Datadog, Grafana Cloud e uma stack de código aberto em servidor próprio.

Como cada um cobra?

É aqui que a maioria se surpreende, porque as unidades não batem.

Opção O que você paga Onde dói
Datadog Hosts, mais o volume de logs duas vezes (ingestão e indexação), mais métricas customizadas acima da cota por host Muitos hosts pequenos; logs em excesso
Grafana Cloud Séries de métricas ativas, depois GB de logs processados, gravados e retidos Métricas de alta cardinalidade; muito volume de logs
Stack Grafana em servidor próprio Computação, armazenamento e as pessoas que a mantêm de pé Ninguém assumir

A última linha quase nunca chega à planilha: código aberto quer dizer sem licença, não sem custo. Os preços de tabela estão nas fontes, no fim.

Qual sai mais barato para um time que cresce?

Depende do que cresce mais rápido no seu sistema, hosts ou dados. Uma conta de exemplo, com preços de tabela e premissas à vista:

  • Datadog, 20 hosts com Infrastructure Pro mais APM, cobrança anual: 20 × (15 + 31) = US$ 920 por mês, sem contar logs nem métricas customizadas acima da cota.
  • Grafana Cloud Pro, 100.000 séries ativas e 500 GB de logs por mês: 19 + (90 × 6,50) + (450 × 0,55) = US$ 851,50 por mês, sem contar traces nem profiling. O 90 são as 100 mil séries menos as 10 mil incluídas; o 450, os 500 GB menos os 50 GB incluídos; e 0,55 é processar, gravar e reter um GB (0,05 + 0,40 + 0,10).

Os dois números medem coisas diferentes, e é por isso que vale olhar os dois. Com muitos hosts pequenos e pouco dado, pesa o preço por host. Com poucos nós grandes e métricas de alta cardinalidade (muitas combinações diferentes de rótulos), pesa o preço por série. Antes de comparar fornecedores, conte seus hosts, suas séries ativas e seus GB de logs por mês. Na minha experiência, quase todo time sabe o primeiro número e chuta os outros dois.

Dois hábitos baixam a fatura nos dois lados: descartar, antes da ingestão, os logs que ninguém consulta e tirar os rótulos que disparam a cardinalidade, como o ID de usuário ou de requisição. Os dois são trabalho de engenharia.

Onde está o lock-in de verdade?

Não onde se costuma olhar. Painéis se refazem em dias, então quase nunca são o que prende você. O problema está em três lugares.

O mais caro é a instrumentação. Se seus serviços emitem telemetria com o agente e as bibliotecas de um fornecedor, trocar de fornecedor obriga a mexer em cada serviço. Depois vêm a linguagem de consulta e os alertas: centenas de regras guardadas num dialeto precisam ser traduzidas e testadas de novo. E o hábito. A pessoa de plantão que sabe onde clicar no meio de um incidente existe, e isso só muda com prática.

O lock-in ordenado pelo custo de troca: instrumentação, consultas e alertas, hábito, e os painéis, o mais fácil de refazerO lock-in ordenado pelo custo de troca: instrumentação, consultas e alertas, hábito, e os painéis, o mais fácil de refazer
Um painel se refaz. O lock-in que custa dinheiro está mais embaixo.

A licença pesa menos, mas convém saber: a Grafana Labs migrou seus projetos principais de Apache 2.0 para AGPLv3 em 20 de abril de 2021. Para uso interno, sem problema. Se você pretende modificá-los e oferecê-los como serviço a terceiros, leia a licença com seu advogado antes.

Por que o OpenTelemetry vem antes do fornecedor?

Porque tira da decisão o lock-in mais caro. O OpenTelemetry é um projeto da CNCF, independente de fornecedor. Ele define como emitir os dados; o backend que os recebe é outra escolha. Se os serviços emitem traces, métricas e logs com os SDKs dele e mandam tudo para um OpenTelemetry Collector, o backend passa a ser uma configuração dos exportadores do Collector. Confirme que cada backend em avaliação aceita OTLP, o protocolo do OpenTelemetry, e você poderá mandar os mesmos dados para os dois durante a avaliação e comparar com o seu próprio tráfego.

É assim que está montada a Autonomah, a plataforma de publicidade com IA que construímos para um cliente: os serviços emitem OpenTelemetry para o Google Cloud, com um registro de custo por chamada. Como a instrumentação é OpenTelemetry, ir para outro backend não deveria obrigar a reinstrumentar cada serviço.

Como é uma stack de código aberto na prática?

Na plataforma da MPI, que roda em Kubernetes na AWS, a stack é VictoriaMetrics para métricas, Loki para logs, Tempo para traces, Pyroscope para profiling e Grafana por cima. Instalar não foi o que mais importou.

Alertas precisam ser provados: você provoca a condição e vê o alerta disparar, porque uma regra que nunca disparou é suposição. Na MPI a produção saiu de zero regras de alerta avaliadas (auditoria de setembro) para 275. Também é preciso cortar o ruído: alerta que dispara sem que ninguém tenha o que fazer é apagado ou corrigido, e a queda se mede. Os alertas disparando ao mesmo tempo caíram 70% entre o fim de setembro e a primeira semana de outubro de 2026, uma janela de duas semanas. E o armazenamento tem que ficar quieto: corrigimos um armazenamento de logs que a consolidação de nós recriava umas três vezes por dia. Quem opera por conta própria herda esse tipo de falha.

Se ninguém no seu time quer operar sistemas de armazenamento, esse último ponto é o argumento a favor de um backend gerenciado, seja Grafana Cloud ou Datadog.

Como decidir numa tarde?

Responda cinco perguntas com números. Quantos hosts ou nós você roda e com que ritmo crescem? Quantas séries de métricas ativas você tem hoje? (O Prometheus responde.) Quantos GB de logs por mês, e que parte alguém chega a consultar? Se opera por conta própria, quem cuida da stack às 3 da manhã? E a que mais importa: seus serviços estão instrumentados com OpenTelemetry, com o agente de um fornecedor ou com nada?

Se a última resposta for “o agente de um fornecedor” ou “nada”, comece por aí. A decisão do backend fica mais barata assim que os dados são portáveis.

O Grafana é uma alternativa real ao Datadog?

Para métricas, logs, traces e painéis, sim. O Datadog reúne mais produtos num só console (segurança, testes sintéticos, visibilidade de CI e outros), e há times que valorizam uma fatura só e um contrato de suporte só. Se você precisa desses extras e não quer montá-los, essa integração é o que se paga ao Datadog. Se bastam os quatro sinais e bons alertas, o Grafana atende, gerenciado ou não.

Por onde começar?

Pelos sinais; o fornecedor vem depois: OpenTelemetry nos serviços, um Collector no meio, três SLOs (metas de confiabilidade que descrevam o que o usuário sente) e alertas que você já viu disparar. É o escopo dos Fundamentos de SRE e observabilidade, US$ 5.000 por duas semanas, e funciona com qualquer backend. O detalhe está na página de SRE e observabilidade e todos os pacotes estão em preços.

Fontes

  • Preços do Datadog: Infrastructure Pro a partir de US$ 15 por host ao mês com cobrança anual (US$ 18 sob demanda); APM a partir de US$ 31 por host; ingestão de logs a partir de US$ 0,10 por GB; indexação padrão de US$ 1,70 por milhão de eventos ao mês; 100 métricas customizadas por host no Pro. Consultados em 7 de outubro de 2026.
  • Preços do Grafana: Free a US$ 0 com 14 dias de retenção; Pro a partir de US$ 19 ao mês mais uso; métricas a US$ 6,50 por 1.000 séries acima das 10.000 incluídas; logs a US$ 0,05 de processamento, 0,40 de gravação e 0,10 de retenção por GB acima dos 50 GB incluídos; Enterprise a partir de US$ 25.000 ao ano. Consultados em 7 de outubro de 2026.
  • Licenciamento do Grafana e What is OpenTelemetry?, consultados em 7 de outubro de 2026.
  • Números da MPI: medição própria, outubro de 2026.
  • sre
  • observabilidade
  • grafana
  • datadog
  • opentelemetry
Ler este artigo em inglêsLer este artigo em espanhol

Coloque isso em prática

SRE e observabilidade

Novos artigos por email

Notas sobre tarifas, engenharia de plataforma, DevOps, SRE, QA e engenharia de IA, com os preços e os números do nosso próprio trabalho.

A DX Clouditive LLC (7901 4th St N, Ste 300, St Petersburg, FL 33702, EUA; [email protected]) vai enviar os artigos novos e um resumo semanal depois que você confirmar. Você pode retirar o consentimento quando quiser pelo link de cancelamento em qualquer e-mail. Leia nossa política de privacidade. Você pode cancelar a inscrição quando quiser, em qualquer email.

Continue lendo

Todos os artigos

O que você precisa resolver?

Respondemos a todo pedido em até 1 dia útil. Assinamos um NDA antes da conversa, se você pedir.