Elige Datadog si quieres que un solo proveedor opere todo y aceptas una factura por host y por evento que crece con tu infraestructura. Elige Grafana, autogestionado o en Grafana Cloud, si prefieres pagar por volumen de datos y dejarte la salida abierta. En cualquiera de los dos casos, instrumenta primero con OpenTelemetry: así el backend sigue siendo una decisión reversible.
Nosotros operamos el stack de código abierto de Grafana para clientes. En un proyecto para una empresa estadounidense de servicios de transporte, mover métricas y logs fuera de un APM comercial (la herramienta que mide el rendimiento de las aplicaciones) bajó el gasto en observabilidad unos USD 5.000 al mes. Es el dato de un proyecto. El criterio con que ordenamos esos costos está en el artículo qué es FinOps. Así decidiría yo para un equipo de 20 a 200 ingenieros.
¿En qué se diferencian realmente Grafana y Datadog?
Datadog es un único producto SaaS: agentes, almacenamiento, tableros, alertas, APM y una larga lista de módulos, todo operado por Datadog y facturado por producto. Tú no operas nada.
Grafana son dos cosas que se suelen confundir. Una es un conjunto de proyectos de código abierto que puedes correr tú: Grafana para tableros, Loki para logs, Tempo para trazas, Mimir para métricas, Pyroscope para perfiles. La otra es Grafana Cloud, la versión administrada por Grafana Labs, con precios por uso. También se pueden combinar: almacenamiento compatible con Prometheus operado por tu equipo y Grafana para las vistas, que es lo que hicimos en la plataforma de un cliente.
Las opciones son tres: Datadog, Grafana Cloud y un stack de código abierto autogestionado.
¿Cómo cobra cada uno?
Aquí la mayoría se lleva la sorpresa, porque las unidades no coinciden.
| Aspecto | Qué pagas | Dónde duele |
|---|---|---|
| Datadog | Hosts, más el volumen de logs dos veces (ingesta e indexado), más métricas personalizadas sobre un cupo por host | Muchos hosts chicos; logs muy verbosos |
| Grafana Cloud | Series de métricas activas, luego GB de logs procesados, escritos y retenidos | Métricas de alta cardinalidad; mucho volumen de logs |
| Stack de Grafana autogestionado | Cómputo, almacenamiento y las personas que lo mantienen funcionando | Que nadie se haga cargo |
La última fila es la que casi nunca llega a la planilla: código abierto significa sin licencia, no sin costo. Los precios de lista están al final, en las fuentes.
¿Cuál sale más barato para un equipo que crece?
Depende de qué crece más rápido en tu sistema, los hosts o los datos. Una cuenta ilustrativa con precios de lista y supuestos a la vista:
- Datadog, 20 hosts con Infrastructure Pro más APM, facturación anual: 20 × (15 + 31) = USD 920 al mes, sin contar logs ni métricas personalizadas por encima del cupo.
- Grafana Cloud Pro, 100.000 series activas y 500 GB de logs al mes: 19 + (90 × 6,50) + (450 × 0,55) = USD 851,50 al mes, sin contar trazas ni perfiles. El 90 son las 100 mil series menos las 10 mil incluidas; el 450, los 500 GB menos los 50 GB incluidos; y 0,55 es procesar, escribir y retener un GB (0,05 + 0,40 + 0,10).
Los dos números miden cosas distintas, y por eso conviene mirar los dos. Con muchos hosts chicos y pocos datos, duele el precio por host. Con pocos nodos grandes y métricas de alta cardinalidad (muchas combinaciones distintas de etiquetas), duele el precio por serie. Antes de comparar proveedores, cuenta tus hosts, tus series activas y tus GB de logs por mes. En mi experiencia casi todos los equipos saben el primer número y adivinan los otros dos.
Dos hábitos bajan la factura en cualquiera de los dos lados: descartar los logs que nadie consulta antes de ingerirlos y quitar las etiquetas que disparan la cardinalidad, como el ID de usuario o el de request. Las dos cosas son trabajo de ingeniería.
¿Dónde está la dependencia de verdad?
No donde se suele mirar. Los tableros se rehacen en días, así que casi nunca son la dependencia. Está en tres lugares.
El más caro es la instrumentación. Si tus servicios emiten telemetría con el agente y las bibliotecas de un proveedor, cambiar de proveedor obliga a tocar cada servicio. Luego están el lenguaje de consultas y las alertas: cientos de reglas guardadas en un dialecto hay que traducirlas y volver a probarlas. Y la costumbre. Las personas de guardia que saben dónde hacer clic en pleno incidente existen, y eso solo cambia con práctica.
La licencia pesa menos, pero conviene saberlo: Grafana Labs pasó sus proyectos principales de Apache 2.0 a AGPLv3 el 20 de abril de 2021. Para uso interno no hay problema. Si piensas modificarlos y ofrecerlos como servicio a terceros, léela antes con tu abogado.
¿Por qué OpenTelemetry va antes que el proveedor?
Porque saca de la decisión la dependencia más cara. OpenTelemetry es un proyecto de la CNCF, neutral frente a proveedores y herramientas, y no es un backend de observabilidad. Si los servicios emiten trazas, métricas y logs con sus SDK y los mandan a un OpenTelemetry Collector, el backend pasa a ser una configuración de los exportadores del Collector. Confirma que cada backend que evalúas acepta OTLP, el protocolo de OpenTelemetry, y podrás enviar los mismos datos a los dos durante la evaluación y compararlos con tu propio tráfico.
Así está armado Autonomah, la plataforma de publicidad con IA que construimos para un cliente: los servicios emiten OpenTelemetry hacia Google Cloud, con un registro de costo por llamada. Como la instrumentación es OpenTelemetry, pasar a otro backend no debería obligar a reinstrumentar cada servicio.
¿Cómo se ve un stack de código abierto en la práctica?
En la plataforma de MPI, que corre sobre Kubernetes en AWS, el stack es VictoriaMetrics para métricas, Loki para logs, Tempo para trazas, Pyroscope para perfiles y Grafana encima. Instalarlo no fue lo que más importó.
Las alertas hay que probarlas: se provoca la condición y se ve cómo disparan, porque una regla que nunca disparó es una suposición. En MPI producción pasó de cero reglas de alerta evaluadas (auditoría de septiembre) a 275. El ruido hay que sacarlo: las alertas que suenan sin que nadie tenga que actuar se borran o se corrigen, y el resultado se mide. Las alertas disparadas en simultáneo bajaron un 70 % entre fines de septiembre y la primera semana de octubre de 2026, una ventana de dos semanas. Y el almacenamiento tiene que quedarse quieto: corregimos un almacén de logs que la consolidación de nodos recreaba unas tres veces por día. Si autogestionas, esas fallas son tuyas.
Si en tu equipo nadie quiere operar sistemas de almacenamiento, ese último punto es el argumento a favor de un backend administrado, sea Grafana Cloud o Datadog.
¿Cómo decides en una tarde?
Responde cinco preguntas con números. ¿Cuántos hosts o nodos corres y a qué ritmo crecen? ¿Cuántas series de métricas activas tienes hoy? (Prometheus te lo dice.) ¿Cuántos GB de logs al mes, y qué parte se consulta alguna vez? Si autogestionas, ¿quién opera el stack a las 3 de la mañana? Y la que más importa: ¿tus servicios están instrumentados con OpenTelemetry, con el agente de un proveedor o con nada?
Si la última respuesta es “el agente de un proveedor” o “nada”, empieza por ahí. La decisión de backend se abarata en cuanto los datos son portables.
¿Grafana es una alternativa real a Datadog?
Para métricas, logs, trazas y tableros, sí. Datadog reúne más productos en una sola consola (seguridad, pruebas sintéticas, visibilidad de CI y otros), y hay equipos que valoran una sola factura y un solo contrato de soporte. Si necesitas esos extras y no quieres armarlos tú, esa integración es lo que le pagas a Datadog. Si te alcanza con las cuatro señales y buenas alertas, Grafana lo cubre, administrado o no.
¿Por dónde empiezo?
Por las señales; el proveedor viene después: OpenTelemetry en los servicios, un Collector en el medio, tres SLO (metas de confiabilidad que describan lo que sienten los usuarios) y alertas que hayas visto disparar. Es el alcance de Fundamentos de SRE y observabilidad, USD 5.000 por dos semanas, y funciona con cualquier backend. El detalle está en la página de SRE y observabilidad y todos los paquetes en precios.
Fuentes
- Precios de Datadog: Infrastructure Pro desde USD 15 por host al mes con facturación anual (USD 18 a demanda); APM desde USD 31 por host; ingesta de logs desde USD 0,10 por GB; indexación estándar USD 1,70 por millón de eventos al mes; 100 métricas personalizadas por host en Pro. Consultados el 7 de octubre de 2026.
- Precios de Grafana: Free a USD 0 con 14 días de retención; Pro desde USD 19 al mes más uso; métricas a USD 6,50 cada 1.000 series pasadas las 10.000 incluidas; logs a USD 0,05 de proceso, 0,40 de escritura y 0,10 de retención por GB pasados los 50 GB incluidos; Enterprise desde USD 25.000 al año. Consultados el 7 de octubre de 2026.
- Licencias de Grafana y What is OpenTelemetry?, consultadas el 7 de octubre de 2026.
- Cifras de MPI: medición propia, octubre de 2026.
