¿Qué es SRE en TI?

SRE, siglas de site reliability engineering o ingeniería de fiabilidad de sitios, es la disciplina que mantiene confiables los servicios en producción con herramientas de ingeniería de software: instrumentar los sistemas, escribir alertas que disparen ante fallas reales, encontrar la causa de los incidentes que se repiten y corregirla, planificar capacidad y ensayar la recuperación. En Clouditive verificamos cada corrección en el sistema en ejecución.

Una alerta que nadie vio disparar es una suposición. Una falla que vuelve todos los días se asume como normal hasta que cuesta una versión o un reporte.

Fundamentos de SRE y observabilidad cuesta USD 5.000 por 2 semanas: métricas, registros y trazas conectados, 3 SLOs definidos, alertas probadas hasta que disparan y un runbook.

Qué recibes, paso a paso

Todo lo que incluye el paquete, en el orden en que llega. El precio y la duración no cambian.

  1. Paso 1: Las señales

    Métricas, registros y trazas conectados.

  2. Paso 2: Los SLOs

    3 SLOs definidos.

  3. Paso 3: Alertas y runbook

    Alertas probadas hasta que disparan, y un runbook.

  4. 2 semanas

    USD 5.000

¿Quieres seguir después del paquete? Suma ingenieros por hora con las tarifas publicadas, con un plazo mínimo de 6 meses. Cómo funciona staff augmentation.

Observabilidad y SRE para una plataforma SaaS fintech

Analítica de inversiones / Fintech

Estado: Plataforma en producción, trabajo en curso

  1. desarrollo
  2. 1 hora de prueba
  3. controles
  4. producción
  • ~3xmás versiones en producción por semana
  • 23 % → 4 %fallas de versiones en producción
  • 0 → 275reglas de alerta en producción
  • 72 sde reversión, ensayada en desarrollo

Dibujado a partir del caso. El producto es un sistema del cliente y no se muestra.

Ver el caso

Para la plataforma SaaS de analítica de portafolios de MPI, sobre AWS EKS, nuestro trabajo incluye:

  • Un conjunto de observabilidad con VictoriaMetrics, Loki, Tempo, Pyroscope y Grafana, con alertas probadas hasta disparar.
  • El almacén de registros ya no se recrea unas tres veces por día por la consolidación de nodos.
  • El autoescalado ya no elimina de golpe la mayoría de los pods de reportes, y los reportes largos terminan antes de que su pod se retire.
  • Una falla por falta de memoria en reportes grandes, diagnosticada y corregida.
  • Auditorías de costo del clúster y de la nube.

¿Prefieres pagar por hora?

Suma ingenieros a tu propio equipo con las tarifas publicadas, en lugar de comprar un paquete.

  • Tú entrevistasConoces al ingeniero que hará el trabajo.
  • Mínimo de 6 mesesSe factura por hora trabajada.
  • Reemplazo sin costoSi se va o no encaja, lo reemplazamos y cubrimos el traspaso sin costo.
Ver cómo funciona staff augmentation
  • Lead / ArquitectoUSD55–⁠60por hora
  • SeniorUSD45–⁠50por hora
  • Mid / Semi seniorUSD35–⁠40por hora
  • JuniorUSD30por hora

USD por hora, dibujado en una sola escala

Para seguir leyendo

Preguntas frecuentes

¿Qué significa SRE en siglas?

Site reliability engineering: ingeniería de fiabilidad de sitios. No confundir con la Secretaría de Relaciones Exteriores de México.

¿Cuál es el trabajo de un ingeniero de fiabilidad?

Que producción sea confiable: instrumentar, alertar, investigar incidentes, corregir su causa, planificar capacidad y ensayar la recuperación.

¿Qué herramientas se utilizan para la observabilidad?

En nuestros casos: VictoriaMetrics, Loki, Tempo, Pyroscope y Grafana en MPI, y OpenTelemetry hacia Google Cloud en Autonomah.

¿Qué es una alerta probada?

Una alerta cuya condición de falla se provocó a propósito para comprobar que llega. Una alerta que nunca disparó es una suposición, no un control.

¿Cuánto cuesta Fundamentos de SRE y observabilidad?

USD 5.000 por 2 semanas, a precio fijo: métricas, registros y trazas conectados, 3 SLOs definidos, alertas probadas hasta que disparan y un runbook.

¿Cuánto cuesta un SRE por hora?

Nuestras tarifas publicadas: USD 55–⁠60 un Lead o Arquitecto, 45–⁠50 un Senior, 35–⁠40 un Mid y 30 un Junior, con un mínimo de 6 meses en staff augmentation.

¿En qué idioma trabaja el equipo?

100 % en español, inglés o portugués, según tu equipo. Entrevistas al ingeniero que hará el trabajo.

Qué cambia Fundamentos de SRE y observabilidad para el negocio

Cada entregable, en los términos que pregunta un CEO o un directorio:

  • Métricas, registros y trazas conectados: cuando el producto se pone lento o falla, tu equipo ve dónde y por qué, sin adivinar.
  • 3 SLOs definidos: tres metas escritas de cuán confiable debe ser el producto, para que «la app se cae seguido» se convierta en un número que puedes seguir.
  • Alertas probadas hasta que disparan: tu equipo se entera de una falla por una alerta, no por un cliente, y cada alerta se disparó a propósito para ver que llega.
  • Un runbook: los pasos iniciales escritos para cada alerta, para que quien esté de guardia pueda actuar sin la persona que construyó el sistema.
  • En MPI, los reportes grandes que se quedaban sin memoria se diagnosticaron y corrigieron, y el autoescalado ya no interrumpe de golpe la mayoría de los reportes en curso.

¿Qué es la observabilidad?

La observabilidad es la capacidad de entender por qué un sistema se comporta como se comporta a partir de las señales que emite, sin desplegar código nuevo para averiguarlo. Las señales habituales son métricas, registros y trazas, y cada vez más los perfiles continuos. Las métricas avisan que algo cambió, los registros cuentan qué pasó, las trazas muestran dónde se fue el tiempo y los perfiles, qué código consumió recursos.

En Autonomah la telemetría va por OpenTelemetry a Google Cloud, con un registro de costo por llamada y cada despliegue a producción verificado contra la compilación probada.

En Nyravorn, un juego online, ensayamos copias de seguridad y restauraciones, y scripts de pruebas de humo comprueban que los datos persisten después de reiniciar el servidor.

La observabilidad es la capacidad de entender qué pasa dentro de un sistema en producción a partir de lo que emite: métricas, registros (logs) y trazas. Con ella, cuando el producto se pone lento o falla, el equipo ve dónde y por qué en lugar de adivinar. OpenTelemetry recoge las tres señales una sola vez, y herramientas abiertas como Grafana, Loki y Tempo las guardan y las muestran.

¿Qué es DevOps y SRE?

DevOps es una forma de trabajar que une construir y operar software; SRE es una disciplina de ingeniería concreta dentro de esa idea, centrada en la confiabilidad de producción. Un ingeniero DevOps suele ser responsable del camino a producción: pipelines e infraestructura como código. Un SRE se ocupa de lo que pasa después: señales, alertas, incidentes, capacidad y recuperación. En MPI hacemos las dos cosas.

En nuestro trabajo, el ingeniero dirige el trabajo y las herramientas de IA asisten: así trabaja nuestro líder técnico de plataforma en MPI. Las alertas se siguen probando y cada corrección se sigue verificando en el sistema en ejecución.

¿Qué necesitas resolver?

Respondemos cada pedido en 1 día hábil. Firmamos un NDA antes de la llamada si lo pides.