El trabajo

Cliente: MPI

Estado
Plataforma en producción, trabajo en curso
Cronología
En curso desde enero de 2025

¿Qué cambió desde el nuevo pipeline de versiones?

Para compradores y vendedores de fondos. Un ingeniero de plataforma de Clouditive, trabajando con un agente de IA, está junto al líder de DevOps del cliente y unos 8 ingenieros.

Cada cifra se midió en los sistemas del cliente: GitLab, Argo CD y Kargo, y su almacén de métricas.

Las versiones en producción pasaron de cerca de 1 por semana a casi 4. La mediana de fusión a producción bajó de más de una semana a pocos días, y las fallas en producción, del 23 % al 4 %. Producción pasó de cero reglas de alerta a 275, y una sola acción reemplazó siete pasos manuales y una lista de certificación. En octubre de 2026 la primera versión por el nuevo pipeline corrió 12 de 12 imágenes verificadas.

  • ~3xversiones por semana

    Unas 3 veces más versiones en producción por semana: de 1,15 por semana (abril a julio de 2026) a entre 3,7 y 4,0 por semana (últimos 30 días)

  • 23 % → 4 %fallas de versiones

    Las fallas de versiones en producción bajaron del 23 % al 4 %

  • 275reglas de alerta

    De cero alertas en producción a 275 reglas de alerta

  • 72 sreversión en desarrollo

    Ensayado en desarrollo: reversión en 72 s y vuelta a avanzar en 124 s, ambas verificadas

También registrado

  • El tiempo mediano de la fusión a producción bajó de entre 7 y 9,5 días a entre 3,4 y 4,3 días; la primera versión por el nuevo pipeline llegó a producción en unas 2 horas, con una hora de observación incluida
  • Siete pasos manuales y una lista de certificación reemplazados por una sola acción
  • Primera versión en producción por el nuevo pipeline de promoción; se verificó que las 12 imágenes de servicio en ejecución coinciden con la versión publicada (octubre de 2026)
  • Los controles automáticos ya pueden frenar una versión defectuosa antes de producción
  • Falta de memoria en reportes grandes diagnosticada y corregida

Qué hicimos, por área

Áreas de trabajo

  • Ingeniería de plataforma
  • Entrega GitOps
  • Infraestructura como código
  • Observabilidad y SRE
  • Auditorías de costos
  • Controles de seguridad
Entrega GitOps

El código nuevo llega solo a desarrollo. Producción espera una hora y debe pasar controles de salud.

Los pipelines de promoción corren en Kargo sobre Argo CD. Los despliegues a desarrollo son automáticos. Producción espera una hora de observación (soak) y los controles de verificación.

Los controles son pruebas de humo en el borde, chequeos de reinicio y disponibilidad (readiness) de pods y uno que frena la versión si sube la proporción de errores HTTP 5xx. Las migraciones corren antes de que la nueva versión entre en servicio (hook pre-sync), y antes se toma una copia instantánea (snapshot) de la base de datos.

La reversión consiste en volver a promover la versión anterior, y se ensayó en desarrollo.

Portal interno de desarrollo

Un portal Backstage para servicios, despliegues y costos

Servicios, despliegues, costos, vulnerabilidades y salud del CI están en un solo portal.

  • Catálogos de servicios y APIs generados desde OpenAPI
  • Mapa de dependencias y estado de despliegues
  • Costos FinOps por servicio
  • Vulnerabilidades de imágenes
  • Salud de CI con estadísticas a 30 días de pruebas inestables y reintentos
  • Diferencias de perfilado entre despliegues
Infraestructura como código

Terraform y OpenTofu con Atlantis, en migración a Crossplane

Los cambios de infraestructura pasan por Terraform/OpenTofu con Atlantis. La migración a Crossplane avanza con cortes sin interrupción del servicio, cada uno con su reversión.

Observabilidad y SRE

Alertas probadas hasta que disparan y fallas recurrentes corregidas

Las herramientas son VictoriaMetrics, Loki, Tempo, Pyroscope y Grafana. Cada alerta se probó hasta verla disparar.

  • La consolidación de nodos ya no recrea el almacén de registros (logs) unas tres veces al día.
  • El autoescalado ya no tira la mayoría de los pods de reportes a la vez.
  • De cero alertas en producción a 275 reglas de alerta.
  • Los trabajos de reportes largos terminan de forma ordenada antes de que se retire su pod.
  • Se diagnosticó y corrigió una falta de memoria en reportes grandes.
Costos y seguridad

Auditorías de costos y un control de vulnerabilidades en cada cambio de código

Auditorías de costos del clúster y la nube.

Un control de vulnerabilidades orientado a SOC 2 corre en cada solicitud de fusión (merge request), con excepciones que vencen. Los secretos viven en un almacén gestionado.

Equipo

Un ingeniero de plataforma, con un agente de IA, dentro del equipo del cliente

Un ingeniero de plataforma de Clouditive trabaja con un agente de IA junto al líder de DevOps del cliente y unos 8 de sus ingenieros. El trabajo está en marcha desde enero de 2025 y continúa hoy.

Stack

  • AWS EKS
  • Argo CD
  • Kargo
  • Helm
  • Karpenter
  • Istio ambient
  • Kong
  • GitLab CI
  • Terraform / OpenTofu
  • Atlantis
  • Crossplane
  • Backstage
  • VictoriaMetrics
  • Loki
  • Tempo
  • Pyroscope
  • Grafana
  • Node.js / TypeScript
  • Python

Servicios utilizados

Los servicios detrás de este trabajo.

Del lado del cliente

Líder de desarrollo del lado del cliente

Publicado sin nombre y sin cita, con la aprobación del cliente.

Preguntas frecuentes

¿En qué trabaja Clouditive para esta plataforma fintech?

Ingeniería de plataforma, DevOps y SRE para una plataforma SaaS de analítica de portafolios: entrega GitOps, portal interno de desarrollo, infraestructura como código, observabilidad, auditorías de costos y controles de seguridad.

¿Cómo llegan las versiones a producción?

Por pipelines de promoción de Kargo sobre Argo CD. Los despliegues a desarrollo son automáticos; producción espera una hora bajo observación y debe pasar antes controles automáticos de salud y de tasa de errores.

¿Cómo funciona la reversión?

Volviendo a promover la versión anterior. Se ensayó en el entorno de desarrollo: 72 segundos hacia atrás y 124 hacia adelante, ambos verificados. Solo se midió el ensayo en desarrollo.

¿Cómo se protegen las migraciones de base de datos?

Antes de cada migración se toma automáticamente una copia instantánea (snapshot) de la base de datos.

¿Qué muestra el portal de desarrollo?

Catálogos de servicios y APIs desde OpenAPI, mapa de dependencias, estado de despliegues, costos FinOps, vulnerabilidades de imágenes, estadísticas de CI a 30 días y diferencias de perfilado entre despliegues.

¿Qué herramientas de observabilidad usa la plataforma?

VictoriaMetrics, Loki, Tempo, Pyroscope y Grafana, con cada alerta probada hasta verla disparar.

¿De dónde salen los costos del portal?

Directamente de la API de facturación de la nube.

¿Cómo se controla la seguridad?

Con un control de vulnerabilidades orientado a SOC 2 en cada solicitud de fusión, con excepciones que vencen, y un almacén de secretos gestionado.

¿Qué tecnologías usa?

AWS EKS con cuentas separadas de desarrollo y producción, Argo CD, Kargo, Helm, Karpenter, Istio ambient, Kong, GitLab CI, Terraform/OpenTofu, Atlantis, Crossplane, Backstage, Node.js/TypeScript y Python.

¿Qué necesitas resolver?

Respondemos cada pedido en 1 día hábil. Firmamos un NDA antes de la llamada si lo pides.