SaaS fintech: unas 3 veces más versiones en producción por semana
Construimos el pipeline de publicación, el portal Backstage y la observabilidad de una plataforma SaaS de analítica de portafolios.
Camino de una versión
- desarrollo
- 1 hora de prueba
- controles
- producción
- ~3xversiones por semana
- 23 % → 4 %fallas de versiones
- 72 sreversión en desarrollo
Dibujado a partir del caso. Es un sistema del cliente y no se muestra.
El trabajo
Cliente: MPI
- Estado
- Plataforma en producción, trabajo en curso
- Cronología
- En curso desde enero de 2025
¿Qué cambió desde el nuevo pipeline de versiones?
Para compradores y vendedores de fondos. Un ingeniero de plataforma de Clouditive, trabajando con un agente de IA, está junto al líder de DevOps del cliente y unos 8 ingenieros.
Cada cifra se midió en los sistemas del cliente: GitLab, Argo CD y Kargo, y su almacén de métricas.
Las versiones en producción pasaron de cerca de 1 por semana a casi 4. La mediana de fusión a producción bajó de más de una semana a pocos días, y las fallas en producción, del 23 % al 4 %. Producción pasó de cero reglas de alerta a 275, y una sola acción reemplazó siete pasos manuales y una lista de certificación. En octubre de 2026 la primera versión por el nuevo pipeline corrió 12 de 12 imágenes verificadas.
~3xversiones por semana
Unas 3 veces más versiones en producción por semana: de 1,15 por semana (abril a julio de 2026) a entre 3,7 y 4,0 por semana (últimos 30 días)
23 % → 4 %fallas de versiones
Las fallas de versiones en producción bajaron del 23 % al 4 %
275reglas de alerta
De cero alertas en producción a 275 reglas de alerta
72 sreversión en desarrollo
Ensayado en desarrollo: reversión en 72 s y vuelta a avanzar en 124 s, ambas verificadas
También registrado
- El tiempo mediano de la fusión a producción bajó de entre 7 y 9,5 días a entre 3,4 y 4,3 días; la primera versión por el nuevo pipeline llegó a producción en unas 2 horas, con una hora de observación incluida
- Siete pasos manuales y una lista de certificación reemplazados por una sola acción
- Primera versión en producción por el nuevo pipeline de promoción; se verificó que las 12 imágenes de servicio en ejecución coinciden con la versión publicada (octubre de 2026)
- Los controles automáticos ya pueden frenar una versión defectuosa antes de producción
- Falta de memoria en reportes grandes diagnosticada y corregida
Qué hicimos, por área
Áreas de trabajo
Entrega GitOps
El código nuevo llega solo a desarrollo. Producción espera una hora y debe pasar controles de salud.
Los pipelines de promoción corren en Kargo sobre Argo CD. Los despliegues a desarrollo son automáticos. Producción espera una hora de observación (soak) y los controles de verificación.
Los controles son pruebas de humo en el borde, chequeos de reinicio y disponibilidad (readiness) de pods y uno que frena la versión si sube la proporción de errores HTTP 5xx. Las migraciones corren antes de que la nueva versión entre en servicio (hook pre-sync), y antes se toma una copia instantánea (snapshot) de la base de datos.
La reversión consiste en volver a promover la versión anterior, y se ensayó en desarrollo.
Portal interno de desarrollo
Un portal Backstage para servicios, despliegues y costos
Servicios, despliegues, costos, vulnerabilidades y salud del CI están en un solo portal.
- Catálogos de servicios y APIs generados desde OpenAPI
- Mapa de dependencias y estado de despliegues
- Costos FinOps por servicio
- Vulnerabilidades de imágenes
- Salud de CI con estadísticas a 30 días de pruebas inestables y reintentos
- Diferencias de perfilado entre despliegues
Infraestructura como código
Terraform y OpenTofu con Atlantis, en migración a Crossplane
Los cambios de infraestructura pasan por Terraform/OpenTofu con Atlantis. La migración a Crossplane avanza con cortes sin interrupción del servicio, cada uno con su reversión.
Observabilidad y SRE
Alertas probadas hasta que disparan y fallas recurrentes corregidas
Las herramientas son VictoriaMetrics, Loki, Tempo, Pyroscope y Grafana. Cada alerta se probó hasta verla disparar.
- La consolidación de nodos ya no recrea el almacén de registros (logs) unas tres veces al día.
- El autoescalado ya no tira la mayoría de los pods de reportes a la vez.
- De cero alertas en producción a 275 reglas de alerta.
- Los trabajos de reportes largos terminan de forma ordenada antes de que se retire su pod.
- Se diagnosticó y corrigió una falta de memoria en reportes grandes.
Costos y seguridad
Auditorías de costos y un control de vulnerabilidades en cada cambio de código
Auditorías de costos del clúster y la nube.
Un control de vulnerabilidades orientado a SOC 2 corre en cada solicitud de fusión (merge request), con excepciones que vencen. Los secretos viven en un almacén gestionado.
Equipo
Un ingeniero de plataforma, con un agente de IA, dentro del equipo del cliente
Un ingeniero de plataforma de Clouditive trabaja con un agente de IA junto al líder de DevOps del cliente y unos 8 de sus ingenieros. El trabajo está en marcha desde enero de 2025 y continúa hoy.
Stack
Servicios utilizados
Los servicios detrás de este trabajo.
Del lado del cliente

Publicado sin nombre y sin cita, con la aprobación del cliente.
Preguntas frecuentes
¿En qué trabaja Clouditive para esta plataforma fintech?
Ingeniería de plataforma, DevOps y SRE para una plataforma SaaS de analítica de portafolios: entrega GitOps, portal interno de desarrollo, infraestructura como código, observabilidad, auditorías de costos y controles de seguridad.
¿Cómo llegan las versiones a producción?
Por pipelines de promoción de Kargo sobre Argo CD. Los despliegues a desarrollo son automáticos; producción espera una hora bajo observación y debe pasar antes controles automáticos de salud y de tasa de errores.
¿Cómo funciona la reversión?
Volviendo a promover la versión anterior. Se ensayó en el entorno de desarrollo: 72 segundos hacia atrás y 124 hacia adelante, ambos verificados. Solo se midió el ensayo en desarrollo.
¿Cómo se protegen las migraciones de base de datos?
Antes de cada migración se toma automáticamente una copia instantánea (snapshot) de la base de datos.
¿Qué muestra el portal de desarrollo?
Catálogos de servicios y APIs desde OpenAPI, mapa de dependencias, estado de despliegues, costos FinOps, vulnerabilidades de imágenes, estadísticas de CI a 30 días y diferencias de perfilado entre despliegues.
¿Qué herramientas de observabilidad usa la plataforma?
VictoriaMetrics, Loki, Tempo, Pyroscope y Grafana, con cada alerta probada hasta verla disparar.
¿De dónde salen los costos del portal?
Directamente de la API de facturación de la nube.
¿Cómo se controla la seguridad?
Con un control de vulnerabilidades orientado a SOC 2 en cada solicitud de fusión, con excepciones que vencen, y un almacén de secretos gestionado.
¿Qué tecnologías usa?
AWS EKS con cuentas separadas de desarrollo y producción, Argo CD, Kargo, Helm, Karpenter, Istio ambient, Kong, GitLab CI, Terraform/OpenTofu, Atlantis, Crossplane, Backstage, Node.js/TypeScript y Python.
¿Qué necesitas resolver?
Respondemos cada pedido en 1 día hábil. Firmamos un NDA antes de la llamada si lo pides.