Caso de éxito
YALO optimiza costos a escala con FinOps: ~$2.850/mes de ahorro confirmado y un cluster GKE que pasó de ~165 a ~140 nodos sin tocar la estabilidad
Resumen
YALO es una plataforma de comercio conversacional con uso intensivo de microservicios en Kubernetes (GKE), bases de datos CloudSQL y Redis, eventos en Kafka y observabilidad con Datadog, al servicio de grandes marcas. Craftech ejecutó un assessment de infraestructura y un plan integral de FinOps sobre Google Cloud Platform que llevó su cluster GKE de ~165 a ~140 nodos mediante rightsizing, contuvo los sobrecostos de Datadog y de las bases de datos, y dejó ~$2.850 USD/mes de ahorro confirmado —con una proyección de hasta ~$10.000/mes— sin comprometer la estabilidad del sistema.
~$2.850/mes
ahorro efectivo confirmado (proyección hasta ~$10.000/mes)
165 → 140
nodos GKE tras rightsizing (mínimos de 134)
−$667/mes
por eliminación de 77 discos persistentes huérfanos
~$1.000/mes
ahorro por redimensionar 6 instancias de Redis
YALO lleva el comercio conversacional a escala: permite a grandes marcas vender e interactuar con sus clientes a través de aplicaciones de mensajería como WhatsApp, apoyándose en un ecosistema intensivo de microservicios sobre Kubernetes (GKE), bases de datos CloudSQL y Redis, eventos en Kafka y observabilidad con Datadog. Operar a ese volumen tiene un costo, y YALO buscó a Craftech para optimizarlo con disciplina FinOps, sin poner en riesgo la estabilidad de su plataforma.
Solución implementada
- Ejecutó un assessment de infraestructura y un plan integral de FinOps sobre GCP sin comprometer la estabilidad
- Hizo un rightsizing vertical conservador de más de 120 servicios en lotes progresivos, ajustando requests/limits al uso real y habilitando autoescalado (HPA)
- Redimensionó in-place las instancias de Memorystore (Redis) y CloudSQL tras analizar hit ratio, conexiones y picos históricos
- Contuvo el costo de Datadog sin tocar el código: Metrics without Limits, percentiles innecesarios desactivados y Exclusion Filters para descartar logs de debug y health-checks
- Eliminó de forma segura 77 discos persistentes huérfanos
- Implementó KEDA para escalado por eventos basado en el lag de Kafka e inició nodepools mixtos con instancias Spot y On-Demand
- Definió un estándar de etiquetado (service, cost-center, customer, tier) para los pipelines de IaC en Pulumi
Desafío de negocio
El diagnóstico inicial mostró un cluster productivo masivo de ~157 nodos en GCP con una eficiencia de CPU cercana al 10%, fruto de un sobreaprovisionamiento generalizado. A eso se sumaban sobrecostos críticos en Datadog —un exceso proyectado de ~$3.500 USD mensuales— por métricas custom de altísima cardinalidad (117 veces por encima del límite del plan) y por indexar logs de infraestructura y debug sin valor. Las bases de datos repetían el patrón: instancias de CloudSQL y Memorystore pagando capacidades enormes (por ejemplo 16 vCPUs y 72 GB de RAM) con consumos reales históricos por debajo del 15%. Y, sin un esquema de etiquetado, era imposible cortar y analizar los costos por cliente o por servicio.
Solución
El equipo de Craftech ejecutó un plan integral de FinOps con un principio rector: recortar sin comprometer la estabilidad. Dividió el ecosistema de más de 120 servicios en lotes progresivos para un rightsizing vertical conservador, ajustando requests y limits de CPU/RAM al uso real y habilitando autoescalado horizontal (HPA), apoyándose en scripts en Python para auditar la subutilización de nodos. Redimensionó in-place las instancias de Memorystore y CloudSQL tras analizar hit ratio, conexiones y picos históricos. Para contener Datadog sin tocar el código, aplicó Metrics without Limits, desactivó percentiles innecesarios y creó Exclusion Filters que descartan logs de debug y health-checks. Eliminó de forma segura decenas de discos persistentes huérfanos, implementó KEDA para escalar por eventos según el lag de Kafka, inició la organización de nodepools mixtos con instancias Spot y On-Demand, y definió un estándar de etiquetado (service, cost-center, customer, tier) para los pipelines de IaC en Pulumi.
Resultados
- ~$2.850 USD/mes de ahorro efectivo confirmado, con proyección estructurada de hasta ~$10.000 USD/mes
- Cluster GKE reducido de ~165 a ~140 nodos activos (mínimos de 134) mediante rightsizing
- −$667 USD/mes inmediatos por eliminar 77 discos persistentes inactivos
- ~$1.000 USD/mes de ahorro por redimensionar 6 instancias de Redis y $700 USD/mes por una intervención en el CloudSQL principal
- Costos de Datadog contenidos sin tocar el código de la aplicación
- Esquema de etiquetado que habilita analizar costos por cliente y por servicio
Trabajar con Craftech
El trabajo con YALO combinó rigor técnico y prudencia operativa: cada intervención se hizo de forma progresiva y medida, validando el impacto antes de avanzar al siguiente lote, para que la reducción de costos nunca pusiera en riesgo la estabilidad de una plataforma en producción. Más allá del ahorro inmediato, Craftech dejó instaladas prácticas de FinOps —rightsizing, etiquetado y escalado por eventos— y una proyección clara de ahorro para los próximos meses.
Tecnologías utilizadas
El trabajo se ejecutó sobre Google Kubernetes Engine (GKE), con rightsizing y autoescalado horizontal (HPA) de los microservicios y KEDA para el escalado por eventos basado en el lag de Kafka. Las bases de datos optimizadas fueron CloudSQL y Memorystore (Redis), y la observabilidad —y su costo— se gestionó sobre Datadog. La infraestructura como código se mantuvo en Pulumi, con un estándar de etiquetado para el análisis de costos, y se incorporaron instancias Spot de GCP en nodepools mixtos.
Stack & tecnologías
¿Tu equipo enfrenta un desafío parecido?
Pedí un assessment gratuito de costos y arquitectura en AWS.