Observabilidad El deploy no es la línea de llegada. Es donde el sistema empieza a ser exigido.
Desde la entrada en producción, el sistema deja de ser promesa y pasa a medirse: disponibilidad, error, tiempo de respuesta, costo de IA por consulta. Cuando algo se sale de lo normal, intenta recuperarse solo, y cuando no puede hacerlo con seguridad, llama a una persona.
Toda entrega de Steply sube instrumentada: el monitoreo nunca es etapa aparte ni ítem opcional en la propuesta.
Lo que pasa entre la alerta y el arreglo.
Cinco pasos, y el humano aparece en el cuarto: nunca antes, para no volverse guardia de madrugada; nunca después, para que ningún cambio de comportamiento entre en producción sin que alguien responda por él.
El ciclo, en orden
Medir
El sistema publica sus propias señales desde la primera etapa: disponibilidad, latencia, tasa de error, cola, costo de IA por consulta. Sin eso, "todo está bien" es opinión de quien construyó.
Detectar el desvío
El límite no es un número redondo elegido al azar: es el comportamiento normal de ese sistema, aprendido en las primeras semanas. Una cola creciendo fuera de hora dispara igual que un error, muchas veces antes.
Aislar y reintentar
Buena parte de las fallas de producción son temporales: la API del socio cayó 40 segundos, la base se trabó en una cola. El sistema espera, reintenta con intervalo creciente y apaga el camino roto antes de tumbar el resto.
Proponer y revisar
Cuando reintentar no resuelve, el sistema no decide por su cuenta: describe lo que vio, apunta la causa probable y sugiere el ajuste. Alguien con nombre revisa y aprueba. Solo el rollback seguro corre sin espera: apagar lo que está causando el problema.
Volverse mejora con alcance
Si la causa es estructural y no un hipo, entra en la fila como etapa, con entregable, fecha y valor, como cualquier otra. Una corrección de emergencia que no se vuelve mejora escrita vuelve a pasar al mes siguiente.
El diseño detrás de la alerta que llega a tu canal
Este es el flujo de operación que Steply corre, no una ilustración de marketing. Entrada de eventos, validación, reintento con espera creciente, ruteo por severidad y envío por canal. Cada canal se recupera solo y todo termina en traza de auditoría. Usa el zoom: es denso a propósito.
- Flujo normal
- Automatización verificada
- Anomalía / alerta
- Recuperación y revisión humana
Lo que queda abierto para ti, y no solo para quien lo construyó.
El panel de cliente suele ser una versión resumida del panel real, con los números buenos y sin los incómodos. Aquí es el mismo panel, con las mismas alertas y el mismo histórico.
Las señales en tiempo real
Disponibilidad, tiempo de respuesta, tasa de error y costo de IA por consulta, con la serie histórica. No es un resumen mensual: es lo que mira nuestro equipo cuando suena la alerta.
El histórico de incidentes
Cada desvío detectado, qué intentó el sistema solo, qué necesitó una persona y cuánto tardó en normalizarse. Incluso los que nadie notó desde afuera, sobre todo esos.
El histórico de entregas
Qué etapa entró en producción, cuándo, qué cambió y si algún indicador se movió después. Es lo que permite ligar una entrega a un efecto, en vez de creer que funcionó.
Preguntas sobre operar después de la entrega.
¿El sistema toma decisiones solo en producción?
Solo las reversibles. Cuando algo se detecta, el sistema aísla, reintenta y, si no resuelve, describe la causa probable y sugiere el ajuste, pero quien aprueba es una persona. La única clase de acción que corre sin espera es el rollback seguro: pausar o revertir lo que está causando el problema, que siempre es deshacer, nunca crear comportamiento nuevo.
¿El monitoreo se cobra aparte después de la entrega?
No. Instrumentar es parte de la etapa: un sistema sin medición no cuenta como entregado, así que no existe una versión "sin monitoreo" más barata. Lo que tiene costo propio es la evolución: cada mejora entra como etapa, con alcance, fecha y valor, bajo la misma regla que cualquier otra.
¿Y si queremos operar esto con el equipo interno?
Es el diseño preferible cuando existe equipo interno. El panel, las alertas y las reglas de detección corren en tu entorno, con las llaves a tu nombre: Steply no es intermediaria de nada. Lo que suele quedar con nosotros es la evolución por etapa y la guardia en las partes que construimos, mientras tenga sentido.
¿Cuánto tiempo después de la entrega siguen acompañando?
Mientras el sistema esté en producción y el acompañamiento esté contratado, pero el punto es otro: incluso si Steply se va, el panel, las alertas y el histórico siguen, porque nunca estuvieron de nuestro lado. Un acompañamiento que solo existe mientras el proveedor está presente no es observabilidad, es dependencia.
¿Tu sistema actual avisa antes que el cliente?
Si la respuesta es "nos enteramos cuando alguien llama", ese es el primer cuello de botella, y casi siempre es más barato de resolver de lo que parece. El diagnóstico mide cuánto cuesta esa ceguera al año.