$ git log --grep="incidents"
Incidentes
Cosas que se rompieron, y lo que enseñaron.
6 posts
- 5 min de lectura
Tu presupuesto de reintentos dura más que la paciencia de tus usuarios
Un panel interno fallaba de forma intermitente. Cinco causas plausibles medidas y descartadas, una trampa de medición creada por mí mismo, y una base de datos ociosa 180 horas de 182.
- 3 min de lectura
¿Quién vigila al chequeo externo?
Un lector preguntó cómo se mantienen confiables los chequeos externos con el tiempo. La respuesta honesta es: en parte. Lo que existe, una corrección al post anterior, y la brecha que encontró la pregunta.
- 5 min de lectura
El arreglo tumbó producción por tres días
En agosto escribí sobre un webhook que dejaba arrancar servicios rotos, y lo arreglé. La semana pasada ese arreglo se negó a admitir su propio reemplazo. No hay una configuración correcta, solo una elección de falla y una cuenta que viene con ella.
- 3 min de lectura
Tu alerta se cerró sola
Siete alertas se dispararon cuando producción dejó de funcionar. Dos horas y cuarenta y cinco minutos después, el monitoreo anunció que la telemetría estaba restaurada. Nada estaba restaurado.
- 7 min de lectura
Lo que hace falta para operar la puerta de un evento real
Feria Arequipa le confió a mi plataforma el control de acceso: gente real, puertas reales, sin segundas oportunidades. Los números, el viernes en que se rompió durante el evento, y las otras tres cosas que salieron mal.
- 5 min de lectura
49 microservicios, una falla invisible: cuando “Running” no significa que funciona
El side project sobre-ingenieriado ahora es una plataforma de 49 servicios corriendo eventos en vivo. Un incidente de viernes por la noche donde todo estaba en verde y nada funcionaba — y la lección de una línea que dejó.