Reliability and Operations

Availability, failover, observability, incidents, and production readiness.

Lessons

  1. SLIs, SLOs, and Error Budgets — Measure Reliability Like a Product
  2. CI/CD & Developer Experience
  3. Noisy Neighbor in Multi-Tenant Systems
  4. The N+1 Query Problem
  5. Availability — Nines, Error Budgets, and Redundancy
  6. Distributed Locking & Lease Expiry — Mutual Exclusion and Fencing Tokens
  7. Out-of-Order Event Processing
  8. Checksums & Data Integrity
  9. Production-Readiness Reviews (PRRs)
  10. Tail Latency and Load Shedding — Surviving Peak Traffic Overload
  11. Watermarks & Late Events in Stream Processing
  12. Circuit Breakers and Cascading Failure Control — Stop One Fire From Burning the Block
  13. Disaster Recovery — RPO, RTO, and Backups That Work
  14. Distributed Tracing
  15. Duplicate Requests & the Idempotency Gap
  16. Failover — Switching to a Healthy Spare
  17. Fault Tolerance — Keep Working When Parts Fail
  18. Heartbeats — Liveness Signals in Distributed Systems
  19. Reliability — Correct Results Under Stress
  20. Retry Storms — When Recovery Makes the Outage Worse
  21. Single Point of Failure (SPOF) — Identifying and Eliminating SPOFs
  22. TCP vs UDP — Reliable Streams vs Lightweight Datagrams
  23. Thundering Herd
  24. Webhooks — Server-to-Server Event Callbacks
  25. Zero-Downtime Schema Migration
  26. Capacity Planning for Backend Services

Back to library · Pillar paths

Shubham Jain · Learning Lab