System status
Measured from three external regions, every 30 seconds. This page is served from a different provider than the product, so it stays up when we don't.
Ninety days, one bar per day. Hover any bar for that day's state.
Every incident gets a written post-mortem within five working days, whether or not anyone asked for one.
A credentials rotation on our side invalidated service-account tokens for BigQuery connections created before March. Syncs queued rather than failed, and all data landed once tokens were reissued. No events were lost and no other source was affected.
ResolvedA rebalance after adding two storage nodes caused p95 query times to reach 9 seconds for about forty minutes. Ingest and alerting were unaffected. We now cap rebalance throughput and run it outside the 07:00–19:00 window.
ResolvedAn expired Slack app token stopped alert delivery for 25 minutes. Alerts were queued and delivered in full afterwards, with their original timestamps. Token expiry now pages us seven days ahead.
ResolvedA bad deploy reached 12% of API pods before automatic canary analysis rolled it back. Ingest clients retried transparently; read endpoints returned 503 for six minutes.