ポストモーテム

SRE実務プラクティス

インシデント対応フローの設計|検知から復旧・振り返りまでSRE流に解説

本番環境で障害が起きたとき、「誰が何をすべきか」が曖昧なまま動いていませんか。 アラートが飛んでくる。Slackが騒ぎ始める。でも初動で5分・10分と時間を無駄にし、気づいたら「誰かが対応してると思ってた」という状況——これはフローが設計さ...
SRE実務プラクティス

ポストモーテムの書き方完全ガイド|blameless文化を現場に根付かせる5つのポイント

障害が起きるたびに「誰が悪かったのか」を探す振り返りになっていませんか。 同じような障害が何度も繰り返される。振り返り会議が「責任の押し付け合い」になってエンジニアが発言しなくなる。形式的にドキュメントは書くが、アクションアイテムが誰も実行...