
こんにちは! 今期よりクラウド基盤チームの担当マネージャーになったTKです。 今期のチーム再編についてはこちらの記事をご覧ください。
今回は、チーム再編して数カ月でぶち当たった大規模障害と、その経験を経て大切だと感じたことを記事にしてみました。
障害の概要
今期、クラウドサービスの認証系に障害が発生しました。原因はWebサーバーのセキュリティアップデートにより、クライアント側の認証情報の形式が受け入れられなくなったというものです。 当然お客様はシステムにログインできず、多大なご迷惑をおかけしました。 問題発生したのが金曜日だったため、お客様の稼働する月曜日までの復旧を目指して、チーム一丸となって対応に当たりました。
対応する上で心がけたこと
体制を整える
障害が発生すると、各部署から一気に問い合わせが来ます。製品に一番詳しいエンジニアが問い合わせ対応に当たると、原因箇所の調査に手が回らず、それだけ障害復旧が遅れます。 とは言え、外部への迅速な連絡は、お客様の信頼をこれ以上失わないために急務です。
- 障害箇所の特定・復旧を担当する人
- 状況を確認して外部への連絡窓口になる人
初動でこの2つを分けることで、最速での復旧を目指しました。 原因箇所が判明してからは、より多くの人に役割分担していただきました。
- 技術的な原因調査と修正:スペシャリストに依頼
- 社内からの問い合わせ対応・情報発信:私が担当
- 外部へのお知らせ・お詫び:私が原案作成し、カスタマーサポートや広報の部署でレビュー・配信
- 関連製品のリリース:部長が取りまとめ、各製品とリリース担当者が実施
今書き出してみても、かなり多くの方々の力を借りて対応を完了することができました。 短い時間で復旧を成し遂げるためには、「自分が担当すべきこと」と「他の人がやった方が早いこと」を分け、それぞれの作業に集中するのが重要でした。
使えるものは何でも使え
前述のチーム編成により、私はチーム移動してきたばかりで、製品に一番詳しい人間ではありませんでした。 そのため、事の重大さにすぐに自分の手には負えないことを判断し、詳しいエンジニアにヘルプを求めました。また、早い段階でAzureのサポート窓口にも問い合わせを投げました。
トラブルが起きた時、ついつい自分で何とかしようと思ってしまいますが、ヘルプを求めることに躊躇してはいけません。
一刻も早い復旧を目指すなら、どんどん周りを巻き込みましょう。
腹を括る
障害が発生すると大きなストレスがかかります。 自分が実装したものでなければ人のせいにしたくもなります。 ただ、いくら考えても起きてしまった現実は変わりません。大事なのは、お客様にとって不利益が起きている状況を、いかに早くリカバリーするかです。
実際、大きなトラブルが起きればそれなりに凹みます。そんな時に、ヘルプに来てくれた方々が大きな心の支えになりました。
まとめ
困難な状況では、完璧な判断を目指すのではなく、目の前の問題にどう向き合うかが大事です。
早くヘルプ依頼を出す: 躊躇せずに専門家を頼ること
自分の役割に集中する: 完璧さより、チーム全体でリカバリーを優先する
腹を括る: 後悔するのではなく「起きてしまったことに全力で向き合う」という姿勢
この障害対応は、自分1人では乗り越えられない大きなものでした。 休日にも関わらず、部内外の方々にサポートいただき対応を終えることができました。 何かあれば支援してくれる人がいる、というのもKENTEMの大きな強みだと感じています。
おわりに
KENTEMでは、様々な拠点でエンジニアを大募集しています! 建設×ITにご興味頂いた方は、是非下記のリンクからご応募ください。 recruit.kentem.jp career.kentem.jp