IT用語: カオスエンジニアリングとは|意図的に障害を起こして耐障害性を高める
本番環境に意図的な障害を注入しシステムの弱点を発見するカオスエンジニアリングの概念とChaos Monkeyを解説。
カオスエンジニアリングとは
カオスエンジニアリングは、本番環境または本番に近い環境に意図的な障害(サーバーシャットダウン・ネットワーク遮断・レイテンシ注入等)を起こし、システムがどう反応するかを観察する実験手法です。Netflixが開発した「Chaos Monkey」ツールが有名で、本番環境のサーバーをランダムに強制終了します。
なぜ本番で障害を起こすのか?
「ステージング環境でのテストをパスしたシステムが、本番では想定外の障害モードを示す」ことはよくあります。制御された条件で意図的に障害を発生させ、弱点を発見・修正することで、実際の障害に対する耐性を高めます。
「ゲームデー」とは
チーム全体で計画的に障害シナリオをシミュレートするイベントです。障害発生→検知→対応のプロセスを演習し、インシデント対応手順の改善と、チームの練度向上を図ります。AWSやGoogleも定期的に実施しています。
関連する用語 (DevOps)
全58件を見るAPIゲートウェイ
クライアントと複数のバックエンドサービスの間に立つ単一の入口(エントリポイント)。認証・レート制限・ルーティング・ロギング・キャッシュを一元管理し、APIの公開・保護・管理を行う。
コンテナレジストリ
Dockerコンテナイメージを保存・管理・配布するリポジトリサービス。Docker Hub・GitHub Container Registry・Amazon ECR・GCR・ACRなどがあり、CI/CDパイプラインの中核を担う。
Fluentd
オープンソースのデータ収集・転送ツール(ログアグリゲーター)。各種ソースからログを収集し、Elasticsearch・S3・Splunkへ転送できる。プラグインが豊富でログ基盤構築に広く使われる。
IT用語: ブルー/グリーンデプロイとは|ダウンタイムゼロのリリース手法
本番環境(Blue)と新バージョン環境(Green)を並列稼働させ、瞬時に切り替えるブルー/グリーンデプロイの仕組みを解説。
SRE
Site Reliability Engineering(サイト信頼性エンジニアリング)の略。Googleが提唱した、ソフトウェアエンジニアリングの手法を運用・インフラに適用するアプローチ。SLO・エラーバジェット・トイルの削減が核心概念。
Helm
KubernetesのパッケージマネージャーAptやyumのK8s版。Helmチャートと呼ばれるテンプレートで複雑なK8sリソースを一括管理・デプロイできる。バージョン管理やロールバックも容易。