IT用語: SRE(サイト信頼性エンジニアリング)とは|Googleが考案した運用手法
ソフトウェアエンジニアリングの手法で運用を改善するSREの概念とSLI・SLO・SLAの関係を解説。
SRE(Site Reliability Engineering)とは
SREはGoogleが考案した、ソフトウェアエンジニアリングの手法で運用の問題を解決するアプローチです。「信頼性を保ちながらいかに速くリリースするか」のバランスをエンジニアリングで最適化します。
重要な指標
| 用語 | 意味 |
|---|---|
| SLI(Service Level Indicator) | 実際の信頼性を示す指標(例: 99.5%の可用性) |
| SLO(Service Level Objective) | 目標値(例: 可用性99.9%を目指す) |
| SLA(Service Level Agreement) | ユーザーとの契約(例: 99.5%未満なら返金) |
エラーバジェットとは
SLOとSLAの差分が「使える障害の余裕(エラーバジェット)」です。例えばSLO 99.9%なら月約43分の障害は許容範囲。バジェットが残っている間は積極的にリリースし、使い切ったら安定化を優先するという判断軸になります。
DevOpsとSREの違い
DevOpsが文化・哲学的な概念であるのに対し、SREはGoogleにおけるDevOpsの具体的実装形態です。「開発者と運用者の協力」を達成するための方法論の一つです。
関連する用語 (DevOps)
全58件を見るECS
Amazon Elastic Container Serviceの略。AWSが提供するフルマネージドのコンテナオーケストレーションサービス。FargateとEC2の2つの起動タイプがあり、EC2を管理せずにコンテナを実行できる。
IT用語: Terraformとは|インフラをコードで管理するIaCツール
AWSやGCPなどのクラウドリソースをコードで定義・管理するTerraformの仕組みとHCL構文を解説。
Lambda
AWSのサーバーレス関数実行サービス(Function as a Service)。コードをアップロードするだけで実行環境を自動管理し、実行時間のみの課金。イベントドリブンな処理やAPIバックエンドに多用される。
IT用語: カナリアリリースとは|一部ユーザーへ先行公開する安全なデプロイ手法
新バージョンを全ユーザーの5〜10%に先行公開し問題がなければ徐々に拡大するカナリアリリースの仕組みを解説。
Prometheus
オープンソースの監視・アラートツール。時系列データベースにメトリクスを収集し、PromQL(独自クエリ言語)で分析できる。Kubernetesとの親和性が高く、Grafanaと組み合わせて可視化するのが一般的。
IaC
Infrastructure as Code(コードとしてのインフラ)の略。インフラ構成をコードで記述・管理することで、自動化・バージョン管理・再現性を実現する考え方。TerraformやAnsibleが代表的ツール。