Prometheus: Prometheusアラートの紹介

このドキュメントはアラートガイドの一部です。完全なガイドはこちらからご覧いただけます:Prometheusアラートの仕組みと設定方法

👋 Stackheroドキュメントへようこそ!

Stackheroは、信頼性とシンプルさを重視したフルマネージドのPrometheusクラウドプラットフォームを提供しています:

  • Alert Managerが標準搭載されており、SlackMattermostPagerDutyなどの主要なサービスへ直接アラートをルーティングできます。
  • 専用のメールサーバーにより、追加設定なしで無制限のメールアラートを送信可能です。
  • Blackboxが含まれており、HTTPICMPTCPなど様々なプロトコルの監視が可能です。
  • オンライン設定ファイルエディタでインスタンスを迅速に設定できます。YAMLを手動で管理する必要はありません。
  • ワンクリックでアップデートを適用可能。Stackheroがアップグレードプロセスを自動で管理し、ダウンタイムや手動作業を最小限に抑えます。
  • 専用のプライベートインフラストラクチャによる高いパフォーマンスと強固なセキュリティを実現しています。

約5分で導入完了。Stackheroがセットアップを担当するため、運用ではなく監視に集中できます。PrometheusクラウドホスティングをStackheroでぜひお試しください。監視・アラート運用を効率化します。

Prometheusは、定義したルールに基づいてメトリクスを分析し、アラートをトリガーできます。Stackhero for Prometheusでは、アラートは2段階で処理されます。まず、Prometheusのアラートルールが評価され、その後Alert Managerが引き継ぎます。

すべてがStackhero for Prometheusで事前にインストールおよび設定されているため、メールアドレスを追加するなどの最小限の設定を行うだけで、アラートを受信し始めることができます。

Stackhero for Prometheusの全体像Stackhero for Prometheusの全体像

Prometheusがメトリクスを取得すると、rules-alert.ymlファイルに指定されたルールに基づいて評価されます。これらのアラートルールは、収集されたメトリクスに基づいてアラートをトリガーするためのしきい値と時間枠を定義します。

例えば、ディスク使用率が80%を超えた場合にアラートがトリガーされることがあります。さらに、将来の状況を予測し、24時間以内にディスクスペースが完全に埋まると推定される場合にアラートを送信するようにルールを設定できます。

もう一つの一般的な使用例は、異常な動作を検出することです。例えば、ネットワーク帯域幅の使用が急増した場合、分散型サービス拒否(DDoS)攻撃やデータ流出の試みを検出するためにアラートがトリガーされることがあります。

Prometheusのアラートルールは、直接Prometheusサーバーに含まれています。

Alert Managerは、Prometheusのアラートルールによってトリガーされたアラートを受信します。アラートを重複排除し、グループ化し、メール、Slack、Mattermost、PagerDutyなどのさまざまな通知チャネルを通じて転送します。設定ファイルはalert-manager.ymlです。

例えば、サーバーの遅延が発生した場合、Prometheusのアラートルールは負荷増加とCPU使用率のために個別のアラートをトリガーするかもしれません。Alert Managerはこれらのアラートを受信し、同じサーバーに関連するためグループ化し、設定に基づいて適切な受信者またはチームに統合された通知を送信します。

遅延が続く場合、Prometheusはアラートを送り続けますが、Alert Managerは指定された期間、重複するメッセージを抑制し、チームに冗長なアラートを送信しないようにします。

必要に応じてアラートをサイレンスまたは完全に抑制することもできます。根本的な問題が解決されると、復旧メッセージが送信され、チームに通知されます。

この例は一般的なシナリオを示していますが、特定の要件に合わせて設定を完全にカスタマイズできます。

警告 Alert Managerは、デフォルトではPrometheusに含まれていません。 時間を節約し、プロセスを簡素化するために、Stackhero for PrometheusAlert Managerを統合および設定しましたので、最小限の労力で数分でアラートを送信できます。