Prometheus: Configuration des règles d'alerte Prometheus

Cette documentation fait partie du guide Alertes. Consultez le guide complet ici : Fonctionnement des alertes Prometheus et configuration.

👋 Bienvenue sur la documentation de Stackhero !

Stackhero propose une plateforme Prometheus cloud entièrement managée, pensée pour la fiabilité et la simplicité :

  • Alert Manager est intégré, ce qui vous permet d'envoyer vos alertes directement vers Slack, Mattermost, PagerDuty et d'autres destinations populaires.
  • Un serveur d'e-mail dédié vous permet d'envoyer un nombre illimité d'alertes par e-mail sans configuration supplémentaire.
  • Blackbox est inclus, pour sonder les protocoles HTTP, ICMP, TCP et bien d'autres, afin d'assurer une supervision complète.
  • Configurez rapidement votre instance grâce à l'éditeur de fichier de configuration en ligne. Il n'est pas nécessaire de gérer le YAML manuellement.
  • Appliquez les mises à jour en un clic. Stackhero s'occupe du processus de mise à niveau pour vous, en limitant les interruptions et les interventions manuelles.
  • Performances élevées et sécurité renforcée sont intégrées, grâce à votre propre infrastructure privée et dédiée.

Soyez opérationnel en environ 5 minutes. Stackhero prend en charge l'installation pour que vous puissiez vous concentrer sur la supervision, pas sur la maintenance. Essayez l'hébergement Prometheus cloud sur Stackhero pour simplifier vos workflows de monitoring et d'alerting.

Vous pouvez ajuster les règles d'alerte Prometheus en modifiant le fichier rules-alert.yml. Pour cela, accédez à votre tableau de bord Stackhero, sélectionnez votre service Prometheus, puis cliquez sur "Configuration des règles d'alerte Prometheus".

Nous avons déjà ajouté des règles d'alerte par défaut à votre instance Stackhero for Prometheus, vous n'aurez donc généralement pas besoin de modifier le fichier rules-alert.yml sauf si vous souhaitez personnaliser la configuration.

Voici un exemple d'alerte qui se déclenche si l'utilisation du disque dépasse 90 % :

- alert: "HostOutOfDiskSpace"
  expr: (node_filesystem_avail_bytes * 100) / node_filesystem_size_bytes < 10 and ON (instance, device, mountpoint) node_filesystem_readonly == 0
  for: 2m
  labels:
    severity: "warning"
  annotations:
    summary: "Host out of disk space (instance {{ $labels.instance }})"
    description: "Disk is almost full (< 10% left)"
    value: "{{ $value }}"

Voici un autre exemple qui anticipe une saturation de l'espace disque dans les 24 prochaines heures :

- alert: "HostDiskWillFillIn24Hours"
  expr: (node_filesystem_avail_bytes * 100) / node_filesystem_size_bytes < 10 and ON (instance, device, mountpoint) predict_linear(node_filesystem_avail_bytes{fstype!~"tmpfs"}[1h], 24 * 3600) < 0 and ON (instance, device, mountpoint) node_filesystem_readonly == 0
  for: 2m
  labels:
    severity: "warning"
  annotations:
    summary: "Host disk will fill in 24 hours (instance {{ $labels.instance }})"
    description: "Filesystem is predicted to run out of space within the next 24 hours at the current write rate"
    value: "{{ $value }}"

Vous trouverez de nombreux autres exemples de règles d'alerte sur le site Awesome Prometheus Alerts.