Prometheus: Configuration des règles d'alerte Prometheus

Cette documentation fait partie du guide Alertes. Consultez le guide complet ici : Comment fonctionnent les alertes Prometheus et comment les configurer.

👋 Bienvenue dans la documentation Stackhero !

Stackhero vous propose une plateforme Prometheus cloud entièrement gérée, conçue pour la fiabilité et la simplicité :

  • Alert Manager est intégré, ce qui vous permet d’acheminer les alertes directement vers Slack, Mattermost, PagerDuty et d’autres destinations populaires.
  • Un serveur email dédié vous permet d’envoyer un nombre illimité d’alertes par email sans configuration supplémentaire.
  • Blackbox est inclus, vous permettant de sonder les protocoles HTTP, ICMP, TCP et autres pour une surveillance complète.
  • Configurez votre instance rapidement grâce à l’éditeur de fichier de configuration en ligne. Plus besoin de gérer le YAML manuellement.
  • Appliquez les mises à jour en un seul clic. Stackhero s’occupe du processus de mise à niveau pour vous, réduisant ainsi les interruptions et les interventions manuelles.
  • Performance élevée et sécurité renforcée sont incluses grâce à votre propre infrastructure privée et dédiée.

Mettez votre instance en service en environ 5 minutes. Stackhero s’occupe de l’installation pour que vous puissiez vous concentrer sur la surveillance, pas sur la maintenance. Essayez l’hébergement Prometheus cloud sur Stackhero pour simplifier vos flux de travail de monitoring et d’alerting.

Vous pouvez ajuster les règles d'alerte Prometheus en modifiant le fichier rules-alert.yml. Pour ce faire, accédez à votre tableau de bord Stackhero, sélectionnez votre service Prometheus, et cliquez sur "Configuration des règles d'alerte Prometheus".

Nous avons déjà ajouté quelques règles d'alerte par défaut à votre instance Stackhero pour Prometheus, vous n'aurez donc généralement pas besoin de modifier le fichier rules-alert.yml sauf si une personnalisation est requise.

Voici un exemple d'alerte qui se déclenche si l'utilisation du disque dépasse 90 % :

- alert: "HostOutOfDiskSpace"
  expr: (node_filesystem_avail_bytes * 100) / node_filesystem_size_bytes < 10 and ON (instance, device, mountpoint) node_filesystem_readonly == 0
  for: 2m
  labels:
    severity: "warning"
  annotations:
    summary: "Host out of disk space (instance {{ $labels.instance }})"
    description: "Disk is almost full (< 10% left)"
    value: "{{ $value }}"

Voici un autre exemple qui prédit une saturation potentielle de l'espace disque dans les 24 heures suivantes :

- alert: "HostDiskWillFillIn24Hours"
  expr: (node_filesystem_avail_bytes * 100) / node_filesystem_size_bytes < 10 and ON (instance, device, mountpoint) predict_linear(node_filesystem_avail_bytes{fstype!~"tmpfs"}[1h], 24 * 3600) < 0 and ON (instance, device, mountpoint) node_filesystem_readonly == 0
  for: 2m
  labels:
    severity: "warning"
  annotations:
    summary: "Host disk will fill in 24 hours (instance {{ $labels.instance }})"
    description: "Filesystem is predicted to run out of space within the next 24 hours at the current write rate"
    value: "{{ $value }}"

Vous pouvez trouver de nombreux exemples supplémentaires de règles d'alerte sur le site Awesome Prometheus Alerts.