Ajuster les seuils

Dans cette section, vous apprendrez à diagnostiquer une métrique signalée avec le mauvais statut, et à l’ajuster.

Lisez d’abord les valeurs appliquées

Les pastilles de seuil affichées en haut des panneaux de rapport système et processus montrent toujours les valeurs réellement appliquées à cette métrique, qu’elles proviennent d’un réglage fixe ou d’une référence calculée. Comparer ces pastilles au graphique situé en dessous répond à lui seul à la plupart des questions.

Un symbole d’infini dans une pastille signifie que le seuil n’est pas configuré et que ce niveau ne peut jamais être signalé. Voir Fonctionnement des seuils pour les détails.

Le triangle d’avertissement sur une pastille

Un petit ⚠ ambre à côté d’une pastille de seuil signifie que l’auto-seuil est activé pour cette métrique mais qu’aucune référence n’est disponible : les valeurs fixes affichées sont donc celles réellement appliquées. Le survol l’indique explicitement.

C’est le seul cas où le rapport pourrait autrement vous induire en erreur : avec l’auto-seuil activé, vous attendez une valeur apprise, et la pastille montre le repli. Cela se produit quand :

  • l’agent vient d’être enregistré et le calcul nocturne n’a pas encore eu lieu ;
  • l’auto-seuil a été activé pour cette métrique depuis le dernier calcul ;
  • la métrique compte moins de 30 échantillons dans la fenêtre d’historique ;
  • la métrique ne varie jamais, et aucune référence ne peut en être dérivée.

Le badge n’apparaît pas pour les métriques dont l’auto-seuil est simplement désactivé : les valeurs fixes y sont un choix délibéré, pas une surprise. Si le badge persiste sur une métrique qui collecte depuis un certain temps, voir quand aucune référence n’est produite.

Note :

Si les valeurs fixes de repli sont vides, une métrique badgée est de fait non surveillée : elle reste OK quelle que soit sa valeur tant qu’aucune référence n’existe. C’est pourquoi conserver des valeurs fixes raisonnables à côté de l’auto-seuil en vaut la peine.

Tout est signalé critique ou majeur

Un composant sain dont toutes les métriques sont colorées est presque toujours une mauvaise unité ou une valeur fixe obsolète.

  1. Ouvrez le panneau de rapport et lisez les pastilles de seuil de la métrique concernée
  2. Comparez les valeurs des pastilles à l’unité de la métrique dans le tableau des unités
  3. Si le seuil est bien en dessous de la valeur normale de fonctionnement, c’est une valeur fixe saisie dans la mauvaise unité

Le cas classique est la mémoire d’un processus : des seuils de 1 et 3 sont des mégaoctets, donc tout processus de l’hôte les franchit. Vider ces champs et laisser l’auto-seuil apprendre la plage normale de chaque processus résout le problème.

Une métrique passe au jaune dès que l’hôte fait quoi que ce soit

Un seuil mineur très proche de zéro, comme 0.01 sur le cpu système, signale mineur pour la moindre activité. Relevez le seuil mineur à une valeur reflétant un usage réellement élevé, en gardant mineur < majeur < critique.

Rien ne déclenche jamais

Vérifiez, dans l’ordre :

  1. Les trois seuils sont-ils vides ? Une métrique non configurée reste toujours OK
  2. L’interrupteur de surveillance de la métrique est-il activé sur l’agent ?
  3. Si l’auto-seuil est activé, une référence a-t-elle déjà été produite ? Une métrique avec trop peu d’échantillons ou sans variation conserve ses valeurs fixes, et si celles-ci sont vides elle reste OK

Les seuils semblent bien trop serrés après leur calcul

Une référence calculée peu après l’enregistrement d’un agent ne décrit que les quelques minutes d’historique disponibles à cet instant. Laissez l’agent collecter sur une période représentative, idéalement une journée de travail complète, puis relancez l’action compute threshold, ou attendez simplement l’exécution nocturne pour la remplacer.

Les alertes se déclenchent sur des pics brefs

Pour le trafic d’un processus, augmentez la fenêtre de moyennage afin que davantage d’échantillons consécutifs soient moyennés avant la comparaison. Une fenêtre plus large réagit plus lentement mais ignore les pics isolés.

Pour les autres métriques, élargissez l’écart entre la référence et l’alerte en augmentant les facteurs d’écart-type, ou passez à une fenêtre d’historique plus longue afin d’inclure la variation quotidienne normale dans la référence.

Changer la fenêtre d’historique

Modifier l’auto threshold range ne réécrit pas de lui-même les références existantes. La nouvelle fenêtre s’applique à la prochaine exécution nocturne, ou immédiatement si vous déclenchez l’action compute threshold.

Note :

Élargir la fenêtre d’historique n’aide que si l’agent collecte effectivement depuis aussi longtemps. Choisir une fenêtre de 8 semaines sur un agent installé il y a trois jours produit une référence bâtie sur trois jours de données.

Voir aussi

Traductions