Disponibilité (uptime)
Définition
La disponibilité, souvent exprimée en pourcentage et désignée par le terme anglais uptime, mesure la proportion du temps pendant laquelle une machine ou un service répond correctement, sur une période de référence (généralement le mois). Elle se calcule comme :
disponibilité (%) = (temps total − temps d'indisponibilité) / temps total × 100
Pourquoi les derniers pourcentages comptent énormément
La disponibilité est un indicateur trompeur si on ne regarde que le chiffre entier : la différence entre 99 % et 99,9 % semble faible, mais elle représente presque 7 heures d'indisponibilité en moins sur un mois. C'est pourquoi les engagements de service (SLA), en particulier ceux d'un MSP envers ses clients, s'expriment souvent avec plusieurs décimales — 99,9 %, 99,95 %, 99,99 % — chaque palier correspondant à une tolérance d'indisponibilité très différente.
Comment la disponibilité est mesurée en pratique
En supervision, la disponibilité est généralement déduite de l'état d'un agent ou d'une sonde réseau (le serveur répond-il aux requêtes, l'agent envoie-t-il des données récentes ?). Une période sans données remontées par l'agent est comptée comme une indisponibilité, ce qui rend la fiabilité de la collecte elle-même importante pour ne pas fausser le calcul.
À ne pas confondre avec
- La performance : un serveur peut être disponible (il répond) tout en étant lent ou sous forte charge. La disponibilité et la performance sont deux axes distincts, tous deux couverts par un dashboard ou un rapport de supervision complet.
- Un seuil d'alerte : la disponibilité est un indicateur calculé a posteriori sur une période ; le seuil d'alerte porte sur une métrique instantanée qui, elle, peut déclencher un trigger en temps réel.