L’astreinte est le fait qu’une personne puisse intervenir en dehors des heures de bureau si le site tombe. Elle n’a de sens que si l’alerte est rare, claire, et réservée aux pannes qui ne peuvent pas attendre le matin. Une astreinte qui sonne pour chaque 404 forme des gens qui n’écoutent plus.
Ce n’est pas un outil. C’est un tour de rôle, un seuil, et une consigne courte. Les messages eux-mêmes arrivent par e-mail ou par un canal d’équipe. Le canal doit déjà être crédible, comme décrit pour les alertes Slack.
Ce qui réveille, et ce qui attend
Écrivez deux listes. Sans elles, chaque alerte devient « au cas où ».
| Situation | La nuit | Le lendemain matin |
|---|---|---|
| Accueil, paiement ou connexion injoignables | Oui, si le site vend ou prend des rendez-vous | — |
| Toute la production en 5xx | Oui | — |
| Un article en 404 | Non | Oui, s’il est encore lié |
| Certificat qui expire dans 20 jours | Non | Oui, dans la semaine |
| Alerte isolée revenue toute seule | Non | Lecture du journal, sans course |
Si personne ne vend la nuit et que le site est une vitrine, la première colonne peut être vide. Dites-le. Une astreinte « parce qu’il faut un numéro » sans critère épuise l’équipe pour des incidents que vous aviez décidé de tolérer jusqu’au matin.
L’alerte qui réveille a déjà été confirmée par l’outil : plusieurs échecs, pas un seul timeout. Le message dit l’URL, le code et l’heure. La personne d’astreinte ne doit pas deviner lequel des quinze sites est concerné. Le monitoring SiteGarde, ou l’outil que vous utilisez, ne sert ici que s’il respecte ce seuil. Une sonde bavarde transforme l’astreinte en nuisance, et la nuisance finit en téléphone coupé.
Un titulaire, un remplaçant, une rotation
Nommez la personne d’astreinte de la période, et le remplaçant si elle ne répond pas. Écrivez les dates. « L’équipe technique » n’est pas joignable. Un numéro personnel privé, si la personne quitte l’entreprise, non plus.
La rotation doit être tenable. Une semaine sur deux, à deux, épuise. Une nuit permanente pour la même personne aussi. Adaptez la période à la taille réelle de l’équipe. S’il n’y a qu’une personne capable d’ouvrir l’hébergement, l’astreinte de nuit n’est pas un processus : c’est un risque. La décision honnête est alors de réduire ce qui peut tomber la nuit (moins de déploiements le vendredi, pages critiques simples) ou d’avoir un hébergeur joignable, pas de faire semblant qu’un tour de rôle existe.
En France, l’astreinte est encadrée par le Code du travail. Elle se compense, dans des conditions fixées par accord ou par l’employeur, et le temps où la personne intervient réellement est du temps de travail effectif. Le rythme, la compensation et le repos ne se improvisent pas dans un canal Slack. Faites-les valider avant d’annoncer le planning. Ce paragraphe ne suffit pas à rédiger le dispositif.
Pendant les congés du titulaire, le planning change avant le départ, pas au premier incident. Le remplaçant a les accès (hébergement, DNS, outil d’alerte) testés un jour ouvré. Un accès qu’on n’a jamais ouvert échoue à 23 h, souvent sur une double authentification dont le téléphone est resté au bureau.
Une consigne d’une page
La consigne tient sur une page, pas dans un dossier de procédures.
- Lire l’URL et le code dans l’alerte.
- Vérifier que ce n’est pas une maintenance annoncée dans le journal des changements.
- Ouvrir l’hébergement et la page de statut du fournisseur.
- Si un déploiement a eu lieu dans l’heure, appliquer le retour arrière déjà écrit dans le journal.
- Si la cause est chez l’hébergeur, ouvrir leur incident et prévenir en interne.
- Écrire trois lignes le lendemain : ce que c’était, ce qui a été fait, si la consigne doit changer.
La personne d’astreinte n’a pas à inventer une refonte à minuit. Si le retour arrière n’est pas documenté, la consigne dit qui appeler, pas « débrouille-toi dans le code ». Après deux incidents du même type, on corrige la cause dans la journée. L’astreinte absorbe l’exception. Elle ne remplace pas la correction, ni une surveillance qui alerte pour un rien.
