Tala Family Handbook

La résilience de l'infrastructure

Ce chapitre explique les mécanismes mis en place par les opérateur·ice·s pour rendre l'infrastructure résiliente à divers désastres.

Mécanismes

Les mécanismes expliqués sont listés par ordre de priorité à assurer.

Réplications des données

Snapshot régulières des données

Une snapshot est un enregistrement des différences de données entre deux points dans le temps.

Imaginons que vous êtes sur Immich, et que les 15 dernières minutes, vous avez ajouté des photos.

  • Alors une snapshot des 15 dernières minutes de vos données sur Immich contiendra exactement les informations d'ajout de ces photos.

Comme il s'agit d'enregistrer les différences, alors les snapshots enregistrent aussi les informations de suppression entre deux points dans le temps, ce qui les rend particulièrement utiles en cas de suppression accidentelle de donnéees.

Notre infrastructure effectue des snapshots toutes les 15 minutes de toutes vos données sensibles, ce qui permettrait, dans le cas où vous auriez accidentellement supprimé un fichier, de facilement le retrouver en restaurant la dernière snapshot qui a été prise avant votre opération.

D'un point de vue opérationnelle, les snapshots sont très importantes car elles permettent de facilement restaurer des bases de données qui se seraient corrompues, en les ramenant à leur dernier était connu comme sain.

Redondance du stockage actif

Les disques durs qui servent de support de stockage vieillissent avec l'âge et peuvent soudainement s'arrêter de fonctionner.

Si on utilisait qu'un seul disque pour stocker nos données, alors quand il tombe en panne, tous les services seraient immédiatement indisponibles, et toutes nos donnéees stockées dessus seraient perdues avec.

Si on possède une réplication des donnéees quelque part, on pourrait les transférer sur un nouveau disque et le brancher pour refaire fonctionner l'infrastructure.

Mais cette opération nécessite beaucoup de travail, et implique de l'indisponibilité, alors nous avons besoin d'un autre mécanisme:

La technologie de stockage ZFS que notre infrastructure utilise permet de configurer un ensemble de disques de manière à ce que les données qu'on y écrit soient systématiquement dupliquées à travers ces disques.

De cette manière, quand un des deux disques en mirroir tombe en panne, l'autre contient encore une copie intégrale des données, et permet au système de continuer de fonctionner.

Les opérateur·ice·s reçoivent un e-mail d'alerte, qui indique que l'ensemble des disques est dégradée à cause de la perte d'un disque, ce qui permet d'agir à temps:

  1. En débranchant le disque défaillant

  2. En branchant un nouveau disque

  3. En lançant l'opération de rééquilibrage des données, où les anciens disques remplissent le nouveau disque d'une duplication des données.

  4. À la fin de l'opération dite de "resilvering", la redondance est restaurée.

À noter que la redondance n'est pas aussi efficace lorsqu'on achète les disques mis en place ensemble de la même source, car les risques que chacun des disques tombe en panne sont fortement corrélés entre eux. Il pourrait donc arriver, dans ce cas, que l'opération de resilvering qui est intense en lecture des anciens disques, fasse tomber en panne un autre de ces disques.

Assurance ménage et dommages naturels

Dans le cas de dommages accidentels ou causés par des catastrophes naturelles, le matériel qui est hebergé dans les logements des personnes qui opèrent l'infrastructure dans son ensemble est couvert.