Comment la taille des blocs de sauvegarde affecte-t-elle la vitesse de restauration et les économies liées à la déduplication ?

Eva Wong est la rédactrice technique et bricoleuse résidente chez ZimaSpace. Geek depuis toujours, passionnée par les homelabs et les logiciels open source, elle se spécialise dans la traduction de concepts techniques complexes en guides accessibles et pratiques. Eva croit que l’auto-hébergement doit être amusant, pas intimidant. À travers ses tutoriels, elle donne à la communauté les moyens de démystifier les configurations matérielles, depuis la construction de leur premier NAS jusqu’à la maîtrise des conteneurs Docker.

Des blocs de sauvegarde plus petits améliorent généralement les gains de déduplication, tandis que des blocs plus volumineux réduisent les métadonnées et rendent souvent les restaurations plus séquentielles et prévisibles.

Imaginez un serveur domestique qui protège des images de machines virtuelles, des photos de famille et des documents fréquemment modifiés sur une seule baie de disques. Découper chaque flux en minuscules fragments permet de repérer davantage de régions répétées, mais crée aussi plus d’empreintes, d’entrées d’index et de lectures dispersées lors de la récupération. Des fragments plus volumineux simplifient la reconstruction, mais détectent moins bien les petites similitudes. La meilleure taille dépend donc du profil des données et du chemin de restauration, plutôt que d’un objectif universel d’économie d’espace de stockage.

La taille des blocs définit la granularité de la détection des doublons

Une sauvegarde avec déduplication stocke un bloc une seule fois et remplace les copies ultérieures par des références vers la même empreinte. Si une petite modification se trouve à l’intérieur d’un très grand bloc fixe, l’ensemble du bloc peut sembler nouveau. Des blocs plus petits isolent la région modifiée, ce qui permet aux zones inchangées voisines de correspondre aux sauvegardes précédentes et augmente la quantité de données pouvant être référencées plutôt que stockées à nouveau.

Les blocs plus petits offrent généralement une meilleure déduplication, car ils comparent les données avec une granularité plus fine, une relation mesurée dans la sauvegarde de fichiers par blocs. Le mécanisme n’est pas une compression magique. Chaque limite supplémentaire crée une nouvelle possibilité d’isoler des octets répétés, notamment dans les documents versionnés, les images de machines virtuelles et les archives logicielles comportant de petites modifications internes.

Cet avantage connaît toutefois des rendements décroissants. Diviser par deux la taille moyenne des blocs double approximativement le nombre d’enregistrements de blocs pour un même volume logique de données, ce qui augmente le calcul des empreintes, la mémoire de l’index, les manifestes et le travail de recherche. Un plus grand nombre de blocs ne permet d’économiser de la capacité que lorsque l’ensemble de données contient des sous-régions réutilisables ; les photos déjà compressées et les archives chiffrées offrent souvent très peu de déduplication supplémentaire en contrepartie de ces métadonnées additionnelles.

Les limites définies par le contenu préservent les gains lorsque les octets se décalent

Le découpage en blocs de taille fixe s’effectue à des positions déterminées dans les octets. Ainsi, l’insertion de quelques octets près du début décale toutes les limites suivantes et peut faire paraître entièrement nouveau un fichier pourtant similaire. Le découpage défini par le contenu choisit les limites à partir du flux d’octets lui-même. Après une insertion locale, les repères suivants peuvent se réaligner, permettant au contenu qui suit de correspondre aux blocs déjà stockés.

Le découpage défini par le contenu résout le problème du décalage des limites, mais consomme toujours du temps processeur pour rechercher ces limites. Cela compte, car l’expression « blocs de 8 Mo » désigne une taille moyenne cible dans de nombreux systèmes CDC, et non des fragments identiques. Les limites minimale, moyenne et maximale influencent à la fois la probabilité de correspondance et la surcharge de traitement, tandis que l’algorithme choisi détermine la puissance de calcul consacrée à la détection des limites.

La méthode de découpage peut donc être aussi importante que la taille nominale. Un flux CDC de taille modérée peut préserver des similitudes que de petits blocs fixes perdraient après des insertions, tout en produisant moins d’enregistrements. Toutefois, le CDC ne permet pas de dédupliquer efficacement les données à forte entropie ou chiffrées : la modification d’un bloc de texte chiffré peut altérer de vastes régions, tandis que la compression élimine délibérément les motifs répétés avant que le moteur de sauvegarde ne les voie.

La vitesse de restauration dépend de la localité, pas seulement du nombre de blocs

Une restauration lit les blocs référencés dans l’ordre nécessaire à la reconstruction des fichiers. Si ces blocs sont répartis dans de nombreux conteneurs et disques, le système peut effectuer de petites lectures aléatoires au lieu de longs transferts séquentiels. Les petits blocs augmentent le nombre de références, mais le véritable ralentissement apparaît lorsque leur emplacement physique diverge de l’ordre de restauration et que les défauts de cache imposent de récupérer plusieurs fois les conteneurs.

La fragmentation peut réduire considérablement le débit de récupération au fil de la vie d’un dépôt, comme le démontrent les mesures de la vitesse de restauration dédupliquée. Les mesures d’atténuation peuvent réduire quelque peu la déduplication ou ajouter un travail d’assemblage afin d’améliorer la localité lors de la restauration. Cela distingue la granularité des blocs de leur placement : deux dépôts comportant un nombre similaire de blocs peuvent être restaurés très différemment si l’un regroupe les blocs associés.

Les blocs plus volumineux améliorent souvent la localité, car chaque référence récupère davantage de données contiguës utiles et les manifestes contiennent moins d’objets. Pourtant, plus grand ne signifie pas automatiquement plus rapide. Si une restauration ne nécessite qu’un petit fichier ou une plage limitée, un grand conteneur compressé peut entraîner une amplification des lectures ; sur des SSD rapides, la décompression et le calcul des empreintes peuvent devenir plus importants que le temps de recherche. Les performances de récupération englobent toute la chaîne : recherche, lecture, vérification, décompression et écriture.

La pression exercée sur l’index et le cache crée un compromis caché

Les petits blocs nécessitent un index d’empreintes plus volumineux, qui peut déborder de la RAM vers le stockage sur un serveur domestique modeste. Lorsque l’index ne tient plus dans le cache prévu, l’ingestion des sauvegardes et les recherches lors des restaurations se disputent les E/S avec les données des fichiers. Les gros blocs réduisent la taille de l’index, mais diminuent les possibilités de correspondance, créant une zone intermédiaire où les métadonnées restent en cache sans sacrifier les régions dupliquées courantes.

Le CDC vectorisé peut augmenter considérablement le débit de découpage tout en préservant la majeure partie des gains d’espace. Ce résultat met en évidence une variable souvent négligée dans les tests domestiques : l’implémentation de l’algorithme. Modifier à la fois la taille des blocs et le moteur de découpage empêche de tirer une conclusion claire, car une détection plus rapide des limites peut masquer le coût processeur d’une granularité plus fine.

Les empreintes de contenu sont également utiles au-delà du stockage des sauvegardes. Le guide de ZimaSpace consacré au hachage de contenu montre le même principe d’empreinte utilisé pour ignorer les éléments RAG inchangés. Dans les deux flux de travail, les métadonnées doivent rester moins coûteuses à stocker et à interroger que le travail qu’elles évitent ; sinon, un suivi plus fin devient une surcharge plutôt qu’une économie.

Évaluez la taille des blocs avec une matrice de tests priorisant la restauration

Créez un ensemble de données représentatif comprenant trois catégories : des documents versionnés ou des images de machines virtuelles, des médias compressés et de nombreux petits fichiers. Testez au moins trois profils de blocs en maintenant constants la compression, le chiffrement, l’ancienneté du dépôt, le matériel de stockage et la concurrence. Mesurez les octets physiques écrits, le nombre de blocs, la mémoire maximale utilisée par l’index, le débit de sauvegarde et le débit de restauration complète, au lieu de vous fier uniquement au taux de déduplication affiché.

Les performances de restauration doivent être considérées comme un résultat essentiel, sans supposer qu’une déduplication maximale est optimale. La suppression de redondance tenant compte de la fragmentation utilise les informations de disposition des blocs pour évaluer le comportement lors de la récupération. Répétez votre test domestique après plusieurs générations incrémentielles, car un dépôt neuf peut sembler séquentiel alors que des mois de références entre sauvegardes révèlent la véritable pénalité de restauration.

Sélectionnez le plus petit profil dont le temps de restauration reste compatible avec votre objectif de récupération et dont l’index reste confortablement en mémoire lors du test le plus exigeant. Si deux profils respectent cette limite, privilégiez celui qui comporte le moins de blocs et dont l’exploitation est la plus simple. Refaites les tests après toute modification du chiffrement du dépôt, de la taille des paquets, du type de disque ou de la composition de la charge de travail ; la taille moyenne des blocs est une variable de réglage, pas une mesure permanente de la qualité des sauvegardes.

Métrique Pourquoi elle compte Rejetez un profil lorsque
Octets physiques Mesurent les économies réelles Les économies sont négligeables
Nombre de blocs Prévoit la charge des métadonnées L’index dépasse la mémoire disponible
Mo/s lors d’une restauration complète Teste l’objectif de récupération La restauration dépasse le délai prévu
Ancienneté du dépôt Révèle la fragmentation Les performances s’effondrent au fil des générations

Centre Tech & IA

Plus à lire

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.