Une sauvegarde de VM qui se fige toujours au même pourcentage uniquement en mode instantané pointe vers le chemin de l’instantané à chaud ou du gel de l’invité, avant d’indiquer une zone défectueuse fixe du disque.
La comparaison décisive consiste à opposer le mode instantané au mode arrêt en utilisant la même VM, la même destination et un ensemble de données approximativement identique. Si le mode arrêt dépasse systématiquement l’ancien pourcentage, l’hypothèse générique d’une zone fixe défectueuse devient moins probable et l’investigation doit se concentrer sur le gel/dégel via QEMU Guest Agent, la mise en cohérence des applications, le stockage compatible avec les instantanés et le comportement des écritures à chaud. Conservez une sauvegarde fonctionnelle en mode arrêt pendant les tests afin que le dépannage ne supprime jamais la dernière copie récupérable.
Vérifier que le mode arrêt dépasse le point d’échec du mode instantané
Exécutez une sauvegarde en mode arrêt pendant une fenêtre de maintenance, vers la même cible que celle utilisée par la tâche de sauvegarde en mode instantané qui échoue. Notez le pourcentage, le disque, le débit et la durée auxquels le mode instantané s’arrête habituellement.
Une comparaison des modes de sauvegarde de Proxmox explique que le mode instantané maintient les VM actives, tandis que le mode arrêt élimine de nombreuses variables liées à l’exécution de l’invité.
Si le mode arrêt se fige au même point, revenez à l’article générique sur le blocage au même pourcentage et effectuez des tests sur le stockage source ou cible. Si le mode arrêt se termine, poursuivez les expériences uniquement sur le chemin spécifique au mode instantané.
Vérifier si le gel de QEMU Guest Agent est le déclencheur
Examinez le journal de sauvegarde à la recherche de guest-fsfreeze-freeze, guest-fsfreeze-thaw, de délais d’attente ou d’erreurs de communication avec l’agent invité. Comparez l’horodatage avec le journal de l’invité ou les journaux d’événements Windows.
Un guide de sauvegarde de Windows avec Proxmox indique que l’agent invité exécute fsfreeze lorsqu’il est activé.
Ne désactivez pas définitivement les fonctions de cohérence de l’invité comme première solution. Effectuez un test contrôlé pour déterminer si l’appel de gel constitue lui-même la limite, puis corrigez l’interaction entre l’agent invité et le système de fichiers.
Rechercher les systèmes de fichiers qui ne se figent pas correctement
Inventoriez les systèmes de fichiers montés à l’intérieur de l’invité, notamment les périphériques loop, les systèmes de fichiers réseau, les montages d’applications de type bind, le stockage des bases de données et les configurations inhabituelles de panneaux de contrôle. Notez quel système de fichiers est occupé au début de l’instantané.
CloudLinux documente un cas où fsfreeze peut bloquer des invités complexes, plutôt que la cible de sauvegarde elle-même soit en cause.
Si la suppression ou la correction d’un montage problématique de l’invité permet au mode instantané de dépasser le pourcentage concerné, rétablissez ensuite la protection de cohérence et documentez cette dépendance. Évitez les réinitialisations forcées répétées, qui peuvent transformer un problème de sauvegarde en endommagement du système de fichiers invité.
Distinguer un délai d’attente du gel d’un blocage du transfert
Vérifiez si la sauvegarde s’arrête avant le début d’un transfert significatif, immédiatement après une demande de gel ou plus tard pendant la copie des blocs. Un pourcentage fixe proche de zéro peut correspondre à une étape d’échec complètement différente d’un blocage à mi-parcours d’un disque virtuel.
Un cas présenté dans une base de connaissances d’hébergement montre que le gel peut bloquer indéfiniment la sauvegarde après le début de la séquence d’instantané.
Si le transfert ne commence jamais, concentrez-vous sur la mise en cohérence de l’invité. Si le transfert progresse normalement pendant longtemps avant de se bloquer, comparez plutôt la charge d’écriture à chaud, le comportement de la couche d’instantané et la latence du stockage.
Reproduire le gel de l’invité en dehors de la sauvegarde complète
Lorsque la plateforme et la politique de maintenance l’autorisent, testez indépendamment le comportement de gel et de dégel de l’agent invité, ou observez attentivement l’invité pendant un événement d’instantané manuel. Gardez une console ouverte et vérifiez que l’invité reprend ses écritures après le dégel.
Un ticket QEMU indique que QEMU fsfreeze peut verrouiller des VM avec certaines configurations de systèmes de fichiers invités.
Si le gel seul reproduit le blocage, corrigez ce chemin dans l’invité avant d’ajuster le débit de PBS. Si le gel et le dégel se déroulent correctement, poursuivez l’analyse du côté du stockage des instantanés et de l’interaction avec les écritures à chaud.
Conserver le mode arrêt comme voie de récupération jusqu’à la réussite du mode instantané
Ne sacrifiez pas des sauvegardes fiables pour résoudre un problème lié à une fonction pratique. Planifiez des sauvegardes en mode arrêt pendant une fenêtre de maintenance acceptable, jusqu’à ce que le mode instantané se termine plusieurs fois et qu’un test de restauration confirme le résultat.
Un exemple sur Server Fault montre qu’un environnement réel utilise le mode arrêt comme solution de secours lorsque le comportement des instantanés à chaud nécessite une gestion distincte.
La correction est terminée lorsque le mode instantané dépasse systématiquement l’ancien pourcentage et que l’invité reste réactif avant, pendant et après la sauvegarde. L’article ZimaSpace associé sur les blocages génériques de sauvegarde au même pourcentage reste la branche à suivre si le mode arrêt se fige également.
Questions fréquentes
Le mode arrêt est-il un remplacement permanent du mode instantané ?
Il peut constituer une solution de secours fiable lorsque l’interruption de service est acceptable, mais le mode instantané est généralement préférable lorsque l’invité peut être mis en cohérence sans risque et que les sauvegardes à chaud se terminent de manière régulière.
Dois-je désactiver QEMU Guest Agent pour faire fonctionner les sauvegardes ?
Uniquement dans le cadre d’un test de diagnostic contrôlé, lorsque cela est approprié. L’agent fournit également des fonctions utiles d’arrêt et de cohérence : il faut donc identifier le problème de gel sous-jacent plutôt que le masquer.
Pourquoi la sauvegarde s’arrête-t-elle au même pourcentage si le problème vient de fsfreeze ?
Les pourcentages de progression peuvent correspondre à des phases répétables de la sauvegarde, et pas uniquement à des emplacements sur le disque. Un gel ou une transition d’instantané atteint au même stade peut donc produire le même pourcentage visible.
Assistance et conseils
Plus à lire

Plex peut-il partager un GPU avec un autre conteneur Docker ?
Plex et un autre conteneur peuvent souvent accéder au même GPU, mais vous devez tester la prise en charge des pilotes, le mappage des...

Comment déterminer si une erreur Plex vient du client ou du serveur
Reproduisez le même élément sur un autre client, comparez le chemin de session, puis recueillez les preuves côté serveur uniquement après que la portée...

Comment configurer le cache de Plex et le stockage temporaire du transcodage
Protégez l’état persistant de Plex en plaçant les fichiers temporaires de transcodage sur un stockage local adapté, puis vérifiez le nettoyage, l’espace libre et...

