Un backup di una VM che si blocca alla stessa percentuale solo in modalità snapshot indica un problema nel percorso dello snapshot live o del congelamento del guest, prima ancora di far pensare a una specifica area danneggiata del disco.
Il confronto decisivo consiste nell’usare la stessa VM, la stessa destinazione e una quantità di dati approssimativamente equivalente in modalità snapshot e in modalità arresto. Se la modalità arresto supera ripetutamente la percentuale precedente, la diagnosi generica di un’area fissa danneggiata diventa meno probabile e l’indagine dovrebbe concentrarsi sulle operazioni di freeze/thaw di QEMU Guest Agent, sulla quiescenza delle applicazioni, sullo storage compatibile con gli snapshot e sul comportamento delle scritture live. Durante i test, conserva un backup funzionante in modalità arresto, così la risoluzione dei problemi non eliminerà mai l’ultima copia recuperabile.
Dimostra che la modalità arresto supera il punto in cui fallisce lo snapshot
Esegui un backup in modalità arresto durante una finestra di manutenzione, usando la stessa destinazione del processo snapshot che non riesce. Registra la percentuale, il disco, la velocità di trasferimento e la durata in corrispondenza del punto in cui la modalità snapshot normalmente si interrompe.
Un confronto tra le modalità di backup di Proxmox spiega che la modalità snapshot mantiene attive le VM, mentre la modalità arresto elimina molte variabili legate all’esecuzione del guest.
Se la modalità arresto si blocca nello stesso punto, torna all’articolo generico sui blocchi alla stessa percentuale ed esegui test sullo storage di origine o di destinazione. Se invece il processo viene completato, mantieni i test successivi all’interno del percorso specifico degli snapshot.
Verifica se il freeze di QEMU Guest Agent è il fattore scatenante
Controlla il log del backup cercando guest-fsfreeze-freeze, guest-fsfreeze-thaw, timeout o errori di comunicazione con il guest agent. Confronta l’orario con il journal del guest o con i log eventi di Windows.
Una guida al backup di Windows su Proxmox osserva che il guest agent esegue fsfreeze quando l’agente è abilitato.
Non disabilitare permanentemente le funzioni di coerenza del guest come prima soluzione. Esegui un test controllato per determinare se la chiamata di freeze costituisce il punto critico, quindi risolvi l’interazione tra guest agent e filesystem.
Cerca filesystem che non vengono congelati correttamente
Inventaria i filesystem montati all’interno del guest, inclusi dispositivi loop, filesystem di rete, mount applicativi simili ai bind mount, storage dei database e configurazioni insolite dei pannelli di controllo. Prendi nota del filesystem occupato quando inizia lo snapshot.
CloudLinux documenta un caso in cui fsfreeze può bloccare guest complessi, invece di indicare lo storage di destinazione del backup come causa.
Se la rimozione o la correzione di un mount problematico del guest consente alla modalità snapshot di superare la percentuale, ripristina in seguito la protezione della coerenza e documenta la dipendenza. Evita ripristini forzati ripetuti, che possono trasformare un problema di backup in un danno al filesystem del guest.
Distingui un timeout del freeze da un blocco del trasferimento
Verifica se il backup si arresta prima che inizi un trasferimento significativo dei dati, subito dopo una richiesta di freeze o più avanti durante la copia dei blocchi. Una percentuale fissa vicina allo zero può rappresentare una fase di errore completamente diversa rispetto a un blocco a metà di un disco virtuale.
Un caso riportato in una knowledge base di hosting mostra che il freeze può bloccare indefinitamente il backup dopo l’avvio della sequenza snapshot.
Se il trasferimento non inizia mai, concentrati sulla quiescenza del guest. Se invece il trasferimento procede normalmente per molto tempo prima di bloccarsi, confronta il carico delle scritture live, il comportamento del livello snapshot e la latenza dello storage.
Riproduci il freeze del guest al di fuori del backup completo
Quando la piattaforma e le policy di manutenzione lo consentono, testa separatamente il comportamento di freeze e thaw del guest agent oppure osserva attentamente il guest durante un evento snapshot manuale. Mantieni aperta una console e verifica che il guest riprenda le scritture dopo il thaw.
Un problema di QEMU documenta che fsfreeze di QEMU può bloccare le VM con determinate configurazioni del filesystem guest.
Se il blocco si riproduce già durante il freeze, risolvi prima quel percorso del guest invece di ottimizzare la velocità di PBS. Se freeze e thaw funzionano correttamente, prosegui analizzando l’interazione tra lo storage degli snapshot e le scritture live.
Mantieni la modalità arresto come percorso di recupero finché la modalità snapshot non funziona
Non sacrificare backup affidabili mentre risolvi un problema legato a una funzione comoda. Pianifica backup in modalità arresto durante una finestra di manutenzione accettabile, finché la modalità snapshot non viene completata più volte e un test di ripristino non ne conferma il risultato.
Un esempio su Server Fault mostra un ambiente reale in cui la modalità arresto fornisce un fallback quando il comportamento degli snapshot live richiede una gestione separata.
La correzione è completa quando la modalità snapshot supera ripetutamente la percentuale precedente e il guest rimane reattivo prima, durante e dopo il backup. L’articolo ZimaSpace correlato sui blocchi del backup alla stessa percentuale resta il ramo principale corretto se anche la modalità arresto si blocca.
Domande frequenti
La modalità arresto è una sostituzione permanente della modalità snapshot?
Può essere un fallback affidabile quando il downtime è accettabile, ma la modalità snapshot è solitamente preferibile quando il guest può essere messo in quiescenza in sicurezza e i backup live vengono completati in modo costante.
Devo disabilitare QEMU Guest Agent per far funzionare i backup?
Solo come test diagnostico controllato, quando appropriato. L’agente fornisce anche utili funzioni di arresto e coerenza, quindi è meglio identificare il problema alla base del freeze anziché nasconderlo.
Perché il backup si arresta alla stessa percentuale se il problema è fsfreeze?
Le percentuali di avanzamento possono corrispondere a fasi di backup ripetibili, non solo a posizioni del disco. Un freeze o una transizione snapshot raggiunti nella stessa fase possono quindi produrre la stessa percentuale visualizzata.
Supporto e consigli
Altro da leggere

Plex può condividere una GPU con un altro container Docker?
Plex e un altro container possono spesso accedere alla stessa GPU, ma è necessario testare il supporto dei driver, la mappatura dei dispositivi, il...

Come capire se un errore di Plex proviene dal client o dal server
Riproduci lo stesso elemento su un altro client, confronta il percorso della sessione, quindi raccogli le prove dal server solo dopo che l’ambito ti...

Come configurare la cache di Plex e l’archiviazione temporanea per la transcodifica
Proteggi lo stato persistente di Plex collocando i file temporanei di transcodifica su un’unità locale adatta, quindi verifica la pulizia, lo spazio libero e...

