Un backup di una VM che ogni notte si blocca alla stessa percentuale sta solitamente raggiungendo la stessa regione di origine o la stessa fase del backup, rendendo la percentuale un indicatore diagnostico ripetibile.
Registra il disco esatto della VM, la fase, il messaggio di log, il throughput e lo stato della destinazione nel punto del blocco. Poi confronta un altro datastore, analizza lo storage di origine in corrispondenza di quella regione, separa gli hook di quiescenza del guest dal trasferimento dei dati e verifica la contesa notturna. Non considerare una percentuale stabile come prova di un problema di rete.
Usa la percentuale come indicatore di posizione ripetibile
Registra per diverse notti la percentuale esatta, il tempo trascorso, il disco VM corrente, la fase del backup, la velocità di trasferimento e l'ultima riga del log. La percentuale fornisce indicazioni sulla posizione del processo, ma non costituisce da sola una diagnosi.
Le attività di ottimizzazione di PBS mostrano che i colli di bottiglia possono spostarsi tra letture dalla sorgente, hashing, compressione, trasferimento di rete e attività sul datastore; individua quindi la fase del blocco prima di modificare impostazioni casuali.
Se la stessa VM e la stessa fase si bloccano quasi nello stesso punto a ogni esecuzione, dai priorità ai dati di origine deterministici o a una fase ripetibile del flusso di lavoro rispetto alla congestione generale della rete.
Confronta la destinazione del backup con un'altra destinazione
Esegui il backup della stessa VM su un datastore diverso o su una destinazione locale temporanea, se la capacità e i criteri di ripristino lo consentono. Mantieni comparabili la modalità snapshot e il carico di lavoro della VM.
Un comune percorso di storage dei backup Proxmox include storage NFS o NAS; la latenza o il locking della destinazione possono bloccare una destinazione mentre la VM rimane integra.
Se la destinazione alternativa supera il punto del blocco precedente, analizza il datastore originale, il filesystem, il percorso di rete e lo spazio libero. Se entrambe si bloccano nello stesso modo, torna a esaminare la sorgente o la fase del backup.
Controlla il disco di origine in corrispondenza della regione ripetibile
Controlla i log dello storage dell'host, i dati SMART, gli errori ZFS o del filesystem e la latenza di lettura mentre il backup si avvicina al punto di errore. Un backup può essere il primo processo a leggere ogni blocco inattivo.
I casi reali di colli di bottiglia prolungati dei backup PBS illustrano perché un backup lungo può essere dominato da un singolo collo di bottiglia, anziché dalle dimensioni nominali della VM.
Un errore di lettura ripetibile, un timeout o un picco di latenza nello stesso punto dovrebbe portare l'incidente in modalità di preservazione dei dati. Evita letture complete ripetute se il disco di origine sta mostrando segni di degrado.
Separa la quiescenza del guest dal trasferimento dei dati
Annota se il backup si blocca durante il congelamento tramite guest agent, la creazione dello snapshot, la preparazione dei metadati o dopo che il trasferimento dei dati è già iniziato. Esegui un backup in una finestra di manutenzione con un carico minimo sul guest.
Il generale flusso di lavoro dei backup Proxmox separa l'orchestrazione del backup dal trasferimento dello storage; questo è utile quando un hook di congelamento coerente con l'applicazione si blocca anche se il throughput del disco e della rete è normale.
Se la disattivazione di un hook di quiescenza non essenziale del guest consente al processo di proseguire, ripara quell'hook o il guest agent prima di ripristinare l'opzione di coerenza. Non lasciare database importanti senza quiescenza senza un piano di ripristino alternativo.
Sposta il processo lontano dalle attività notturne concorrenti
Confronta l'orario del blocco con scrub, repliche, scansioni dei media, snapshot, deduplicazione o processi di sincronizzazione cloud. Sposta temporaneamente una sola attività concorrente per verificare la presenza di contesa.
Una visione più approfondita dell'architettura e l'ottimizzazione di PBS è utile quando diverse risorse condividono la stessa finestra notturna e la percentuale del backup indica semplicemente il punto in cui la contesa diventa visibile.
Il problema è risolto quando il backup supera ripetutamente il precedente punto di blocco e completa il processo con un punto di ripristino utilizzabile. La guida ZimaSpace correlata sulla prontezza dei backup delle VM aggiunge il limite di recupero; inserisci almeno un ripristino di prova nel piano di convalida invece di affidarti a un indicatore di avanzamento al 100%.
Supporto e consigli
Altro da leggere

Plex può condividere una GPU con un altro container Docker?
Plex e un altro container possono spesso accedere alla stessa GPU, ma è necessario testare il supporto dei driver, la mappatura dei dispositivi, il...

Come capire se un errore di Plex proviene dal client o dal server
Riproduci lo stesso elemento su un altro client, confronta il percorso della sessione, quindi raccogli le prove dal server solo dopo che l’ambito ti...

Come configurare la cache di Plex e l’archiviazione temporanea per la transcodifica
Proteggi lo stato persistente di Plex collocando i file temporanei di transcodifica su un’unità locale adatta, quindi verifica la pulizia, lo spazio libero e...

