Una copia de seguridad de una VM que se congela en el mismo porcentaje cada noche normalmente está llegando a la misma región de origen o fase de copia, lo que convierte ese porcentaje en un indicador de diagnóstico repetible.
Registra el disco exacto de la VM, la fase, el mensaje del registro, el rendimiento y el estado del destino en el punto de congelación. Después, compara con otro almacén de datos, inspecciona el almacenamiento de origen alrededor de esa región, separa los hooks de puesta en reposo del invitado de la transferencia masiva y comprueba la contención nocturna. No consideres que un porcentaje estable demuestre que la red está fallando.
Usa el porcentaje como indicador de ubicación repetible
Registra el porcentaje exacto, el tiempo transcurrido, el disco actual de la VM, la fase de copia, la velocidad de transferencia y la última línea del registro durante varias noches. El porcentaje aporta información sobre dónde se encuentra el trabajo, pero no es un diagnóstico por sí solo.
Los trabajos de ajuste de PBS muestran que los cuellos de botella de rendimiento de PBS pueden desplazarse entre las lecturas de origen, el cálculo de hashes, la compresión, la transferencia de red y las operaciones del almacén de datos, así que determina la fase del bloqueo antes de cambiar configuraciones al azar.
Si la misma VM y la misma fase se detienen casi en el mismo punto en cada ejecución, da prioridad a los datos de origen deterministas o a un paso repetible del flujo de trabajo antes que a una congestión general de la red.
Compara el destino de la copia con otro destino
Ejecuta la copia de seguridad de la misma VM en otro almacén de datos o en un destino local temporal, si la capacidad y la política de recuperación lo permiten. Mantén comparables el modo de instantánea y la carga de trabajo de la VM.
Una ruta de almacenamiento de copias de Proxmox habitual incluye almacenamiento NFS o NAS, y la latencia o los bloqueos del destino pueden hacer que un destino se detenga mientras la propia VM sigue funcionando correctamente.
Si el destino alternativo supera el antiguo punto de congelación, investiga el almacén de datos original, el sistema de archivos, la ruta de red y el espacio libre. Si ambos se congelan de forma idéntica, vuelve a investigar el origen o la fase de copia.
Comprueba el disco de origen alrededor de la región repetible
Inspecciona los registros de almacenamiento del host, los datos SMART, los errores de ZFS o del sistema de archivos y la latencia de lectura mientras la copia se aproxima al punto problemático. Una copia de seguridad puede ser el primer trabajo que lea cada bloque en frío.
Los informes reales sobre cuellos de botella prolongados en copias de PBS ilustran por qué una copia larga puede estar dominada por un único cuello de botella, en lugar del tamaño total anunciado de la VM.
Un error de lectura, tiempo de espera o aumento de latencia que se repita en el mismo punto debe hacer que el incidente pase a un modo de preservación de datos. Evita repetir lecturas completas si el disco de origen se está deteriorando.
Separa la puesta en reposo del invitado de la transferencia de datos
Observa si la copia se congela durante la congelación mediante el agente invitado, la creación de la instantánea, la preparación de metadatos o después de que haya comenzado la transferencia masiva de datos. Prueba una copia durante una ventana de mantenimiento con una carga mínima en el invitado.
El flujo de trabajo de copias de Proxmox general separa la orquestación de la copia de la transferencia de almacenamiento, lo que resulta útil cuando un hook de congelación para mantener la coherencia de las aplicaciones se bloquea aunque el rendimiento del disco y de la red sea normal.
Si desactivar un hook no esencial de puesta en reposo del invitado permite que el trabajo continúe, repara ese hook o el agente invitado antes de restaurar la opción de coherencia. No dejes bases de datos importantes sin poner en reposo sin un plan de recuperación alternativo.
Desplaza el trabajo para evitar otras tareas nocturnas
Compara la hora del congelamiento con las tareas de scrub, replicación, análisis multimedia, instantáneas, deduplicación o sincronización con la nube. Desplaza temporalmente una sola tarea en conflicto para comprobar si existe contención.
Una visión más profunda de la arquitectura y el ajuste de PBS resulta útil cuando varios recursos comparten la misma ventana nocturna y el porcentaje de la copia solo indica dónde se hace visible esa contención.
El problema está resuelto cuando la copia supera repetidamente el antiguo punto de bloqueo y termina con un punto de restauración utilizable. La guía relacionada de ZimaSpace sobre la preparación de copias de VM añade el límite de recuperación; incluye una restauración de prueba en el plan de validación en lugar de confiar en un indicador de progreso del 100 %.
Soporte y Consejos
Más para leer

¿Puede Plex compartir una GPU con otro contenedor de Docker?
Plex y otro contenedor suelen poder acceder a la misma GPU, pero debes probar la compatibilidad de los controladores, la asignación de dispositivos, la...

Cómo saber si un error de Plex proviene del cliente o del servidor
Reproduce el mismo elemento en otro cliente, compara la ruta de la sesión y recopila pruebas del servidor solo después de que el alcance...

Cómo configurar la caché de Plex y el almacenamiento temporal para la transcodificación
Protege el estado persistente de Plex mientras colocas los archivos temporales de transcodificación en un almacenamiento local adecuado; después, verifica la limpieza, el espacio...

