Correlacione el momento de la congelación del agente invitado con la latencia del almacén de datos del host; una congelación antes de que aparezca presión en el host apunta hacia el invitado, mientras que la latencia en varios invitados apunta al almacenamiento.
La decisión es importante cuando una máquina virtual se pausa o deja de responder durante una copia de seguridad en modo de instantánea. Los dos estados en competencia son el retraso de la puesta en reposo del invitado, del sistema de archivos o del vaciado de la aplicación, y la latencia del almacén de datos, la instantánea, la red o el destino de copia de seguridad del host. Comience con una configuración guardada y datos desechables, observe una rama a la vez y deténgase si la prueba aumenta el riesgo de pérdida de datos, permisos o disponibilidad.
Separe el retraso de la puesta en reposo del invitado, del sistema de archivos o del vaciado de la aplicación de la latencia del almacén de datos, la instantánea, la red o el destino de copia de seguridad del host
Registre el entorno antes de cambiar nada: versiones de software y firmware, identidades de dispositivos, ruta de montaje o red, espacio libre, permisos y síntoma observable. La línea base debe conservar suficientes detalles para reproducir una pausa o falta de respuesta de una máquina virtual durante una copia de seguridad en modo de instantánea.
El primer candidato es el retraso de la puesta en reposo del invitado, del sistema de archivos o del vaciado de la aplicación. El segundo es la latencia del almacén de datos, la instantánea, la red o el destino de copia de seguridad del host. El comportamiento actual de Proxmox vzdump define el mecanismo o límite de comandos utilizado en la prueba; no sustituye la observación de este servidor doméstico específico.
Escriba la condición de aceptación y la condición de detención antes de ejecutar el discriminador. Una prueba superada debe cambiar las pruebas previstas por una rama mientras deja intactos los servicios no relacionados; una prueba fallida debe devolver el sistema al estado guardado en lugar de iniciar una cadena de correcciones especulativas.
Ejecute un discriminador controlado
Utilice este discriminador: registre las marcas de tiempo de los eventos de congelación y reanudación, la latencia del disco del invitado, la latencia del almacenamiento del host y el resto del comportamiento de la máquina virtual durante una copia de seguridad controlada. Mantenga constantes la carga de trabajo, el cliente, la ruta, el conjunto de archivos y el momento para que el resultado pueda atribuirse a la variable modificada.
Use el estado del agente invitado de QEMU para seleccionar el campo que realmente pueda separar las ramas y capture su marca de tiempo, estado de salida, texto del error, identidad del dispositivo o de la instantánea, latencia, bytes transferidos, permisos y estado de recuperación. Un comando que finaliza correctamente no basta cuando la identidad, la durabilidad o el estado de la aplicación son la afirmación que se está comprobando.
Repita la prueba una vez después de un reinicio, una reconexión, un nuevo montaje o una caché fría cuando ese evento forme parte de la condición original. Si la primera ejecución es destructiva o el entorno no puede restaurarse, deténgase y reproduzca la prueba en una copia desechable.
journalctl -u qemu-guest-agent
pvesh get /nodes/NODE/status
# correlacione las marcas de tiempo con la latencia del almacén de datos
Interprete qué rama respaldan las pruebas
SUPERADA: un invitado se congela mientras el host permanece saludable, o varios invitados se ralentizan con un aumento de la cola y la latencia del host. Registre la versión exacta, la identidad y la carga de trabajo que produjeron el resultado para que la conclusión siga siendo condicional en lugar de convertirse en una afirmación universal.
FALLIDA: el ancho de banda de la copia de seguridad y los metadatos de la instantánea pueden crear ambas señales, así que repita con la puesta en reposo desactivada únicamente en un estado desechable. Una prueba fallida no demuestra automáticamente la rama opuesta cuando la red, la memoria, los permisos o la coherencia del origen pueden influir en ambas; aísle esas dependencias compartidas antes de continuar.
EXCEPCIÓN O RESULTADO AMBIGUO: restaure el modo de copia de seguridad anterior y reactive el invitado antes de cambiar la configuración del almacenamiento o del agente. Conserve los registros y no ejecute comandos de reparación, depuración, destrucción, reparticionado ni de cambio recursivo de propietario hasta que exista una copia recuperable.
Aplique la acción correspondiente y reproduzca el fallo original
Aplique la acción correspondiente a la rama observada y, después, repita la condición original en lugar de utilizar un sustituto reducido. La decisión solo se sostiene cuando un invitado se congela mientras el host permanece saludable, o varios invitados se ralentizan con un aumento de la cola y la latencia del host durante dos ciclos o durante el reinicio, suspensión, interrupción o transición de carga pertinente.
Use los modos de copia de seguridad de Proxmox para comprobar el flujo de trabajo dependiente más cercano, pero mantenga sin cambios el activador original. Los conjuntos de datos, recursos compartidos, contenedores, usuarios y puntos de recuperación no relacionados deben conservar su acceso y sus tiempos anteriores.
El límite de detención es explícito: si el ancho de banda de la copia de seguridad y los metadatos de la instantánea pueden crear ambas señales, repita con la puesta en reposo desactivada únicamente en un estado desechable, vuelva a la última configuración verificada, conserve las pruebas y escale a una prueba más profunda de la plataforma o del hardware solo cuando la rama sea reproducible.
Cuando se mantenga el resultado objetivo, compárelo con las dependencias de apagado para que la solución no traslade el riesgo a un servicio vecino. Una prueba objetivo exitosa con un nuevo fallo de copia de seguridad, identidad, tiempo de espera o disponibilidad sigue siendo un cambio fallido.
Preguntas frecuentes
En el diagnóstico de congelaciones durante copias de seguridad de máquinas virtuales, las búsquedas restantes suelen centrarse en si desactivar la congelación del invitado demuestra que el agente tiene la culpa, por qué se pausan todas las máquinas virtuales durante una copia de seguridad y cuándo debe utilizarse el modo de detención. Las respuestas siguientes mantienen esos casos límite separados de la decisión principal.
El límite de aceptación no cambia: un invitado se congela mientras el host permanece saludable, o varios invitados se ralentizan con un aumento de la cola y la latencia del host. Si una condición posterior cambia el sistema de archivos, la identidad, la ruta de red o la versión de la aplicación, repita únicamente el discriminador afectado por ese cambio.
Deje de ampliar el experimento cuando el ancho de banda de la copia de seguridad y los metadatos de la instantánea puedan crear ambas señales, así que repita con la puesta en reposo desactivada únicamente en un estado desechable. En ese momento, restaure el modo de copia de seguridad anterior y reactive el invitado antes de cambiar la configuración del almacenamiento o del agente; conserve las pruebas antes de escalar al responsable de la plataforma, el almacenamiento o el hardware.
¿Desactivar la congelación del invitado demuestra que el agente tiene la culpa?
Aísla la ruta de puesta en reposo, pero puede reducir la coherencia de la aplicación; utilícelo únicamente como prueba controlada.
¿Por qué se pausan todas las máquinas virtuales durante una copia de seguridad?
La cola de almacenamiento del host, los metadatos de la instantánea o el ancho de banda de la copia de seguridad pueden afectar al almacén de datos compartido.
¿Cuándo debe utilizarse el modo de detención?
Cuando sea necesario un apagado limpio y su tiempo de inactividad encaje con el objetivo de recuperación.
El diagnóstico termina cuando la misma carga de trabajo hace que las pruebas sigan el retraso de la puesta en reposo del invitado, del sistema de archivos o del vaciado de la aplicación, o la latencia del almacén de datos, la instantánea, la red o el destino de copia de seguridad del host, y la acción correspondiente elimina el síntoma original sin crear otro. Si ninguna de las dos ramas sigue siendo reproducible, conserve intactos los registros y el estado guardado; la incertidumbre es motivo para escalar, no para acumular más correcciones.
Soporte y Consejos
Más para leer

La carpeta compartida NAS muestra archivos antiguos después de reemplazar el almacenamiento: comprobaciones y soluciones
Compara el almacenamiento local con el recurso compartido activo y con un cliente limpio. Repara únicamente la capa que se haya demostrado obsoleta y,...

Guía de mantenimiento de refrigeración para mini PC: ventiladores, rejillas de ventilación y valores térmicos de referencia
Utiliza mediciones repetibles en reposo y bajo carga. Limpia primero el flujo de aire externo, confirma el funcionamiento del ventilador y abre el chasis...

Lista de comprobación de actualización del firmware del servidor doméstico para la BIOS, el orden de arranque y los dispositivos
Captura primero las versiones, las entradas UEFI y el estado del almacenamiento y del passthrough. Actualiza una capa a la vez y conserva el...

