ZFS ARC se reduce durante el uso de memoria del host fijada porque los búferes de transferencia de IA no reclamables aumentan la presión sobre la memoria que el kernel puede recuperar, incluida la caché del sistema de archivos.
Los tiempos de ejecución de GPU fijan páginas del host para que los dispositivos puedan transferir datos sin que esas páginas se muevan ni se intercambien durante la operación. Esto mejora la previsibilidad de DMA, pero las asignaciones fijadas son difíciles de recuperar cuando queda poca RAM disponible. Linux invoca mecanismos de recuperación y reducción, y ZFS responde expulsando bloques almacenados en caché o reduciendo el objetivo de ARC, dejando más memoria para asignaciones que no pueden cederla.
Las páginas fijadas cambian la memoria que el kernel puede recuperar
Las páginas anónimas ordinarias pueden intercambiarse, y las páginas limpias de la caché de archivos pueden descartarse. Las páginas fijadas a largo plazo permanecen residentes porque un dispositivo o controlador depende de su asignación física, lo que reduce el conjunto flexible disponible para satisfacer nuevas asignaciones.
La documentación de Linux sobre el bloqueo de páginas a largo plazo distingue entre este bloqueo y las referencias ordinarias, y explica por qué los usuarios de DMA deben marcar las páginas correctamente. El mecanismo hace que la memoria fijada sea cualitativamente diferente de una asignación de proceso que el kernel puede mover o recuperar fácilmente.
Los frameworks de IA utilizan búferes de preparación fijados para acelerar las copias del host al dispositivo, las colas de carga de datos y la descarga de datos. Varios trabajadores o colas de precarga sobredimensionadas pueden mantener fijada mucha más memoria del host de la que sugiere un único lote visible. Esta distinción sigue siendo visible durante las pruebas domésticas posteriores.
ARC es un gran consumidor recuperable por diseño
La caché de reemplazo adaptable conserva los bloques de ZFS usados recientemente y con frecuencia para evitar lecturas del almacenamiento. En Linux participa en la gestión de la presión de memoria y puede reducir su tamaño residente cuando el sistema necesita páginas en otro lugar. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
La documentación de OpenZFS sobre el tamaño y la recuperación de ARC describe los controles de tamaño de ARC y los parámetros ajustables relacionados con la recuperación. Un máximo configurado es un límite superior, no una promesa de que los datos almacenados en caché permanecerán residentes bajo presión. Ese límite debe medirse por separado en condiciones operativas realistas.
Cuando crecen los búferes fijados, la expulsión de ARC puede ser la respuesta correcta, no una fuga. La consecuencia aparece después en forma de menores tasas de aciertos de caché, más lecturas del disco y un acceso más lento a los archivos una vez finalizado el trabajo de IA, hasta que la caché vuelve a calentarse.
La memoria unificada y las métricas de los contenedores pueden ocultar la competencia
En una GPU integrada, los tensores del modelo y la caché del sistema de archivos utilizan la misma RAM física, aunque los paneles indiquen el uso de forma diferente. En una GPU dedicada, la preparación de datos en el host permanece separada de la VRAM, pero sigue compitiendo con ARC en el servidor.
La implementación del reductor de ARC de OpenZFS para Linux registra el comportamiento de recuperación de ARC en la gestión de memoria del kernel. La evidencia a nivel de código ayuda a distinguir la reducción deliberada de la caché de una orden directa de la aplicación para que ZFS descarte bloques. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
El límite de fallo consiste en asumir que hay memoria fijada siempre que ARC disminuye. Un escaneo grande de archivos, límites explícitos de ARC, presión de metadatos, recuperación del cgroup, crecimiento de máquinas virtuales o un comportamiento adaptativo normal pueden producir el mismo gráfico. Confirma los recuentos de páginas fijadas y el momento de las asignaciones.
Correlaciona los bytes fijados con la recuperación de ARC y los fallos de caché
Ejecuta una carga de trabajo de IA fija mientras registras la memoria fijada o no desalojable, MemAvailable, las pausas de recuperación, el tamaño y el objetivo de ARC, la tasa de aciertos de ARC, las lecturas de ZFS, el tamaño del grupo de búferes fijados, el número de trabajadores, el tamaño del lote, la VRAM y la latencia de las solicitudes. Incluye una línea base de almacenamiento sin IA.
Usa la memoria compartida del host para separar los síntomas de CPU, memoria y almacenamiento. Repite la prueba con transferencias paginables, una profundidad de precarga menor, menos trabajadores y un grupo de memoria fijada limitado, cambiando un solo control por ejecución. Esta dependencia debe seguir siendo explícita en la interfaz final.
Considera causal la fijación cuando la contracción de ARC siga al crecimiento de la memoria fijada y disminuya con un grupo más pequeño. Limita el grupo si los fallos de almacenamiento perjudican a otros servicios, pero conserva suficiente memoria fijada para evitar que el acelerador se quede sin recursos; el equilibrio correcto depende de la demanda simultánea del NAS.
Centro de Tecnología e IA
Más para leer

¿Qué causa los bucles de reconexión de WebSocket en una interfaz remota de IA doméstica?
Diagnostica los bucles de WebSocket en las capas de enlace, proxy, autenticación, latido, ruta de red, recuperación de sesión y espera progresiva del cliente.

¿Qué provoca que las sumas de comprobación de las copias de seguridad no coincidan después de una transferencia interrumpida?
Rastrea las discrepancias de las sumas de comprobación mediante instantáneas de origen, manifiestos de fragmentos, desplazamientos de reanudación, archivos parciales, transformaciones, escrituras en el...

¿Qué causa entidades domésticas duplicadas en un grafo de conocimiento privado?
Diagnostica los nodos duplicados del grafo de conocimiento separando las variantes de extracción, las claves de identidad, los umbrales de resolución, la procedencia de...

