La generación local de imágenes se ralentiza con la vista previa en vivo porque los latentes intermedios deben decodificarse, convertirse, copiarse y mostrarse mientras el proceso de eliminación de ruido aún está en ejecución.
Normalmente, un modelo de difusión mantiene los estados intermedios en una representación latente compacta hasta que la imagen final está lista. La vista previa en vivo añade trabajo adicional entre los pasos de muestreo: un decodificador reconstruye los píxeles, el entorno de ejecución sincroniza las operaciones del dispositivo y un servidor puede codificar y transmitir el fotograma. Repetir este proceso a alta resolución puede competir con la propia generación por los recursos de cómputo y el ancho de banda de la memoria.
La vista previa convierte una decodificación final en muchas decodificaciones intermedias
Sin vista previa, el muestreador actualiza un tensor latente durante muchos pasos e invoca el decodificador de imágenes una sola vez, cerca del final. Una vista previa en cada paso invoca repetidamente un decodificador aproximado o completo, multiplicando el trabajo que no mejora la trayectoria final de eliminación de ruido.
La sobrecarga de la decodificación de vistas previas documenta que las vistas previas VAE completas pueden añadir bastante tiempo de ejecución, mientras que un decodificador de vistas previas pequeño reduce el coste, pero no lo elimina. La comparación aísla la elección del decodificador y la frecuencia de las vistas previas como variables de primer orden.
La ralentización aumenta con el número de píxeles porque los mapas de características decodificados y los fotogramas de salida escalan con la resolución. Una vista previa cada cinco pasos a 512 píxeles puede ser lo bastante económica, mientras que la decodificación a resolución completa en cada paso puede dominar una ejecución breve de muestreo acelerado.
La sincronización del dispositivo y el tráfico de memoria interrumpen el bucle de muestreo
Los kernels del acelerador normalmente se ejecutan de forma asíncrona, lo que permite al entorno de ejecución poner el trabajo en cola de manera eficiente. Leer una vista previa en el host puede forzar la sincronización, asignar búferes de imagen, mover bytes a través de una ruta de memoria compartida o PCIe y esperar a la conversión antes de que continúe el muestreo.
La arquitectura de difusión latente explica por qué la difusión latente realiza la costosa síntesis de imágenes en un espacio comprimido y utiliza un autocodificador para pasar entre píxeles y latentes. Cada vista previa cruza ese límite antes y con más frecuencia que la ruta que solo genera la salida final.
Los sistemas de memoria unificada evitan una copia explícita mediante PCIe, pero siguen compitiendo por el ancho de banda y la capacidad de la caché. En cambio, las GPU dedicadas pueden asumir costes de transferencia y sincronización. Por tanto, el fotograma de vista previa visible representa tanto la decodificación neuronal como la sobrecarga del sistema.
La codificación de la pantalla puede convertirse en el cuello de botella después de optimizar la decodificación
Una interfaz web local puede cambiar el tamaño de la vista previa, convertir los colores, codificarla en JPEG o PNG, serializarla, enviarla mediante un socket y pedir al navegador que la decodifique y la renderice. Las operaciones pequeñas repetidas decenas de veces pueden tardar más que un decodificador pequeño y rápido.
La investigación sobre la canalización de difusión en tiempo real reduce la latencia de la difusión en streaming mediante el procesamiento por lotes y optimizaciones de la canalización, lo que demuestra que la salida en tiempo real depende de toda la ruta de ejecución y no de un solo kernel del modelo. El transporte de la vista previa sigue estando fuera del recuento teórico de pasos del eliminador de ruido.
El error está en asumir que toda ejecución más lenta se debe a la representación de la vista previa. Diferentes semillas, el calentamiento, los límites térmicos, la descarga del modelo u otra carga de trabajo en la GPU pueden cambiar la duración. Compara solicitudes idénticas con la vista previa desactivada y conserva todos los demás ajustes.
Mide el coste de la vista previa por etapa y frecuencia
Ejecuta el mismo prompt, semilla, modelo, muestreador, número de pasos, resolución y tamaño de lote con la vista previa desactivada, cada diez pasos, cada cinco pasos y en cada paso. Registra el tiempo total, el tiempo de eliminación de ruido, el tiempo de decodificación, la codificación de imágenes, los bytes transferidos, la frecuencia de renderizado del navegador, la memoria máxima y la utilización del dispositivo.
Relaciona las lecturas de memoria y cómputo con las pruebas de cuellos de botella de recursos y repite después con un decodificador pequeño y un VAE completo. Mantén activada la decodificación final de la imagen en todas las ejecuciones para que la comparación mida únicamente las vistas previas intermedias añadidas.
Elige la frecuencia de vista previa más lenta que siga proporcionando información útil. Si predomina la decodificación, utiliza un decodificador o una resolución de vista previa más pequeños; si predominan la codificación y la transferencia, agrupa los fotogramas; si cambia el tiempo de eliminación de ruido, investiga la sincronización y la presión sobre la memoria.
Centro de Tecnología e IA
Más para leer

¿Por qué los cambios de archivos SMB llegan a un indexador incremental en ráfagas?
Observa cómo la caché de escritura SMB, las concesiones, CHANGE_NOTIFY, el desbordamiento del búfer, la reconexión y el procesamiento por lotes del indexador transforman...

¿Por qué el OCR omite el texto tenue después de recomprimir un PDF?
Aprende cómo la recomprensión de PDF cambia los píxeles tenues, por qué los visores pueden ocultar la pérdida y cómo probar la resolución, el...

¿Por qué la latencia de la IA local oscila con la curva del ventilador de un servidor doméstico?
Descubre cómo el calor, el control del ventilador, los límites de frecuencia, el retraso de los sensores y la sincronización de la carga de...

