¿Cuánta memoria de GPU se necesita para realizar búsquedas de visión y lenguaje en un NAS doméstico?

Eva Wong es la Redactora técnica y manitas residente en ZimaSpace. Una geek de toda la vida con pasión por los homelabs y el software de código abierto, se especializa en traducir conceptos técnicos complejos en guías accesibles y prácticas. Eva cree que el autoalojamiento debe ser divertido, no intimidante. A través de sus tutoriales, empodera a la comunidad para desmitificar las configuraciones de hardware, desde construir su primer NAS hasta dominar los contenedores Docker.

La búsqueda basada en visión y lenguaje puede comenzar con alrededor de 8–12 GB de VRAM, pero el tamaño del modelo, la cuantización, los tokens de imagen, la longitud del contexto y la concurrencia determinan el mínimo fiable.

Un modelo cuantizado compacto de clase 7B puede cargarse en una GPU de 8 GB, pero fallar cuando se procesan conjuntamente varias imágenes de alta resolución y un historial de chat largo. La búsqueda también puede utilizar un codificador de imágenes y un reranker independientes. La capacidad debe incluir las asignaciones máximas durante la ejecución, no solo el tamaño del archivo del modelo mostrado en el disco durante el patrón de consultas más exigente previsto.

Los pesos establecen el mínimo, no el pico

La memoria teórica de los pesos es el número de parámetros multiplicado por los bits por parámetro. Siete mil millones de parámetros a cuatro bits ocupan aproximadamente 3,5 GB antes de añadir escalas, metadatos, búferes del framework y cualquier capa no cuantizada. El codificador de imágenes puede ser independiente o estar integrado en el modelo.

Una explicación práctica de los componentes de la memoria de la GPU separa los pesos del modelo, la caché KV, las activaciones y la sobrecarga de ejecución. Por tanto, el tamaño del archivo por sí solo subestima la memoria necesaria para la inferencia.

La cuantización reduce la memoria ocupada por los pesos, pero no disminuye todas las asignaciones en la misma proporción. Las proyecciones visuales, los búferes temporales de atención y algunos kernels pueden permanecer en precisión de 16 bits. Un modelo que apenas se carga no deja margen para consultas reales con imágenes.

Las imágenes se convierten en tokens y estado de ejecución

Los codificadores de visión dividen o redimensionan las imágenes en parches y luego envían los tokens visuales al modelo de lenguaje. Más imágenes, una resolución máxima admitida más alta o el teselado dinámico aumentan el número de tokens. Esos tokens incrementan el trabajo de atención y, en las etapas autorregresivas, la demanda de caché KV.

La investigación sobre el ajuste de instrucciones visuales muestra cómo las imágenes se conectan con los modelos de lenguaje mediante representaciones visuales aprendidas. La arquitectura y el preprocesamiento determinan cuántas características visuales entran en el contexto.

Procesar varias búsquedas por lotes multiplica el estado activo de imágenes y texto, aunque los pesos sigan compartidos. Por eso, el nivel de 8–12 GB es adecuado para búsquedas compactas de un solo usuario, mientras que 16–24 GB ofrece más margen para modelos grandes, varias imágenes o solicitudes simultáneas.

Cuándo dejan de aplicarse las recomendaciones de VRAM

Los sistemas con memoria unificada, la descarga a la CPU, los codificadores divididos y la búsqueda de embeddings respaldada en disco cambian la limitación. La descarga puede permitir ejecutar un modelo con menos VRAM, pero aumenta la latencia. Los embeddings de imágenes precalculados requieren mucho menos trabajo de visión durante la ejecución que generar descripciones para cada consulta.

Un análisis de la asignación de la caché KV ilustra cómo la longitud del contexto y la asignación de la caché KV pueden obligar a establecer límites más bajos incluso cuando los pesos caben. Las entradas multimodales ajustan aún más ese mismo presupuesto.

Estos rangos tampoco se aplican al entrenamiento o al ajuste fino, que requieren gradientes y el estado del optimizador. Describen únicamente la inferencia. Una mayor cantidad de VRAM no garantiza una búsqueda precisa si los embeddings de imágenes, el OCR, la combinación de metadatos o la evaluación son deficientes.

-15% OFF

Verifica el pico de VRAM con consultas de imágenes representativas

Carga el modelo cuantizado, el codificador y el reranker previstos; después, ejecuta consultas representativas con una imagen, varias imágenes, alta resolución e historiales largos. Repite las pruebas con la concurrencia planificada y registra la VRAM asignada y reservada, los eventos de falta de memoria, la latencia del primer token y el tiempo de procesamiento de imágenes.

Prueba con un conjunto de datos de ancho de banda del canal de imágenes que refleje imágenes y capturas de pantalla de creadores, en lugar de entradas sintéticas en blanco. Mantén separados los flujos de embeddings precalculados y de codificación en tiempo real.

Selecciona un nivel de VRAM cuyo peor caso de consulta válida se mantenga por debajo de aproximadamente el 80–85 % de la capacidad. Si solo se dispara la codificación de imágenes, traslada ese codificador o precalcula los embeddings. Si domina la caché KV, limita el contexto o la concurrencia antes de asumir que necesitas un modelo de visión más grande.

Centro de Tecnología e IA

Más para leer

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.