La búsqueda basada en visión y lenguaje puede comenzar con alrededor de 8–12 GB de VRAM, pero el tamaño del modelo, la cuantización, los tokens de imagen, la longitud del contexto y la concurrencia determinan el mínimo fiable.
Un modelo cuantizado compacto de clase 7B puede cargarse en una GPU de 8 GB, pero fallar cuando se procesan conjuntamente varias imágenes de alta resolución y un historial de chat largo. La búsqueda también puede utilizar un codificador de imágenes y un reranker independientes. La capacidad debe incluir las asignaciones máximas durante la ejecución, no solo el tamaño del archivo del modelo mostrado en el disco durante el patrón de consultas más exigente previsto.
Los pesos establecen el mínimo, no el pico
La memoria teórica de los pesos es el número de parámetros multiplicado por los bits por parámetro. Siete mil millones de parámetros a cuatro bits ocupan aproximadamente 3,5 GB antes de añadir escalas, metadatos, búferes del framework y cualquier capa no cuantizada. El codificador de imágenes puede ser independiente o estar integrado en el modelo.
Una explicación práctica de los componentes de la memoria de la GPU separa los pesos del modelo, la caché KV, las activaciones y la sobrecarga de ejecución. Por tanto, el tamaño del archivo por sí solo subestima la memoria necesaria para la inferencia.
La cuantización reduce la memoria ocupada por los pesos, pero no disminuye todas las asignaciones en la misma proporción. Las proyecciones visuales, los búferes temporales de atención y algunos kernels pueden permanecer en precisión de 16 bits. Un modelo que apenas se carga no deja margen para consultas reales con imágenes.
Las imágenes se convierten en tokens y estado de ejecución
Los codificadores de visión dividen o redimensionan las imágenes en parches y luego envían los tokens visuales al modelo de lenguaje. Más imágenes, una resolución máxima admitida más alta o el teselado dinámico aumentan el número de tokens. Esos tokens incrementan el trabajo de atención y, en las etapas autorregresivas, la demanda de caché KV.
La investigación sobre el ajuste de instrucciones visuales muestra cómo las imágenes se conectan con los modelos de lenguaje mediante representaciones visuales aprendidas. La arquitectura y el preprocesamiento determinan cuántas características visuales entran en el contexto.
Procesar varias búsquedas por lotes multiplica el estado activo de imágenes y texto, aunque los pesos sigan compartidos. Por eso, el nivel de 8–12 GB es adecuado para búsquedas compactas de un solo usuario, mientras que 16–24 GB ofrece más margen para modelos grandes, varias imágenes o solicitudes simultáneas.
Cuándo dejan de aplicarse las recomendaciones de VRAM
Los sistemas con memoria unificada, la descarga a la CPU, los codificadores divididos y la búsqueda de embeddings respaldada en disco cambian la limitación. La descarga puede permitir ejecutar un modelo con menos VRAM, pero aumenta la latencia. Los embeddings de imágenes precalculados requieren mucho menos trabajo de visión durante la ejecución que generar descripciones para cada consulta.
Un análisis de la asignación de la caché KV ilustra cómo la longitud del contexto y la asignación de la caché KV pueden obligar a establecer límites más bajos incluso cuando los pesos caben. Las entradas multimodales ajustan aún más ese mismo presupuesto.
Estos rangos tampoco se aplican al entrenamiento o al ajuste fino, que requieren gradientes y el estado del optimizador. Describen únicamente la inferencia. Una mayor cantidad de VRAM no garantiza una búsqueda precisa si los embeddings de imágenes, el OCR, la combinación de metadatos o la evaluación son deficientes.
Verifica el pico de VRAM con consultas de imágenes representativas
Carga el modelo cuantizado, el codificador y el reranker previstos; después, ejecuta consultas representativas con una imagen, varias imágenes, alta resolución e historiales largos. Repite las pruebas con la concurrencia planificada y registra la VRAM asignada y reservada, los eventos de falta de memoria, la latencia del primer token y el tiempo de procesamiento de imágenes.
Prueba con un conjunto de datos de ancho de banda del canal de imágenes que refleje imágenes y capturas de pantalla de creadores, en lugar de entradas sintéticas en blanco. Mantén separados los flujos de embeddings precalculados y de codificación en tiempo real.
Selecciona un nivel de VRAM cuyo peor caso de consulta válida se mantenga por debajo de aproximadamente el 80–85 % de la capacidad. Si solo se dispara la codificación de imágenes, traslada ese codificador o precalcula los embeddings. Si domina la caché KV, limita el contexto o la concurrencia antes de asumir que necesitas un modelo de visión más grande.
Centro de Tecnología e IA
Más para leer

Cómo medir la calidad de recuperación de RAG local e interpretar la exhaustividad, la precisión y la cobertura de citas
Crea un conjunto de pruebas RAG local, calcula las métricas principales de recuperación, interpreta sus ventajas y desventajas, y audita si las afirmaciones de...

¿Por qué es cada vez más importante la computación de funciones del hogar inteligente a medida que aumenta la cantidad de sensores con la misma frecuencia de muestreo?
Rastrea el procesamiento por sensor y entre sensores a medida que aumenta el número de dispositivos, identifica los costos no lineales de la fusión...

¿Por qué importa más el costo de evaluar RAG a medida que crece la biblioteca de documentos con el mismo volumen de consultas?
Comprende por qué el crecimiento del corpus aumenta el esfuerzo de evaluación de RAG sin más consultas de los usuarios y cómo las pruebas...

