Un millón de fragmentos requieren aproximadamente entre 1,5 y 6,1 GB solo para los vectores float32 habituales, antes de añadir índices de grafos, metadatos, texto, réplicas y espacio de trabajo.
El cálculo comienza con las dimensiones, no con el número de documentos: un millón de vectores de 768 dimensiones en formato float32 contienen 768 millones de valores de cuatro bytes, es decir, unos 3,07 GB decimales. Un almacenamiento listo para producción ocupa más espacio porque debe identificar los vectores, buscarlos de forma eficiente, filtrar los metadatos, conservar el texto de los fragmentos y soportar el mantenimiento de los índices durante las operaciones de búsqueda y mantenimiento en el servidor.
Los bytes de los vectores sin procesar proporcionan el mínimo reproducible
Multiplica el número de fragmentos por las dimensiones de los embeddings y los bytes por coordenada. Para un millón de vectores float32, 384 dimensiones utilizan 1,536 GB, 768 utilizan 3,072 GB y 1.536 utilizan 6,144 GB. Los gigabytes binarios parecen aproximadamente un siete por ciento más pequeños en las unidades mostradas.
Una descripción general del escalado muestra la misma relación de almacenamiento de vectores sin procesar: el número de dimensiones multiplicado por el tamaño del valor determina la carga útil de coordenadas antes de añadir las estructuras de la base de datos.
Float16 puede reducir a la mitad el componente vectorial, mientras que int8 o la cuantización de productos pueden reducirlo aún más. La compresión puede afectar a la exhaustividad y requiere compatibilidad por parte de la base de datos. Los documentos originales y el texto de los fragmentos generados no están incluidos en estas cifras.
Los índices y los metadatos pueden igualar a las coordenadas
La búsqueda plana añade relativamente poca estructura de índice, pero analiza muchos vectores. HNSW almacena enlaces entre vecinos y varias capas de grafos para reducir el trabajo de búsqueda. Los identificadores por vector, las marcas de registros eliminados, los filtros, la alineación y las páginas de la base de datos añaden más sobrecarga.
Una introducción a la conectividad HNSW explica por qué la conectividad de grafos acelera la búsqueda aproximada, al tiempo que consume memoria y almacenamiento adicionales. El número de vecinos configurado modifica directamente ese coste.
Los metadatos varían aún más. Un identificador de documento compacto y un código de idioma pueden añadir decenas de bytes; las rutas repetidas, los permisos y el texto completo de los fragmentos pueden añadir cientos o miles. Almacena el texto una sola vez o de forma coherente dentro de la base de datos vectorial antes de comparar los totales.
Cuándo falla una única estimación de almacenamiento
Un intervalo práctico de planificación para un millón de fragmentos float32 de 768 dimensiones suele ser de 5 a 12 GB para los vectores más un índice aproximado, antes de añadir texto sustancial y réplicas. Este es un intervalo presupuestario, no una garantía de formato.
Una comparación de arquitecturas vectoriales estima una sobrecarga de almacenamiento de HNSW que supera considerablemente a las coordenadas sin procesar en algunas configuraciones de HNSW. Los valores predeterminados del motor y los parámetros del grafo determinan el multiplicador real.
El intervalo deja de ser válido con varios embeddings por fragmento, índices híbridos de palabras clave, replicación, instantáneas o reconstrucciones que duplican temporalmente los datos. También puede sobreestimar un almacenamiento comprimido respaldado en disco. “Un millón de fragmentos” no es suficiente si no se especifican las dimensiones, el tipo de datos, el índice, los metadatos y el número de copias.
Extrapola a partir de una muestra del diez por ciento del índice
Inserta 100.000 fragmentos representativos utilizando el tipo de datos final de los embeddings, el esquema de metadatos y los parámetros del índice. Mide por separado los bytes de la columna de vectores sin procesar, el índice, los metadatos, el texto, el registro de escritura anticipada y las instantáneas después de la compactación. Extrapola por diez los componentes escalables y añade margen para la reconstrucción y las copias de seguridad.
Realiza la prueba en el nivel de espacio de trabajo de almacenamiento previsto, porque la compresión y la asignación del sistema de archivos afectan a los totales físicos. Evita extrapolar a partir de archivos de base de datos vacíos.
Presupuesta al menos el total estable medido, más una copia temporal del índice y un 20 % de espacio libre. Si la replicación está activada, multiplica solo los componentes replicados. Repite la muestra cada vez que cambien las dimensiones, los metadatos o la configuración de vecinos de HNSW.
Centro de Tecnología e IA
Más para leer

Cómo medir la calidad de recuperación de RAG local e interpretar la exhaustividad, la precisión y la cobertura de citas
Crea un conjunto de pruebas RAG local, calcula las métricas principales de recuperación, interpreta sus ventajas y desventajas, y audita si las afirmaciones de...

¿Por qué es cada vez más importante la computación de funciones del hogar inteligente a medida que aumenta la cantidad de sensores con la misma frecuencia de muestreo?
Rastrea el procesamiento por sensor y entre sensores a medida que aumenta el número de dispositivos, identifica los costos no lineales de la fusión...

¿Por qué importa más el costo de evaluar RAG a medida que crece la biblioteca de documentos con el mismo volumen de consultas?
Comprende por qué el crecimiento del corpus aumenta el esfuerzo de evaluación de RAG sin más consultas de los usuarios y cómo las pruebas...

