Sí, si «sin descifrarlos en reposo» significa que los documentos permanecen cifrados en el almacenamiento y solo se descifran dentro de un proceso de confianza cuando deben indexarse o recuperarse. Ese es un diseño realista para un sistema RAG doméstico privado. Sin embargo, la búsqueda semántica ordinaria no puede simplemente apuntar un modelo de embeddings hacia un texto cifrado opaco y comprender el documento.
Por lo tanto, la arquitectura práctica consiste en almacenamiento cifrado en reposo, descifrado controlado en la memoria, índices derivados cifrados o con acceso controlado y una estricta separación de claves. Buscar directamente sobre texto cifrado solo es posible con técnicas criptográficas especializadas, y esas técnicas no sustituyen directamente a una base de datos vectorial normal.
«Cifrado en reposo» no significa «nunca se descifra»
El cifrado en reposo protege los archivos mientras están almacenados en un disco, SSD, destino de copia de seguridad o dispositivo apagado. Un proceso con la clave correcta aún puede descifrar los datos cuando es necesario realizar una operación legítima.
Documento cifrado en el disco
|
| lectura autorizada
v
Memoria del proceso RAG de confianza
├─ descifrar
├─ analizar / dividir en fragmentos
├─ generar embeddings
└─ recuperar
|
v
Índice cifrado / base de datos protegida
Esto es similar a cómo funcionan muchas bases de datos y sistemas de archivos cifrados: el medio de almacenamiento no contiene texto plano útil, pero las aplicaciones pueden ver el texto plano después de la autorización.
Ese diseño es compatible con un asistente de IA privado en un NAS. La clave es definir dónde se permite que exista texto plano y durante cuánto tiempo.
Por qué la búsqueda vectorial normal no puede buscar texto cifrado sin procesar
Un modelo de embeddings necesita características significativas del texto, la imagen o el audio. El cifrado convencional destruye intencionadamente los patrones visibles para que el texto cifrado no conserve las relaciones semánticas que el modelo necesita.
Si dos frases en texto plano son similares, sus textos cifrados de forma segura no deberían parecerse entre sí de manera evidente. De lo contrario, se filtraría información sobre los originales.
Por lo tanto, una ruta normal de ingesta RAG hace lo siguiente:
- Autentica el proceso.
- Descifra el documento en la memoria o en un área temporal estrictamente controlada.
- Extrae y normaliza el contenido.
- Crea fragmentos y embeddings.
- Almacena los datos de búsqueda derivados bajo su propia política de protección.
- Descarta el texto plano temporal cuando finalice la ingesta.
La frase «los documentos cifrados permanecen cifrados en reposo» puede seguir siendo cierta durante todo este flujo de trabajo, porque el texto plano nunca necesita convertirse en un archivo persistente en el disco.
Los embeddings no son lo mismo que el documento original, pero siguen siendo confidenciales
Un error común es cifrar los archivos PDF y dejar sin protección los embeddings, el texto de los fragmentos, los nombres de archivo, los metadatos y las instantáneas de la base de datos vectorial. Eso traslada el problema de privacidad en lugar de resolverlo.
| Artefacto | ¿Puede revelar información? | Tratamiento recomendado |
|---|---|---|
| Archivo original | Sí, directamente | Cifrar en reposo |
| Texto del fragmento extraído | Sí, directamente | Cifrar o evitar texto plano persistente |
| Vector de embedding | Potencialmente, como derivado semántico | Proteger como datos confidenciales |
| Nombre de archivo / etiquetas | A menudo | Minimizar y controlar el acceso |
| Índice vectorial | Puede exponer relaciones y pertenencia | Cifrar el almacenamiento y restringir el acceso |
| Respaldo / instantánea | Contiene copias históricas | Cifrar de forma independiente |
La documentación de seguridad actual de Qdrant enfatiza que una implementación autoalojada debe protegerse de forma explícita. El cifrado del almacenamiento es responsabilidad de la infraestructura en entornos autogestionados, no algo que deba darse por hecho porque la base de datos sea local.
En un sistema de búsqueda privado, trata los embeddings como parte de la base de conocimientos protegida, no como archivos de caché inofensivos.
¿Dónde deben almacenarse las claves de descifrado?
No almacenes la clave de descifrado junto a los documentos cifrados en un archivo de configuración legible por todo el mundo. El objetivo es que robar el disco o copiar un respaldo no sea suficiente para recuperar los datos.
Un diseño más sólido para un laboratorio doméstico separa:
- volumen de datos: documentos y archivos de base de datos cifrados;
- material criptográfico: llavero del sistema operativo, almacenamiento de claves respaldado por hardware o un almacén de secretos protegido por separado;
- identidad del servicio: el proceso RAG recibe únicamente las claves que necesita;
- claves de respaldo: guardadas fuera de la única copia del respaldo cifrado.
El cifrado del disco por sí solo no puede proteger un servidor en ejecución completamente desbloqueado frente a una vulneración con privilegios de administrador. Protege frente a otra amenaza: discos robados, copias sin conexión, hardware retirado y acceso no autorizado a los medios de respaldo.
¿Cómo se evitan los archivos temporales en texto plano?
Muchos analizadores de documentos crean archivos temporales discretamente. Las canalizaciones de OCR pueden desempaquetar páginas, los conversores de documentos de oficina pueden escribir formatos intermedios y las herramientas de PDF pueden almacenar en caché los recursos extraídos.
Audita la ruta de ingesta y elige uno de estos tres patrones:
- transmite los bytes descifrados directamente al analizador;
- usa un sistema de archivos temporal respaldado por RAM para los archivos intermedios;
- coloca el almacenamiento temporal en un volumen cifrado y elimínalo inmediatamente después del procesamiento.
Revisa también los registros. Un registro de «depuración» que imprima el texto de los documentos, las indicaciones, los fragmentos recuperados o los argumentos de las herramientas puede convertirse en la copia sin cifrar más grande de la base de conocimientos.
¿Puede el cifrado homomórfico buscar en los documentos sin descifrarlos?
El cifrado homomórfico es la tecnología a la que recurre la mayoría cuando quiere realizar cálculos sobre datos cifrados. La documentación de SEAL de Microsoft explica que los esquemas homomórficos pueden realizar determinados cálculos mientras los valores permanecen cifrados.
Pero también expone una limitación importante: el cifrado homomórfico tiene una sobrecarga de rendimiento considerable y admite eficientemente solo ciertas operaciones. Microsoft SEAL permite realizar operaciones aritméticas, como sumas y multiplicaciones cifradas; las comparaciones generales, la ordenación y las expresiones regulares normalmente no resultan prácticas del mismo modo que con el cálculo en texto sin cifrar.
Los cálculos aproximados de distancia pueden construirse con esquemas como CKKS, por lo que la investigación sobre búsquedas vectoriales con preservación de la privacidad es real. Eso no convierte la búsqueda semántica cifrada en algo equivalente a instalar Qdrant, pgvector o Weaviate y activar una opción de «consulta cifrada».
| Enfoque | Viabilidad práctica del RAG en el hogar | Principal desventaja |
|---|---|---|
| Disco cifrado + descifrado en memoria | Alta | El proceso en ejecución puede acceder al texto sin cifrar |
| Volumen de base de datos cifrado | Alta | Protege el almacenamiento, no un entorno de ejecución comprometido |
| Cifrado buscable / homomórfico | Especializado | Complejidad, modelos de filtración, rendimiento |
| Subir el texto cifrado a una base de datos vectorial común | No resulta útil | No queda ninguna estructura semántica |
Un diseño de RAG privado más seguro
Para la mayoría de los hogares y equipos pequeños, la mejor relación entre seguridad y complejidad es la siguiente:
Conjunto de datos cifrado en el NAS
|
| clave específica del servicio
v
Contenedor de ingesta de RAG
|
+-- solo texto sin cifrar en la memoria / temporal cifrado
|
+-- embeddings + metadatos
v
Volumen cifrado de la base de datos vectorial
|
v
Servicio de recuperación local
|
| fragmentos mínimos recuperados
v
Modelo local o modelo en la nube aprobado
Si interviene un modelo en la nube, el almacenamiento puede permanecer perfectamente cifrado mientras el texto recuperado sigue saliendo del hogar dentro del prompt. El cifrado del almacenamiento y el control de salida de datos son problemas distintos. La guía sobre los límites de confianza de la IA local resulta útil aquí: el componente autorizado para descifrar los datos no debería ser automáticamente el mismo que tiene permiso para transmitirlos.
Lista de comprobación del cifrado de RAG privado
- Cifra el volumen de documentos de origen.
- Protege también el almacenamiento de la base de datos vectorial, las instantáneas y las copias de seguridad.
- Mantén las claves fuera de los directorios habituales de documentos.
- Concede al servicio RAG únicamente el acceso mínimo necesario a las claves y las rutas.
- Evita las cachés persistentes de extracción en texto plano.
- Inspecciona los directorios temporales de OCR, conversión y depuración.
- No registres de forma predeterminada los fragmentos privados recuperados.
- Separa el permiso de recuperación local del permiso de salida a la nube.
- Prueba la recuperación antes de rotar o eliminar las claves de cifrado.
La guía de búsqueda documental y RAG puede ayudar a aplicar esta capa de seguridad a la extracción, segmentación, generación de embeddings y recuperación.
Preguntas frecuentes
¿Puede una base de datos vectorial indexar directamente un PDF cifrado con AES?
No. Un proceso autorizado debe descifrar el contenido antes de que un modelo normal de embeddings de texto o multimodal pueda extraer su semántica.
¿El cifrado de disco completo protege un servidor RAG en ejecución?
Solo parcialmente. Una vez desbloqueado el volumen, los procesos con privilegios pueden leerlo. El cifrado de disco completo ofrece la mayor protección contra el acceso sin conexión, los discos robados y los medios copiados.
¿Deben cifrarse los embeddings?
Para conocimiento privado sensible, sí: protege el almacenamiento que contiene los embeddings e índices, restringe el acceso a la base de datos e incluye esos archivos en la misma revisión de seguridad que los documentos de origen.
Veredicto final
Un sistema RAG privado puede mantener los documentos cifrados en reposo sin renunciar a la búsqueda semántica habitual. El patrón realista consiste en un descifrado controlado y temporal dentro de memoria de confianza, no en una búsqueda mágica sobre texto cifrado opaco. Protege los embeddings e índices derivados, separa las claves de los datos, elimina los archivos temporales en texto plano y trata la búsqueda homomórfica como un diseño criptográfico especializado, no como una función habitual de un RAG doméstico.
Centro de Tecnología e IA
Más para leer

Las 10 mejores interfaces web de IA local para laboratorios domésticos en 2026
Compara 10 interfaces web de IA locales autoalojadas para laboratorios domésticos, incluyendo compatibilidad con Ollama, RAG, agentes, acceso multiusuario, dificultad de configuración y casos...

¿Cuánto cuesta GPT-6 Astra con el tiempo? Cuándo tiene sentido la IA en la nube frente a la IA local
Una guía práctica sobre los costos de GPT-6 Astra que abarca el uso de tokens, las cargas de trabajo de IA a largo plazo,...

GPT-6 Astra frente a la IA local: ¿Qué partes de un agente deberían permanecer en tu servidor doméstico?
GPT-6 Astra puede permanecer en la nube mientras tu servidor doméstico mantiene localmente los archivos, la memoria, el RAG, las herramientas, los permisos y...

