El aislamiento por usuario requiere una autorización vinculada a la identidad en cada límite de datos y herramientas, además de controles de recursos que impidan que un miembro del hogar consuma el servidor compartido.
Una sola GPU doméstica puede atender a varios miembros de la familia sin cargar un modelo independiente para cada persona, pero la inferencia compartida no equivale al acceso compartido. La puerta de enlace debe conservar quién inició cada solicitud, filtrar la recuperación y la memoria según esa identidad, delegar únicamente credenciales con alcance limitado y aplicar colas o cuotas por usuario antes de que el trabajo llegue a los servicios comunes de modelos y almacenamiento.
La identidad debe mantenerse durante toda la ruta de la solicitud
La autenticación establece quién utiliza la interfaz, pero el aislamiento depende de trasladar esa identidad a través de la recuperación, el ensamblaje de instrucciones, las llamadas a herramientas, los registros y las tareas en segundo plano. Sustituirla por una única cuenta de servicio compartida destruye el contexto necesario para las decisiones de autorización posteriores.
Una arquitectura detallada de aislamiento de identidades de inquilinos separa la identidad del inquilino, el aislamiento de datos, el cifrado, los límites de frecuencia y las cuotas de recursos. Los mismos límites pueden aplicarse a un hogar, donde cada usuario tiene archivos privados y diferentes privilegios de automatización.
Los tokens de delegación de corta duración deben identificar tanto al usuario como a la acción del agente. Los servicios deben validarlos de forma independiente en lugar de confiar en texto de identidad incluido en la instrucción, que un LLM puede interpretar incorrectamente o que un documento inyectado puede manipular.
Los datos, la memoria y las credenciales necesitan espacios de nombres independientes
Cada documento, fragmento, memoria, conversación y credencial de herramienta debe incluir una política de propietario o de grupo autorizado. La recuperación aplica esos filtros antes de que los candidatos entren en el contexto del modelo, y las cachés incluyen el alcance de autorización para que un resultado privado no pueda reutilizarse para otro usuario.
Un diseño de control de acceso en tiempo de consulta para embeddings conserva el contexto de control de acceso de los archivos junto con el contenido indexado. Demuestra por qué la similitud semántica debe permanecer subordinada a los permisos originales de la fuente, en lugar de convertirse en una nueva vía para eludirlos.
Las credenciales merecen el espacio de nombres más restringido. El asistente de un menor puede leer un calendario compartido, pero no el correo electrónico de sus padres; un flujo de trabajo multimedia puede escribir en una carpeta, pero no en todos los recursos compartidos del NAS. El modelo ve las descripciones de las herramientas, mientras que la puerta de enlace de ejecución conserva y libera los secretos reales.
El aislamiento de cómputo controla a los usuarios ruidosos, no el acceso a los datos
Los límites de concurrencia por usuario, los presupuestos de tokens, las ponderaciones de cola y la cancelación impiden que una generación prolongada monopolice los recursos de la GPU. La CPU, la RAM, el almacenamiento temporal y la salida de red también necesitan límites, porque las cargas de trabajo de las herramientas pueden agotar el servidor fuera del modelo.
Un diseño de servicio con cuotas de tokens por cliente explica el etiquetado de solicitudes, la aplicación de cuotas, los controles contra usuarios ruidosos y la programación de GPU compartidas. Estos mecanismos mejoran la equidad, pero no sustituyen la autorización de documentos y credenciales. Esta distinción sigue siendo visible durante las pruebas posteriores del hogar.
El error está en suponer que una sesión de chat independiente equivale a aislamiento. Las cachés vectoriales compartidas, las cachés de prefijos, los archivos temporales, los registros o las credenciales de servicio demasiado amplias aún pueden cruzar usuarios. Prueba cada componente compartido para comprobar que utiliza claves conscientes de la identidad y deniega el acceso, no solo la base de datos visible de la aplicación.
Realiza una prueba de aislamiento entre usuarios
Crea dos cuentas con un documento compartido, un documento privado para cada una, memorias distintas, permisos diferentes para las herramientas y cuotas de cómputo desiguales. Emite desde ambas identidades consultas semánticamente idénticas, intentos directos de adivinar rutas, solicitudes para calentar la caché, instrucciones largas simultáneas y tareas en segundo plano.
Compara el límite de autorización con el aislamiento basado en capacidades, que considera el alcance de la capacidad parte de la seguridad del agente, no del comportamiento de la instrucción. Registra las lecturas exitosas, los intentos denegados, la espera en cola, las claves de caché, la identidad de la credencial delegada y los eventos de auditoría.
La prueba solo se supera cuando la evidencia compartida aparece para ambos usuarios, la evidencia privada nunca entra en el contexto del otro y una carga de trabajo no puede privar de recursos a la otra más allá de lo establecido en la política. Cualquier coincidencia de caché entre usuarios que contenga contexto privado es un defecto bloqueante.
Centro de Tecnología e IA
Más para leer

¿Qué componentes permiten realizar búsquedas híbridas en archivos NAS?
Aprende cómo los identificadores exactos y el significado semántico conducen a un único resultado clasificado de búsqueda de NAS sin eludir los permisos ni...

¿Qué características permiten seleccionar de forma fiable la versión de los documentos en RAG?
Descubre cómo RAG selecciona la revisión aplicable en lugar de la copia obsoleta más similar y cómo probar actualizaciones explícitas, implícitas y superpuestas.

¿Qué factores hacen que los planes de los agentes diverjan de los permisos de herramientas disponibles?
Descubre cómo el descubrimiento, la delegación, la retroalimentación de políticas y la replanificación mantienen los pasos propuestos por un agente de IA alineados con...

