Que funcionalidades permitem o isolamento por utilizador num servidor de IA doméstico partilhado?

Eva Wong é a Redatora Técnica e e entusiasta residente na ZimaSpace. Uma geek de longa data com paixão por homelabs e software de código aberto, ela é especialista em traduzir conceitos técnicos complexos em guias acessíveis e práticos . Eva acredita que o auto-hospedagem deve ser divertida, não intimidante. Através dos seus tutoriais, ela capacita a comunidade adesmistificar configurações de hardware , desde a construção do seu primeiro NAS até dominar os contêineres Docker., from building their first NAS to mastering Docker containers.

O isolamento por utilizador exige autorização vinculada à identidade em cada fronteira de dados e ferramentas, além de controlos de recursos que impeçam um membro do agregado familiar de consumir o servidor partilhado.

Uma única GPU doméstica pode servir vários membros da família sem carregar um modelo separado para cada pessoa, mas a inferência partilhada não é o mesmo que acesso partilhado. O gateway deve preservar quem iniciou cada pedido, filtrar a recuperação e a memória com base nessa identidade, delegar apenas credenciais com âmbito limitado e impor filas ou quotas por utilizador antes de o trabalho chegar aos serviços comuns de modelos e armazenamento.

A identidade tem de persistir em todo o percurso do pedido

A autenticação estabelece quem está a utilizar a interface, mas o isolamento depende de transportar essa identidade pela recuperação, composição do prompt, chamadas de ferramentas, registos e tarefas em segundo plano. Substituí-la por uma única conta de serviço partilhada destrói o contexto necessário para as decisões de autorização a jusante.

Uma arquitetura detalhada de isolamento da identidade dos inquilinos separa a identidade do inquilino, o isolamento de dados, a encriptação, os limites de frequência e as quotas de recursos. Os mesmos limites aplicam-se a um agregado familiar, no qual cada utilizador tem ficheiros privados e diferentes privilégios de automação.

Os tokens de delegação de curta duração devem identificar tanto o utilizador como a ação do agente. Os serviços devem validá-los de forma independente, em vez de confiarem no texto de identidade incluído no prompt, que um LLM pode interpretar incorretamente ou que um documento injetado pode manipular.

Os dados, a memória e as credenciais precisam de espaços de nomes separados

Cada documento, fragmento, memória, conversa e credencial de ferramenta deve incluir uma política de proprietário ou de grupo autorizado. A recuperação aplica esses filtros antes de os candidatos entrarem no contexto do modelo, e as caches incluem o âmbito de autorização para que um resultado privado não possa ser reutilizado por outro utilizador.

Um modelo de controlo de acesso no momento da consulta para embeddings preserva o contexto de controlo de acesso aos ficheiros juntamente com o conteúdo indexado. Demonstra por que motivo a semelhança semântica deve permanecer subordinada às permissões originais da fonte, em vez de se tornar uma nova forma de as contornar.

As credenciais merecem o espaço de nomes mais restrito. O assistente de uma criança pode ler um calendário partilhado, mas não o e-mail de um progenitor; um fluxo de trabalho multimédia pode escrever numa pasta, mas não em todas as partilhas NAS. O modelo vê as descrições das ferramentas, enquanto o gateway de execução guarda e disponibiliza os segredos efetivos.

O isolamento computacional controla os vizinhos ruidosos, não o acesso aos dados

Os limites de simultaneidade por utilizador, os orçamentos de tokens, os pesos das filas e o cancelamento impedem que uma geração longa monopolize os recursos da GPU. A CPU, a RAM, o armazenamento temporário e a saída de rede também precisam de limites, porque as cargas de trabalho das ferramentas podem esgotar o servidor fora do modelo.

Um modelo de disponibilização com quotas de tokens por cliente explica a etiquetagem dos pedidos, a aplicação de quotas, os controlos contra vizinhos ruidosos e o agendamento partilhado de GPU. Estes mecanismos melhoram a equidade, mas não substituem a autorização de documentos e credenciais. Esta distinção continua visível durante os testes posteriores do agregado familiar.

A fronteira de falha consiste em assumir que uma sessão de chat separada equivale a isolamento. Caches vetoriais partilhadas, caches de prefixos, ficheiros temporários, registos ou credenciais de serviço demasiado abrangentes podem ainda atravessar utilizadores. Teste todos os componentes partilhados quanto a chaves conscientes da identidade e ao bloqueio de acesso, não apenas a base de dados visível da aplicação.

Execute um teste de isolamento entre utilizadores

Crie duas contas com um documento partilhado, um documento privado para cada uma, memórias distintas, diferentes permissões de ferramentas e quotas de computação desiguais. Emita consultas semanticamente idênticas, tentativas diretas de adivinhar caminhos, pedidos de aquecimento da cache, prompts longos simultâneos e tarefas em segundo plano a partir de ambas as identidades.

Compare a fronteira de autorização com o isolamento baseado em capacidades, que trata o âmbito da capacidade como parte da segurança do agente, e não como um comportamento do prompt. Registe leituras bem-sucedidas, tentativas negadas, atrasos na fila, chaves da cache, identidade da credencial delegada e eventos de auditoria.

Considere o teste aprovado apenas quando forem apresentadas evidências partilhadas a ambos os utilizadores, as evidências privadas nunca entrarem no contexto do outro e uma carga de trabalho não puder privar a outra de recursos para além da política declarada. Qualquer acerto de cache entre utilizadores que contenha contexto privado é um defeito bloqueador.

Centro de Tecnologia e IA

Mais para Ler

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.