Os clusters de pesquisa facial podem separar-se após a rotação, porque a deteção e o alinhamento podem produzir recortes e embeddings diferentes a partir da imagem recém-orientada.
Para uma pessoa, rodar uma fotografia de família parece preservar a identidade, mas o pipeline pode descodificar a orientação EXIF de forma diferente, reamostrar cada píxel, voltar a detetar o rosto e estimar novos pontos de referência. Um recorte deslocado altera a pose, o fundo, a nitidez e as proporções faciais apresentadas ao codificador. As correspondências limítrofes podem então ultrapassar o limiar de clustering, embora a pessoa não tenha mudado.
A Orientação Armazenada e a Rotação dos Píxeis São Entradas Diferentes
Uma edição da orientação EXIF pode deixar os píxeis comprimidos intactos, enquanto instrui os visualizadores a rodá-los. Uma rotação física reescreve o raster e normalmente volta a comprimi-lo. Se a indexação aplicar a orientação numa passagem, mas a ignorar ou duplicar noutra, o detetor vê uma geometria diferente.
A investigação sobre a rotação facial no plano trata a rotação facial arbitrária no plano como um desafio de deteção distinto e calibra progressivamente a orientação dos candidatos. A necessidade de uma calibração explícita mostra que um detetor normal de imagens direitas não é automaticamente invariante a 360 graus.
Um rosto indexado anteriormente pode manter um recorte direito, enquanto o registo regenerado começa a partir de píxeis brutos rodados lateralmente, ou vice-versa. Por isso, a invalidação da cache e a normalização da orientação determinam se fotografias visualmente equivalentes seguem o mesmo percurso.
O Alinhamento por Pontos de Referência Converte Pequenos Erros de Rotação em Novos Recortes
Os sistemas faciais detetam normalmente os olhos, o nariz e a boca, rodando e redimensionando depois um recorte para uma pose canónica. Uma estimativa diferente dos pontos de referência altera a transformação afim, mudando quais os píxeis do cabelo, queixo, fundo e rosto que ocupam cada posição no codificador.
Um estudo de reconhecimento facial sobre características faciais dependentes da rotação modela a rotação como um componente que altera as características profundas e aprende a compensá-la. O mecanismo sustenta a observação de que a pose e a rotação são representadas no espaço dos embeddings, em vez de desaparecerem automaticamente.
A interpolação acrescenta desfocagem e oscilações, enquanto gravações JPEG repetidas reduzem a textura fina. Um rosto pequeno, escuro ou de perfil perde mais qualidade do que um rosto grande e frontal, pelo que a mesma operação de rotação pode separar apenas os membros mais fracos do cluster de uma pessoa.
O Clustering Transforma o Movimento Contínuo dos Embeddings numa Separação Visível
Os embeddings movem-se continuamente, mas o clustering aplica um limiar, uma regra de vizinhança ou uma decisão de ligação. Um pequeno aumento da distância pode desligar uma fotografia do grafo, e voltar a executar o cluster pode separar imagens adicionais que dependiam dessa ponte.
O trabalho sobre qualidade dos embeddings faciais relaciona a magnitude das características faciais com a qualidade do reconhecimento e mostra que as amostras difíceis e de baixa qualidade ocupam regiões menos fiáveis. A desfocagem ou o pior alinhamento induzidos pela rotação podem, portanto, afetar tanto a similaridade como a confiança. Esta distinção continua visível durante testes domésticos posteriores.
O limite da falha consiste em tratar cada separação após a rotação como falta de invariância à rotação. Um novo modelo facial, um limiar de clustering alterado, miniaturas regeneradas ou uma fusão de pessoas duplicadas podem coincidir com a edição. Volte a gerar os embeddings dos píxeis originais e rodados através de um único pipeline congelado antes de atribuir a causa.
Execute um Teste de Invariância à Rotação em Todo o Pipeline Facial
Crie variantes sem perdas de 0, 90, 180 e 270 graus, além de rotações apenas por EXIF, para rostos representativos frontais, de perfil, pequenos, escuros e parcialmente obstruídos. Registe a orientação descodificada, a caixa do detetor, os pontos de referência, o recorte alinhado, a pontuação de qualidade, o embedding, a identidade mais próxima e a pertença ao cluster.
Use os componentes da pesquisa de fotografias como inventário de um pipeline de fotografias pesquisáveis e compare depois o resultado. Meça a revocação da deteção, a sobreposição dos recortes, a distância de cosseno entre pessoas iguais, a retenção do vizinho mais próximo e a conectividade do cluster, mantendo fixos o modelo, o limiar, o tamanho das miniaturas e o algoritmo de clustering. O resultado intermédio deve permanecer inspecionável antes de a automatização avançar.
Normalize a orientação antes da deteção e evite gravações repetidas com perdas. Se os recortes rodados continuarem inconsistentes, use um detetor consciente da rotação ou aumento de dados; se apenas as fotografias limítrofes se separarem, preserve as ligações de identidade manuais em vez de alargar globalmente o limiar e fundir pessoas diferentes.
Centro de Tecnologia e IA
Mais para Ler

Porque é que os gráficos de casas inteligentes dão saltos quando os carimbos de data/hora dos sensores são arredondados?
Saiba como o arredondamento, os intervalos de tempo, a agregação, a interpolação, os fusos horários e os carimbos de data/hora duplicados criam saltos artificiais...

Porque é que as respostas dos LLM locais ficam mais curtas sob carga simultânea?
Veja por que motivo a concorrência deve afetar a latência, não o significado, e como os orçamentos de serviço, os agendadores, a pressão sobre...

Porque é que os pedidos de aprovação do agente reaparecem depois de atualizar o navegador?
Saiba como o estado da página, o armazenamento da sessão, os registos do fluxo de trabalho do servidor, o âmbito de aprovação, a idempotência...

