As etiquetas de fotografias geradas por IA mudam depois de uma atualização porque o novo modelo representa as imagens, compara as etiquetas e aplica limites de confiança de forma diferente do modelo antigo.
Uma biblioteca de fotografias auto-hospedada pode manter os mesmos ficheiros originais, enquanto os termos de pesquisa inteligente, os objetos detetados, os grupos de rostos, as sugestões de duplicados ou as etiquetas de cenas mudam depois de uma atualização. Estas etiquetas são registos derivados da base de dados, não factos gravados permanentemente na imagem. Quando o codificador visual, o codificador de texto, o vocabulário de classes, o limiar, o pipeline de pré-processamento ou a regra de agrupamento mudam, o sistema recalcula onde uma fotografia se enquadra.
Uma etiqueta de fotografia é uma decisão do modelo, não metadados permanentes
Os carimbos de data/hora da câmara e os nomes dos ficheiros podem ser lidos a partir dos dados armazenados, mas etiquetas como “praia”, “cão”, “aniversário” ou “veículo” são previsões produzidas por uma determinada versão e configuração do modelo.
O Amazon Rekognition devolve a versão do modelo de deteção de etiquetas juntamente com os resultados, porque a versão faz parte do significado da previsão. O serviço também disponibiliza aliases, categorias e valores de confiança, em vez de tratar uma única cadeia de texto como uma propriedade imutável.
Um sistema local de fotografias deve preservar a mesma proveniência. Sem o nome e a versão do modelo, as definições de pré-processamento e a hora da tarefa, um administrador não consegue determinar se uma etiqueta alterada resulta de um novo modelo, de um limiar diferente ou de um índice danificado.
Novos embeddings criam um espaço de similaridade diferente
Os sistemas de pesquisa inteligente convertem normalmente cada imagem num vetor. As consultas de texto e os conceitos candidatos são mapeados para o mesmo espaço, e as etiquetas ou os resultados da pesquisa dependem dos itens que ficam mais próximos.
A Qdrant explica que mesmo pequenas alterações no modelo de embeddings podem mudar a geometria do espaço vetorial, sendo necessário voltar a gerar embeddings e a reindexar os dados para obter comparações rigorosas.
Os vetores antigos e novos não são pontuações intermutáveis. Uma fotografia próxima de “jardim” num espaço pode aproximar-se de “parque” ou “quintal” noutro, mesmo quando ambos os modelos fornecem descrições razoáveis da cena.
As palavras candidatas e os prompts alteram o vencedor
A classificação sem exemplos não descobre uma etiqueta universal independentemente da linguagem. Compara uma imagem com etiquetas candidatas ou prompts de texto fornecidos e ordena essas alternativas.
O fluxo de trabalho de classificação de imagens sem exemplos do Hugging Face constrói explicitamente prompts de etiquetas candidatas, como “Esta é uma fotografia de …”, antes de os comparar com uma imagem.
Uma atualização pode adicionar etiquetas, mudar-lhes o nome, traduzi-las ou alterar os modelos de prompt. Adicionar “golden retriever” pode substituir a etiqueta mais abrangente “cão”, enquanto remover uma classe específica pode fazer com que a mesma imagem passe a ser classificada como “animal”.
As hierarquias de etiquetas alteram o nível de detalhe
As etiquetas de fotografias formam frequentemente relações entre categorias principais e secundárias: veículo, carro, carro desportivo; comida, sobremesa, bolo. O sistema pode apresentar a classe mais específica, a categoria principal ou vários níveis, consoante o modelo e a interface.
A investigação CHiLS mostra que conjuntos hierárquicos de etiquetas podem alterar a classificação ao gerar subclasses e, em seguida, mapear as previsões de volta para categorias principais.
Assim, uma ontologia atualizada pode fazer com que as etiquetas pareçam mais específicas ou mais gerais sem uma perda direta de precisão. A auditoria deve comparar a hierarquia e as regras de mapeamento, não apenas verificar se a cadeia de texto antiga continua presente.
Os limiares de confiança determinam quais as etiquetas visíveis
Os modelos devolvem normalmente vários candidatos com pontuações. A aplicação escolhe quantos deve armazenar e qual a confiança mínima necessária para que uma etiqueta apareça na pesquisa ou na vista de detalhes da fotografia.
A alteração de um limiar pode ocultar etiquetas limítrofes ou expor muitas outras com pouca confiança. Um modelo cuja calibração de pontuações seja diferente da do seu antecessor pode precisar de um limiar diferente, mesmo que a qualidade da sua ordenação seja superior.
Armazene as pontuações brutas ou as pontuações dos k primeiros resultados durante a avaliação e, em seguida, escolha limiares de apresentação por versão do modelo. Reutilizar um único valor de corte numérico em modelos não relacionados pode fazer com que a atualização pareça instável, quando o verdadeiro problema é a calibração das pontuações.
Os grupos de rostos podem mudar mesmo quando as etiquetas de objetos não mudam
O reconhecimento facial cria normalmente embeddings para os rostos detetados e agrupa pontos próximos em pessoas. Um novo detetor pode alterar o recorte, enquanto um novo modelo de reconhecimento altera as distâncias entre os vetores faciais.
O DBSCAN agrupa pontos de acordo com o raio da vizinhança e a densidade mínima; os parâmetros de distância e densidade determinam se um rosto se junta a uma pessoa, forma outro grupo ou permanece como valor atípico.
As alterações do modelo e as alterações do agrupamento devem ser auditadas separadamente. Um recorte facial mais limpo pode dividir uma pessoa anteriormente agrupada de forma incorreta, enquanto um limiar de distância mais permissivo pode juntar familiares com aparência semelhante.
O reprocessamento parcial mistura duas gerações de etiquetas
Se apenas as fotografias novas forem processadas com o modelo atualizado, a biblioteca conterá simultaneamente espaços semânticos antigos e novos. Os resultados da pesquisa e as etiquetas podem variar consoante o momento em que cada recurso foi adicionado ao sistema.
O Immich recomenda aos administradores que reprocessem todos os recursos depois de alterar o modelo de pesquisa inteligente e observa que os dados incompatíveis do modelo anterior podem causar erros.
Utilize uma reconstrução versionada ou um segundo índice, confirme a conclusão e, em seguida, alterne as pesquisas de forma atómica. Não elimine o índice antigo até que a nova geração tenha contagens completas de recursos e resultados aceitáveis nos testes de recuperação.
Faça a gestão das versões das previsões e proteja as correções humanas
Mantenha as etiquetas geradas pelo modelo separadas dos álbuns criados pelos utilizadores, das etiquetas manuais, das pessoas identificadas e das decisões sobre etiquetas ocultas. Uma reconstrução automática não deve substituir silenciosamente o trabalho de organização do utilizador.
Avalie um conjunto fixo de fotografias representativas antes da implementação. Compare as etiquetas adicionadas e removidas, as alterações de posição, os falsos positivos, as divisões e fusões de rostos e as consultas de pesquisa importantes para a família.
O artigo da ZimaSpace sobre como a resolução das imagens altera a carga da IA multimodal acrescenta outra variável: a resolução de pré-processamento e a política de recorte podem alterar os dados visuais fornecidos ao modelo atualizado.
Perguntas frequentes
Uma etiqueta alterada significa que o novo modelo é pior?
Não. Pode utilizar um vocabulário diferente ou escolher uma classe mais específica numa hierarquia de categorias principais e secundárias. A precisão deve ser avaliada com base em fotografias representativas e nas tarefas de pesquisa pretendidas.
As etiquetas antigas geradas por IA devem ser eliminadas imediatamente?
Não. Mantenha a geração antiga até terminar o reprocessamento e a comparação. As etiquetas versionadas permitem efetuar reversões e análises de regressão.
As etiquetas manuais das fotografias podem sobreviver às atualizações do modelo?
Sim, quando as etiquetas manuais são armazenadas separadamente das previsões geradas e as tarefas de reconstrução ficam limitadas aos campos geridos pelo modelo.
Centro de Tecnologia e IA
Mais para Ler

Como é que um corretor secreto fornece credenciais a um agente de IA sem as expor nos prompts?
Acompanhe a identidade da carga de trabalho, a política, a emissão de tokens, a injeção de pedidos, a redação, a expiração e a revogação...

Como é que uma sandbox de ferramentas contém os efeitos secundários de um agente de IA?
Veja como o isolamento, as restrições de capacidades, o estado descartável, o controlo de saída, as quotas e os registos de auditoria limitam os...

Como é que a descodificação condicionada produz JSON válido de acordo com o esquema?
Compreenda a compilação de esquemas, o mascaramento de tokens, o estado do analisador, os subconjuntos suportados, a latência, o truncamento e por que motivo...

