Immich gör foton sökbara genom att omvandla förberedda bilder till lagrade representationer som kan jämföras med sökningar och filtreras utifrån åtkomst.
En förälder minns en röd cykel på ett semesterfoto men inte filnamnet eller datumet och söker på hemmaservern för foton med vanligt språk. Ett användbart resultat kräver mer än att bilden finns lagrad på disken. Den visuella representationen, databassökningen och behörighetsomfattningen måste fungera tillsammans, medan den valda modellen avgör vilka likheter sökningen kan känna igen.
Att förbereda en bild är inte att träna en modell
Vid import av ett bibliotek körs normalt inferens med en befintlig modell; ingen ny modell för allmänna ändamål tränas på familjens bildsamling. Servern förbereder användbara bilddata, begär analys och kopplar den returnerade informationen till en resurs. Denna skillnad förklarar varför en stor första import kräver beräkningsresurser utan att ett träningsprojekt för hushållet behövs.
Lokal visuell indexering gör det möjligt för en värdbaserad fotoapplikation att skapa sökrepresentationer innan användaren skickar en sökning. Den första genomgången tar tid eftersom varje berättigad bild fortfarande måste bearbetas. När representationerna väl finns kan en senare sökning återanvända dem i stället för att köra hela bildanalysen över varje foto igen.
Gränsen för när en bild är redo ligger därför efter uppladdningen. Ett läsbart original kan finnas innan den visuella representationen är tillgänglig. Betrakta den första indexeringen som ett separat steg och tolka inte en lyckad överföring eller en snabbt visad cachad förhandsvisning som bevis på att den semantiska analysen är klar för resursen.
Embeddings kopplar samman bilder och ord
En embedding är en numerisk representation som används för att jämföra betydelse eller visuellt innehåll. En bildkodare och en kompatibel textkodare mappar olika indata till jämförbara representationer. Sökfrasen kontrolleras inte bara mot ett hemligt genererat filnamn, och ett lyckat resultat innebär inte att systemet har skrivit en korrekt bildtext för varje bild.
Kontrastiv bild-text-inlärning anpassar relaterade bilder och beskrivningar samtidigt som mindre relaterade par skiljs åt under träningen. Vid sökning stöder den tränade representationen jämförelser mellan en fras och lagrade bildvektorer. Det är denna mekanism som gör det möjligt att söka efter visuella koncept utan att först tilldela samma bokstavliga nyckelord till varje relevant foto.
En cykel på en strand kan till exempel rankas högt för en beskrivande fras även om inget av orden förekommer i metadata. Det är en relevansbedömning, inte ett bevis på att bilden innehåller varje efterfrågad detalj. Ordval, beskärning, små objekt och konkurrerande visuella egenskaper kan påverka rankningen trots att originalfilen är oförändrad.
Databasen gör resultaten åtkomliga
Att beräkna en vektor avslutar inte sökvägen för hämtning: applikationen måste lagra den och söka efter den tillsammans med information om resursen. Databasen returnerar identifierare för möjliga resultat, varefter applikationen kan tillhandahålla motsvarande media. Beräkningskapacitet och fördröjning vid databashämtning är relaterade men separat mätbara delar av upplevelsen.
Sökbackendens version spelar roll. Immich tog bort stödet för pgvecto.rs i v3 och rekommenderar VectorChord som ersättare, så en äldre arkitekturartikel som nämner pgvecto.rs bör inte användas som aktuell vägledning för driftsättning. Den bestående principen är kombinationen av lagrade vektorer och relationellt applikationstillstånd, inte namnet på ett historiskt tillägg.
För att illustrera skalan tar 100 000 vektorer med 512 fyrabytevärden upp cirka 205 MB som rådata. Detta är inte en uppskattning av en Immich-databas: faktiska dimensioner, datatyper, index, rader och WAL-loggning förändrar totalen. Beräkningen visar endast varför en representation skiljer sig från att lagra ytterligare en bild i full upplösning.
Personer, metadata och visuell sökning är olika vägar
Visuell sökning, metadatafiltrering och sökning efter namngivna personer besvarar olika frågor. Ett datumfilter använder registrerad information; visuell sökning rankar en scenbeskrivning; ansiktsrelaterade funktioner upptäcker och grupperar ansikten som användaren sedan kan namnge. Att förvänta sig att alla tre fungerar som exakt filnamnsmatchning döljer varför en väg fungerar medan en annan gör en besviken.
Organisering av familjefoton gynnas av att dessa vägar kombineras i stället för att en modell förväntas återfinna varje uppgift. Ett personnamn, en ungefärlig månad och en visuell beskrivning begränsar olika delar av samlingen. Deras användbarhet beror på tillgängliga metadata, slutförd bearbetning och vilka foton det aktuella kontot får komma åt.
Skillnaden förebygger också ett noggrannhetsmisstag: att känna igen ett visuellt liknande ansikte är inte ett oberoende bevis på identitet. Granska grupper innan du förlitar dig på ett namn, särskilt när ålder, belysning eller skymmande objekt förändrar utseendet. Håll exakta administrativa eller känsliga beslut utanför en likhetsrankning som är utformad för att underlätta bläddring i ett fotobibliotek.
Integritet och noggrannhet har separata gränser
En lokal modell kan hålla bildanalysen inom hemmaservern, men förtroendegränsen följer den konfigurerade slutpunkten. Om analysen skickas till en annan dator är det den datorn som bearbetar den tillhandahållna informationen. En fjärraccelerator i ett privat nätverk och en okänd värdbaserad slutpunkt har olika integritetskonsekvenser även om båda kallas fjärrbaserad maskininlärning.
Modellens begränsningar är separata från integriteten vid driftsättning. Den ursprungliga CLIP-forskningen beskriver svagheter i uppgifter som räkning och finmaskiga distinktioner och varnar för att resultaten beror på vilka kategorier eller uppmaningar som tillhandahålls. Att hålla inferensen lokal eliminerar inte dessa begränsningar och förvandlar inte ett likhetspoäng till en faktabaserad beskrivning av en familjehändelse.
Påståendet om privat sökning faller om det förutsätter att egen drift automatiskt skyddar varje slutpunkt, säkerhetskopia, konto och delat album. Påståendet om korrekt sökning faller om det utlovar fullständig träffsäkerhet med godtyckliga formuleringar. Ange båda gränserna: vem som hanterar indata och vad representationen rimligen kan skilja åt i den valda samlingen.
Kontrollera processen med kända foton
Skapa en liten auktoriserad referensuppsättning med tydliga objekt, tvetydiga scener, små detaljer och flera kända personer. När bearbetningen är klar jämför du exakt metadatafiltrering med visuella sökningar och sökning efter namngivna personer. Anteckna den valda modellen och serverversionen så att en senare förändring kan utvärderas mot samma exempel i stället för mot minnet.
Ett förstahandsexperiment med modellbyte rapporterade avsevärt annorlunda sökkvalitet med en annan konfigurerad modell. Observationen stöder att relevansen kontrolleras mot personliga exempel, inte att varje större modell antas förbättra varje sökning. Hårdvarukostnad, språkstöd och krav på ombearbetning måste hållas åtskilda från en entusiastisk berättelse om bättre resultat.
Godkänn processen när representativa resurser har genomgått den nödvändiga bearbetningen, behöriga användare kan hämta de förväntade exemplen och svagheter har dokumenterats i stället för att döljas. Om metadata hittar en resurs men en visuell formulering inte gör det, undersök relevansen innan du förklarar data som förlorad. Om analysen omdirigerades, verifiera den mottagande värden som ett separat integritetsbeslut.
Teknik- och AI-hubb
Mer att läsa

Öppna modeller kommer ikapp den ledande AI:n – blir 2026 året då lokal AI blir tillräckligt bra?
Öppna modeller blir tillräckligt bra för fler lokala AI-arbetsbelastningar, medan avancerade molnmodeller fortfarande är användbara för de svåraste resonemangs- och agentuppgifterna.

NVIDIA PAIR förvandlar ditt hemnätverk till ett lokalt AI-kluster – behöver du fortfarande en enda stor GPU-server?
NVIDIA PAIR distribuerar lokala AI-förfrågningar över flera datorer, vilket gör beräkningskapaciteten mer elastisk samtidigt som en hems server kan hålla data och tillstånd beständiga.

Varför känns Immich snabbare på LAN än via fjärranslutningar?
LAN-förfrågningar tar vanligtvis en kortare väg med lägre latens. Fjärråtkomst innebär begränsningar i WAN-kapaciteten och kan lägga till DNS-, TLS-, proxy-, VPN- eller relähopp.

