Komprimering av vektorindex minskar RAM-användningen genom att lagra representationer med lägre precision, men den resulterande distorsionen i avstånden kan sänka återkallningen av närmaste grannar.
Ett lokalt RAG-index kan rymma hundratusen textsegment utan problem, men bli minnesbegränsat efter flera år av dokument, foton och transkriptioner. Kvantisering kan hålla fler vektorer i minnet, men sökkvaliteten beror på om de komprimerade avstånden bevarar samma kandidatordning som full precision. Resultatet varierar beroende på embeddingfördelning, komprimeringsgrad, indextyp, kandidatbredd och om originalvektorerna fortfarande finns tillgängliga för omsortering.
Komprimering minskar vektordatan, men inte alla indexkostnader
Ett vektorindex använder minne för embeddingvärden, graf- eller partitionsstrukturer, identifierare, metadata, allokeringsöverhead och tillfälliga frågebuffertar. Komprimering minskar främst representationen av embeddingarna. HNSW-länkar och metadata kan förbli ungefär desamma, så den totala besparingen i RAM kan bli mindre än vad komprimeringsförhållandet för vektorerna antyder.
högdimensionella vektorer är kostsamma eftersom varje dimension som lagras som ett värde med full precision bidrar till minnes- och avståndsberäkningskostnaden. Genom att ersätta dessa värden med kompakta koder minskar den residenta datamängden och cacheeffektiviteten kan förbättras.
Den praktiska besparingen beror därför på indexets sammansättning. Högdimensionella flyttalsvektorer ger vanligtvis ett stort besparingsutrymme, medan små vektorer med tät grafanslutning kan ge mindre proportionella besparingar. Mät processens residenta minne och indexfiler före och efter komprimering i stället för att multiplicera råa vektorbyte med antalet dokument.
Kvantisering introducerar distorsion i avstånden
Skalär kvantisering mappar varje dimension till ett mindre numeriskt intervall, medan produktkvantisering delar upp en vektor i delrum och lagrar val från kodböcker. Båda metoderna ersätter exakta koordinater med approximationer. Frågeavståndet beräknas då mot rekonstruerade värden eller kodboksavstånd i stället för den ursprungliga flyttalsvektorn.
Experiment med produktkvantisering utvärderar komprimering genom att mäta distorsionen i rekonstruerade avstånd och återkallningen. Mer kompakta koder kan minska svarstiden eller minnesanvändningen, men gör det också svårare att rangordna närliggande kandidater korrekt när deras verkliga avstånd ligger nära varandra.
Återkallningen minskar när en relevant granne hamnar under kandidatgränsen, inte enbart för att varje avstånd är något felaktigt. Frågor med tydlig marginal mellan relevanta och irrelevanta textsegment kan klara kraftig komprimering, medan täta semantiska grannskap med många nästan lika kandidater är känsligare.
Utökning av kandidatmängden och omsortering kan återställa återkallningen
En sökning i två steg använder komprimerade vektorer för att hitta en bred kortlista och beräknar sedan om avstånden med vektorer med högre precision för dessa kandidater. Översampling ger relevanta objekt fler chanser att överleva det approximativa första steget, medan omsortering återställer ordningen där kompakta koder har suddat ut små skillnader i avstånd.
högre komprimeringsgrader minskar vanligtvis återkallningen, medan översampling och omsortering kan förbättra precisionen. Återställningen kräver extra läsningar, minne och frågebearbetning, så komprimering flyttar resurskostnaden snarare än eliminerar kvalitetskostnaden.
Att lagra fullständiga vektorer på disk kan bevara ett litet RAM-avtryck, men tillföra lagringsfördröjning vid omrankning. Att behålla dem i RAM förbättrar svarstiden men minskar minnesvinsten. Den bästa konfigurationen beror på om hemmaservern begränsas av minneskapacitet, lagringens IOPS eller målen för svarstid.
Återkallning måste mätas för den lokala sökuppgiften
Skapa en referensmängd genom att köra exakt sökning eller sökning med hög precision för representativa frågor. Jämför sedan om den komprimerade sökningen returnerar samma relevanta grannar inom top-k. Ta med parafraser, egennamn, nästan identiska dokument, sällsynta termer och frågor där svaret beror på en liten skillnad i bevismaterialet.
Detta kompletterar konfidens för retrieval grounding: grannlikhet och stöd för svaret hänger ihop, men är inte identiska. Mät Recall@k mot sökbaslinjen och kontrollera även om förlorade eller omordnade textsegment förändrar det bevismaterial som är tillgängligt för generatorn.
Det finns ingen universell vinnare mellan maximal komprimering och maximal precision. Öka komprimeringen tills RAM-användning, svarstid och återkallning för uppgiften når önskad balans, och testa sedan igen efter ändringar av embeddingmodell eller korpus. En konfiguration som fungerar för bred fotosimilaritet kan vara för förlustbringande för teknisk dokumentsökning med många semantiskt närliggande textavsnitt.
Teknik- och AI-hubb
Mer att läsa

Varför Jellyfins hemserverarkitektur förändras när du lägger till tjänster
En Jellyfin-box blir en tjänstestack när fler appar läggs till, så CPU, lagring, nätverk, hemligheter, säkerhetskopior och återställningsgränser behöver ha ett tydligt ägarskap.

Så mäter du Jellyfins prestanda utan att förväxla cache med kapacitet
Ett tillförlitligt Jellyfin-benchmarktest skiljer tydligt mellan kallt och varmt tillstånd, så att cachad metadata eller cachade filsystemsidor inte misstas för permanent hårdvarukapacitet.

Hur mycket iGPU-kapacitet kräver Jellyfin för flera användare?
Jellyfins iGPU-marginal är arbetsbelastningsspecifik: reservera marginal över den mest krävande återkommande samtidiga transkodningsmixen, inte en godtycklig nyttjandegrad i procent.

