De doorvoer van de NAS daalt tijdens het indexeren van kleine bestanden, omdat vaste metadata- en open-sluitkosten de overhand krijgen voordat de opslag efficiënte sequentiële overdrachtssnelheden kan bereiken.
Een indexeerder die één terabyte aan gegevens in enkele grote archieven scant, kan de gegevens streamen, maar voor dezelfde hoeveelheid bytes, verspreid over miljoenen documenten, zijn miljoenen opzoekingen nodig. Elk pad kan directorytraversal, toestemmingscontroles, attribuutcontroles, openen, kleine leesbewerkingen, sluiten, hashing en indexschrijfbewerkingen activeren. De werklast wordt daardoor begrensd door bewerkingen per seconde en latentie, in plaats van uitsluitend door bandbreedte.
Elk bestand voegt werk toe dat niet meeschaaalt met de bestandsgrootte
Voordat de inhoud wordt gelezen, bepalen de client en de NAS het pad, controleren ze de metadata, passen ze toestemmingen toe en openen ze een handle. Deze vaste bewerkingen kosten bijna evenveel voor een notitie van twee kilobytes als voor een grote video, waardoor het aantal nuttige bytes per verzoek afneemt naarmate de gemiddelde bestandsgrootte kleiner wordt.
Het TableFS-onderzoek naar werklasten die door metadata worden gedomineerd is ontworpen voor werklasten met veel metadata en kleine bestanden. Het toont aan dat conventionele lokale bestandssystemen een knelpunt kunnen vormen bij naamruimtebewerkingen, zelfs wanneer de onderliggende opslag gegevens veel sneller kan overdragen.
Een netwerkbestandssysteem voegt protocoluitwisselingen en vergrendeling of cachevalidatie aan de serverzijde toe. Parallellisme kan een deel van de latentie verbergen, maar te veel workers vergroten wachtrijen, verdringen nuttige metadata uit de cache en zorgen ervoor dat interactieve NAS-verzoeken achter bulkopsommingen moeten wachten.
Grote directories en willekeurige toegang doorbreken sequentiële efficiëntie
Miljoenen vermeldingen vergroten directory-indexen en inode-werksets tot boven de cachecapaciteit. De scan springt tussen metadatablokken en kleine extents, waardoor read-ahead minder effectief wordt en HDD-zoekacties of verspreide SSD-verzoeken nodig zijn in plaats van lange sequentiële overdrachten.
Onderzoek naar schaalbare bestandsdirectories onderzoekt directories met miljoenen tot miljarden kleine bestanden en verdeelt de groei van metadata over partities. Het ontwerp illustreert dat schaalbaarheid van de naamruimte een afzonderlijk probleem is ten opzichte van de ruwe apparaatbandbreedte. Dit onderscheid blijft zichtbaar tijdens latere tests in huishoudelijke omstandigheden.
De AI-pijplijn voegt nog een willekeurige gegevensstroom toe wanneer deze hashes, OCR-tekst, miniaturen of records voor een vectordatabank schrijft. Lees- en schrijf wachtrijen concurreren met elkaar, en synchrone databasecommits kunnen de opname pauzeren, zelfs wanneer de schijven ongebruikte pieksequentiële doorvoer tonen.
Cachevervanging verspreidt de vertraging naar andere NAS-gebruikers
Directoryvermeldingen, attributen, bestandsgegevens, modelpagina's en indexbuffers concurreren allemaal om RAM. Een brede scan kan veelgebruikte huishoudelijke bestanden uit de cache verdringen, terwijl antivirussoftware, het genereren van miniaturen of checksumming de leesbewerkingen die door dezelfde nieuwe toegangsgebeurtenissen worden geactiveerd, dupliceert.
Een analyse van de overhead van kleine bestanden legt uit hoe grote aantallen objecten van minder dan 64 KB metadata- en verzoekoverhead veroorzaken die bulkdoorvoermetingen verbergen. Door werk te groeperen verandert de verhouding tussen nuttige payload en verwerking per object. Het tussentijdse resultaat moet controleerbaar blijven voordat automatisering wordt toegepast.
De foutgrens ligt bij de aanname dat alleen het aantal bestanden de prestaties bepaalt. Een warme SSD-metadatacache, een ingepakt archief, een lokale indexdatabase en een gebatcht protocol kunnen meer bestanden verwerken dan een koude HDD via SMB met hoge latentie. Meet bewerkingen en wachtrijvorming onder de daadwerkelijke indeling.
Benchmark bestanden per seconde afzonderlijk van megabytes per seconde
Maak datasets met een gelijk totaal aantal bytes, maar met mediane bestandsgroottes van 4 KB, 64 KB, 1 MB en 64 MB, plus ondiepe en diep geneste directories. Registreer bestanden per seconde, metadata-bewerkingen, netwerkretouren, IOPS, wachtrijlatentie, cachemissers, indexschrijfbewerkingen en interactieve NAS-latentie.
Gebruik scheiding van knelpunten als raamwerk voor het knelpunt. Herhaal de test met één, vier en zestien indexeerworkers en vervolgens met batching van de inhoud en de indexdatabase op een ander apparaat. Leg de bestandsset en cachestatus expliciet vast.
Kies de mate van gelijktijdigheid op het punt waarop het aantal bestanden per seconde niet meer verbetert of de interactieve p95-latentie de limiet overschrijdt. Als metadata overheerst, verminder dan herhaalde stat-bewerkingen en batch het werk; als het lezen van inhoud overheerst, optimaliseer dan de opslagindeling in plaats van sequentiële bandbreedte te behandelen als de ontbrekende capaciteit.
Tech & AI HUB
Meer om te lezen

Welke invloed heeft downsampling van tijdreeksen op anomaliedetectie in een slimme woning?
Ontdek hoe bucketbreedte, aggregatie, anti-aliasing, ontbrekende gegevens, gebeurtenisduur en retentie op meerdere schalen de detectie van afwijkingen in slimme woningen beïnvloeden.

Hoe combineert een bezettingsraster zwakke signalen van een slim huis?
Leer hoe ruimtelijke cellen, sensormodellen, log-odds-updates, verval, gecorreleerd bewijs en drempelwaarden zwakke signalen uit huis omzetten in bezettingsschattingen.

Hoe beïnvloedt fotometrische normalisatie het clusteren van privégezichten?
Bekijk hoe verlichtingscorrectie gezichtscrops, embeddings, clust afstanden, drempelwaarden, overnormalisatie en de evaluatie van privéfotozoekopdrachten verandert.

