Il throughput del NAS diminuisce durante l'indicizzazione dei file di piccole dimensioni perché i costi fissi dei metadati e delle operazioni di apertura e chiusura prevalgono prima che lo storage possa raggiungere velocità di trasferimento sequenziale efficienti.
Un indicizzatore che analizza un terabyte contenuto in pochi archivi di grandi dimensioni può trasmettere i dati in streaming, ma gli stessi byte distribuiti tra milioni di documenti richiedono milioni di ricerche. Ogni percorso può attivare l'attraversamento delle directory, i controlli delle autorizzazioni, la lettura degli attributi, le aperture, le letture di piccole dimensioni, le chiusure, il calcolo degli hash e le scritture nell'indice. Il carico di lavoro diventa vincolato alle operazioni al secondo e alla latenza, anziché esclusivamente alla larghezza di banda.
Ogni file aggiunge lavoro che non varia in base alle sue dimensioni
Prima di leggere il contenuto, il client e il NAS risolvono un percorso, esaminano i metadati, applicano le autorizzazioni e aprono un handle. Queste operazioni fisse hanno un costo quasi uguale per una nota da due kilobyte e per un video di grandi dimensioni, quindi i byte utili per richiesta crollano quando diminuiscono le dimensioni medie dei file.
Il lavoro di TableFS sui carichi di lavoro dominati dai metadati è stato progettato per carichi di lavoro dominati dai metadati e dai file di piccole dimensioni, dimostrando che i file system locali convenzionali possono diventare un collo di bottiglia nelle operazioni sullo spazio dei nomi anche quando lo storage sottostante può trasferire i dati molto più velocemente.
Un file system di rete aggiunge scambi di protocollo e blocchi lato server o convalide della cache. Il parallelismo può nascondere parte della latenza, ma un numero eccessivo di worker aumenta le code, espelle i metadati utili e costringe le richieste interattive del NAS ad attendere dietro l'enumerazione di massa.
Le directory di grandi dimensioni e l'accesso casuale compromettono l'efficienza sequenziale
Milioni di voci espandono gli indici delle directory e i set di lavoro degli inode oltre la capacità della cache. La scansione salta tra blocchi di metadati ed extent di piccole dimensioni, riducendo l'efficacia della lettura anticipata e costringendo gli HDD a eseguire seek o gli SSD a effettuare richieste sparse, invece di trasferimenti sequenziali prolungati.
La ricerca sulle directory di file scalabili esamina directory contenenti da milioni a miliardi di file di piccole dimensioni e distribuisce la crescita dei metadati tra le partizioni. Il suo design dimostra che la scalabilità dello spazio dei nomi è un problema distinto dalla larghezza di banda grezza del dispositivo. Questa distinzione rimane visibile durante i successivi test domestici.
La pipeline di IA aggiunge un altro flusso casuale quando scrive hash, testo OCR, miniature o record di database vettoriali. Le code di lettura e scrittura competono tra loro, e i commit sincroni del database possono mettere in pausa l'acquisizione anche quando i dischi mostrano una capacità sequenziale di picco ancora inutilizzata.
Il ricambio della cache estende il rallentamento agli altri utenti del NAS
Voci delle directory, attributi, dati dei file, pagine dei modelli e buffer degli indici competono tutti per la RAM. Una scansione estesa può sostituire nella cache i file utilizzati frequentemente in casa, mentre l'antivirus, la generazione delle miniature o il calcolo dei checksum duplicano le letture attivate dagli stessi nuovi eventi di accesso.
Un'analisi dell'overhead dei file di piccole dimensioni spiega come grandi quantità di oggetti inferiori a 64 KB creino un overhead di metadati e richieste che le metriche di throughput aggregato nascondono. Raggruppare il lavoro modifica il rapporto tra payload utile ed elaborazione per oggetto. Il risultato intermedio deve rimanere ispezionabile prima che l'automazione proceda.
Il limite di errore consiste nel presumere che siano solo il numero di file a determinare le prestazioni. Una cache dei metadati di un SSD già riscaldata, un archivio impacchettato, un database di indici locale e un protocollo raggruppato possono gestire più file rispetto a un HDD freddo tramite SMB ad alta latenza. Misurare le operazioni e l'accodamento con il layout effettivo.
Misurare separatamente i file al secondo e i megabyte al secondo
Creare dataset con lo stesso numero totale di byte ma con file mediani da 4 KB, 64 KB, 1 MB e 64 MB, oltre a directory poco profonde e profondamente annidate. Registrare i file al secondo, le operazioni sui metadati, i round trip di rete, gli IOPS, la latenza delle code, i cache miss, le scritture dell'indice e la latenza interattiva del NAS.
Usare la separazione dei colli di bottiglia come struttura per l'analisi, ripetendo poi i test con uno, quattro e sedici worker dell'indicizzatore, quindi con il raggruppamento dei contenuti e il database degli indici su un altro dispositivo. Mantenere espliciti il set di file e lo stato della cache.
Scegliere la concorrenza nel punto in cui il numero di file al secondo smette di migliorare o la latenza p95 interattiva supera il limite. Se prevalgono i metadati, ridurre le operazioni stat ripetute e raggruppare il lavoro; se prevalgono le letture dei contenuti, ottimizzare il layout dello storage invece di considerare la larghezza di banda sequenziale come la capacità mancante.
Hub Tecnologico e AI
Altro da leggere

In che modo il downsampling delle serie temporali influisce sul rilevamento delle anomalie nelle smart home?
Scopri come la larghezza dei bucket, l'aggregazione, l'anti-aliasing, i dati mancanti, la durata degli eventi e la conservazione multiscala modificano il tasso di rilevamento...

In che modo una griglia di occupazione combina segnali deboli della casa intelligente?
Scopri come le celle spaziali, i modelli dei sensori, gli aggiornamenti log-odds, il decadimento, le evidenze correlate e le soglie trasformano i deboli segnali...

In che modo la normalizzazione fotometrica influisce sul clustering privato dei volti?
Scopri come la correzione dell’illuminazione modifica i ritagli dei volti, gli embedding, le distanze tra i cluster, le soglie, l’eccessiva normalizzazione e la valutazione...

