Indeksowanie multimediów może bardziej nagrzewać serwer NAS niż sekwencyjna kopia zapasowa, ponieważ aktywuje procesor, pamięć masową, pamięć operacyjną, bazy danych i akceleratory, pozostawiając im mniej czasu bezczynności.
Kopia zapasowa często odczytuje duże zakresy danych w kolejności i zapisuje je w kolejności, dzięki czemu dyski, pamięci podręczne i silniki DMA mogą działać wydajnie. Indeksowanie multimediów otwiera wiele plików, odczytuje nagłówki i rozproszone klatki, dekoduje kodeki, oblicza skróty, generuje miniatury, aktualizuje bazy danych i może uruchamiać modele rozpoznawania twarzy lub obiektów. W rezultacie niższa całkowita przepustowość może oznaczać większe zużycie energii na przetworzony bajt.
Przechodzenie po metadanych i małe pliki zastępują wydajne operacje wejścia-wyjścia sekwencyjnego
Indeksatory przechodzą przez katalogi, pobierają informacje o wpisach, otwierają pliki, odczytują małe fragmenty, zamykają je i aktualizują rekordy postępu. Dyski mechaniczne wykonują operacje wyszukiwania między metadanymi a zawartością; dyski SSD lepiej radzą sobie z losowym dostępem, ale nadal wykonują więcej poleceń i pracy kontrolera na każdy użyteczny bajt.
Badanie dotyczące narzutu metadanych małych plików pokazuje, dlaczego obciążenia związane z małymi plikami zaczynają być zdominowane przez operacje na metadanych, a nie transfer dużych ilości danych. Ten kontrast wyjaśnia, jak indeksator może utrzymywać stos pamięci masowej w stanie intensywnej pracy bez zbliżania się do sekwencyjnej przepustowości. Różnica ta pozostaje widoczna podczas późniejszych testów domowych.
Kopia zapasowa również może skanować metadane, ale po wybraniu dużego pliku może przesyłać długie zakresy danych strumieniowo. Odczyt z wyprzedzeniem i łączenie kolejek działają wtedy dobrze, ograniczając wybudzenia procesora i narzut urządzenia na każdy przeniesiony gigabajt. Wynik pośredni musi pozostać możliwy do sprawdzenia, zanim automatyzacja będzie kontynuowana.
Dekodowanie multimediów i zasoby pochodne zwiększają obciążenie obliczeniowe każdego pliku
Odczyt bajtów to dopiero początek. Korekcja orientacji zdjęć, dekodowanie plików RAW, wyszukiwanie klatek kluczowych w filmach, analiza dźwięku, haszowanie percepcyjne, skalowanie miniatur i transkodowanie obciążają jednostki wektorowe i kodeki, a klasyfikacja z użyciem AI może korzystać ze zintegrowanego układu graficznego, karty graficznej lub akceleratora neuronowego.
Projekt zadań indeksowania multimediów opisuje potok analizy multimediów, który wyodrębnia metadane i tworzy miniatury przed rozpoczęciem rozpoznawania na wyższym poziomie. Pokazuje to, dlaczego przeszukiwalne multimedia wymagają pracy nieobecnej w kopii zapasowej bit po bicie. Tę granicę należy mierzyć osobno w realistycznych warunkach pracy.
Zdekodowane obrazy są znacznie większe niż pliki skompresowane i generują ruch danych w pamięci. Zapisy w bazie danych i miniatur również zmieniają skanowanie z przewagą odczytu w obciążenie mieszane, uniemożliwiając dyskom i procesorom przejście w jeden wydajny tryb pracy.
Ciepło odzwierciedla rozkład mocy, chłodzenie i czas trwania
Temperatura nie jest bezpośrednią miarą wykonanej pracy. Ta sama moc może powodować różne odczyty czujników w zależności od krzywych pracy wentylatorów, rozmieszczenia dysków, przepływu powietrza w obudowie, temperatury otoczenia oraz tego, czy procesor i dyski nagrzewają obudowę jednocześnie.
Przegląd dotyczący pomiarów zasilania i parametrów termicznych serwerów wyjaśnia, jak energia pobierana przez serwer zamienia się w ciepło, które muszą usunąć systemy chłodzenia. Wykorzystanie podzespołów i przepływ powietrza są więc ważniejsze niż same wykresy szybkości transferu. Praktyczne konsekwencje widać, gdy kilka źródeł konkuruje o ograniczony czas procesora.
Błędem jest uznanie indeksowania za mniej wydajne na podstawie odczytu tylko jednego czujnika temperatury. Kopia zapasowa może przenieść znacznie więcej danych i zużyć więcej energii w całym procesie, jednocześnie utrzymując niższą temperaturę szczytową. Porównuj energię, czas trwania, moc podzespołów i wykonaną pracę.
Porównuj energię na gigabajt zindeksowanych i zarchiwizowanych danych
Uruchamiaj indeksowanie i kopię zapasową osobno, zaczynając od tego samego stanu termicznego. Rejestruj moc pobieraną z gniazdka, moc pakietu procesora, wykorzystanie akceleratora, aktywność dysków, liczbę operacji wejścia-wyjścia na sekundę, przepustowość, temperatury, prędkość wentylatorów, liczbę przetworzonych plików, liczbę odczytanych i zapisanych bajtów, miniatury, skróty, zatwierdzenia w bazie danych oraz wnioskowania modeli.
Mapuj etapy indeksowania za pomocą przepływu pracy indeksowania multimediów, a następnie powtarzaj testy, wyłączając kolejno miniatury, analizę wideo i zadania AI. Zachowaj ten sam zestaw plików, temperaturę otoczenia, obudowę i stan pamięci podręcznej we wszystkich porównaniach. Ta zależność powinna pozostać wyraźnie widoczna w końcowym interfejsie.
Podawaj liczbę dżuli na plik i na gigabajt danych źródłowych wraz z temperaturą szczytową. Jeśli dominuje losowy dostęp do metadanych, grupuj skany i planuj je w odpowiednich porach; jeśli dominuje dekodowanie lub AI, ogranicz liczbę procesów roboczych; jeśli dominuje przepływ powietrza, popraw chłodzenie, nie myląc niższej temperatury z mniejszą ilością obliczeń.
Centrum Technologii i Sztucznej Inteligencji
Więcej do przeczytania

Dlaczego zmiany plików SMB docierają do indeksatora przyrostowego seriami?
Zobacz, jak buforowanie zapisu SMB, dzierżawy, CHANGE_NOTIFY, przepełnienie bufora, ponowne połączenie i grupowanie zadań indeksatora przekształcają regularne edycje w skokowe zdarzenia pozyskiwania danych.

Dlaczego OCR pomija bladego tekstu po ponownej kompresji pliku PDF?
Dowiedz się, jak ponowna kompresja plików PDF zmienia ledwo widoczne piksele, dlaczego przeglądarki mogą ukrywać utratę jakości oraz jak testować rozdzielczość, kontrast, kodek i...

Dlaczego opóźnienia lokalnej sztucznej inteligencji oscylują wraz z krzywą pracy wentylatora serwera domowego?
Zobacz, jak ciepło, sterowanie wentylatorem, limity taktowania zegara, opóźnienia czujników i harmonogram obciążenia powodują okresowe opóźnienia lokalnej sztucznej inteligencji - oraz jak udowodnić tę...

