Co powoduje spowolnienie puli dysków SSD po spadku ilości wolnego miejsca poniżej 15%?

Eva Wong jest Technicznym pisarzem i stałym majsterkowiczem w ZimaSpace. Całe życie geek z pasją do homelabów i oprogramowania open-source, specjalizuje się w tłumaczeniu skomplikowanych koncepcji technicznych na przystępne, praktyczne przewodniki. Eva wierzy, że samodzielne hostowanie powinno być zabawą, a nie czymś onieśmielającym. Poprzez swoje samouczki umożliwia społeczności rozwiewanie tajemnic konfiguracji sprzętu, od budowy pierwszego NAS po opanowanie kontenerów Docker.

Pula SSD często zwalnia, gdy jest niemal pełna, ponieważ kontroler i system plików mają mniej czystej przestrzeni roboczej na zapisy, relokację danych, metadane i migawki.

Poziom 15 procent nie jest uniwersalnym punktem krytycznym, ale dla wielu obciążeń domowych serwerów stanowi użyteczny próg ostrzegawczy. Pula może mieć wolne bajty logiczne, podczas gdy migawki, aprowizacja cienka, metadane systemu plików, usunięte, lecz nadal otwarte pliki lub brak obsługi discard ograniczają przestrzeń, którą kontrolery SSD i oprogramowanie pamięci masowej mogą rzeczywiście ponownie wykorzystać. Diagnozuj efektywny zapas miejsca na zapisy i opóźnienia zapisu, zamiast polegać na jednym procencie wyświetlanym w panelu.

Potwierdź, która wartość wolnego miejsca osiągnęła 15 procent

Porównaj surową pojemność SSD, pojemność puli, wolne miejsce systemu plików, przydział aprowizowany cienko, wykorzystanie migawek, limity, zarezerwowane bloki oraz wolumin aplikacji, który działa wolno. Wartości te odpowiadają na różne pytania.

GNU Coreutils wyjaśnia, że dostępne miejsce systemu plików jest raportowane na podstawie ewidencji zamontowanego systemu plików, która może nie uwzględniać każdej puli, migawki, woluminu cienkiego ani rezerwy na poziomie kontrolera wpływającej na zapisy.

Jeśli niemal pełny jest tylko jeden zbiór danych lub wolumin cienki, napraw tę warstwę, zamiast uznawać wszystkie dyski SSD za wolne. Jeśli cała pula ma niewiele nieprzydzielonej pojemności, przejdź do sprawdzenia przestrzeni roboczej kontrolera, discard i migawek.

Zrozum, dlaczego zapisy NAND wymagają czystej przestrzeni roboczej

Zmierz opóźnienia zapisu ciągłego i małych losowych zapisów przed przekroczeniem przez pulę tego progu i po jego przekroczeniu. Szybkość odczytu może pozostać akceptowalna, podczas gdy zapisy będą się zatrzymywać lub staną się niestabilne.

Crucial opisuje nadmiarową alokację SSD jako zarezerwowaną pojemność wykorzystywaną do odśmiecania, równoważenia zużycia i zastępowania bloków, co wyjaśnia, dlaczego mniejszy zapas miejsca na zapisy może zwiększać relokację danych w tle podczas nowych zapisów.

Nie zakładaj, że każde spowolnienie oznacza zużycie pamięci flash. Sprawny dysk SSD może tymczasowo zwolnić, gdy musi wymazywać, przenosić i ponownie zapisywać większą ilość prawidłowych danych dla każdego nowego zapisu.

Sprawdź, czy discard lub TRIM dociera do dysków SSD

Sprawdź, czy usunięte bloki systemu plików są odrzucane na bieżąco, okresowo czy wcale. Uwzględnij każdą warstwę między systemem plików a SSD: szyfrowanie, RAID, aprowizację cienką, HBA, dysk wirtualny i obudowę.

Operacja retrim narzędzia Optimize-Volume firmy Microsoft pokazuje, że usunięte bloki muszą zostać przekazane przez stos pamięci masowej, aby urządzenie mogło przygotować je do ponownego użycia.

Pomyślne wykonanie polecenia na poziomie systemu plików nie dowodzi, że SSD otrzymał żądanie discard. Porównaj liczniki urządzenia lub kontrolowane zachowanie podczas zapisu przed obsługiwaną operacją TRIM i po niej. Nie włączaj discard przez warstwę, która nie zachowuje go w bezpieczny sposób.

-15% OFF

Sprawdź migawki, kosze i usunięte, lecz nadal otwarte pliki

Zmierz miejsce zajmowane przez migawki, klony, foldery przechowywania danych, kosze, dzienniki baz danych oraz otwarte pliki, których wpisy w katalogach zostały usunięte. Mogą one utrzymywać przydział bloków po tym, jak użytkownicy uznają dane za usunięte.

Dokumentacja Oracle dotycząca ZFS wyjaśnia, że migawki zachowują wskazywane bloki, dlatego usunięcie dużego aktywnego pliku może nie zwolnić zajmowanego miejsca, jeśli starsze migawki nadal zależą od tych bloków.

Usuwaj tylko punkty przechowywania, które wykraczają poza ustaloną politykę, i potwierdź, do których bloków się odwołują. Duża migawka nie jest automatycznie zbędna, a awaryjne usunięcie może pozbawić Cię jedynej ścieżki odzyskania niedawnych zmian.

Oddziel nadmiarową alokację kontrolera od wolnego miejsca systemu plików

Sprawdź, czy każdy dysk SSD ma niepartycjonowaną przestrzeń rezerwową, obszar zapasowy określony przez producenta lub nadmiarową alokację zarządzaną przez hosta. Wolne miejsce systemu plików i rezerwa kontrolera pełnią powiązane, lecz różne funkcje.

Kingston wyjaśnia, że nadmiarowa alokacja hosta pozostawia część pojemności nieprzydzieloną, dzięki czemu kontroler SSD otrzymuje dodatkową przestrzeń roboczą poza wolnymi blokami widocznymi dla systemu plików.

Nie zmniejszaj aktywnej puli bez sprawdzonych kopii zapasowych i obsługiwanej ścieżki zmniejszania. Nadmiarową alokację najlepiej zaplanować przed wdrożeniem lub wprowadzić podczas kontrolowanej migracji.

Uruchom obsługiwany TRIM i zmierz poprawę

Po usunięciu zbędnych danych i migawek uruchom obsługiwaną przez platformę operację discard w okresie niskiego obciążenia. Zapisz liczbę odrzuconych bajtów i sprawdź, czy opóźnienie zapisu zmienia się po zakończeniu przez SSD czyszczenia w tle.

Podręcznik fstrim wyjaśnia, że discard dotyczy nieużywanych bloków systemu plików, a wielokrotne przycinanie tych samych obszarów może nie przynieść dodatkowych korzyści.

Raportowanie przez TRIM zera bajtów nie oznacza automatycznie błędu; system plików może być już przycięty albo warstwa pośrednia może blokować discard. Przed zmianą opcji montowania wykorzystaj dowody dostarczane przez sam stos pamięci masowej.

Przywróć zapas miejsca i zweryfikuj rzeczywiste wąskie gardło

Przenieś dane tymczasowe, usuń wyłącznie migawki zatwierdzone przez politykę, kompaktuj bazy danych tam, gdzie jest to obsługiwane, i przywróć zaplanowany margines wolnego miejsca. Następnie powtórz to samo obciążenie zapisu, mierząc opóźnienie, głębokość kolejki, czas oczekiwania CPU i temperaturę SSD.

Artykuł ZimaSpace dotyczący sygnałów ostrzegawczych awarii pamięci podręcznej SSD wyznacza granicę między odwracalną presją związaną z małą ilością miejsca a oznakami możliwej awarii samego urządzenia.

Diagnozę można uznać za zakończoną, gdy opóźnienie zapisu poprawia się po potwierdzonym odzyskaniu zapasu miejsca lub wykonaniu discard, migawki i metadane pozostają zgodne z polityką, a to samo obciążenie jest stabilne powyżej wybranej rezerwy. Jeśli wydajność nadal jest słaba mimo dużej ilości wolnego miejsca, zbadaj ograniczanie wydajności z powodu temperatury, zużycie, błędy kontrolera, działanie RAID lub operacje wejścia-wyjścia aplikacji.

Wsparcie i wskazówki

Więcej do przeczytania

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.