RAID 스크럽이 새로운 손상을 발견하고 있다는 경고 신호는 무엇인가요?

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

스크럽은 실행 간 오류 수가 증가하거나 동일한 장치에서 반복적으로 수리가 발생하거나 이전에 정상인 데이터가 복구 불가능해질 때 새로운 손상을 발견하는 과정입니다. 단일 고립된 수리된 블록은 악화되는 패턴과 같지 않습니다.

가장 안전한 해석은 단일 경고 수치에 반응하기보다는 완료된 스크럽 보고서, 드라이브 수준 오류 및 영향을 받은 파일을 비교하는 데서 나옵니다. 이 가이드는 정상적인 수정과 누적되는 손상을 구분하고, 언제 일상적인 유지보수를 중단하고 데이터를 우선 보호해야 하는지 알려줍니다.

오류 수 증가가 가장 명확한 경고입니다

가장 중요한 비교는 스크럽에서 오류가 보고되었는지 여부가 아니라 다음 완료된 스크럽에서 체크섬, 패리티, 미디어 또는 복구 불가능한 오류가 더 많이 보고되었는지입니다. 수리 후 안정적인 수치는 과거 사건을 반영할 수 있습니다. 오류 수가 증가한다면 저장 경로에서 여전히 잘못된 읽기나 데이터가 발생하고 있다는 뜻입니다.

매 실행 후 시작 시간, 완료 시간, 수리된 바이트, 복구 불가능한 오류 수, 장치별 읽기, 쓰기, 체크섬 카운터를 기록하세요. 스크럽 및 무음 손상에 대한 실용적인 설명은 일반 작업 부하가 몇 달 동안 건드리지 않은 손상을 전체 읽기가 어떻게 드러내는지 보여줍니다.

동일 디스크에서 반복되는 수리는 주의가 필요합니다

중복 파일시스템은 다른 복사본에서 손상된 블록을 수리하고도 풀을 온라인 상태로 유지할 수 있습니다. 경고는 이후 스크럽에서 동일한 물리적 디스크의 새로운 블록을 수리할 때 나타나며, 특히 디스크가 보류 중, 재할당 또는 복구 불가능한 섹터를 누적할 때 더욱 그렇습니다.

카운터를 초기화하고 사건을 잊지 마세요. 먼저 디스크 시리얼, SMART 스냅샷, 스크럽 결과를 저장하세요. 그런 다음 어레이가 여전히 중복되고 반응이 정상이라면 긴 드라이브 자체 테스트를 실행하세요. 반복적인 수리는 파일시스템이 원인을 해결했다는 증거가 아니라 멤버, 케이블, 베이, 전원 경로 및 컨트롤러를 조사해야 한다는 증거입니다.

복구 불가능한 파일은 우선순위를 바꿉니다

복구 불가능한 결과는 중복성이 적어도 하나의 블록에 대해 검증된 복사본을 생성하지 못했다는 의미입니다. 이 경우 다음 스크럽이 자동으로 다음 단계가 아닙니다. 이름이 지정된 파일을 식별하고 읽을 수 있는 중요한 데이터를 다른 곳에 복사하며, 토폴로지 변경 전에 로그를 보존하세요.

실제 사례인 복구 불가능한 데이터가 있는 스크럽은 수정된 메타데이터와 여전히 백업에서 복원해야 했던 파일 간의 차이를 보여줍니다. 유용한 신호는 단순히 큰 원시 오류 총계가 아니라, 깨끗한 후속 실행이 새로운 오류 없이 완료될 수 있는지 여부입니다.

동일 논리 영역에서 반복되는 오류는 정상적이지 않습니다

동일한 스트라이프, 블록 범위 또는 파일에서 반복되는 오류는 지속적인 읽기 불가 영역이나 손상된 패리티 상태를 가리킬 수 있습니다. 오류가 이동한다면 더 넓은 미디어 악화, 불안정한 메모리, 링크 문제 또는 전원 불안정을 나타낼 수 있습니다. 플랫폼이 정확한 오프셋을 노출하면 반드시 저장하세요.

첫 번째 영향을 받은 범위를 이해하지 못한 채 수백만 개의 오류에 대해 반복적으로 수리를 강제하지 마세요. 대규모 패리티 오류 클러스터는 이전 I/O 실패 하나에서 시작되어 이후 비교를 오염시킬 수 있으므로 첫 번째 손상 위치와 그 이전 사건이 중요합니다.

스크럽 중 새로운 링크 또는 I/O 오류는 중요합니다

스크럽은 지속적인 읽기를 생성하며, 불안정한 케이블, 백플레인, 전원 커넥터, USB 브리지 또는 컨트롤러 경로를 드러낼 수 있습니다. 스크럽 실행 중 시스템 로그를 주시하세요. 링크 재설정, 명령 시간 초과, 장치 분리, CRC 오류는 단순히 느린 진행률보다 더 강력한 경고입니다.

통신 오류가 증가하지만 미디어 섹터 지표가 안정적이라면 디스크를 바로 비난하지 말고 잠시 멈추세요. 한 번에 하나씩 연결을 재장착하거나 교체하고, 시리얼-베이 맵을 보존하며, 오류 기준선을 재설정한 후 제어된 읽기를 반복하세요. 경로에 머무는 결함은 드라이브를 따라가는 결함과 다른 수리가 필요합니다.

완료하지 못하는 스크럽도 결과입니다

스크럽이 반복적으로 거의 같은 지점에서 일시 중지, 재시작 또는 중단된다면 단순히 시간이 오래 걸리는 것이 아닙니다. 먼저 예약 작업, 종료 또는 다른 리실버가 중단시키지 않는지 확인하세요. 그런 다음 중단 지점을 장치 로그 및 디스크별 지연 시간과 연관 지으세요.

예약된 프로세스는 지속 시간과 처리량에 대해 안정적인 기준선을 가져야 합니다. 스크럽 출력 해석에 대한 안내는 진행 상황, 수리된 바이트 및 최종 상태를 함께 읽어야 하므로 경과 시간만으로 손상을 판단할 수 없다는 점에서 유용합니다.

결정을 내리기 전에 추세 표를 사용하세요

짧은 기록은 한 번의 잡음이 심한 실행으로 위험한 교체를 결정하는 것을 막아줍니다. 아래 관찰 항목을 최소한 마지막 정상 실행과 첫 오류 이후 모든 실행에 대해 기록하세요.

관찰 항목 보통 모니터링 즉시 조치
수리된 블록 한 번의 사건, 다음 스크럽은 정상 이후 스크럽에서 새로운 수리 발생
복구 불가능한 데이터 없음 이름이 지정된 파일 또는 영구 오류 발생
장치 카운터 재설정 후 안정적 읽기/쓰기/체크섬 카운터가 계속 증가
시스템 로그 재설정 또는 시간 초과 없음 반복적인 분리, 재설정 또는 I/O 실패
완료 상태 정상 기준선 근처에서 완료 반복적으로 동일 범위에서 중단

두 가지 이상의 즉시 조치 신호가 함께 나타나면 쓰기를 줄이고 백업을 확인한 후 영향을 받은 하드웨어 경로를 진단하고 다음 전체 스크럽을 시작하세요.

자주 묻는 질문

수리된 스크럽 후 오류 카운터를 초기화해야 하나요?

보고서를 저장하고 물리적 디스크를 식별한 후에만 초기화하세요. 초기화된 기준선은 재발을 감지하는 데 도움이 될 수 있지만, 먼저 초기화하면 손상이 새로 발생했는지 알려주는 비교가 사라집니다.

체크섬 오류 하나만으로 드라이브를 교체해야 하나요?

그 자체로는 아닙니다. 한 번 수정된 오류는 미디어, 메모리, 케이블 또는 이전 중단에서 발생할 수 있습니다. 경로를 점검한 후 동일 시리얼 번호 디스크에서 새로운 오류가 발생하면 교체가 더 정당화됩니다.

과도한 애플리케이션 트래픽이 체크섬 손상을 일으킬 수 있나요?

과도한 트래픽은 스크럽을 느리게 하고 약한 하드웨어를 드러낼 수 있지만, 정상적인 작업 부하는 검증된 콘텐츠 불일치를 생성하지 않습니다. 새로운 체크섬 오류는 저장 무결성 이벤트로 취급하고 정상적인 성능 부작용으로 보지 마세요.

결정 경계

완료된 실행에서 오류가 증가하거나, 한 멤버에서 수리가 반복되거나, 복구 불가능한 파일이 나타나거나, 동일한 하드웨어 경로가 계속 재설정될 때 스크럽 결과를 악화되는 손상으로 간주하세요. 스트레스를 반복하기 전에 데이터를 보호하세요.

지원 및 팁

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.