RAID 재구성 진행 중인데 I/O 오류가 증가할 때: 대처 방법

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

NAS 재구성 중 I/O 오류가 계속 증가하면 쓰기를 줄이고 생존 멤버나 연결 경로를 불안정한 것으로 간주하세요. 진행 중인 백분율이 증가하는 읽기 실패를 무시해도 안전하다는 의미는 아닙니다.

즉각적인 목표는 읽을 수 있는 데이터를 보존하고 오류가 미디어 실패인지, 링크 재설정인지, 아니면 대상 문제인지를 식별하는 것입니다. 로그와 일련 번호를 저장하고 백업 상태를 확인하며 소스 세트가 악화되는 동안 재구성을 반복해서 재시작하지 마세요.

증가하는 오류가 진행 표시줄을 무시한다

재구성 백분율은 대상의 얼마나 많은 부분이 처리되었는지 알려줍니다. 모든 소스 읽기가 성공했는지는 알려주지 않습니다. 누적 읽기, 쓰기, 체크섬, 미디어 및 명령 시간 초과 카운터를 정기적으로 비교하세요.

재구성이 진행되면서 오류도 증가한다면, 배열은 대부분의 블록을 재구성하지만 특정 영역에서 실패하고 있을 수 있습니다. RAID 레벨에 해당 블록의 남은 복사본이 없으면 하나의 실패한 소스 읽기가 수천 번의 성공적인 읽기보다 더 중요할 수 있습니다.

어떤 장치가 오류를 발생시키는지 식별하기

모든 로그 식별자를 물리적 일련 번호에 매핑하세요. 오류가 기존 생존 멤버, 새 대상 또는 공유 컨트롤러 경로에서 발생하는지 확인하세요. 대상 쓰기 오류와 소스 읽기 오류는 서로 다른 결정을 요구합니다.

드라이브 상태 데이터는 조사의 우선순위를 정하는 데 도움이 됩니다. Backblaze의 다섯 가지 SMART 경고 속성 운영 사용은 단일 전체 상태 레이블에 의존하기보다 재할당, 수정 불가, 시간 초과, 보류 및 오프라인 수정 불가 지표에 주목합니다.

미디어 오류와 링크 오류 구분하기

보류 중이거나 수정할 수 없는 섹터는 읽을 수 없는 미디어를 나타냅니다. UDMA CRC 증가, 전송 재설정 및 반복적인 분리는 케이블, 백플레인, 브리지, 전원 또는 컨트롤러 경로 문제를 더 자주 나타냅니다. 둘 다 재구성을 중단시킬 수 있지만 디스크를 교체해도 공유 링크 문제는 해결되지 않습니다.

UDMA CRC 오류 수 설명은 인터페이스 전송 오류와 플래터 손상을 구분합니다. 원시 수치를 저장하고, 연결 변수 하나를 수정한 후 카운터가 계속 증가하는지 확인하세요.

실패하는 재구성을 계속 재시작하지 마세요

각 전체 재시작은 생존 멤버를 다시 읽으며 같은 약한 영역에 스트레스를 줄 수 있지만 더 나은 결과를 내지 못할 수 있습니다. 작업이 같은 주소 근처에서 반복적으로 중단되거나 두 번째 드라이브가 떨어지면 일상적인 수리 시도를 중단하세요.

소스 오류로 차단된 재구성은 핵심 한계를 보여줍니다: 유일한 정상 소스에 복구 불가능한 읽기 오류가 있으면 어레이는 누락된 데이터를 얻을 다른 곳이 없습니다. 강제 옵션은 알 수 없는 내용을 재생성할 수 없습니다.

계속 진행, 복사, 이미징 중 선택

상태 선호하는 방향 이유
오류는 안정적이며 재구성 진행 중 부하를 줄여 모니터링 복구가 정상적으로 완료될 수 있음
링크 오류 증가, 미디어는 안정적임 케이블/베이/컨트롤러 경로 안정화 고장은 드라이브 외부에 있을 수 있음
소스 미디어 오류 증가 중요한 읽을 수 있는 데이터를 먼저 복사 남은 중복성이 약화되고 있음
같은 범위에서 반복 중단 발생 무작정 재구성 재시도 중단 지속적인 읽을 수 없는 영역
두 번째 멤버가 연결 해제되거나 실패함 이미징/복구 워크플로우 고려 어레이가 내결함 한계를 초과할 수 있음

데이터가 대체 불가능하고 백업이 검증되지 않은 경우, 읽을 수 있는 멤버를 이미지화하는 것이 또 다른 자동 재구성을 허용하는 것보다 더 안전할 수 있습니다. 복구 지향적인 재구성 중 두 번째 드라이브 실패 워크플로우는 생존 세트가 불안정할 때 쓰기 집중 수리 시도를 중단하는 것을 강조합니다.

사건을 숨기지 않고 전면 작업 줄이기

백업, 미디어 인덱싱, 다운로드, 가상 머신 및 기타 불필요한 쓰기를 중단하세요. 중요한 데이터를 복사하거나 어레이를 모니터링하는 데 필요한 서비스만 유지하세요. 작업 부하를 줄이면 대기열이 감소하고 오류 타이밍을 해석하기 쉬워집니다.

증거를 캡처하기 전에 로그를 지우거나 SMART 카운터를 재설정하거나 반복적으로 재부팅하지 마세요. 재부팅은 장치 이름을 변경하고 어떤 멤버가 먼저 실패했는지 보여주는 순서를 지울 수 있습니다.

전원 차단 전에 캡처할 내용

  • 배열 상태, RAID 레벨, 멤버 역할, 재구성 대상 및 정확한 진행 카운터
  • 모든 디스크 모델, 일련 번호, 베이, 컨트롤러 포트 및 현재 장치 식별자
  • 첫 번째 실패부터 최신 I/O 오류까지의 커널 또는 컨트롤러 이벤트
  • SMART 원시 미디어, 타임아웃, 온도 및 인터페이스 오류 값
  • 읽을 수 없는 파일 또는 블록 범위 목록과 최신 검증된 백업 상태

이 기록은 어떤 멤버가 가장 최신 데이터를 포함했는지 추측하지 않고도 제어된 케이블 테스트, 디스크 교체, 복제 또는 전문 복구를 지원합니다.

어떤 개입 후에도 안정적인 후속 조치가 필요합니다

케이블 교체, 확인된 일련 번호 디스크 이동 또는 작업 부하 감소 후에는 관련 비교 기준선만 재설정하고 재발 여부를 관찰하세요. 일시적인 개선은 근본적인 결함이 사라졌다는 증거가 아닙니다.

배열은 복구를 완료하고 전체 멤버십으로 복귀하며 이후 무결성 검사에서 새로운 I/O 오류 없이 통과해야 합니다. 정상적인 대표 작업 부하에서 이 세 가지 조건이 모두 충족될 때까지 사건을 안전하게 열어 두고 캡처된 로그를 보관하세요.

자주 묻는 질문

오류가 몇 개만 나타나면 재구성을 완료하도록 놔둬도 되나요?

오류가 이해되고 안정적이며 데이터가 백업된 경우에만 교체하세요. 소스 읽기 오류가 증가하거나 반복적인 재설정은 대상 비율이 계속 상승하더라도 문제 심화 신호입니다.

SMART 카운트가 가장 높은 디스크를 교체해야 하나요?

자동으로는 포함되지 않습니다. 오류가 해당 일련 번호 디스크를 따르는지 아니면 그 베이와 연결 경로에 남아 있는지 확인하세요. 저하된 상태에서 잘못된 멤버를 교체하면 남아 있는 유효한 소스가 파괴될 수 있습니다.

완료된 재구성에도 손상된 파일이 포함될 수 있나요?

예. 일부 구현에서는 복구할 수 없는 섹터나 영향을 받은 파일을 보고하면서도 완료될 수 있습니다. 항상 최종 오류 보고서를 검토하고 배열이 안정 상태로 돌아온 후 무결성 검사를 실행하세요.

중지 조건

재구성 중 I/O 오류가 증가하면 완료를 추적하기 전에 읽을 수 있는 데이터를 보호하세요. 모든 남은 블록을 공급할 수 있을 만큼 소스 세트와 연결 경로가 안정적임을 증명한 후에만 계속 진행하세요.

지원 및 팁

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.