처리된 블록 수가 반복 검사에서 증가하지 않고 로그에 의도적인 일시 중지, 우선순위 제한, 대기 중인 단계, 복구 가능한 재시도가 없을 때만 RAID 재구성이 중단되었다고 판단하세요. 경과 시간만으로는 충분하지 않습니다.
대형 배열은 느린 구간에서 몇 시간 머무르거나, 애플리케이션 부하에 따라 속도가 급격히 변하거나, 재구성과 검증 사이에 일시 중지할 수 있습니다. 개입하기 전에 카운터와 로그로 진행 상황을 확인하세요. 배열을 중단하거나 재조립하는 것이 기다리는 것보다 더 큰 위험을 초래할 수 있습니다.
단일 백분율이 아니라 진행률 변화량을 사용하세요
고정 간격으로 처리된 블록 수, 백분율, 속도, 예상 완료 시간을 정확히 기록하세요. 블록 수가 증가하면 반올림된 백분율이 변하지 않아도 재구성은 진행 중입니다. 다중 테라바이트 배열에서는 표시된 0.1%가 큰 작업량을 의미할 수 있습니다.
매번 동일한 인터페이스에서 컨트롤러나 운영 체제를 확인하세요. 서로 다른 대시보드는 상태를 캐시하거나 다른 단계를 보고할 수 있습니다. 블록 카운터가 증가하는데 진행 표시줄이 멈춘 것처럼 보인다면 이는 모니터링 문제이지 재구성 중단이 아닙니다.
범용 타임아웃 대신 지역 기준선을 추정하세요
안전한 시간 수치는 없습니다. 재구성 시간은 사용 용량, RAID 구성, 드라이브 속도, 오류, 컨트롤러 정책, 백그라운드 부하, 그리고 구현 방식이 모든 블록을 복사하는지 아니면 할당된 영역만 복사하는지에 따라 달라집니다.
첫 번째 안정적인 1시간을 사용해 대략적인 범위를 추정한 후 이후 간격과 비교하세요. 매우 느린 mdadm 재동기화 속도는 작업 부하, 정렬, 링크 동작 또는 문제가 있는 드라이브 때문일 수 있으며, 올바른 진단은 단순히 속도 제한을 높이는 것 이상이 필요합니다.
의도적인 일시 중지 또는 새로운 단계를 확인하세요
일부 시스템은 전경 I/O를 보호하기 위해 복구 속도를 제한하거나, 재실버링 중 스크럽을 일시 중지하거나, 예비 드라이브 할당을 기다리거나, 재구성에서 패리티 초기화 또는 일관성 검증으로 전환합니다. 활성 작업이 변경되어도 레이블은 “재구성 중”으로 남아 있을 수 있습니다.
예정된 유지보수, 전원 설정, 온도 제한, 재구성 우선순위 및 애플리케이션 트래픽을 검토하세요. 전경 부하가 줄어들 때 속도가 상승하면 배열이 정체된 것이 아니라 자원 제약 상태입니다.
반복적인 읽기 오류는 실제 정체를 만듭니다
소스 드라이브가 약한 섹터를 재시도하는 데 오랜 시간을 보내면 처리량이 동일한 블록 범위 근처에서 급격히 떨어질 수 있습니다. 컨트롤러가 결국 복구 불가능한 읽기를 보고하면 중복성이 해당 영역을 재구성할 수 없어 재구성이 중단될 수 있습니다.
읽기 오류로 중단된 재구성은 마지막 성공 블록과 그 직후 커널 오류가 중요한 이유를 보여줍니다. 데이터를 보호하고 소스 멤버를 검사하지 않고 동일 주소에서 실패하는 복구를 반복적으로 재시작하지 마세요.
로그 활동이 있는 0 속도는 재시도 중일 수 있음
명령 재시도, 장치 재설정, 오류 복구, 메타데이터 업데이트 또는 일시 중지 중에 0 속도가 표시될 수 있습니다. 디스크 바쁜 시간, 큐 깊이, 컨트롤러 이벤트 및 커널 메시지를 주시하세요. 반복적인 재설정이나 타임아웃은 건강한 진행이 아닙니다.
반복적으로 중단되는 복구는 모든 중단이 명확한 SMART 오류를 동반하지 않는다는 것을 보여줍니다. 새 디스크나 더 높은 속도 설정이 해결책이라고 가정하지 말고 정확한 시점과 모든 로그를 캡처하세요.
실용적인 정체 결정 표 사용
| 두 개 이상의 간격에 걸친 관찰 | 해석 | 조치 |
|---|---|---|
| 처리된 블록 증가 | 느리지만 진행 중 | 모니터링 계속 |
| 백분율 변동 없음, 블록 증가 | 반올림 표시 | 대기 |
| 블록 변경 없음, 작업이 일시 중지됨 | 의도적인 보류 | 일시 중지 또는 정책 이유 찾기 |
| 블록 변경 없음, 반복 재시도/재설정 | 하드웨어 또는 경로 문제 | 쓰기 감소; 소스 및 연결 점검 |
| 재시작 후 동일 블록에서 중지 | 지속적인 읽을 수 없는 영역 | 데이터 보호; 무작위 재시도 중지 |
| 후속 단계 활성화 상태에서 99.9% | 최종화 또는 메타데이터 작업 | 작업 라벨 및 로그 확인 |
재구성이 중단되었다고 판단하기 전에 최소 두 개의 독립 신호에서 증거를 요구하세요: 카운터가 움직이지 않고 오류, 중단 상태 또는 지속적인 동일 중지 지점이 있는 경우.
무엇을 재시작하기 전에 해야 하나요
- 어레이 세부 정보, 멤버 시리얼, 처리된 블록 카운터 및 전체 이벤트 로그를 저장하세요.
- 필수적이지 않은 애플리케이션 I/O를 줄이고 대상 및 소스 디스크가 계속 감지되는지 확인하세요.
- 모든 활성 소스에서 SMART 미디어 지표와 링크 재설정 또는 CRC 카운터를 점검하세요.
- 일시 중지 상태, 온도 제한, 우선순위 정책 또는 대기 중인 검증 단계가 없는지 확인하세요.
- 동일한 읽을 수 없는 범위가 반복 시도를 멈출 때 백업, 이미지 생성 또는 복구로 에스컬레이션하세요.
어레이 상태와 정확한 구현을 알기 전까지 stop, assemble, force-online, metadata-clear 명령을 사용하지 마세요.
조용한 간격 동안 진행 상황 비교
유용한 중단 테스트는 통제된 관찰 창이 필요합니다. 대용량 전송과 예약 작업을 일시 중지한 후 간격 시작과 끝에서 카운터를 기록하세요. 이는 전경 경쟁과 자체적으로 진행할 수 없는 복구 과정을 구분합니다.
부하가 줄어들 때 진행이 재개되면 낮은 유지보수 우선순위나 조용한 일정을 선택하세요. 카운터가 고정되고 동일한 오류가 반복되면 추가 대기만으로는 정보가 거의 늘어나지 않습니다.
자주 묻는 질문
99.9% 진행이 한 시간 동안 지속되면 자동으로 중단된 건가요?
아니요. 최종 메타데이터 업데이트나 검증 단계는 시간이 걸릴 수 있습니다. 개입하기 전에 처리된 블록, 장치 쓰기 또는 작업 상태가 여전히 변하는지 확인하세요.
재구성 속도 제한을 높여야 하나요?
디스크가 건강하고 전경 I/O 정책이 병목임을 증명한 후에만 멈추세요. 제한을 높이면 애플리케이션 지연이 악화되고 한계에 가까운 소스 드라이브에 더 큰 부담을 줄 수 있습니다.
언제 기다림을 멈춰야 하나요?
카운터가 반복 검사에서 변하지 않고 로그에 중단, 반복 장치 재설정, 복구 불가능한 읽기 또는 동일한 블록 범위에서 실패가 기록되면 이를 정상으로 간주하지 마세요.
중단의 작업 정의
재구성이 측정 가능한 작업이 중단되고 시스템이 일시 중지를 정책, 부하 또는 새로운 단계로 설명할 수 없을 때 중단됩니다. 불안감이나 실제 시간 대신 카운터와 오류 증거를 사용하세요.
지원 및 팁
더 읽어보기

전원 손실 후 RAID 어레이가 비활성화되는 이유는 무엇인가요?
비활성 배열은 종종 메타데이터가 발견되었지만 시스템이 비정상 종료 후 안전하게 시작할 만큼 충분한 신뢰도나 구성원이 없음을 의미합니다.

누락된 RAID 멤버를 강제로 온라인 상태로 전환할 때의 위험은 무엇인가요?
강제 옵션은 오래된 메타데이터, 손상된 패리티, 누락된 쓰기 또는 활성 풀에 대한 안전 검사 우회를 허용하므로 사용하기 전에 증거를 확인하고 보존하세요.

불량 SATA 케이블과 고장 나는 NAS 드라이브를 구별하는 방법
오류가 디스크에 따라 발생하는지 아니면 SATA 경로에 남아 있는지 추적하고, 하드웨어를 교체하기 전에 전송 카운터와 미디어 상태 증거를 구분하세요.

