불량 SATA 케이블은 전송 오류를 발생시키고, 고장 난 드라이브는 미디어 또는 장치 오류를 발생시킵니다. 신뢰할 수 있는 테스트는 어떤 오류 유형이 증가하는지, 그리고 그 오류가 어디에서 발생하는지를 추적하는 것입니다.
단일 SMART 상태나 한 번의 연결 끊김만으로 진단하지 마십시오. 디스크 시리얼 번호, 현재 카운터, 커널 메시지, 베이, 케이블, 컨트롤러 포트를 기록한 후 한 번에 하나의 경로 구성 요소를 변경하세요. 각 제어된 변경 후의 패턴이 원래 오류 수보다 더 유용합니다.
어떤 부품도 재장착하기 전에 기준값을 기록하세요
케이블을 교체하기 전에 영향을 받은 드라이브의 시리얼 번호, 모델, 베이, 컨트롤러 포트, SMART 속성, 자체 테스트 로그, 오류 로그, 최근 시스템 메시지를 기록하세요. 재장착은 증상을 멈출 수 있지만 드라이브와 경로 간의 관계를 지울 수 있습니다.
/dev/sdX와 같은 장치 이름은 부팅이나 케이블 이동 시 변경될 수 있으므로 시리얼 번호가 안정적인 식별자입니다. 기준값에 타임스탬프를 찍고 원시 카운터 값을 기록하세요. 여러 SMART 카운터는 누적되며 케이블 교체 후 0으로 초기화되지 않습니다.
어레이가 손상되었거나 오류가 증가하는 경우 무거운 쓰기를 일시 중지하세요. 증거를 먼저 보존한 후 한 번에 하나의 제어된 변경을 수행하세요. 그렇지 않으면 케이블, 베이, 전원 커넥터, 드라이브를 동시에 교체할 경우 신뢰할 수 있는 진단이 불가능합니다.
전송 오류와 미디어 오류를 구분하세요
전송 오류는 명령이나 데이터가 SATA 경로를 통과할 때 발생하며, 미디어 오류는 드라이브가 섹터를 신뢰성 있게 읽거나 쓸 수 없을 때 발생합니다. 두 가지 오류 유형은 유사한 애플리케이션 증상을 유발할 수 있지만 서로 다른 하드웨어 문제를 가리킵니다.
리눅스 ATA 오류 모델은 ATA 버스 오류와 미디어 오류를 구분합니다: CRC 및 전송 실패는 경로에 속하며, 재시도 후 보고된 수정 불가능한 읽기 오류는 장치 미디어에 속합니다. 타임아웃은 모호할 수 있으므로 지원 카운터와 제어된 교체가 필요합니다.
조치를 취하기 전에 각 로그 항목을 분류하세요. 증가하는 CRC 또는 링크 재설정 증거는 케이블, 커넥터, 백플레인, 전원 안정성 또는 컨트롤러 경로에 주의를 기울이게 하며, 읽을 수 없는 섹터와 실패한 자체 테스트는 드라이브 자체에 의심을 둡니다.
CRC 및 링크 카운터가 계속 증가하는지 관찰하세요
0이 아닌 CRC 카운트는 인터페이스 오류가 발생했음을 나타내지만, 과거 총합만으로 현재 케이블이 불량임을 증명하지는 않습니다. 핵심 신호는 알려진 테스트 기간 동안 원시 카운트가 증가하는지 여부입니다.
ICRC는 인터페이스 CRC 오류를 기록합니다. 이 카운터는 드라이브에 저장되므로 원래 케이블이나 호스트가 교체된 후에도 보일 수 있으니, 과거 값을 활성 오류로 간주하지 말고 교체 전후 값을 비교하세요.
데이터 케이블을 재장착하거나 교체한 후 제어된 읽기 작업을 실행하고 새 카운트를 기록하세요. CRC 또는 링크 재설정 이벤트가 중단되고 미디어 지표가 안정적이라면 경로가 주요 원인이며, 카운트가 계속 증가하면 베이, 포트, 전원 연결을 계속 분리하세요.
자체 테스트로 드라이브 측 고장을 확인하세요
읽을 수 없는 섹터, 대기 중인 섹터, 재할당된 섹터, CRC와 관련 없는 실패한 명령, 반복 가능한 위치에서 중단되는 자체 테스트가 보고되면 드라이브가 의심됩니다. 이러한 신호는 장치가 미디어에 접근하는 능력과 관련이 있습니다.
SMART 자체 테스트와 오류 로그는 RAID 계층에만 의존하지 않고 장치 측 증거를 보존하므로 유용합니다. SMART 자체 테스트 로그는 원시 속성 및 시스템 로그와 함께 해석해야 하며, 단일 PASSED 라인으로 축소해서는 안 됩니다.
심각하게 손상된 어레이나 이미 반복된 읽기 오류를 반환하는 드라이브에 과도한 부하를 주는 확장 테스트는 실행하지 마세요. 데이터가 위험할 경우 백업 또는 이미징을 우선시하고, 제어된 작업 부하에서 분리된 드라이브를 테스트하세요.
한 번에 하나의 경로 구성 요소만 교체하세요
가장 명확한 구분자는 오류가 물리적 드라이브를 따라 발생하는지 아니면 SATA 경로에 머무르는지입니다. 테스트당 한 구성 요소만 변경하세요: 먼저 데이터 케이블, 그다음 베이나 백플레인 경로, 마지막으로 플랫폼이 안전하게 허용한다면 컨트롤러 포트 순입니다.
새 오류를 비교하는 동안 동일한 디스크 시리얼과 작업 부하를 유지하세요. 특정 베이나 케이블에서만 전송 카운터가 증가하면 디스크가 원인이 아니며, 깨끗한 경로를 따라 시리얼을 따라가는 미디어 오류와 실패한 자체 테스트는 드라이브 문제를 가리킵니다.
시리얼-슬롯 매핑을 기록하고 저장 스택이 슬롯 순서가 아닌 메타데이터로 멤버를 식별하는지 확인하지 않고 활성 RAID 멤버를 섞지 마세요. 시스템이 제어된 이동을 지원하지 않으면 케이블을 먼저 교체하고 로그를 사용해 나머지 경로를 좁히세요.
타임아웃과 재설정을 보조 증거로 해석하세요
명령 타임아웃, SATA 링크 재설정, 장치가 잠시 사라지는 현상은 약한 케이블, 불안정한 전원, 컨트롤러 문제, 응답을 멈춘 드라이브에서 발생할 수 있습니다. 중요한 신호이지만 스스로 원인을 식별하지는 않습니다.
ATA 복구 경로는 전송 실패나 알 수 없는 명령 상태 후에 링크를 재설정할 수 있습니다. 반복되는 재설정과 증가하는 CRC 오류는 경로 가설을 강화하며, 반복되는 수정 불가능 섹터나 자체 테스트 실패는 미디어 가설을 강화합니다.
각 이벤트를 타임스탬프로 RAID 드롭, 애플리케이션 I/O 오류, SMART 변경과 연관시키세요. 유지보수 후 한 번의 재설정은 설득력이 떨어지며, 동일한 케이블, 베이, 드라이브 시리얼에서 반복되는 패턴이 더 신뢰할 만합니다.
증거가 가리키는 부품을 교체하세요
새 CRC 및 링크 오류가 한 연결에 묶여 있고 드라이브가 다른 곳에서 제어된 미디어 검사를 통과하면 케이블을 교체하거나 경로를 수리하세요. 장치 측 오류가 알려진 양호한 경로를 따라 시리얼을 따라가면 드라이브를 교체하거나 폐기하세요.
모호한 경우 이분법적 답변을 강요하지 마세요. 고장 난 드라이브가 경계선 케이블과 공존할 수 있으며, 안정적인 SMART 자체 테스트가 반복되는 전송 오류를 지우지 않아도 RAID 멤버를 떨어뜨릴 수 있습니다.
수리 후 새 기준값을 설정하고 정상 작업 부하, 스크럽 또는 일관성 검사, 모니터링 기간 동안 카운터가 증가하지 않는지 확인하세요. 오류가 계속되거나 데이터가 읽을 수 없거나 어레이에 남은 중복성이 없으면 에스컬레이션하거나 디스크 이미징을 진행하세요.
| 관찰된 패턴 | 더 일치하는 원인 | 다음 제어된 조치 |
|---|---|---|
| CRC 카운트 증가; 미디어 테스트 통과 | 케이블, 커넥터, 베이 또는 컨트롤러 경로 | 한 경로 구성 요소를 교체하고 재테스트 |
| 수정 불가능 섹터가 디스크 시리얼을 따름 | 드라이브 미디어 고장 | 데이터 보호 및 드라이브 교체 |
| 명확한 카운터 없이 타임아웃 발생 | 모호한 경로 또는 장치 결함 | 로그를 연관시키고 변수 하나를 변경 |
| 케이블 교체 후 오류 중단 | 해결된 전송 오류 | 새 기준값에서 모니터링 유지 |
지원 및 팁
더 읽어보기

전원 손실 후 RAID 어레이가 비활성화되는 이유는 무엇인가요?
비활성 배열은 종종 메타데이터가 발견되었지만 시스템이 비정상 종료 후 안전하게 시작할 만큼 충분한 신뢰도나 구성원이 없음을 의미합니다.

누락된 RAID 멤버를 강제로 온라인 상태로 전환할 때의 위험은 무엇인가요?
강제 옵션은 오래된 메타데이터, 손상된 패리티, 누락된 쓰기 또는 활성 풀에 대한 안전 검사 우회를 허용하므로 사용하기 전에 증거를 확인하고 보존하세요.

속도가 다른 드라이브들이 동일한 미러 배열을 공유할 수 있나요?
속도가 다른 드라이브는 데이터를 미러링할 수 있지만, 느린 드라이브가 전체 어레이의 쓰기, 복구, 지연 시간 및 작업 부하 한계를 설정할 수 있습니다.

