불량 SATA 케이블과 고장 난 NAS 드라이브를 구별하는 방법

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

NAS 드라이브가 한 번의 연결 끊김, I/O 경고 또는 SMART 라인만으로 고장났다고 판단하지 마세요. 불량 SATA 데이터 케이블, 느슨한 커넥터, 불안정한 전원선, 고장난 포트, 컨트롤러 문제 및 손상된 드라이브는 겹치는 증상을 일으킬 수 있습니다. 신뢰할 수 있는 방법은 원본 증거를 보존하고 링크 오류와 미디어 오류를 구분하며 한 번에 하나의 변수를 변경하고 새로운 오류가 케이블 경로를 따르는지 아니면 드라이브 일련 번호를 따르는지 확인하는 것입니다.

어레이를 보호하고 최초 증거를 보존하세요

NAS가 저하되었거나 멤버가 반복적으로 연결이 끊긴다면, 불필요한 쓰기를 줄이고 대체 불가능한 데이터가 별도의 읽을 수 있는 백업에 존재하는지 확인하세요. 어떤 것도 재장착하기 전에 어레이 상태를 기록하세요. 케이블 테스트는 비용이 적게 들지만, 실수로 두 번째 디스크를 제거하거나 불안정한 연결을 통해 재구성하면 훨씬 더 큰 복구 문제가 발생할 수 있습니다.

영향을 받은 드라이브의 모델, 일련 번호, 베이, 장치 이름, SMART 보고서, 자체 테스트 기록, 컨트롤러 이벤트 및 각 재설정 또는 I/O 오류의 정확한 시간을 저장하세요. ZimaSpace의 드롭된 RAID 디스크와 불량 드라이브 베이 구분 가이드는 같은 원리를 사용합니다: 먼저 물리적 장치를 식별한 후 오류가 어디를 따르는지 추적합니다.

기준선을 저장하기 전에 SMART 속성, 컨트롤러 카운터 또는 시스템 로그를 초기화하지 마세요. 많은 카운터는 누적 합계이며 케이블 교체 후에도 0으로 돌아가지 않습니다. 중요한 것은 제어된 변경 후 원시 값이 증가하는지 여부입니다. 케이블을 사진으로 찍고 양쪽 끝에 라벨을 붙이면 나중에 교체 시 실제로 어떤 경로가 테스트되었는지 혼동을 방지할 수 있습니다.

테스트 전에 두 가지 경쟁 가설을 세우세요

가설 A는 연결 경로 결함입니다: SATA 데이터 케이블, 커넥터, 포트, 백플레인 회로, 컨트롤러 채널, 전원 커넥터 또는 불안정한 전원 공급 장치입니다. 이 경로는 링크 재설정, CRC 오류, 다운시프트, 명령 시간 초과, 갑작스러운 연결 끊김 또는 동일 하드웨어 경로를 통해 연결된 다른 드라이브에서 동일한 증상을 더 자주 발생시킵니다.

가설 B는 드라이브 결함입니다: 읽을 수 없는 미디어, 증가하는 재할당 또는 대기 중인 섹터, 실패한 자체 테스트, 내부 전자 장치 고장, 비정상적인 소음, 또는 알려진 정상 케이블과 포트를 통해 동일한 일련 번호 디스크에서 발생하는 오류입니다. BleepingComputer 토론에서는 케이블 관련 전송 오류가 자동으로 물리적 불량 섹터로 간주되어서는 안 되는 이유를 설명합니다.

증거가 분리될 때까지 두 가설을 모두 열어 두세요. 하나의 CRC 오류가 케이블이 현재 나쁘다는 증거가 아니며, 하나의 읽기 오류가 드라이브를 즉시 폐기해야 한다는 증거도 아닙니다. 테스트 모델은 어떤 새 카운터가 증가하는지, 증상이 어떤 구성 요소를 따르는지, 드라이브가 안정 경로에서 장기 자가 진단을 완료할 수 있는지 물어야 합니다.

SMART 데이터에서 링크 오류와 미디어 오류를 구분하세요

UDMA CRC 오류 수는 종종 SMART 속성 C7 또는 199으로 표시되며 주로 통신 경로 단서입니다. Level1Techs는 UDMA CRC 오류가 드라이브와 호스트 컨트롤러 간에 감지된 손상을 기록한다고 설명합니다. 케이블이 일반적인 원인이지만 커넥터, 포트, 백플레인, 컨트롤러, 전원 불안정 또는 드라이브 자체 인터페이스 전자장치도 원인이 될 수 있습니다.

미디어 관련 속성은 다른 방향을 가리킵니다. 재할당 섹터 수, 현재 대기 중인 섹터 수, 오프라인 수정 불가, 보고된 수정 불가 오류, 그리고 읽기 실패로 끝나는 장기 자가 진단은 드라이브 문제의 더 강한 증거입니다. 공급업체 속성 이름과 원시 형식이 다르므로 모든 모델에 하나의 보편적 임계값을 적용하기보다는 추세와 테스트 결과를 비교하세요.

저장된 CRC 총계만으로는 충분하지 않습니다. HardForum의 CRC 원시 값이 계속 증가하는지 관찰하는 설명이 핵심 차이를 잘 설명합니다. 케이블 교체 후 카운트가 변하지 않으면 과거 사건일 수 있습니다. 새 전송 중에 증가하면 활성 링크 경로가 여전히 불안정한 것입니다.

증거 케이블, 포트 또는 전원 경로와 더 일치함 고장 난 드라이브와 더 일치함 여전히 모호함
UDMA CRC / 인터페이스 CRC 카운트 케이블 또는 포트 변경 후 새로운 증가분이 멈춤 새로운 증가분이 알려진 정상 경로를 따라 동일한 드라이브에서 발생함 증가하지 않는 오래된 0이 아닌 총계
재할당되었거나 대기 중인 섹터 일반적으로 데이터 케이블만으로는 발생하지 않음 안정 경로 테스트 후에도 카운트가 증가하거나 해결되지 않음 추세나 테스트 결과가 없는 과거 값 하나
장기 SMART 자가 진단 링크 수리 후 반복적으로 통과함 다른 시스템에서 반복 가능한 LBA 또는 읽기 단계에서 실패함 드라이브가 연결 해제되어 중단됨
시스템 로그 링크 재설정, PHY 오류, 다운시프트, 장치 재연결 복구 불가능한 미디어 읽기, 센스 오류, 반복된 불량 LBA 하위 수준 세부 정보 없는 일반 I/O 타임아웃
오류가 따라옴 동일한 베이, 케이블, 포트, 백플레인 또는 전원 분기 동일한 일련 번호의 드라이브 여러 변수를 동시에 변경함

하드웨어 변수를 한 번에 하나씩 변경하세요

인클로저나 컨트롤러가 계획한 정확한 핫스왑 동작을 지원하지 않는 경우 NAS 전원을 끄세요. 드라이브와 케이블에 라벨을 붙이고, 짧고 단단히 고정되며 심하게 구부러지지 않은 알려진 양호한 SATA 데이터 케이블만 교체하세요. 첫 비교를 위해 동일한 드라이브, 포트, 전원 커넥터, 베이를 유지하세요.

시스템을 부팅하고 새 기준선을 저장한 후 제한된 대표 작업 부하를 실행하면서 새로운 CRC 오류, 리셋 또는 연결 끊김을 관찰하세요. Unraid 커뮤니티는 CRC 오류는 일반적으로 SATA 연결 문제를 가리키지만 전원 문제도 포함될 수 있다고 합니다. 오류가 계속되면 드라이브는 그대로 두고 알려진 양호한 포트나 전원 분기로 옮기세요.

케이블 교체, 드라이브 이동, 포트 변경, 전원 케이블 교체를 한 번에 하지 마세요. 증상이 사라질 수 있지만 고장 부품을 식별하는 데 필요한 증거가 사라집니다. 각 변경 후 경과 시간, 작업 부하, 온도, SMART 변화, 로그 이벤트를 기록하여 결과를 기억하는 대신 비교할 수 있도록 하세요.

새 오류가 따라오는 상황으로 결정하세요

드라이브의 미디어 속성이 안정적이고, 장시간 테스트를 통과하며, 데이터 케이블 교체 후 새로운 CRC 또는 리셋 이벤트가 중단될 때 케이블이 주요 원인입니다. 의심되는 케이블은 다른 곳에 재설치하지 말고 폐기하세요. 문제가 특정 메인보드 포트나 백플레인 슬롯에서만 발생한다면, 고장 부품은 케이블보다 상류에 있습니다.

읽을 수 없는 섹터, 대기 중인 섹터, 재할당 이벤트 또는 자체 테스트 실패가 알려진 양호한 케이블과 포트에서 계속 발생할 때, 특히 동일한 LBA 또는 일련 번호가 있는 디스크가 관련된 경우 드라이브가 주요 원인입니다. Tom's Hardware도 CRC 오류만으로는 전송 경로 문제를 식별하며 자동으로 디스크 고장을 의미하지 않는다고 지적합니다; 드라이브 교체는 미디어 상태나 오류 추적 테스트에서 더 강력한 증거가 필요합니다.

서로 다른 드라이브가 동일한 베이, 동일한 컨트롤러 포트 또는 동일한 전원 분배기에 실패할 때 공유 경로가 주요 원인입니다. 여러 드라이브가 함께 연결이 끊기면 여러 디스크를 비난하기 전에 전원 공급 장치, 공유 백플레인, HBA 및 커넥터를 점검하세요. 근본 원인은 실패에 공통적인 부품이며, 경고에 처음 언급된 장치일 필요는 없습니다.

재구성 전에 확인된 원인을 수리하세요

확인된 케이블 문제의 경우, 케이블을 영구적으로 교체하고 양쪽 커넥터를 고정하며 날카로운 굴곡이나 장력을 수정하고 새로운 카운터 기준선을 설정하세요. 일반적인 읽기 및 쓰기를 확인한 후 플랫폼에서 지원하는 스크럽 또는 일관성 검사를 실행하세요. 미디어 속성이 안정적이고 수리된 경로에서 새로운 링크 오류가 나타나지 않으면 건강한 드라이브는 서비스를 재개할 수 있습니다.

확인된 드라이브 문제의 경우, 먼저 읽을 수 있는 중요한 데이터를 복사하고 배열 절차에 따라 디스크를 교체한 후 재구성을 모니터링하세요. 다른 멤버에 오류가 발생하거나 교체 드라이브가 반복적으로 연결이 끊기면 중지하고 재평가하세요. ZimaSpace의 RAID 중복성과 백업 복구 설명이 관련 경계입니다: 재구성은 중복성을 복원할 뿐 손상된 데이터의 이전 깨끗한 복사본을 복원하지 않습니다.

동일한 경로가 여러 정상 드라이브에 영향을 줄 때는 컨트롤러, 백플레인 또는 전원 문제로 확대 조사하세요. “어떻게 되는지 보기” 위해 반복 재구성을 시작하지 마세요. 의심되는 부품이 분리되고 교체 경로가 안정적이며 카운터가 더 이상 증가하지 않고 드라이브 또는 배열이 검증을 통과하며 중요한 데이터가 NAS 외부에서 복구 가능한 경우에만 진단이 완료됩니다.

자주 묻는 질문

0이 아닌 UDMA CRC 카운트가 드라이브 고장을 의미하나요?

아니요. 이는 드라이브-호스트 경로에서 감지된 통신 오류를 기록합니다. 현재 값을 저장하고 케이블을 교체한 후 알려진 정상 포트에서 테스트하여 값이 증가하는지 관찰하세요.

불량 SATA 케이블이 보류 중인 섹터를 만들 수 있나요?

불량 케이블은 일반적으로 전송 또는 링크 오류를 더 자주 발생시킵니다. 보류 중이거나 재할당된 섹터는 미디어 상태에 대한 더 강력한 단서이지만, 중단된 명령과 모호한 로그가 겹칠 수 있습니다. 결정을 내리기 전에 안정적인 경로에서 드라이브를 다시 테스트하세요.

저하된 RAID 배열에서 긴 SMART 테스트를 실행해야 하나요?

먼저 읽을 수 있는 데이터를 보호하고 나머지 멤버에 대한 부하를 고려하세요. NAS 플랫폼의 지침에 따라 테스트를 실행하고, 무거운 작업이 겹치지 않도록 하며, 연결이 끊기거나 추가 오류가 발생하면 중지하세요.

지원 및 팁

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.