홈 서버가 절전 모드에서 깨어난 후에만 NVMe 드라이브 하나를 인식하지 못하는 이유는 무엇인가요?

에바 왕기술 작가 그리고 이자 ZimaSpace의 상주 장인입니다. 평생을 기술에 열정을 가진 사람으로서 홈랩과 오픈소스 소프트웨어에 열정을 가지고 있으며,복잡한 기술 개념을 쉽게 이해할 수 있는 실습 가이드로 번역하는 데 전문성을 가지고 있습니다.에바는 셀프 호스팅이 어렵지 않고 재미있어야 한다고 믿습니다. 그녀의 튜토리얼을 통해 커뮤니티가 하드웨어 설정의 신비를 풀도록돕고 있습니다. 첫 NAS 구축부터 Docker 컨테이너 마스터링까지.

NVMe 드라이브는 컨트롤러 또는 PCIe 링크가 재개 과정에서 저전력 상태에서 정상적으로 복귀하지 못하면 절전 모드 후 사라질 수 있습니다.

콜드 부팅 후에는 정상 작동하지만 일시 중지 후에만 사라지는 드라이브라면 단순한 파일 시스템 문제가 아닐 가능성이 높습니다. 네임스페이스, 파티션, 파일 시스템 또는 애플리케이션이 표시되기 전에 문제가 발생할 수 있습니다. PCIe 장치가 다시 열거되지 않거나, NVMe 컨트롤러가 준비 상태로 전환되지 않거나, 전원 관리 조합으로 인해 링크에 접근할 수 없게 될 수 있습니다. 가장 하위에서 사라진 계층부터 진단하고, 장치 경로를 파악하기 전에는 저장 장치를 포맷하거나 교체하거나 재구축하지 마세요.

재개 후 사라지는 가장 하위 계층 확인

절전 모드로 전환하기 전에 PCI 장치, NVMe 컨트롤러, 네임스페이스, 파티션, 파일 시스템 UUID, 드라이브를 사용하는 마운트 지점과 애플리케이션을 기록하세요. 재개 직후 동일한 항목을 다시 확인하세요.

Linux NVMe 하위 시스템은 컨트롤러와 네임스페이스를 별도의 계층으로 노출합니다. Ubuntu의 nvme list 명령을 사용하면 컨트롤러 자체가 사라진 것인지, 컨트롤러는 남아 있지만 예상한 네임스페이스를 더 이상 노출하지 않는 것인지 구분할 수 있습니다.

PCI 기능이 사라졌다면 펌웨어, PCIe 링크 전원 관리 및 절전 동작에 집중하세요. 컨트롤러는 남아 있지만 블록 장치가 사라졌다면 NVMe 재설정, 네임스페이스, 드라이버 오류 및 컨트롤러 준비 상태를 확인하세요.

콜드 부팅, 재부팅 및 지원되는 각 절전 상태 비교

콜드 부팅, 일반 재부팅, 유휴 상태로의 일시 중지 및 운영 체제와 펌웨어에서 제공하는 경우에만 심층 일시 중지를 테스트하세요. 어떤 전환에서 문제가 재현되는지 기록하세요.

Linux 커널은 유휴 상태로의 일시 중지, 대기 모드 및 RAM 일시 중지를 구분하며, 각각 장치와 플랫폼의 전원 감소 수준이 다릅니다. 커널의 절전 상태 설명에서는 한 NVMe 컨트롤러가 얕은 절전 상태에서는 정상적으로 재개되지만 더 깊은 플랫폼 전환 후에는 실패할 수 있는 이유를 설명합니다.

특정 절전 상태에서만 발생하는 문제는 디스크 포맷 문제보다 전원 전환 문제일 가능성이 높다는 증거입니다. 영구적인 펌웨어 또는 드라이버 수정 사항을 테스트하는 동안에는 정상 작동이 확인된 상태를 계속 사용할 수 있도록 하세요.

PCIe 장치가 다시 열거되는지 확인

절전 전과 재개 후의 PCI 버스 출력을 비교하세요. NVMe 컨트롤러 주소, 협상된 링크 상태, 커널 드라이버 및 오류 카운터를 포함해야 합니다. 테스트 전에 정확한 버스 주소를 저장하세요.

lspci 유틸리티는 네임스페이스나 파일 시스템이 관여하기 전 PCI 계층에서 컨트롤러를 보고하므로, NVMe 장치 전체가 사라진 것처럼 보일 때 이를 구분하는 데 적합합니다.

PCI 열거에서 장치가 사라졌다면 파일 시스템을 다시 검색하거나 마운트를 새로 만들어도 도움이 되지 않습니다. 장치가 계속 표시된다면 컨트롤러를 재설정하기 전에 NVMe 및 커널 오류를 캡처하세요.

-15% OFF

NVMe 자율 전원 상태 전환 테스트

현재 NVMe 전원 상태 설정과 자율 전원 상태 전환이 활성화되어 있는지 기록하세요. 한 번의 제어된 일시 중지 주기에서 전원 관련 변수 하나만 변경하세요.

ArchWiki는 NVMe 절전 동작과 APST 지연 시간 제어를 설명합니다. 특정 하드웨어가 불안정하게 재개될 때 이 제어를 사용하면 컨트롤러가 진입할 수 있는 저전력 상태의 깊이를 제한할 수 있습니다.

APST 제한은 진단을 위한 임시 조치일 뿐, 모든 심층 전원 상태에 결함이 있다는 증거는 아닙니다. 더 얕은 전원 정책을 사용할 때만 반복적인 재개 주기에서 드라이브가 정상적으로 유지된다면, 이 우회 방법을 영구적으로 적용하기 전에 펌웨어 및 커널 수정 사항을 비교하세요.

펌웨어, BIOS 및 모던 스탠바이 동작 검토

메인보드 펌웨어 버전, NVMe 펌웨어, 운영 체제 빌드 및 최근 BIOS나 드라이버 변경 사항을 기록하세요. 플랫폼이 기존 절전 모드를 사용하는지, 모던 스탠바이 기반의 저전력 유휴 모델을 사용하는지 확인하세요.

Microsoft의 모던 스탠바이 모델은 지원되는 장치가 기존 절전 모드와 동일한 경로를 따르지 않고 플랫폼에서 관리하는 저전력 동작 상태를 유지한다는 점을 보여줍니다. 이로 인해 시스템마다 NVMe 문제가 재현되는 방식이 달라질 수 있습니다.

한 번에 하나의 펌웨어 계층만 업데이트하고 이전 버전 또는 복구 방법을 보존하세요. BIOS 업데이트, SSD 펌웨어 업데이트 및 운영 체제 업그레이드를 한 번의 테스트에 함께 적용하지 마세요. 어떤 변경으로 문제가 해결되었는지 확인할 수 없게 됩니다.

PCIe 링크 전원 및 런타임 전원 관리 확인

PCIe ASPM 설정, 런타임 전원 상태 및 시스템 절전 전에 NVMe 컨트롤러가 일시 중지된 런타임 상태로 진입하는지 확인하세요. 서버 설계상 안전한 경우에만 문제가 발생하는 슬롯을 다른 슬롯과 비교하세요.

Red Hat의 전원 관리 지침은 런타임 전원 관리와 PCIe ASPM이 서로 다른 메커니즘임을 설명합니다. 따라서 한 기능을 비활성화한 뒤 변화가 관찰되었다고 해서 자동으로 해당 기능이 원인이라고 단정할 수는 없습니다.

문제가 드라이브를 따라 다른 슬롯으로 이동한다면 컨트롤러 또는 펌웨어를 의심하세요. 특정 슬롯에서만 계속 발생한다면 메인보드 펌웨어, 바이퍼케이션, 공유 레인, 슬롯 전원 및 신호 무결성을 점검하세요.

안전하게 복구하고 반복적인 재개 주기 확인

드라이브가 사라지면 콜드 종료를 하기 전에 로그를 보존하세요. 컨트롤러가 치명적 상태, 링크 오류 또는 사라지는 네임스페이스를 보고하는 경우 반복적인 핫 리셋을 피하세요.

ZimaSpace의 홈 서버 복구 체크리스트는 관련 원칙을 제공합니다. 파일 시스템 복구를 실행하거나 데이터를 복원하기 전에 하드웨어 가시성과 저장 장치 상태를 확인해야 합니다.

의도한 전원 상태에서 반복적인 절전 및 재개 주기를 거치는 동안 컨트롤러, 네임스페이스, 파티션, 마운트 및 애플리케이션이 모두 유지되면 문제가 해결된 것입니다. 수정 사항이 재부팅, 유휴 시간 및 일반적인 저장 장치 부하에서도 유지되는지 확인할 때까지 최신 백업을 보관하세요.

지원 및 팁

더 읽어보기

Get More Builds Like This

Stay in the Loop

Get updates from Zima - new products, exclusive deals, and real builds from the community.

Stay in the Loop preferences

We respect your inbox. Unsubscribe anytime.