결론: RAID 장애 인지를 ZimaOS 대시보드에만 의존하지 마세요
RAID는 구성원 하나에 장애가 발생한 후에도 성능 저하 모드로 온라인 상태를 유지할 수 있습니다. 사용자가 다음 로그인 때까지 문제를 알아차리지 못한다면 바로 이 시점에서 문제가 발생할 가능성이 큽니다. 실용적인 모니터링 구성은 ZimaOS 스토리지를 구성의 기준으로 유지한 다음, 휴대폰, Discord, 이메일 또는 웹훅으로 알림을 보낼 수 있는 독립적인 SMART/드라이브 상태 모니터를 추가하는 것입니다.
2026년 스레드에서는 Scrutiny와 ntfy를 사용했습니다. Scrutiny는 물리 드라이브의 SMART 데이터를 검사할 수 있고 여러 알림 전송 방식을 지원하므로, 이는 여전히 합리적인 설계입니다.
물리 디스크를 확인할 수 있는 드라이브 상태 모니터를 설치하세요
Scrutiny는 마운트된 파일 시스템만이 아니라 실제 SATA/NVMe 장치에 액세스해야 합니다. Docker에서는 앱에 필요한 /dev/sdX 또는 /dev/nvmeX 장치가 전달되었고 SMART 수집이 정상적으로 수행되는지 확인하세요. 디스크가 HBA, USB 브리지 또는 RAID 컨트롤러 뒤에 있다면 수집기에 컨트롤러별 처리가 필요할 수 있습니다.
smartctl -H /dev/sda
smartctl -a /dev/sda
nvme smart-log /dev/nvme0
Scrutiny의 Scrutiny 알림은 이메일, 웹훅, Discord, Gotify, ntfy, Slack, Telegram 및 기타 대상을 지원합니다. Netdata 모니터링은 SMART가 제공하지 않는 호스트 지표를 담당합니다.
SMART 이벤트에 연결하기 전에 ntfy를 테스트하세요
먼저 휴대폰이 일반 테스트 메시지를 수신하는지 확인하세요.
curl -d "Zima drive alert test" https://ntfy.sh/YOUR_UNIQUE_TOPIC


추측하기 어려운 토픽 이름을 사용하거나, 알림 내용이 민감하다면 인증된 자체 호스팅 ntfy를 사용하세요. 공개 ntfy 토픽은 기억하기 쉬운 이름을 선택했다는 이유만으로 비밀로 간주해서는 안 됩니다.
Scrutiny를 알림 대상에 연결하세요
최신 Scrutiny 릴리스는 scrutiny.yaml을 통한 알림 URL을 지원합니다. 컨테이너를 다시 만들 때 알림 설정이 조용히 삭제되지 않도록 알림 구성을 영구 AppData에 보관하세요. 변경한 후에는 Scrutiny를 다시 시작하고 알림 상태 점검을 호출하세요.
curl -X POST http://SCRUTINY_IP:PORT/api/health/notify
SMART 대시보드가 정상으로 표시된다고 해서 외부 알림 채널이 작동한다는 의미는 아니므로, 테스트 알림이 성공적으로 전달되는 것이 중요합니다.
SMART 상태와 별도로 RAID 상태를 모니터링하세요
SMART는 물리 드라이브에 대한 경고를 제공할 수 있지만, RAID 저하는 어레이 수준의 상태입니다. 유용한 사전 장애 SMART 경고 없이 디스크가 갑자기 사라질 수도 있습니다. 다음 두 가지를 모두 확인하세요.
cat /proc/mdstat
mdadm --detail /dev/md0
Linux의 mdadm RAID 상태는 어레이 수준의 기준 정보입니다. RAID 복구에서는 ZimaOS 측 복구 범위를 다룹니다.
무엇을 해야 하는지 알려 주는 알림을 정의하세요
모든 상황에 똑같이 모호한 “디스크 문제” 메시지를 보내지 마세요. 유용한 알림은 최소한 SMART 중대 경고, 디스크 누락, RAID 성능 저하, RAID 재구성 중, 파일 시스템 용량 부족 임박, 설정한 임계값을 초과한 스토리지 온도를 구분해야 합니다. 가능하면 장치 모델/일련 번호와 어레이 이름을 포함하세요. 그러면 섀시를 열기 전에 어떤 드라이브를 점검해야 하는지 알 수 있습니다.
SMART가 백업 전략이 될 때까지 기다리지 마세요
드라이브는 긴 SMART 경고 없이 장애가 발생할 수 있으며, RAID는 삭제, 랜섬웨어 또는 섀시 분실을 방지하지 못합니다. 대체할 수 없는 데이터는 검증된 두 번째 사본을 유지하세요. ZimaOS 백업은 모니터링만으로는 대체할 수 없는 복구 계층을 제공합니다.
모니터링 스택 자체를 위한 보조 가동 시간 모니터를 사용하세요
Scrutiny 또는 ntfy가 실행을 멈추면 알림이 오지 않는 상황을 “모든 것이 정상”인 것으로 오해할 수 있습니다. 간단한 가동 시간 점검으로 Scrutiny 웹 엔드포인트 또는 알림 서비스를 모니터링하세요. Uptime Kuma 모니터링은 이러한 메타 모니터링 계층에 유용합니다.
FAQ
RAID 디스크에 장애가 발생하면 ZimaOS가 이메일을 보내나요?
대시보드에 표시된다는 것과 외부 알림이 전송된다는 것은 다릅니다. 독립적인 알림 경로를 추가하고 처음부터 끝까지 테스트하세요.
Scrutiny가 RAID 저하를 감지할 수 있나요?
Scrutiny는 주로 물리 드라이브의 SMART 데이터를 평가합니다. RAID 저하 여부는 mdadm/ZimaOS 어레이 상태를 별도로 확인하세요.
SMART에는 장애가 발생한 드라이브가 정상이라고 표시되면 어떻게 하나요?
예측 가능한 SMART 경고 없이도 전원, 케이블, 컨트롤러 또는 갑작스러운 전자 부품 고장으로 디스크가 사라질 수 있습니다. 장치 존재 여부와 RAID 상태도 모니터링하세요.
드라이브 알림에 ntfy를 사용해도 안전한가요?
적절하게 구성하면 안전합니다. 특히 알림에 호스트 이름, 일련 번호 또는 기타 인프라 세부 정보가 포함된다면 고유 토픽이나 인증된 토픽을 사용하세요.
SMART는 얼마나 자주 확인해야 하나요?
전체 수집은 매일 수행하는 경우가 많으며, 중요한 장치 및 어레이 존재 여부는 더 자주 확인할 수 있습니다. 불필요한 디스크 활동을 유발하는 과도한 테스트는 피하세요.
