서버 RAID5 다중 디스크 장애 데이터복구

서버 RAID5 다중 디스크 장애 데이터복구

RAID5 서버에서 여러 하드디스크 장애가 발생한 경우

RAID5는 하나의 디스크 장애를 허용할 수 있도록 구성되지만, 여러 디스크에서 동시에 장애가 발생하거나 장애 디스크를 교체한 후 RAID Rebuild에 문제가 발생하면 데이터에 접근할 수 없는 상황이 발생할 수 있습니다.

특히 서버 RAID5에서 여러 HDD가 인식되지 않거나 읽기 오류가 반복되는 경우에는 단순히 디스크를 교체하거나 RAID를 다시 구성하기보다 각 디스크의 상태와 기존 RAID 구조를 먼저 분석하는 것이 중요합니다.

이번 사례에서는 서버 RAID5에서 다중 디스크 장애가 발생하여 데이터에 접근할 수 없는 상황을 기준으로 구성 디스크 개별 진단 → RAID 구성 분석 → 가상 RAID 구성 → 파일시스템 분석 → 데이터 추출 및 검증 과정을 진행합니다.


장애 증상

서버에서 다음과 같은 증상이 확인될 수 있습니다.

  • 여러 HDD가 RAID에서 인식되지 않음
  • RAID5가 Degraded 또는 Failed 상태로 표시됨
  • 서버에서 데이터 볼륨에 접근할 수 없음
  • 특정 폴더와 파일이 열리지 않음
  • RAID Controller에서 Array를 정상적으로 인식하지 못함
  • RAID Rebuild가 실패하거나 완료되지 않음

RAID5는 구성 디스크 중 하나에 장애가 발생한 경우에도 운영이 가능한 구조이지만, 추가 디스크 장애가 발생하면 상황이 달라질 수 있습니다.


01. 구성 HDD 개별 진단

먼저 RAID5를 구성하고 있던 모든 HDD를 개별적으로 확인합니다.

각 디스크의 인식 상태와 읽기 상태를 확인하고 다음과 같은 장애 여부를 분석합니다.

  • 배드섹터
  • 읽기 불량
  • 디스크 인식불가
  • 펌웨어 이상
  • 헤드 또는 미디어 손상
  • 인터페이스 장애

RAID에 여러 개의 장애 디스크가 포함되어 있다면 각 디스크에서 읽을 수 있는 데이터 영역을 최대한 정확하게 확인하는 것이 중요합니다.


02. 디스크 상태 및 장애 순서 분석

RAID5에서는 단순히 “몇 개의 디스크가 고장났는가”만 확인해서는 충분하지 않습니다.

각 디스크의 상태와 장애 발생 과정, 기존 RAID 구성 및 데이터 기록 상태를 함께 분석해야 합니다.

특히 다음 사항을 확인합니다.

  • RAID 구성 디스크 개수
  • 각 디스크의 용량
  • 디스크 순서
  • RAID Level
  • Stripe Size
  • 패리티 방식
  • 데이터 시작 위치
  • RAID Metadata

이러한 정보를 바탕으로 기존 RAID5 구조를 분석합니다.


03. 원본 데이터 확보

정상적으로 읽을 수 있는 디스크라고 하더라도 장애 상태의 RAID 디스크를 반복적으로 사용하는 것은 주의해야 합니다.

가능한 경우 원본 디스크에 직접 작업하기보다 디스크 이미지를 확보하여 분석 작업을 진행합니다.

배드섹터가 있는 디스크는 정상 영역을 우선적으로 확보하고 읽기 오류가 발생하는 영역은 상태에 따라 별도의 이미징 전략을 적용합니다.


04. RAID5 구성 분석

구성 디스크의 데이터를 분석하여 기존 RAID5의 구조를 확인합니다.

특히 RAID5에서는 데이터가 여러 디스크에 분산되고 패리티 정보가 함께 기록되기 때문에 디스크 순서와 Stripe 구조를 정확하게 확인하는 것이 중요합니다.

분석 대상은 다음과 같습니다.

RAID Level · 디스크 순서 · Stripe Size · 패리티 방향 · 데이터 시작 위치 · RAID Metadata

RAID Controller에서 기존 구성을 정상적으로 확인할 수 없는 경우에도 구성 디스크의 데이터를 분석하여 RAID 파라미터를 추정할 수 있습니다.


05. 가상 RAID 구성

분석된 RAID 파라미터를 이용하여 가상 RAID5 환경을 구성합니다.

가상 환경에서는 원본 디스크에 데이터를 기록하지 않고 RAID 구조를 재구성한 뒤 데이터 영역이 정상적으로 연결되는지 확인합니다.

이 과정에서 파일시스템과 폴더 구조가 정상적으로 나타나는지 확인하여 RAID 구성의 정확성을 검증합니다.


06. 파일시스템 분석

가상 RAID가 정상적으로 구성되면 서버에서 사용하던 파일시스템을 분석합니다.

파일시스템의 메타데이터와 데이터 영역을 확인하고 다음 항목을 검증합니다.

  • 파티션
  • 볼륨
  • 폴더 구조
  • 파일 목록
  • 파일 크기
  • 파일 데이터 영역

파일 목록이 확인된다고 해서 모든 데이터가 정상이라는 의미는 아니므로 중요한 파일을 직접 확인하는 과정이 필요합니다.


07. 데이터 추출 및 검증

복구 가능한 데이터가 확인되면 별도의 저장장치로 데이터를 추출합니다.

추출 과정에서는 파일과 폴더 구조를 유지하면서 데이터를 저장하고, 중요한 파일을 직접 확인하여 데이터의 정상 여부를 검증합니다.

특히 서버 환경에서는 다음과 같은 업무 데이터를 확인할 수 있습니다.

  • 문서 파일
  • 데이터베이스
  • 이미지 및 동영상
  • 백업 파일
  • 가상머신 데이터
  • 업무용 파일 및 폴더

RAID5 다중 디스크 장애에서 중요한 점

RAID5에서 여러 디스크에 장애가 발생한 경우 무조건 RAID를 새로 구성하거나 Rebuild를 진행하는 것은 위험할 수 있습니다.

다음과 같은 작업은 복구 가능성에 영향을 줄 수 있으므로 주의해야 합니다.

RAID Rebuild

장애 디스크를 교체한 후 Rebuild를 진행하면 기존 데이터 영역에 새로운 정보가 기록될 수 있습니다.

디스크 순서 변경

RAID 구성에서 디스크 순서는 데이터 구조와 관련이 있기 때문에 임의로 변경하지 않는 것이 좋습니다.

RAID 초기화

기존 Array를 삭제하거나 새로운 RAID를 생성하면 기존 RAID Metadata와 구성정보가 변경될 수 있습니다.

포맷 및 초기화

운영체제에서 디스크 또는 RAID 볼륨을 초기화하거나 포맷하면 기존 파일시스템 구조에 영향을 줄 수 있습니다.


서버 RAID5 데이터복구 결과

서버 RAID5 다중 디스크 장애의 복구 가능성은 장애 디스크의 수와 상태, RAID 구성정보, 데이터 기록 상태 및 파일시스템 손상 정도에 따라 달라집니다.

따라서 RAID5 장애가 발생한 경우 단순히 디스크를 교체하거나 RAID를 재구성하기보다 각 구성 디스크를 개별적으로 진단하고 기존 RAID 구조를 먼저 분석하는 것이 중요합니다.

인젠은 서버 RAID5 장애 발생 시 구성 디스크의 상태를 확인하고 RAID 파라미터를 분석하여 가상 RAID 환경을 구성한 후 파일시스템과 데이터 영역을 단계적으로 분석합니다.

복구 가능한 데이터가 확인되면 별도의 저장장치로 데이터를 추출하고 주요 파일을 검증하여 데이터 상태를 확인합니다.

서버 RAID5 장애 상담 시 확인하면 좋은 정보

  • 서버 제조사 및 모델
  • RAID Controller 모델
  • RAID5 구성 디스크 수
  • HDD/SSD 용량
  • 현재 RAID 상태
  • 장애가 발생한 디스크
  • Rebuild 또는 초기화 진행 여부
  • 서버 부팅 및 데이터 접근 여부

중요한 데이터가 있는 RAID5 서버에서 다중 디스크 장애가 발생했다면 추가적인 Rebuild나 초기화 작업을 진행하기 전에 현재 상태를 보존하고 전문적인 진단을 받는 것이 좋습니다.

Share this post:

답글 남기기