“재해 상황에서 모든 서버를 같은 방식으로 복구해야 할까요?” 재해복구(DR, Disaster Recovery)는 시스템 장애나 재해 상황에서 서비스를 복구하기 위한 체계입니다. 백업을 확보하고 복제를 구성하는 것까지는 비교적 명확한 작업에 해당합니다. 일반적으로 재해복구의 목표는 모든 시스템을 장애 이전 상태로 되돌리는 것으로 설정됩니다. 다만 모든 시스템에 동일한 복구 수준을 적용하려면 그만큼의 자원과 운영 부담이 따릅니다. 복구 시간을 짧게 잡을수록 […] ||
“재해 상황에서 모든 서버를 같은 방식으로 복구해야 할까요?”
재해복구(DR, Disaster Recovery)는 시스템 장애나 재해 상황에서 서비스를 복구하기 위한 체계입니다. 백업을 확보하고 복제를 구성하는 것까지는 비교적 명확한 작업에 해당합니다. 일반적으로 재해복구의 목표는 모든 시스템을 장애 이전 상태로 되돌리는 것으로 설정됩니다. 다만 모든 시스템에 동일한 복구 수준을 적용하려면 그만큼의 자원과 운영 부담이 따릅니다. 복구 시간을 짧게 잡을수록 상시 유지해야 하는 자원이 늘어나고, 보호 대상을 넓힐수록 복제 비용과 검증해야 할 범위도 함께 늘어납니다. 그래서 실제 구축에서는 시스템의 중요도에 따라 복구 수준을 나누게 되는데, 그 기준을 세우는 일이 쉽지 않습니다. 서버 목록과 사양만으로는 각 시스템이 어떤 조건에서 복구되는지, 그 조건을 갖추는 데 무엇이 필요한지 판단할 근거가 부족하기 때문입니다.
웅진프리드라이프는 온프레미스 서버 21대를 대상으로 AWS Elastic Disaster Recovery(AWS DRS) 기반 재해복구 체계를 구축하고 모의 복구 훈련을 수행하였습니다. 보호 대상의 86%가 Windows Server였으며, Windows Server 2012 R2부터 2019까지 여러 세대가 혼재한 환경이었습니다. 오랜 기간 운영되면서 서버마다 설정과 구성이 조금씩 달라져 있어, 자료만으로는 각 서버가 복구 환경에서 어떻게 동작할지 판단하기 어려운 상태였습니다.
그래서 복제를 구성한 뒤 drill 수행 과정을 통해 서버를 실제로 기동해보는 방식으로 하나씩 확인해 나갔습니다. 이 과정에서 복제 단계, 부팅 단계, 서비스 단계마다 확인해야 할 항목이 드러났고, 서버마다 복구에 필요한 조건이 서로 다르다는 점도 함께 확인할 수 있었습니다. 본 블로그에서는 단계별로 확인된 이슈와 대응 방법, 그리고 서버별 복구 목표를 정의하기까지의 과정을 공유합니다.
웅진프리드라이프 소개
웅진프리드라이프는 국내 상조업계를 선도하는 라이프 케어 기업입니다. 2019년 업계 최초로 누적 선수금 1조 원을 돌파한 데 이어 2023년 2조 원, 2026년 4월에는 단일 상조기업 최초로 3조 원을 넘어섰습니다.
2025년 6월에는 웅진그룹 계열사로 편입되어 웅진그룹은 기존 교육, 에너지, 여가 사업에 상조를 더해, 생애주기 전반을 지원하는 ‘토탈 라이프 케어’ 기업으로 사업 구조를 확장하고 있습니다. 이번 프로젝트는 AWS의 Migration & Modernization 컨설팅 파트너인 ㈜웅진 클라우드사업본부와 함께 진행되어 재해복구 체계 설계부터 복구 훈련 검증까지 약 4개월간 수행되었습니다.
프로젝트 배경과 목표
프리드라이프는 온프레미스 환경 전체를 AWS로 이관하는 마이그레이션을 준비하고 있었습니다. 이번 프로젝트는 그 여정의 첫 단계로, 두 가지 목표를 함께 설정했습니다.
재해복구 체계 확보 – 24시간 운영되는 서비스에 대한 복구 수단 마련
마이그레이션 사전 검증 – 온프레미스 서버들이 AWS 환경에서 정상 기동되는지, 이관 전에 정비해야 할 항목이 무엇인지 미리 확인
특히 마이그레이션 사전 검증 관점에서 AWS DRS의 Drill 기능은 운영 서비스와 복제 상태에 영향을 주지 않고 복구 인스턴스를 실제로 기동해볼 수 있도록 합니다. 재해복구 훈련인 동시에 마이그레이션 리허설로도 활용할 수 있는 구조입니다.
시스템 요구 사항
장례 의전은 발생 시점을 예측할 수 없고 접수 즉시 대응이 시작되어야 하는 24시간 서비스입니다. 콜센


