본문 바로가기
카테고리 없음

AWS 전 세계 앱 마비가 남긴 것 4가지

by Play__ 2026. 7. 9.
반응형
아마존-AWS-대규모-장애로-전-세계-앱-웹서비스-마비-클라우드-의존-리스크-다시-불붙-1-ce5504a0.png
클라우드의 편리함은 분산된 듯 보이지만, 의존이 한곳에 몰리면 장애도 세계화된다.
아마존-AWS-대규모-장애로-전-세계-앱-웹서비스-마비-클라우드-의존-리스크-다시-불붙-2-9006ff07.png

전 세계가 멈춘 그날 밤, 무슨 일이 있었나요
2025년 10월 19일 밤 11시 48분(PDT), 아마존 AWS의 북버지니아 리전 US-EAST-1에서 조용히 시작된 장애가 전 세계를 뒤흔들었습니다. Reddit, Snapchat, Roblox, Zoom, Coinbase, Fortnite까지 수천 개 서비스가 줄줄이 먹통이 됐습니다. Downdetector 기준 400만 건 이상의 사용자 신고가 쏟아졌고, 런던부터 도쿄까지 결제·항공·업무가 모두 흔들렸습니다. 복구 완료까지 무려 15시간 이상이 걸렸습니다.

아마존-AWS-대규모-장애로-전-세계-앱-웹서비스-마비-클라우드-의존-리스크-다시-불붙-3-1ce3e327.png

왜 하필 DNS 한 줄이 도미노를 쓰러뜨렸을까요
AWS 공식 사후보고서에 따르면 최초 원인은 DynamoDB의 자동 DNS 관리 시스템에 잠복해 있던 결함이었습니다. 이 결함이 드러나면서 dynamodb.us-east-1.amazonaws.com 엔드포인트의 DNS 레코드가 비정상적으로 비어버렸습니다. 새 연결을 만들지 못하게 되자 EC2 인스턴스 실행 실패, NLB 헬스체크 오류, Lambda·컨테이너 서비스 지연이 연쇄적으로 터졌습니다. 서버 한 대 문제가 아니라 DNS·DB·컴퓨팅·로드밸런싱 의존성이 도미노처럼 무너진 구조적 사고였습니다.

아마존-AWS-대규모-장애로-전-세계-앱-웹서비스-마비-클라우드-의존-리스크-다시-불붙-4-85b1d6b6.png

이번 장애가 클라우드 의존 논쟁에 불을 지핀 이유는요
TechRadar는 이 사건을 2025년 '가장 파괴적인 단일 인터넷 장애'로 기록했습니다. 2026년 1분기 기준 전 세계 클라우드 인프라 지출은 약 1,290억 달러이고, AWS는 그중 28%를 차지합니다. 단 하나의 리전이 흔들렸을 뿐인데 글로벌 앱 경제 전체가 충격을 받은 셈입니다. 이 사건은 '비용 절감을 위한 단일 클라우드 집중'과 '복원력을 위한 멀티클라우드 분산' 사이의 선택을 기업들에게 다시 강요하고 있습니다.

아마존-AWS-대규모-장애로-전-세계-앱-웹서비스-마비-클라우드-의존-리스크-다시-불붙-5-7c41518d.png

앞으로 우리가 주목해야 할 변화는 무엇일까요
AWS는 재발 방지를 위해 DynamoDB DNS 자동화 수정, NLB 용량 제거 제한, EC2 복구 테스트 강화 등을 약속했습니다. 하지만 이런 조치들이 실제로 신뢰를 회복하기까지는 시간이 필요합니다. 이번 사건 이후 멀티리전·멀티클라우드 설계, DNS 장애 대비 아키텍처, 클라우드 집중 리스크 관리가 IT 업계의 핵심 화두로 떠올랐습니다. 편리함에 기댄 의존이 얼마나 큰 취약점이 될 수 있는지를 이번 15시간이 선명하게 보여줬습니다.

#AWS장애 #클라우드장애 #USEAST1 #DynamoDB #아마존웹서비스 #클라우드의존리스크 #멀티클라우드 #인터넷장애 #IT인프라 #클라우드보안

반응형