Global cloud outage ng Amazon: timeline, sanhi, at saklaw

  • Pangkalahatang insidente sa AWS na may sentro ng lindol sa US-EAST-1 na nagsimula bandang 9:00 AM (Peninsula Time)
  • Nakita ng Amazon ang pinagmulan sa DynamoDB at isang pinagbabatayan na isyu sa DNS, na may progresibong pagbawi sa tanghali.
  • Epekto sa maraming serbisyo: Alexa, Prime Video, Canva, Duolingo, Snapchat, at mga video game tulad ng Fortnite at Roblox
  • Nagpatuloy ang mga partikular na epekto hanggang hapon habang ipinatupad ang mga hakbang sa pagpapagaan.

Pangkalahatang larawan ng pandaigdigang pagkawala ng AWS

Isang malawakang pagkawala ng kuryente na nakakaapekto sa imprastraktura ng Amazon Web Services (AWS) ang paulit-ulit na naantala ang serbisyo para sa libu-libong platform at application sa iba't ibang bansa. Tumaas ang mga ulat ng mga gumagamit tungkol sa mga isyu sa koneksyon, mga problema sa latency, at mga pagkabigo sa pag-load kaninang umaga , na may partikular na mataas na konsentrasyon sa Estados Unidos at nakikitang mga epekto sa Europa.

Ayon sa status dashboard ng kumpanya, ang isyu ay nagmula sa rehiyon ng US-EAST-1 (Northern Virginia) at nagdulot ng hindi pangkaraniwang pagtaas ng mga error rate sa ilang API. Pagsapit ng kalagitnaan ng umaga, iniulat ng AWS na nakakita sila ng malinaw na mga senyales ng pagbangon sa maraming serbisyo, bagama't nagsusumikap pa rin ang mga team upang ganap na malutas ang isyu at maibalik sa normal ang lahat ng operasyon.

Kronolohiya ng pangyayari

Ang mga unang alerto ay dumating bandang 9:00 AM (oras sa peninsula ng Espanya), na may pinakamataas na bilang ng mga insidente pagkaraan nito at patuloy na mga abiso sa mga tool sa pagsubaybay tulad ng DownDetector. Mula 11:00 AM pataas, iniulat ng kumpanya na natukoy nito ang isang posibleng sanhi at sinimulan ang pagpapatupad ng mga hakbang sa pagpapagaan na nagpapabilis sa pagbangon sa iba't ibang antas.

Bandang tanghali, iniulat ng AWS na karamihan sa mga operasyon ay bumabalik na sa normal , bagama't nabanggit nito ang paminsan-minsang mga paghihigpit sa ilang mga kahilingan at mga partikular na serbisyo sa apektadong rehiyon. Sa unang bahagi ng hapon, nararamdaman pa rin ang mga natitirang epekto habang nagpapatuloy ang mga pagsisikap sa pagpapanatag.

Ilustrasyon tungkol sa mga problema sa Amazon cloud

Saan ang teknikal na pinagmulan

Ang kumpanya ay nakatuon sa Amazon DynamoDB , ang pinamamahalaang serbisyo ng database ng key-value nito, na ang endpoint sa US-EAST-1 ay nakaranas ng mga pagkabigo na nagresulta sa magkakasunod na mga error sa maraming dependency. Itinuro ng AWS ang isang pinagbabatayan na isyu sa DNS bilang sanhi, na unti-unting tinutugunan.

Sa pagsasagawa, kapag ang Domain Name System (DNS) ay nabigong mag-resolve nang tama, hindi mahanap ng mga application ang kanilang mga resources , na nagreresulta sa mga error sa koneksyon, mga timeout, at mga pagkabigo sa paglo-load ng data. Bilang isang hakbang para sa mga hindi inaasahang pangyayari, inirerekomenda ng AWS na i-flush ng mga customer na nakakaranas ng mga patuloy na isyu ang kanilang mga DNS cache upang maibalik ang resolution sa mga tamang endpoint.

Sino ang naapektuhan

Malawakan ang epekto: Mismong ang Amazon ay nag-ulat ng mga isyu sa Alexa at Prime Video , habang ang mga serbisyo ng ikatlong partido tulad ng Canva , Duolingo , at Snapchat ay nakaranas ng mga problema . Naobserbahan din ang mga pagkawala ng kuryente sa mga generative AI platform at mga collaborative application na umaasa sa AWS cloud.

Hindi rin nakaligtas ang digital entertainment. Ang mga laro at serbisyo na may malalaking user base, tulad ng Fortnite , Roblox , at Clash Royale , ay nag-ulat ng mga error sa pag-login o koneksyon, habang ang ilang game store at launcher ay nagpatupad ng mga mitigasyon upang mabawasan ang epekto hanggang sa maging matatag ang trapiko.

Epekto sa Espanya

Sa buong bansa, maraming gumagamit ang nag-ulat ng mga problema sa pag-access sa mga digital service application at website, lalo na noong bandang kalagitnaan ng umaga. Naapektuhan din ang mga ticketing platform tulad ng Ticketmaster, na nagpaantala sa mga nakatakdang paglabas ng mga kanta sa tanghali, kabilang ang mga tiket para sa mga pinakahihintay na konsiyerto.

Ang mga institusyong pinansyal at pangunahing plataporma ng mga mamimili ay nag-ulat ng mga nakahiwalay na insidente sa kanilang mga online system, bagama't ang epekto ay iba-iba ayon sa rehiyon at serbisyo. Habang ipinatupad ang mga hakbang sa pagpapagaan sa apektadong rehiyon ng US, isang unti-unting pagbangon ng access ang naobserbahan sa Europa.

Kasalukuyang sitwasyon at rekomendasyon

Habang lumilipas ang mga oras, ipinahiwatig ng AWS na nakakakita ito ng mga makabuluhang senyales ng pagbangon sa karamihan ng mga serbisyo nito, habang pinapanatili ang limitadong mga paghihigpit sa ilang partikular na operasyon sa loob ng US-EAST-1. Patuloy na sinusubaybayan ng kumpanya ang pagganap at nagpapatupad ng mga pagsasaayos upang lubos na malutas ang isyu.

Kung nakakaranas ka pa rin ng ilang mga pagkabigo, ipinapayong suriin ang opisyal na katayuan ng AWS at, kung naaangkop, i-clear ang DNS cache o i-restart ang mga kliyente at serbisyo na umaasa sa resolusyon ng endpoint sa apektadong rehiyon. Sa mga kritikal na deployment, inirerekomenda rin na i-verify ang mga failover , mga dependency sa network, at mga patakaran sa muling pagsubok upang mabawasan ang epekto ng latency at mga transient error.

Itinatampok ng episode na ito ang lawak ng naging istruktural na imprastraktura ng cloud computing para sa digital na ekonomiya: ang isang lokal na pagkabigo sa isang pangunahing hub ay maaaring humantong sa mga chain reaction sa pandaigdigang saklaw, mula sa streaming at mga video game hanggang sa mga aplikasyon sa pananalapi at produktibidad.


Idagdag bilang ginustong mapagkukunan sa Google