Artikel top billede

Konfigurationsfejl skyld i stort Microsoft-nedbrud

Se hvorfor Microsofts store Azure-tjeneste bragede ned i sidste uge.

Computerworld News Service: Det var en fejl i systemkonfigurationen, der var årsag til det nedbrud, der ramte vesteuropæiske Windows Azure-kunder i sidste uge, oplyser Microsoft.

På grund af denne fejl var Microsofts platform til hosting og udvikling af offentlige cloud-applikationer utilgængelig i cirka to en halv time torsdag.

Microsoft har ikke sat tal på, hvor mange kunder, der fik nedbruddet at føle.

Problemet havde at gøre med en "sikkerhedsventil" i Azures netværksinfrastruktur, der har til formål at forhindre netværksnedbrud i at sprede sig ude af kontrol.

Ny kapacitet

For at bremse en kaskadevirkning begrænser denne mekanisme antallet af forbindelser, som kan oprettes til netværkshardwareenheder.

"Forud for denne hændelse tilføjede vi ny kapacitet til den vesteuropæiske underregion på grund af øget efterspørgsel. Begrænsningen af antallet af enheder var dog ikke blevet justeret under valideringsprocessen til at modsvare den nye kapacitet," skriver Mike Neil, der er chef for Windows Azure, i et blogindlæg.

En pludselig stigning i brugen af den påvirkede klynge førte til, at sikkerhedsventilens tærskel blev overskredet, hvilket genererede en storm af advarselsbeskeder i netværksadministrationen.

"Den øgede administrationstrafik udløste fejl i nogle af klyngens hardwareenheder, hvilket fik deres CPU'ers udnyttelsesgrad op på 100 procent, hvilket påvirkede datatrafikken," forklarer Neil.

Sådan løste Microsoft problemet

Microsoft løste hurtigt problemet ved at øge grænseværdierne for den påvirkede klynges sikkerhedsventil.

For at forhindre situationen i at gentage sig er Microsoft nu ved at rette de identificerede fejl i netværkshardwareenhederne og arbejder desuden på at forbedre systemerne til netværksovervågning, så de kan opdage og løse sådanne problemer, før de fører til nedbrud.

Analytiker James Staten fra Forrester Research påpeger, at PaaS-clouds (platform as a service) såsom Azure er meget komplekse og stærkt automatiserede miljøer, og understreger, at der kan opstå tekniske problemer i produktionsmiljøer, som ikke kan forudses i et testmiljø.

"Dette ser ud til at være et sådant tilfælde," vurderer han.

I takt med at der tilføjes nye funktioner, anvendelsen øges og andre faktorer træder i kraft, er administratorerne nødt til at sørge for at justere og optimere det kørende system, og nogen gange vil noget gå i stykker, siger han.

Ingen grund til bekymring

"Bør det bekymre klienterne? Faktisk ikke. Dette er et eksempel på, hvad der kan ske i et cloud-miljø. Men i et typisk datacenter sker der oftere langt værre ting," fremhæver Staten.

It-chefer og udviklere med planer om at hoste applikationer i skyen bør designe og konfigurere dem til at være fejltolerante. "Det er en grundlæggende ændring i tilgangen, som udviklere og driftsteam er nødt til at forstå, når de kaster sig over cloud-udrulning," siger han.

"Disse former for nedbrud udgør læringsmuligheder både for cloud-leverandørerne og for cloud-kunderne. I stedet for at se en sådan hændelse som et argument imod cloud bør man se den som en mulighed for at forbedre sin viden om cloud," tilføjer han.

Oversat af Thomas Bøndergaard




Brancheguiden
Brancheguide logo
Opdateres dagligt:
Den største og
mest komplette
oversigt
over danske
it-virksomheder
Hvad kan de? Hvor store er de? Hvor bor de?
Despec Denmark A/S
Distributør af forbrugsstoffer, printere, it-tilbehør, mobility-tilbehør, ergonomiske produkter, kontor-maskiner og -tilbehør.

Nøgletal og mere info om virksomheden
Skal din virksomhed med i Guiden? Klik her

Kommende events
SAP Excellence Day 2025

Hvordan du orkestrerer og opdeler SAP-projekter for at opnå gevinster hurtigere? Hvordan påvirker AI fremtiden for SAP i almindelighed og måske også din virksomhed? Dette er blot nogle af de svar du får ved at deltage på denne spændende konference.

03. april 2025 | Læs mere


Cyber Briefing: Backup, availability og disaster recovery

I en tid hvor truslerne mod it-driften kun vokser, er det afgørende at kende forskellen på backup, availability og disaster recovery. Deltag og få konkret viden og praksisnære eksempler på, hvordan I kan styrke jeres beredskab.

07. april 2025 | Læs mere


Cyberthreat Day, København: Trusler, angreb og forsvar i praksis

Stå rustet mod cybertrusler. Få et detaljeret overblik over de nyeste sårbarheder, angrebsmønstre og metoder, som cyberkriminelle anvender. Lyt til beretninger fra sikkerhedseksperter på den digitale frontlinje, og få indsigt i både succesfulde angreb og de, der blev afværget

08. april 2025 | Læs mere