Artikel top billede

Konfigurationsfejl skyld i stort Microsoft-nedbrud

Se hvorfor Microsofts store Azure-tjeneste bragede ned i sidste uge.

Computerworld News Service: Det var en fejl i systemkonfigurationen, der var årsag til det nedbrud, der ramte vesteuropæiske Windows Azure-kunder i sidste uge, oplyser Microsoft.

På grund af denne fejl var Microsofts platform til hosting og udvikling af offentlige cloud-applikationer utilgængelig i cirka to en halv time torsdag.

Microsoft har ikke sat tal på, hvor mange kunder, der fik nedbruddet at føle.

Problemet havde at gøre med en "sikkerhedsventil" i Azures netværksinfrastruktur, der har til formål at forhindre netværksnedbrud i at sprede sig ude af kontrol.

Ny kapacitet

For at bremse en kaskadevirkning begrænser denne mekanisme antallet af forbindelser, som kan oprettes til netværkshardwareenheder.

"Forud for denne hændelse tilføjede vi ny kapacitet til den vesteuropæiske underregion på grund af øget efterspørgsel. Begrænsningen af antallet af enheder var dog ikke blevet justeret under valideringsprocessen til at modsvare den nye kapacitet," skriver Mike Neil, der er chef for Windows Azure, i et blogindlæg.

En pludselig stigning i brugen af den påvirkede klynge førte til, at sikkerhedsventilens tærskel blev overskredet, hvilket genererede en storm af advarselsbeskeder i netværksadministrationen.

"Den øgede administrationstrafik udløste fejl i nogle af klyngens hardwareenheder, hvilket fik deres CPU'ers udnyttelsesgrad op på 100 procent, hvilket påvirkede datatrafikken," forklarer Neil.

Sådan løste Microsoft problemet

Microsoft løste hurtigt problemet ved at øge grænseværdierne for den påvirkede klynges sikkerhedsventil.

For at forhindre situationen i at gentage sig er Microsoft nu ved at rette de identificerede fejl i netværkshardwareenhederne og arbejder desuden på at forbedre systemerne til netværksovervågning, så de kan opdage og løse sådanne problemer, før de fører til nedbrud.

Analytiker James Staten fra Forrester Research påpeger, at PaaS-clouds (platform as a service) såsom Azure er meget komplekse og stærkt automatiserede miljøer, og understreger, at der kan opstå tekniske problemer i produktionsmiljøer, som ikke kan forudses i et testmiljø.

"Dette ser ud til at være et sådant tilfælde," vurderer han.

I takt med at der tilføjes nye funktioner, anvendelsen øges og andre faktorer træder i kraft, er administratorerne nødt til at sørge for at justere og optimere det kørende system, og nogen gange vil noget gå i stykker, siger han.

Ingen grund til bekymring

"Bør det bekymre klienterne? Faktisk ikke. Dette er et eksempel på, hvad der kan ske i et cloud-miljø. Men i et typisk datacenter sker der oftere langt værre ting," fremhæver Staten.

It-chefer og udviklere med planer om at hoste applikationer i skyen bør designe og konfigurere dem til at være fejltolerante. "Det er en grundlæggende ændring i tilgangen, som udviklere og driftsteam er nødt til at forstå, når de kaster sig over cloud-udrulning," siger han.

"Disse former for nedbrud udgør læringsmuligheder både for cloud-leverandørerne og for cloud-kunderne. I stedet for at se en sådan hændelse som et argument imod cloud bør man se den som en mulighed for at forbedre sin viden om cloud," tilføjer han.

Oversat af Thomas Bøndergaard




Brancheguiden
Brancheguide logo
Opdateres dagligt:
Den største og
mest komplette
oversigt
over danske
it-virksomheder
Hvad kan de? Hvor store er de? Hvor bor de?
Alfapeople Nordic A/S
Rådgivning, implementering, udvikling og support af software og it-løsninger indenfor CRM og ERP.

Nøgletal og mere info om virksomheden
Skal din virksomhed med i Guiden? Klik her

Kommende events
Hybrid, on-premise eller public cloud. Bliv klogere på fremtidens datacenter

Få indblik i, hvordan du planlægger, designer og drifter dit datacenter, så det kan følge med virksomhedens vækst, støtter bæredygtighedsindsatsen og lever op til krav om effektiv datahåndtering.

25. februar 2025 | Læs mere


Identity Festival 2025

Er du klar til en dag, der udfordrer din forståelse af, hvad Identity & Access Management (IAM) kan gøre for din organisation? En dag fyldt med indsigt, inspiration og løsninger, der sætter kursen for, hvordan vi arbejder med IAM i de kommende år.

05. marts 2025 | Læs mere


Tech Transformation Trends 2025

Tech Transformation Trends er konferencen, hvor vi sætter fokus på de helt store Danske virksomheders digitale transformationer og måden de driver virksomhed på. Dagen byder på cases og vidensdeling, der vil give inspiration som kan være med til at løfte din strategi og navigere i fremtidens digitale landskab.

06. marts 2025 | Læs mere






White paper
Sådan: Opgradér din printerløsning uden store investeringer