Graag meningen over onderstaand verhaal.
Groeten,
Een hostingtime klant.
Start mail quote:
Subject: Briefing server crash
Hostingtime
Beste,
Het is u niet ongaan dat de server waarop uw website is gehost in de afgelopen 3 weken structureel onbereikbaar was.
Wat gebeurde er nou precies?
De server viel uit het niets steeds uit en door de server opnieuw op te starten, was de server meestal binnen 15 min weer online. Uit de log bestanden van de server bleek dat de kernel van de server was gecrashed. Uit voorzorg hebben wij de kernel en gehele software systeem geupdate om uit te sluiten dat de huidige kernel versie een bug bevatte. Na deze werkzaamheden heeft de server 5 dagen goed gewerkt. Na onze 72 uur intensieve monitoring dachten wij het probleem te hebben opgelost, maar tevergeefs.
Hardware defect?
Hierna zijn we dieper gaan kijken en meteen uit voorzorg hardware onderdelen gaan vervangen. Zowel de moederboard als geheugen modules zijn van de server vervangen. Want ook deze kunnen de oorzaak zijn van een eventuele server crash. De server heeft hierna 3 dagen goed gefunctioneerd en de 4de dag viel de server weer uit.
Vanaf dat moment wisten we dat het goed mis was met de server en konden we met zekerheid uitsluiten dat het in iedergeval geen hardware of kernel versie oorzaak was.
Dus besloten we een gehele nieuwe server te plaatsen en alleen de harde schijven te verplaatsen, omdat er 3 hardeschijven in de server staan, 2 staan in raid5 (mocht 1 uitvallen dan blijft de ander functioneren) en de 3de is er voor de backups. Dit zou het probleem definitief opgelost moeten hebben, maar ook deze poging was tevergeefs. Zelfs nadat wij externe hp deskundige hadden ingehuurd om dieper in de materie te gaan kijken, bleef de server crashen, en met als gevolg volledig te zijn gecrashed.
Toen dit gebeurde, was 1 ding belangrijk: dat was de data die op de server stond (uw website) te waarborgen, zodat deze niet verloren kon gaan. In dit soort zeldzame situaties hebben wij er voor gekozen om altijd een extra hardeschijf te gebruiken voor alleen de backups. Deze hebben we dus kunnen gebruiken voor het herstel.
Wat hebben wij hierna moeten doen?
Hierna was duidelijk dat de data en besturingssysteem van de server volledig instabiel waren en alle data van de afgelopen 2 weken instabiel en corrupt was. Dus het herstellen van de backups op de zelfde server was niet mogelijk, omdat hiermee het besturingssyteem niet mee wordt hersteld. Ook omdat de server zo instabiel was geworden dat er geen garantie was dat de backups ook werkelijk goed terug gezet zouden worden, en dat de server weer crashed tijdens het terug zetten van de backups.
Dus hebben wij gekozen om een extra server in te zetten, en deze precies in te richten als de oude, maar dan met een schone cPanel en besturingsinstallatie en de backups van 2 weken geleden op deze server te verplaatsen en vanuit deze nieuwe server de backups pas te gaan herstellen. Omdat we dan zeker wisten dat het besturingssyteem en de hardeschijven geen fouten bevatten.
Deze hele operatie heeft veel tijd en inspanning vereist. Met als gevolg dat we ruim 3.5 dag down waren en met man en macht de server getracht zsm online te krijgen. Wij hebben veel support gekregen van onze klanten, die op deze server al ruim 3 jaar zonder al te veel problemen altijd goed geb ruik hebben gemaakt van onze diensten. Maar ook een aantal klanten die weinig goeds vonden aan onze aanpak en de manier hoe wij de zaken weer op de rails hebbengeprobeerd te krijgen. Uiteraad begrijpen wij dat de ellende zowel voor ons, maar ook vooral voor u onacceptabel was.
De afgelopen 3 maanden hebben we helaas te kampen gehad met 3 grote storingen:
1. Onze server rack en die van 20 andere collega bedrijven stond een gehele middag zonder stroom.
2. Half Nederland lag plat, omdat er in het Datacenter van Evoswitch/Leaseweb een storing was.
3. En de huidige server crash.
Storing 1 en 2 was helaas buiten onze toedoen en had geen gevolgen voor de servers die wij hebben.
Wij willen niks verbergen voor onze klanten en vandaar de openheid, naar u toe. Wij hebben ruim 125 servers in beheer en hosten op dit moment ruim 10.000 domeinen en hebben ooit in het verleden een soort gelijke server crash mee gemaakt, maar nog nooit op zo’n wijze dat het zoveel tijd heeft gekost, het proces zoals hierboven beschreven heeft veel tijd gekost ipv de handdoek in de ring te gooien, hebben we doorgezet en alles zsm online weer te krijgen, omdat uw continuteit van ons afhangt en u als klant onze primaire continuteit bent. Op dit moment zijn we druk bezig om de verloren data van de afgelopen 2 weken alsnog te herstellen. Omdat de server en alle andere systemen op deze server zo instabiel zijn, kost dit veel tijd om hier bij te komen. Wij hopen morgen de server weer te kunnen gebruiken voor het herstel proces en aankomende weekend beginnen met het restoren van de meest recente versie. Als u dus subdomeinen of accounts in uw reseller pakket hebt aangemaakt in de afgelopen 2 weken, dan zullen deze niet zichtbaar zijn.
Als u vragen heeft of wilt reageren op deze mail, aarzel geen moment en stuur ons een email.
Hopend op uw begrip en toevertrouwen.
HOSTINGTIME CREW
Einde mail quote

Likes:


Quote
