Volgens mij komt het overal nog steeds voor dat er één feed faalt en dat men hun router op één feed heeft aangesloten.
Ik heb nog niks vernomen over het falen van beide feeds in de DC's.
Afdrukvoorbeeld
Waar haal jij deze informatie vandaan? Ik heb namelijk nog wat via de e-mail heen en weer gepraat met Nedzone, en er was wel degelijk een backup route.
Deze route liep via TeleGlobe die hoog en laag beweerde dat hun routes buiten Nikhef om liepen, maar dit bleek dus niet het geval te zijn. Hierdoor lag heel NedZone plat.
Ook komt er binnen 2 weken een duidelijke verbetering in de capaciteit, infrastructuur en redundantie van het netwerk. Alleen weet ik niet of ik al deze inside informatie mag delen dus dat laat ik over aan NedZone zelf.
Opzich is er zelf een betere manier: laat ams-ix wat animo creëren om de poorten over 2 locaties te spreiden van zowel access als content providers.
Opzich kost fiber tussen een aantal locaties ook niet zoveel meer in Amsterdam + je dient voor je backup geen extra transit commitments af te nemen (zolang iedereen op die manier werkt).
Ideaal zou zijn dat deze aparte locatie een andere exchange is zodat je ook software problemen op hun platform & dat van ams-ix omzeilt.
Dat is nog erger - heb je een dure router staan, zorg je niet voor goede power uplinks. Wij draaien dan geen eigen netwerk, maar als we dat wel gaan doen, komt er voor iedere router toch minimaal een UPS die de router een uur kan laten draaien.
Ik beschuldigde Nedzone ook nergens van, don't get me wrong. Ik zei enkel dat alle routes via Nikhef liepen. Als Teleglobe tegenover Nedzone gegarandeerd heeft dat hun routes buiten Nikhef om lopen, dan ligt de fout inderdaad niet bij Nedzone zelf (al blijven zij uiteraard wel eindverantwoordelijke tegenover hun klanten).Citaat:
Oorspronkelijk geplaatst door Falcon2
AMS-IX biedt die mogelijkheid natuurlijk al. Wellicht dat het een goed idee zou zijn als AMS-IX hun klanten dit inderdaad duidelijker aanbeveelt, maar hun klanten kunnen dit al doen en zouden dat dus ook moeten doen. Tuurlijk, kost net wat meer, maar voor betrouwbaarheid betaal je nu eenmaal.Citaat:
Oorspronkelijk geplaatst door luser
Echter, dit heeft alleen zin als ALLE partijen die bij de AMS-IX peeren, een uplink hebben op minimaal 2 locaties. Hetzelfde geldt voor bijvoorbeeld een aansluiting op de NL-IX; dit heeft alleen zin voor het peeren met partijen die daar peeren. Enerzijds kun je daar natuurlijk weinig aan doen als je zelf wel bereikbaar bent op meerdere locaties, maar anderzijds kun je dit toch voor zijn door toch voldoende transit beschikbaar te hebben om al het peering verkeer op te vangen. En nogmaals, die transit capaciteit is er, en ja, ook genoeg om de hele AMS-IX op te vangen mocht die helemaal plat liggen.
Nogmaals, ik zeg ook niet dat het goedkoop is om de mogelijkheid te hebben om alles over transit te kunnen gooien. Voor echte redundancy betaal je nu eenmaal. Bottomline is wel dat als je die investering niet maakt, dat je dan bij netwerkproblemen door uitval van een locatie enkel jezelf kan verwijten.
En zolang jij niet weet hoe of wat, waarom blijf jij dan maar speculeren en namen noemen?Citaat:
Als Teleglobe tegenover Nedzone gegarandeerd heeft dat hun routes buiten Nikhef om lopen, dan ligt de fout inderdaad niet bij Nedzone zelf (al blijven zij uiteraard wel eindverantwoordelijke tegenover hun klanten).
Naar mijn idee is dit weer typisch zon gevalletje waarbij je niet moet gaan kijken wie zn schuld het is maar hoe we het kunnen voorkomen. Ik vind preventie veel belangrijker, dan wie schuldig is. Natuurlijk moet er wel over gepraat worden als het door nalatigheid of dergelijke komt maar dan nog...
Precies, zo meen ik me te herinneren dat ook de netwerken in Grafix te Alphen a/d Rijn "down" waren door de meest recente stroomstoring in Grafix te Capelle a/d IJssel (even ter voorbeeld). Daar kunnen we net zo'n discussie over starten... lijkt me daarom tijd voor een {xx} hier...
Dit is weer precies z'n "De klok wel hebben horen luiden, maar niet weten waar de klepel hangt."
Het heeft totaal niets met BGP te maken, maar met de gateways met klanten welke net waren verhuisd van Capelle naar Alphen. De Gateways stonden dus nog in Capelle. Zowel GrafiX, Caveo en het Technotop netwerk draaien op het moment volledig onafhankelijk _per locatie_.
Iedereen in dit topic heeft in zekere mate gelijk, enkel waarvan een aantal op dit moment niet haalbare oplossingen. ANS is inderdaad een mooi stukje software, maar op het "grote" internet zie ik niet zo snel netwerken hier gebruik van maken.
Een netwerk moet op minimaal 2 locaties zijn prefixes announcen naar aparte transitleveranciers. Enkel moet dit van twee kanten komen, dus zowel van de access als contentprovider. We hebben er immers niets aan als een grote content leverancier wel redundant is maar alle accessproviders op hun gat liggen door uitval op het sciencepark.. maar laten we eerlijk zijn.
Het internet is ooit opgezet als "onfaalbaar" geheel. Door middel van vele verspreide routers en verbindingen zou het eigenlijk onmogelijk moeten zijn om het te laten falen. Het geheel zou een reguliere graaf moeten zijn, waarbij iedere node ongeveer evenveel verbindingen heeft. In de praktijk zijn er echter een paar grote knooppunten met heel veel, veel minder verbonden, takken naar de rest. Dit is in meerdere onderzoeken aangetoond (referenties kan ik opzoeken, maar kan het merendeel wsl toch niet bij).
Het probleem hiermee is dat de redundantie weg is. Het omvallen van enkele grote knooppunten helpt de connectiviteit op het internet gewoon om de zeep. Het is compleet irrelevant of het hierbij om transit of peering gaat, gezien alle grote transit toko's uiteindelijk ook dezelfde knooppunten (NIKHEF, Sara etc.) gebruiken. Natuurlijk kan 1 partij het oplossen door z'n uitgaande verkeer zoveel mogelijk te verdelen en meer traffic engineering trucjes toe te passen, maar als iedereen dat doet blijft het probleem nog altijd even groot en is het dus geen oplossing.
Wat de oplossing dan wel is? Niet meer van die enorme knooppunten als in Amsterdam bouwen, maar meer individuele connecties. Probleem daarmee is echter vaak de kosten :-)
Misschien dat jullie het niet meer weten, maar toen die aardbeving twee jaar geleden was in Azie, was China gedurende een half jaar minder goed bereikbaar. Dat geeft al ongeveer aan dat je altijd een zwakke schakel hebt. Hoeveel lijntjes heb je nodig....
Het is geen 200% extra capaciteit maar 100% extra capaciteit, maar dat ter zijde.
Je hebt verder geheel gelijk, en dat is inderdaad het probleem - partijen willen niet investeren om dat extra stukje betrouwbaarheid te implementeren. Allemaal leuk en aardig, maar dan moeten die zelfde partijen ook geen 99.9% (of nog hoger) aan netwerk uptime garanderen, want ze kunnen feitelijk helemaal geen uptime garanderen zo lang er geen volledige redunantie is (tenzij je dikke packetloss als uptime rekent).
Ik heb dit argument al meerdere malen voorbij horen komen, en dit is typisch zo'n argument waar men zich makkelijk achter kan verschuilen. De pot verwijt de ketel zeg maar. Wellicht kun je niet alle partijen via een omweg bereiken, maar er zijn er genoeg die je in ieder geval wel kunt bereiken, en buiten dat ben je dus ook zelf voor anderen ook via een omweg bereikbaar. Omdat sommige anderen niet geheel redundant zijn, is geen reden om dat zelf ook maar niet te zijn.Citaat:
Oorspronkelijk geplaatst door Technotop
Het argument over de kosten is een stuk meer steekhoudend - maar de partijen die hiervoor kiezen moeten zich niet achter andere argumenten verschuilen.
Het zou ook niet gefaald hebben als niet in heel NIKHEF in een keer al het licht uitging. Dat is wellicht een vierde discussie of zelfs een eigen topic waard, maar waarom valt alles in een heel DC uit? Ik heb op de MTS (elektro) lang moeten rekenen aan selectiviteit om er voor te zorgen dat een lokale overbelasting niet tot een globale uitval zou leiden.
Ik heb niet gehoord wat er precies gebeurd is, maar in mijn bescheiding mening mag het niet zo zijn dat een storing, waar dan ook binnen de muren van NIKHEF, tot een volledig uitvallen van NIKHEF zou mogen leiden.
Als het niet helemaal duidelijk is hoe ik dat bedoel, neem dan even je eigen spul als voorbeeld. Als ik een metalen staaf door je mailserver heen ram gebeurt er verdomd weinig. De zekering in de voeding van de mailserver piept er uit, en de acht tot vijfendertig machines in hetzelfde rack draaien gewoon door. Als ik een stapje hoger op de vandalisme-ladder stap en een metalen staaf door je hele kast heen timmer valt niet alles van je colocatie-provider uit. Enkel de zekeringsautomaat van jouw rack piept eruit en de andere racks in dezelfde ruimte draaien zonder morren gewoon door. Sla ik een bijl door de feed van je colo-provider, dan zouden gebruikers van andere ruimtes in hetzelfde pand dat niet eens mogen merken. 1 zaal/suite in het donker, de rest snort gewoon door.
Maandagavond had precies dat moeten gebeuren in NIKHEF. Er had een machine, een rack of een ruimte uit moeten vallen, maar niet meer dan dat. In plaats daarvan zat het hele gebouw zonder stroom.
Het gevolg van daarvan is dat partijen die dachten dat ze hun redundancy op orde hebben met twee racks, alle links dubbel en voeding uit A/B-feeds maandagavond het nakijken hadden. Iets wat in het allerergste geval tot uitval van 1/6de van NIKHEF zou hebben mogen leiden (1 van drie fases van twee gescheiden feeds) heeft tot een totaal falen geleid. Hoe heeft dat zo kunnen gebeuren?
(als je denkt dat dit een eigen topic waard is: zeg het gerust..)