<?xml version="1.0" encoding="UTF-8"?><rss version="2.0"
	xmlns:content="http://purl.org/rss/1.0/modules/content/"
	xmlns:wfw="http://wellformedweb.org/CommentAPI/"
	xmlns:dc="http://purl.org/dc/elements/1.1/"
	xmlns:atom="http://www.w3.org/2005/Atom"
	xmlns:sy="http://purl.org/rss/1.0/modules/syndication/"
	xmlns:slash="http://purl.org/rss/1.0/modules/slash/"
	>

<channel>
	<title>drift Archives - Simply.com blog</title>
	<atom:link href="https://blog.simply.com/tag/drift/feed/" rel="self" type="application/rss+xml" />
	<link></link>
	<description>Få de seneste nyheder om domæner og webhoteller her.</description>
	<lastBuildDate>Wed, 31 Aug 2016 11:16:14 +0000</lastBuildDate>
	<language>da-DK</language>
	<sy:updatePeriod>
	hourly	</sy:updatePeriod>
	<sy:updateFrequency>
	1	</sy:updateFrequency>
	<generator>https://wordpress.org/?v=7.0.3</generator>

<image>
	<url>https://blog.simply.com/wp-content/uploads/2022/11/cropped-simply_logomark_rgb-32x32.png</url>
	<title>drift Archives - Simply.com blog</title>
	<link></link>
	<width>32</width>
	<height>32</height>
</image> 
	<item>
		<title>Incident report 31-08-2016: Netværksudfald</title>
		<link>https://blog.simply.com/2016/incident-report-31-08-2016-netvaerksudfald/</link>
					<comments>https://blog.simply.com/2016/incident-report-31-08-2016-netvaerksudfald/#comments</comments>
		
		<dc:creator><![CDATA[Tom Sommer (Simply.com)]]></dc:creator>
		<pubDate>Wed, 31 Aug 2016 10:56:20 +0000</pubDate>
				<category><![CDATA[Drift]]></category>
		<category><![CDATA[drift]]></category>
		<category><![CDATA[incident]]></category>
		<guid isPermaLink="false">http://blog.simply.com/?p=2901</guid>

					<description><![CDATA[<p>Wow, det er træls at skulle skrive endnu en incident report indenfor så kort tid. Onsdag nat samt Onsdag morgen, har vi haft udfald på vores netværksinfrastruktur der driver vores storage og VMware-platforme. Som konsekvens af dette har vi haft nedsat tilgængelighed til hele den virtuelle infrastruktur i vores datacenter. Uddybning Fejlen er lokaliseret til 4 &#8230; <a href="https://blog.simply.com/2016/incident-report-31-08-2016-netvaerksudfald/" class="more-link">Læs videre<span class="screen-reader-text"> "Incident report 31-08-2016: Netværksudfald"</span></a></p>
<p>The post <a href="https://blog.simply.com/2016/incident-report-31-08-2016-netvaerksudfald/">Incident report 31-08-2016: Netværksudfald</a> appeared first on <a href="https://blog.simply.com">Simply.com blog</a>.</p>
]]></description>
										<content:encoded><![CDATA[<p>Wow, det er <a href="http://sproget.dk/lookup?SearchableText=tr%C3%A6ls">træls</a> at skulle skrive endnu en incident report indenfor så kort tid.</p>
<p>Onsdag nat samt Onsdag morgen, har vi haft udfald på vores netværksinfrastruktur der driver vores storage og VMware-platforme. Som konsekvens af dette har vi haft nedsat tilgængelighed til hele den virtuelle infrastruktur i vores datacenter.</p>
<p><span id="more-2901"></span></p>
<h2>Uddybning</h2>
<p>Fejlen er lokaliseret til 4 centrale switch-enheder der driver en stor del af vores VMware platform.</p>
<p>Der er opstået et loop i en del af netværket, som normalvis ville være mitigeret af de indbyggede funktioner i switchene, men i stedet for at løse problemet har disse fået switchene, der forwarder trafikken til resten af netværket, til at gå i stå.</p>
<p>Den helt præcise fejlkilde undersøges stadig og samtidig er der kommunikation med switchleverandøren for at undersøge hvorfor enheden ikke agerede som planlagt.</p>
<p>Fra afbrydelserne i nat overvågede vores teknikere netværket tæt og fejlsøgte på problematikken. Ingen af problemerne har nogen sammenhæng med det der er sket om morgenen, så vidt logs og overvågning viser os, men vi udelukker naturligvis intet endnu.</p>
<p><strong>00.45 &#8211; 00.50</strong>: Kort udfald på netværks infrastruktur</p>
<p><strong>04.48 &#8211; 04.53</strong>: Kort udfald på netværks infrastruktur</p>
<p><strong>07.34 &#8211; 08.01:</strong> Udfald på central netværkscore, der understøtter hele vores VMware infrastruktur. Fejlen betød at intern samt ekstern trafik mellem servere stoppede med at fungere.</p>
<p><strong>08.30 &#8211; 08.40</strong>: Omlægning af trafikken på shared service betød afbrydelser til enkelte services i dette tidsrum.</p>
<p><strong>09.00</strong>: Al drift normal</p>
<p>&nbsp;</p>
<p>The post <a href="https://blog.simply.com/2016/incident-report-31-08-2016-netvaerksudfald/">Incident report 31-08-2016: Netværksudfald</a> appeared first on <a href="https://blog.simply.com">Simply.com blog</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://blog.simply.com/2016/incident-report-31-08-2016-netvaerksudfald/feed/</wfw:commentRss>
			<slash:comments>1</slash:comments>
		
		
			</item>
		<item>
		<title>Incident report 29-07-2016: Strømafbrydelse i datacenter</title>
		<link>https://blog.simply.com/2016/incident-report-29-07-2016-stroemafbrydelse-datacenter/</link>
					<comments>https://blog.simply.com/2016/incident-report-29-07-2016-stroemafbrydelse-datacenter/#comments</comments>
		
		<dc:creator><![CDATA[Tom Sommer (Simply.com)]]></dc:creator>
		<pubDate>Sat, 30 Jul 2016 09:12:35 +0000</pubDate>
				<category><![CDATA[Drift]]></category>
		<category><![CDATA[hosting]]></category>
		<category><![CDATA[incident]]></category>
		<guid isPermaLink="false">http://blog.simply.com/?p=2874</guid>

					<description><![CDATA[<p>Fredag aften kl. 20.50, skete det der aldrig må ske i et datacenter: Vi mistede alt strøm. Strømafbrydelsen betød, at alle UnoEuro servere og services, var utilgængelige fra kl. 20.50 og frem. De første services kom online igen kl. 23.34, og al drift var normaliseret igen kl. 01.03. Fejlen er blevet lokaliseret til en defekt enhed &#8230; <a href="https://blog.simply.com/2016/incident-report-29-07-2016-stroemafbrydelse-datacenter/" class="more-link">Læs videre<span class="screen-reader-text"> "Incident report 29-07-2016: Strømafbrydelse i datacenter"</span></a></p>
<p>The post <a href="https://blog.simply.com/2016/incident-report-29-07-2016-stroemafbrydelse-datacenter/">Incident report 29-07-2016: Strømafbrydelse i datacenter</a> appeared first on <a href="https://blog.simply.com">Simply.com blog</a>.</p>
]]></description>
										<content:encoded><![CDATA[<p>Fredag aften kl. 20.50, skete det der aldrig må ske i et datacenter: Vi mistede alt strøm.</p>
<p>Strømafbrydelsen betød, at alle UnoEuro servere og services, var utilgængelige fra kl. 20.50 og frem. De første services kom online igen kl. 23.34, og al drift var normaliseret igen kl. 01.03.</p>
<p><span id="more-2874"></span></p>
<p>Fejlen er blevet lokaliseret til en defekt enhed i nødstrømsgeneratoren i det panel, der bestemmer, om vores datacenter skal køre på strøm fra el-nettet eller på strøm fra generatoren selv. Normalt ved strømafbrydelser sørger denne enhed for datacentrets uafbrudte strømforsyning, ved at aktivere henholdsvis generator eller ekstern strømforsyning.</p>
<p>Vores UPS-anlæg nåede, inden det løb tør for batteristrøm, at udvide fejlsøgningsvinduet med 35 minutter. Normalt ville nødstrømsgeneratoren overtage driften fra UPS-anlægget i løbet af ganske kort tid, men grundet den defekte enhed skete dette desværre ikke, og datacenteret stod derfor uden strøm.</p>
<p>Vores teknikere var til stede i datacentret og i kontakt med leverandøren, inden UPS-anlægget løb tør for strøm. Da fejlen skete i et stærkstrømsområde, var personsikkerhedsrisikoen imidlertid for stor til, at ikke-certificerede fagpersoner måtte arbejde på anlægget, samtidig var der risiko for at fejlhåndtering af situationen kunne lede til en eksplosion i datacenteret (som de professionelle sagde), hvilket selvfølgelig ville være katastrofal.</p>
<p>Den præcise fejl i nødstrømsgeneratoren blev lokaliseret kl. 22.10. Efter anskaffelse af en reservedel kunne elektrikerne kl. 23.10 genetablere strømmen i datacentret. Vores teknikere gik herefter i gang med at starte alle systemerne igen.</p>
<p>På trods af denne yderst kritiske hændelse var al drift genetableret kl. 01:03.</p>
<p>Under hele forløbet har vi holdt kunder opdateret på primært <a href="http://www.twitter.com/unoeuro">Twitter</a> og <a href="https://www.facebook.com/unoeuro">Facebook</a> så godt vi kunne.</p>
<p>Vi er selvfølgelig ekstremt kede af at dette kunne ske. At stå i et datacenter uden strøm er praktisk talt vores værste mareridt. Det er en situation vi nogle gange sidder og snakker om ved frokostbordet som en &#8220;Det sker aldrig, men hvad nu hvis&#8221;-situation. Nu skete det så, og på trods af virkelig træls nedetid, er vi ekstremt stolte over at vores systemer og infrastruktur praktisk talt &#8216;kom op af sig selv&#8217; da der kom strøm på igen. Det skyldes alene at vi har investeret enorme mængder penge og tid i vores systemer.</p>
<p>Vi håber vores kunder vil tage dette med i deres vurdering. Vi beklager.</p>
<h2>Hændelsesforløb</h2>
<p>20.14: UPS-anlægget aktiveres. Tilkaldevagt alarmeres.</p>
<p>20.25: Vores teknikere er fremme ved datacentret og inspicerer fejlen. Efter kort samråd med el-vagten tilkaldes to certificerede elektrikere.</p>
<p>20.50: UPS-anlægget løber tør for strøm. Datacentret er nede.</p>
<p>21.15: Første elektriker er fremme ved datacentret og begynder fejlsøgning. Inden for 15 minutter ankommer ekstra elektrikere, så der er 4 mand på opgaven.</p>
<p>21.15-22.10: Fejlsøgning af el står på.</p>
<p>22.10: Fejlen er lokaliseret, og elektrikere går i gang med at fremskaffe den nødvendige reservedel til dieselgeneratoren. ETA er 20 minutter, før den kan leveres onsite.</p>
<p>22.39: Elektrikerne går i gang med udbedre fejlen, lave kontrol-målinger og sikre korrekt procedure for at sikre færrest mulige risici ved opstart af anlæggene.</p>
<p>23.10: Dieselgeneratoren kobles ind, UPS-anlægget startes op igen og der er igen strøm i datacentret.</p>
<p>23.10: Vores teknikere starter infrastruktursystemerne i korrekt rækkefølge for at have så få problemer som muligt efterfølgende (SAN, netværk, hosts, mv.).</p>
<p>01.03: Al drift er genetableret</p>
<h2>Spørgsmål</h2>
<h3>Er jeres setup ikke redundant?</h3>
<p>Jo, til et vist punkt. Vi har redundante internetforbindelser, redundante UPS, redundante strømforsygninger i serverne, og vi har offsite backup af vores data. Det eneste vi ikke har redundant er vores nødstrømsgenerator. Det er svært at sige om det havde gjort en forskel i den her situation, grundet omstændighederne, men det er selvfølgelig noget vi vil undersøge nærmere.</p>
<p>Vores navneservere er geografisk adskilt, så DNS drift har ikke været påvirket &#8211; men de web- &amp; mailservere som DNS har peget på, har selvfølgelig været utilgængelige.</p>
<h2>Tester man ikke sådan en nødstrømsgenerator?</h2>
<p>Jo, det gør vi jævnligt, men den enhed som er gået i stykker har formentlig virket perfekt lige indtil den ikke gjorde, hvilket så har forsaget problemet.</p>
<h2>Hvad med datatab?</h2>
<p>Ingen data er gået tabt og ingen mails er ikke blevet leveret. Mails er dog selvfølgelig blevet leveret med forsinkelse.</p>
<p>The post <a href="https://blog.simply.com/2016/incident-report-29-07-2016-stroemafbrydelse-datacenter/">Incident report 29-07-2016: Strømafbrydelse i datacenter</a> appeared first on <a href="https://blog.simply.com">Simply.com blog</a>.</p>
]]></content:encoded>
					
					<wfw:commentRss>https://blog.simply.com/2016/incident-report-29-07-2016-stroemafbrydelse-datacenter/feed/</wfw:commentRss>
			<slash:comments>12</slash:comments>
		
		
			</item>
	</channel>
</rss>

<!--
Object Caching 25/67 objects using Disk
Page Caching using Disk: Enhanced 

Served from: blog.simply.com @ 2026-08-08 07:51:05 by W3 Total Cache
-->