Η Amazon Web Services (AWS) ανακοίνωσε την Πέμπτη ότι ένα από τα κέντρα δεδομένων της στη Βόρεια Βιρτζίνια λειτουργούσε σε θερμοκρασίες αρκετά υψηλές για να διαταράξουν τις εργασίες των πελατών, και ότι οι μηχανικοί προσπαθούσαν ακόμα να επαναφέρουν πλήρως το σημείο σε λειτουργία όταν οι περισσότεροι χρήστες είχαν ήδη κοιμηθεί.
Δείτε επίσης: Το ‘απομονωμένο’ sandbox του AWS Bedrock έρχεται με μια διέξοδο DNS

Η αιτία ήταν απλή: η αύξηση της θερμοκρασίας σε ένα μόνο κέντρο δεδομένων, που αποδόθηκε σε ανεπάρκεια του συστήματος ψύξης, ανάγκασε την AWS να περιορίσει και στη συνέχεια να ανακατευθύνει μερικώς την κυκλοφορία μακριά από την επηρεασμένη Ζώνη Διαθεσιμότητας.
Σύμφωνα με την εταιρεία, επιπλέον δυναμικότητα ψύξης άρχισε να τίθεται σε λειτουργία λίγες ώρες μετά τις πρώτες αναφορές επιπτώσεων, και “πρώιμα σημάδια ανάκαμψης” εμφανίστηκαν λίγο αργότερα.
Μια μεταγενέστερη ενημέρωση ήταν λιγότερο καθησυχαστική: η προσθήκη αρκετής επιπλέον ψύξης για να επανεκκινήσουν με ασφάλεια τα υπόλοιπα συστήματα έπαιρνε περισσότερο χρόνο από το αναμενόμενο, και η AWS δεν ήταν πρόθυμη να δώσει χρονικό πλαίσιο για την πλήρη αποκατάσταση.
Η Coinbase επιβεβαίωσε ότι τα προβλήματα στην πλατφόρμα συναλλαγών της προκλήθηκαν από το συμβάν της AWS. Μετά από αρκετές ώρες υποβαθμισμένων αγορών, το ανταλλακτήριο δήλωσε ότι όλες οι αγορές είχαν επανενεργοποιηθεί και οι συναλλαγές είχαν επιστρέψει στο φυσιολογικό.
Η CME Group, η μεγαλύτερη αγορά παραγώγων στον κόσμο, ανέφερε επίσης προβλήματα με την πλατφόρμα CME Direct κατά το ίδιο χρονικό διάστημα, αν και περιέγραψε την αιτία μόνο ως “απαραίτητη συντήρηση” και δεν ανέφερε αν το συμβάν της AWS ήταν παράγοντας. Και οι δύο εταιρείες αρνήθηκαν να σχολιάσουν περαιτέρω εκτός ωρών εργασίας.
Δείτε ακόμα: UNC6426: Εκμεταλλεύτηκε nx npm supply chain για AWS admin πρόσβαση

Το σύμπλεγμα στη Βόρεια Βιρτζίνια, γνωστό ως US-East-1 στην ορολογία της AWS, είναι η παλαιότερη, πιο πολυσύχναστη και πιο συγκεντρωμένη περιοχή της εταιρείας.
Μια Ζώνη Διαθεσιμότητας σε αυτή την περιοχή περιλαμβάνει ένα ή περισσότερα φυσικά κέντρα δεδομένων που έχουν σχεδιαστεί να λειτουργούν ανεξάρτητα, και η επίσημη οδηγία της AWS κατά την ανάκαμψη ήταν η τυπική σύσταση: οι πελάτες που λειτουργούν στη ζώνη που επηρεάστηκε πρέπει να μεταφερθούν σε μία από τις άλλες. Αυτό λειτουργεί καλά για τις ομάδες μηχανικών που έχουν προετοιμαστεί για αυτό. Λειτουργεί λιγότερο καλά για εκείνους που δεν έχουν.
Το μοτίβο γίνεται οικείο. Η AWS υπέστη μια πολύ μεγαλύτερη διακοπή τον περασμένο Οκτώβριο όταν μια αποτυχία επίλυσης DNS στο DynamoDB εξαπλώθηκε σε περισσότερες από εκατό υπηρεσίες και έθεσε εκτός λειτουργίας πλατφόρμες από το Snapchat και το Reddit μέχρι την United Airlines και την Coinbase. Εκείνο το συμβάν διήρκεσε περίπου δεκατέσσερις ώρες και ήταν η μεγαλύτερη διακοπή στο διαδίκτυο από τη δυσλειτουργία του λογισμικού CrowdStrike το 2024.
Ένα μήνα αργότερα, η CME υπέστη μία από τις μεγαλύτερες διακοπές συναλλαγών της σε χρόνια, που εντοπίστηκε σε αποτυχία ψύξης σε κέντρο δεδομένων της CyrusOne στην περιοχή του Σικάγου.
Η επανάληψη έχει σημασία. Οι αποτυχίες ψύξης, τα σφάλματα διαμόρφωσης και οι αποτυχίες DNS είναι διαφορετικά τεχνικά γεγονότα, αλλά μοιράζονται ένα αποτέλεσμα: ένα μόνο φυσικό ή λογικό σημείο γίνεται το στενό σημείο για ένα υπερβολικό μερίδιο της κυκλοφορίας που απευθύνεται στο κοινό. Η περιοχή της Βόρειας Βιρτζίνιας φέρει αυτό το φορτίο περισσότερο λόγω ιστορικού ατυχήματος παρά σχεδιασμού.
Δείτε επίσης: AWS data centers: Drone επιθέσεις προκάλεσαν εκτεταμένες βλάβες

Το περιστατικό της Πέμπτης δείχνει ότι ακόμα και με αυτή τη δουλειά, μια μόνο διακοπή λόγω υπερθέρμανσης εξακολουθεί να προκαλεί ευρύτερες διαταραχές.
