Issue affecting network connectivity

Postmortem

Stellungnahme zur Störung des Edge Clusters im Rechenzentrum FRA2

Sehr geehrte Damen und Herren,

am Freitag, den 24. Juli 2026, kam es im Rechenzentrum FRA2 zu einer Beeinträchtigung eines Hypervisor-Clusters, über das die WAN-Konnektivität (Firewall-VMs sowie VMware Edge Firewalls) unserer Kunden bereitgestellt wird.

Die Hypervisor-Cluster, auf denen die Workload-VMs der Kunden betrieben werden, waren von dem Vorfall nicht betroffen.

Störungszeitraum

Beginn: 24.07.2026, 12:30 Uhr
Ende: 24.07.2026, 16:17 Uhr

Aktuelle Lage

  • 24.07. um 12:30 Uhr: Beeinträchtigung der Netzwerk-Stacks des Clusters. Die WAN-Konnektivität einzelner Kunden war beeinträchtigt bzw. kurzzeitig ausgefallen.
  • Im Rahmen des Troubleshootings wurden die Netzwerkkarten (NICs) eines Herstellers als Ursache identifiziert und gezielt deaktiviert. Bereits wenige Minuten nach dieser Maßnahme war das Cluster wieder stabil.
  • 24.07. um 16:17 Uhr: Nach Abschluss der Funktions- und Connectivity-Tests waren alle Systeme wieder vollständig funktional.

Ursache und Auswirkungen

Ursache:
Derzeit erfolgt gemeinsam mit Broadcom, Dell und dem OEM-Hersteller der Netzwerkkarten die Root-Cause-Analyse.

Auswirkungen:

  • Ausfall bzw. Beeinträchtigung der WAN-/Firewall-Konnektivität einzelner Kunden im Rechenzentrum FRA2.
  • Keine Beeinträchtigung der laufenden Kunden-Workload-VMs.

Maßnahmen

Sofortmaßnahme: Deaktivierung der betroffenen NICs eines Herstellers

Ähnliche Vorfälle ereigneten sich bereits am 22.03.2026 und am 17.04.2026. Aus diesem Grund wurde am 19.04.2026 bereits eine neue Firmware auf den betroffenen NICs installiert. Zudem wurden gemeinsam mit Broadcom, Dell und dem OEM-Hersteller weitere Anpassungen umgesetzt.

Zusätzlich wurde im Nachgang die Hälfte der NICs durch Modelle eines anderen Herstellers ersetzt. Dank dieser Herstellerredundanz konnten die betroffenen NICs unter Beibehaltung der Redundanz deaktiviert werden.

Vollständiger Austausch der verbleibenden Netzwerkkarten

Neue Netzwerkkarten zum Austausch der verbleibenden betroffenen NICs sind bereits bestellt und werden nach Lieferung umgehend verbaut. Da das Cluster redundant ausgelegt ist, wird keine erneute Beeinträchtigung des Betriebs erwartet.

Fazit und nächste Schritte

Durch die nach den vorherigen Vorfällen bereits erfolgte Teilmodernisierung der Netzwerkkarten sowie die zielgerichtete Sofortmaßnahme konnte das Edge Cluster in FRA2 innerhalb kurzer Zeit und ohne dauerhaften Ausfall stabilisiert werden.

Mit dem vollständigen Austausch der verbleibenden NICs gegen das bereits bewährte alternative Modell wird die Ursache für diese Art von Störung dauerhaft beseitigt. Aufgrund des redundanten Clusteraufbaus wird der Einbau ohne Auswirkungen auf den laufenden Betrieb erfolgen.

Wir entschuldigen uns ausdrücklich für die entstandenen Unannehmlichkeiten und danken Ihnen für Ihr Verständnis und Ihre Geduld. Für Rückfragen stehen wir Ihnen jederzeit gerne zur Verfügung.

Mit freundlichen Grüßen

Ihr DMRZ-Team

Posted Jul 30, 2026 - 11:10 CEST

Resolved

The issue has been fully resolved and all systems are operating normally. During the monitoring phase, no further irregularities were detected.

Thank you for your patience and for bearing with us while we worked to restore service.

If you experience any further issues, please don't hesitate to reach out to us.
Posted Jul 24, 2026 - 14:38 CEST

Monitoring

A fix has been successfully implemented and the affected services are now operating as expected. We are closely monitoring the situation to ensure stability.

Thank you for your patience and understanding.
Posted Jul 24, 2026 - 14:14 CEST

Identified

We have identified the root cause of the issue affecting. Our team is currently working on implementing a fix. An update will follow as soon as the fix is implemented.

Thank you for your continued patience.
Posted Jul 24, 2026 - 13:50 CEST

Investigating

We are currently investigating a potential issue affecting network connectivity.

Our team is working to identify the root cause and will provide an update as soon as more information is available.

Thank you for your patience and understanding.
Posted Jul 24, 2026 - 13:32 CEST
This incident affected: Datacenter Infrastructure / Cloud Services.