Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more

Ein Split-Brain entsteht, wenn ein Cluster in zwei Teile zerfällt, die jeweils glauben, allein maßgeblich zu sein, und deshalb dieselbe VM gleichzeitig starten. In Proxmox VE verhindern drei Mechanismen das zusammen: eine Mehrheitsentscheidung (Quorum), eine stabile Corosync-Kommunikation und das Fencing isolierter HA-Knoten. Ein QDevice kann bei gerader Knotenzahl eine zusätzliche Stimme liefern. Es ersetzt aber weder ein zuverlässiges Netz noch Fencing, und für eine erfolgreiche Wiederherstellung müssen die Gastdaten am Zielknoten erreichbar sein.

Die vier Schutzebenen und was ohne sie passiert

Viele Probleme mit Split-Brain entstehen, weil Leser Quorum, Corosync, Fencing und Storage für eine einzige Funktion halten. Es sind getrennte Mechanismen, und jeder deckt einen anderen Fehlerfall ab.

Ebene Aufgabe Risiko, wenn sie fehlt oder schwach ist
Quorum Entscheidet, welche Partition Clusteroperationen fortsetzen darf Zwei Teilcluster könnten sich widersprechende Konfigurationen schreiben
Corosync-Netz Hält die Knoten als gemeinsamen Cluster zusammen und meldet Ausfälle Knoten werden fälschlich als ausgefallen oder erreichbar bewertet
Fencing Stoppt einen isolierten HA-Knoten, bevor seine Gäste anderswo starten Dieselbe VM läuft auf zwei Knoten
Storage und Ressourcen Machen Disk-Images und benötigte Geräte am Zielknoten verfügbar Die Wiederherstellung schlägt fehl, obwohl Quorum und Fencing korrekt arbeiten

Quorum als Mehrheitsentscheidung

Quorum bedeutet, dass eine Partition nur dann Clusteroperationen fortsetzen darf, wenn sie genügend Stimmen auf sich vereint. Bei Quorumverlust setzt das Proxmox Cluster File System pmxcfs auf schreibgeschützt. Das schützt vor widersprüchlichen Clusterkonfigurationen, bedeutet im Betrieb aber auch, dass Änderungen am Cluster bis zur Wiederherstellung des Quorums nicht möglich sind (Proxmox Server Solutions GmbH, pmxcfs-Dokumentation, Stand 2025-07-31: https://pve.proxmox.com/pve-docs-9-beta/chapter-pmxcfs.html).

What’s actually slowing this PC down?

Pick the symptom - the matching free tool is one click away.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Das Grundproblem bei zwei Knoten ist Arithmetik: Mit zwei Stimmen braucht die Mehrheit beide Knoten. Fällt einer aus oder wird er abgetrennt, hat der verbleibende Knoten keine Mehrheit. Genau hier setzt ein QDevice an.

Zwei-Knoten-Cluster und das QDevice

Ein QDevice ist ein externer Quorum-Teilnehmer, der über den Daemon corosync-qnetd auf einem separaten Server läuft. Die Clusterknoten nutzen dazu corosync-qdevice. Der Proxmox VE 8 Administration Guide (2025) ordnet den Einsatz so ein:

Knotenzahl Empfehlung laut Proxmox VE 8 Administration Guide
2 Knoten QDevice empfohlen, wenn höhere Verfügbarkeit gewünscht ist
Gerade Anzahl (z. B. 4 oder 6 Knoten) QDevice wird unterstützt; es liefert eine zusätzliche Stimme
Ungerade Anzahl (z. B. 3 oder 5 Knoten) Proxmox rät derzeit vom QDevice ab, weil das Abstimmungsverhalten dann anders ist und der Ausfall des qnetd-Servers bereits den Verlust des Quorums auslösen kann

Der Guide nennt außerdem zwei Risiken, die man vor dem Einsatz bewerten sollte: die Folgen einer massenhaften HA-Wiederherstellung und die Auswirkungen auf die Ceph-Verfügbarkeit (Proxmox VE 8 Administration Guide: https://pve.proxmox.com/pve-docs-8/pve-admin-guide.pdf).

Gleichstand: Der Zufall entscheidet

Sind zwei gleich große Partitionen getrennt und erreichen beide den qnetd-Server, wählt das QDevice laut Guide nach dem Zufallsprinzip eine der beiden Partitionen aus und gibt ihr die Stimme. Es gibt keine garantierte bevorzugte Seite, und man kann sich nicht darauf verlassen, welche Seite überlebt. Das QDevice ist daher ein Tie-Breaker und keine Erlaubnis, beide Seiten unabhängig weiterzubetreiben. Die Seite ohne Stimme verliert das Quorum und sollte ihre HA-Gäste durch Self-Fencing verlassen (siehe unten).

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Ausfall des QDevice

Fällt das QDevice aus, entspricht die Lage laut Guide dem Betrieb ohne QDevice. Im Zwei-Knoten-Fall bedeutet das: Ein einzelner Knoten hat keine Mehrheit. Der qnetd-Host sollte deshalb nicht gemeinsam mit einem der Clusterknoten ausfallen können, etwa durch denselben Stromkreis, Switch oder Standort. Prüfen Sie die Erreichbarkeit des Hosts von beiden Clusterseiten aus, denn eine Partition, die ihn nicht erreicht, bekommt keine Stimme.

QDevice einrichten

Der folgende Ablauf folgt der Struktur des Proxmox VE 8 Guides. Paketnamen, Befehle und Ausgaben müssen mit der Dokumentation Ihrer installierten Proxmox-Version abgeglichen werden.

  1. Stellen Sie einen separaten Linux-Server bereit, der nicht Teil des Clusters ist, und installieren Sie dort das Paket corosync-qnetd.
  2. Öffnen Sie auf diesem Host den TCP-Port 5403 (Standardport laut Guide) für die Clusterknoten.
  3. Installieren Sie auf allen Clusterknoten das Paket corosync-qdevice.
  4. Starten Sie auf einem Clusterknoten die Einrichtung mit pvecm qdevice setup <QDEVICE-IP> und ersetzen Sie <QDEVICE-IP> durch die Adresse des qnetd-Hosts.
  5. Der Guide verlangt verschlüsselten Verkehr zwischen Daemon und Cluster. Halten Sie sich an die Vorgaben der eingesetzten Version und kontrollieren Sie das Ergebnis.
  6. Prüfen Sie den Status mit pvecm status. Die Ausgabe sollte das QDevice als zusätzliche Stimme ausweisen. Das genaue Format hängt von der Version ab.

Ein Test des Verhaltens sollte nur geplant und in einem Wartungsfenster erfolgen, denn ein Quorumverlust betrifft den Clusterbetrieb.

Corosync-Netz planen

Corosync ist die Kommunikationsschicht, auf der Quorum und Ausfallerkennung beruhen. Proxmox empfiehlt mehrere Corosync-Netze und beschreibt, dass Corosync zwischen ihnen wechseln kann, wenn eines unbrauchbar wird (Proxmox VE Wiki, Network Configuration: https://pve.proxmox.com/wiki/Network_Configuration).

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.
  • Verwenden Sie stabile Verbindungen mit niedriger Latenz.
  • Trennen Sie das Corosync-Netz von Storage- und Backupverkehr, damit große Datenströme die Cluster-Kommunikation nicht verdrängen.
  • Planen Sie mehr als einen Link ein. Redundante Links verringern das Risiko eines Kommunikationsausfalls, ändern aber nichts an den Quorumregeln.

Fencing und HA-Zeitabläufe

Quorum entscheidet, welche Seite Clusteroperationen durchführen darf. Fencing sorgt dafür, dass ein Knoten, der die Verbindung zum quorumfähigen Cluster verliert, seine HA-Gäste nicht weiter ausführt. Laut Proxmox-Übersicht zur HA wartet ein solcher Knoten zunächst auf die Wiederverbindung. Bleibt der Kontakt aus, fenct er sich selbst: „If not, the node will fence itself.“ (Proxmox Server Solutions GmbH, Proxmox VE Wiki, Abschnitt High Availability: https://pve.proxmox.com/wiki/Migrate_to_Proxmox_VE).

Die Wiki-Übersicht nennt als ungefähre Orientierung:

  • etwa 10 Sekunden für Presence-Meldungen,
  • rund eine Minute bis zum Self-Fencing nach Verlust des Corosync-Kontakts,
  • ungefähr zwei Minuten, bis der Cluster Gäste eines nicht zurückkehrenden Knotens wiederherstellt.

Diese Werte beschreiben den Übersichtstext und hängen von Version und Konfiguration ab. Sie sind keine garantierte Umschaltzeit und sollten im eigenen Test oder in der Dokumentation Ihrer Version geprüft werden.

Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.Support on Ko-Fi

Storage und Wiederherstellung

Quorum stellt keine Gastdaten bereit. Ob ein HA-Gast auf einem anderen Knoten wieder anläuft, hängt davon ab, ob seine Disk-Images und benötigten Geräte dort verfügbar sind. Die Replikationsart bestimmt, wie aktuell die Daten sind.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Gemeinsamer Storage

Gemeinsamer Storage macht Images mehreren Knoten zugänglich. Die Beschreibung des Storage-Modells in der Version-7-Referenz (Proxmox Server Solutions GmbH, pvesm(1): https://pve.proxmox.com/pve-docs-7/pvesm.1.html) ist für ältere Versionen gedacht und sollte für aktuelle Installationen gegen die passende Dokumentation geprüft werden.

ZFS-Replikation

In kleineren Clustern kann ZFS-Replikation eine Alternative sein. Die Proxmox-Übersicht bezeichnet sie als asynchron. Änderungen nach dem letzten erfolgreichen Replikationslauf können deshalb auf dem Zielknoten fehlen (Proxmox VE Wiki, Migrate to Proxmox VE: https://pve.proxmox.com/wiki/Migrate_to_Proxmox_VE).

Lokale Disks und Passthrough-Geräte

Gäste mit lokalen Disks oder nur lokal verfügbaren Ressourcen lassen sich nicht auf diese Weise wiederherstellen. Passthrough-Geräte müssen am Zielknoten ebenfalls vorhanden sein.

Manuelle Wiederherstellung eines Nicht-HA-Gasts

Vor einer manuellen Wiederherstellung muss der Quellknoten ausgeschaltet oder gefenct sein. Proxmox warnt, dass das Verschieben der VM-Konfiguration bei noch laufendem Quellknoten die Sperrregeln verletzen und unerwartete Folgen haben kann (pmxcfs-Dokumentation: https://pve.proxmox.com/pve-docs-9-beta/chapter-pmxcfs.html).

Free tools Windows power users keep installed

One-click scans. No signup required.

Special offer. See more information about Outbyte and uninstall instructions. Please review EULA and Privacy policy.

Symptome bei Quorumverlust

  • Clusterkonfigurationen lassen sich nicht ändern, weil pmxcfs schreibgeschützt ist.
  • Ein Knoten zeigt keine Mehrheit und bleibt in diesem Zustand, bis er wieder mit dem Rest des Clusters oder dem QDevice verbunden ist.
  • HA-Gäste werden auf dem abgetrennten Knoten nach der Self-Fencing-Phase beendet.

Beheben Sie die Ursache, also das Netz, den Corosync-Link oder den qnetd-Host. Erzwingen Sie keinen Quorum-Zustand, ohne die Auswirkungen in der Dokumentation Ihrer Version geprüft zu haben.

Checkliste vor dem Produktivbetrieb

  • Knotenzahl bestimmen und die passende QDevice-Empfehlung der eigenen Version prüfen.
  • qnetd-Host außerhalb der Clusterknoten-Ausfalldomäne platzieren und Port 5403 freigeben.
  • Corosync-Netze getrennt von Storage- und Backupverkehr führen.
  • Für jeden HA-Gast festhalten, auf welchen Knoten seine Disks verfügbar sind.
  • Replikationsintervalle als möglichen Datenverlust bewerten.
  • Befehle, Paketnamen und HA-Zeiten gegen die installierte Version abgleichen.

“

Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.