iTechGuides is reader-supported. When you buy through links on our site, we may earn an affiliate commission. As an Amazon Associate I earn from qualifying purchases. Learn more
Ein Split-Brain entsteht, wenn ein Cluster in zwei Teile zerfällt, die jeweils glauben, allein maßgeblich zu sein, und deshalb dieselbe VM gleichzeitig starten. In Proxmox VE verhindern drei Mechanismen das zusammen: eine Mehrheitsentscheidung (Quorum), eine stabile Corosync-Kommunikation und das Fencing isolierter HA-Knoten. Ein QDevice kann bei gerader Knotenzahl eine zusätzliche Stimme liefern. Es ersetzt aber weder ein zuverlässiges Netz noch Fencing, und für eine erfolgreiche Wiederherstellung müssen die Gastdaten am Zielknoten erreichbar sein.
Die vier Schutzebenen und was ohne sie passiert
Viele Probleme mit Split-Brain entstehen, weil Leser Quorum, Corosync, Fencing und Storage für eine einzige Funktion halten. Es sind getrennte Mechanismen, und jeder deckt einen anderen Fehlerfall ab.
| Ebene | Aufgabe | Risiko, wenn sie fehlt oder schwach ist |
|---|---|---|
| Quorum | Entscheidet, welche Partition Clusteroperationen fortsetzen darf | Zwei Teilcluster könnten sich widersprechende Konfigurationen schreiben |
| Corosync-Netz | Hält die Knoten als gemeinsamen Cluster zusammen und meldet Ausfälle | Knoten werden fälschlich als ausgefallen oder erreichbar bewertet |
| Fencing | Stoppt einen isolierten HA-Knoten, bevor seine Gäste anderswo starten | Dieselbe VM läuft auf zwei Knoten |
| Storage und Ressourcen | Machen Disk-Images und benötigte Geräte am Zielknoten verfügbar | Die Wiederherstellung schlägt fehl, obwohl Quorum und Fencing korrekt arbeiten |
Quorum als Mehrheitsentscheidung
Quorum bedeutet, dass eine Partition nur dann Clusteroperationen fortsetzen darf, wenn sie genügend Stimmen auf sich vereint. Bei Quorumverlust setzt das Proxmox Cluster File System pmxcfs auf schreibgeschützt. Das schützt vor widersprüchlichen Clusterkonfigurationen, bedeutet im Betrieb aber auch, dass Änderungen am Cluster bis zur Wiederherstellung des Quorums nicht möglich sind (Proxmox Server Solutions GmbH, pmxcfs-Dokumentation, Stand 2025-07-31: https://pve.proxmox.com/pve-docs-9-beta/chapter-pmxcfs.html).
What’s actually slowing this PC down?
Pick the symptom - the matching free tool is one click away.
Das Grundproblem bei zwei Knoten ist Arithmetik: Mit zwei Stimmen braucht die Mehrheit beide Knoten. Fällt einer aus oder wird er abgetrennt, hat der verbleibende Knoten keine Mehrheit. Genau hier setzt ein QDevice an.
#1 Best Overall
Zwei-Knoten-Cluster und das QDevice
Ein QDevice ist ein externer Quorum-Teilnehmer, der über den Daemon corosync-qnetd auf einem separaten Server läuft. Die Clusterknoten nutzen dazu corosync-qdevice. Der Proxmox VE 8 Administration Guide (2025) ordnet den Einsatz so ein:
| Knotenzahl | Empfehlung laut Proxmox VE 8 Administration Guide |
|---|---|
| 2 Knoten | QDevice empfohlen, wenn höhere Verfügbarkeit gewünscht ist |
| Gerade Anzahl (z. B. 4 oder 6 Knoten) | QDevice wird unterstützt; es liefert eine zusätzliche Stimme |
| Ungerade Anzahl (z. B. 3 oder 5 Knoten) | Proxmox rät derzeit vom QDevice ab, weil das Abstimmungsverhalten dann anders ist und der Ausfall des qnetd-Servers bereits den Verlust des Quorums auslösen kann |
Der Guide nennt außerdem zwei Risiken, die man vor dem Einsatz bewerten sollte: die Folgen einer massenhaften HA-Wiederherstellung und die Auswirkungen auf die Ceph-Verfügbarkeit (Proxmox VE 8 Administration Guide: https://pve.proxmox.com/pve-docs-8/pve-admin-guide.pdf).
Gleichstand: Der Zufall entscheidet
Sind zwei gleich große Partitionen getrennt und erreichen beide den qnetd-Server, wählt das QDevice laut Guide nach dem Zufallsprinzip eine der beiden Partitionen aus und gibt ihr die Stimme. Es gibt keine garantierte bevorzugte Seite, und man kann sich nicht darauf verlassen, welche Seite überlebt. Das QDevice ist daher ein Tie-Breaker und keine Erlaubnis, beide Seiten unabhängig weiterzubetreiben. Die Seite ohne Stimme verliert das Quorum und sollte ihre HA-Gäste durch Self-Fencing verlassen (siehe unten).
PC Slower Than It Used to Be?
A free scan shows the junk files, broken settings and background clutter dragging Windows down - then fixes them in one click.Free scan · Windows 10 & 11Outdated Drivers Are Slowing You Down
One free scan finds every outdated or missing driver and matches the right update for your exact hardware.Free scan · exact hardware matchAusfall des QDevice
Fällt das QDevice aus, entspricht die Lage laut Guide dem Betrieb ohne QDevice. Im Zwei-Knoten-Fall bedeutet das: Ein einzelner Knoten hat keine Mehrheit. Der qnetd-Host sollte deshalb nicht gemeinsam mit einem der Clusterknoten ausfallen können, etwa durch denselben Stromkreis, Switch oder Standort. Prüfen Sie die Erreichbarkeit des Hosts von beiden Clusterseiten aus, denn eine Partition, die ihn nicht erreicht, bekommt keine Stimme.
QDevice einrichten
Der folgende Ablauf folgt der Struktur des Proxmox VE 8 Guides. Paketnamen, Befehle und Ausgaben müssen mit der Dokumentation Ihrer installierten Proxmox-Version abgeglichen werden.
- Stellen Sie einen separaten Linux-Server bereit, der nicht Teil des Clusters ist, und installieren Sie dort das Paket
corosync-qnetd. - Öffnen Sie auf diesem Host den TCP-Port 5403 (Standardport laut Guide) für die Clusterknoten.
- Installieren Sie auf allen Clusterknoten das Paket
corosync-qdevice. - Starten Sie auf einem Clusterknoten die Einrichtung mit
pvecm qdevice setup <QDEVICE-IP>und ersetzen Sie<QDEVICE-IP>durch die Adresse des qnetd-Hosts. - Der Guide verlangt verschlüsselten Verkehr zwischen Daemon und Cluster. Halten Sie sich an die Vorgaben der eingesetzten Version und kontrollieren Sie das Ergebnis.
- Prüfen Sie den Status mit
pvecm status. Die Ausgabe sollte das QDevice als zusätzliche Stimme ausweisen. Das genaue Format hängt von der Version ab.
Ein Test des Verhaltens sollte nur geplant und in einem Wartungsfenster erfolgen, denn ein Quorumverlust betrifft den Clusterbetrieb.
Corosync-Netz planen
Corosync ist die Kommunikationsschicht, auf der Quorum und Ausfallerkennung beruhen. Proxmox empfiehlt mehrere Corosync-Netze und beschreibt, dass Corosync zwischen ihnen wechseln kann, wenn eines unbrauchbar wird (Proxmox VE Wiki, Network Configuration: https://pve.proxmox.com/wiki/Network_Configuration).
- Verwenden Sie stabile Verbindungen mit niedriger Latenz.
- Trennen Sie das Corosync-Netz von Storage- und Backupverkehr, damit große Datenströme die Cluster-Kommunikation nicht verdrängen.
- Planen Sie mehr als einen Link ein. Redundante Links verringern das Risiko eines Kommunikationsausfalls, ändern aber nichts an den Quorumregeln.
Fencing und HA-Zeitabläufe
Quorum entscheidet, welche Seite Clusteroperationen durchführen darf. Fencing sorgt dafür, dass ein Knoten, der die Verbindung zum quorumfähigen Cluster verliert, seine HA-Gäste nicht weiter ausführt. Laut Proxmox-Übersicht zur HA wartet ein solcher Knoten zunächst auf die Wiederverbindung. Bleibt der Kontakt aus, fenct er sich selbst: „If not, the node will fence itself.“ (Proxmox Server Solutions GmbH, Proxmox VE Wiki, Abschnitt High Availability: https://pve.proxmox.com/wiki/Migrate_to_Proxmox_VE).
Die Wiki-Übersicht nennt als ungefähre Orientierung:
Rank #4
- etwa 10 Sekunden für Presence-Meldungen,
- rund eine Minute bis zum Self-Fencing nach Verlust des Corosync-Kontakts,
- ungefähr zwei Minuten, bis der Cluster Gäste eines nicht zurückkehrenden Knotens wiederherstellt.
Diese Werte beschreiben den Übersichtstext und hängen von Version und Konfiguration ab. Sie sind keine garantierte Umschaltzeit und sollten im eigenen Test oder in der Dokumentation Ihrer Version geprüft werden.
Independent reader supportYour contribution helps us test, update, and keep practical guides available for everyone.Storage und Wiederherstellung
Quorum stellt keine Gastdaten bereit. Ob ein HA-Gast auf einem anderen Knoten wieder anläuft, hängt davon ab, ob seine Disk-Images und benötigten Geräte dort verfügbar sind. Die Replikationsart bestimmt, wie aktuell die Daten sind.
The Tool Desk
Outbyte PC Repair FREEClear out junk files and repair common Windows errorsFree Scan →Outbyte Driver Updater FREEFix the driver behind crashes, sound loss and screen glitchesFind Drivers →Gemeinsamer Storage
Gemeinsamer Storage macht Images mehreren Knoten zugänglich. Die Beschreibung des Storage-Modells in der Version-7-Referenz (Proxmox Server Solutions GmbH, pvesm(1): https://pve.proxmox.com/pve-docs-7/pvesm.1.html) ist für ältere Versionen gedacht und sollte für aktuelle Installationen gegen die passende Dokumentation geprüft werden.
Best Value
ZFS-Replikation
In kleineren Clustern kann ZFS-Replikation eine Alternative sein. Die Proxmox-Übersicht bezeichnet sie als asynchron. Änderungen nach dem letzten erfolgreichen Replikationslauf können deshalb auf dem Zielknoten fehlen (Proxmox VE Wiki, Migrate to Proxmox VE: https://pve.proxmox.com/wiki/Migrate_to_Proxmox_VE).
Lokale Disks und Passthrough-Geräte
Gäste mit lokalen Disks oder nur lokal verfügbaren Ressourcen lassen sich nicht auf diese Weise wiederherstellen. Passthrough-Geräte müssen am Zielknoten ebenfalls vorhanden sein.
Manuelle Wiederherstellung eines Nicht-HA-Gasts
Vor einer manuellen Wiederherstellung muss der Quellknoten ausgeschaltet oder gefenct sein. Proxmox warnt, dass das Verschieben der VM-Konfiguration bei noch laufendem Quellknoten die Sperrregeln verletzen und unerwartete Folgen haben kann (pmxcfs-Dokumentation: https://pve.proxmox.com/pve-docs-9-beta/chapter-pmxcfs.html).
Free tools Windows power users keep installed
One-click scans. No signup required.
Symptome bei Quorumverlust
- Clusterkonfigurationen lassen sich nicht ändern, weil pmxcfs schreibgeschützt ist.
- Ein Knoten zeigt keine Mehrheit und bleibt in diesem Zustand, bis er wieder mit dem Rest des Clusters oder dem QDevice verbunden ist.
- HA-Gäste werden auf dem abgetrennten Knoten nach der Self-Fencing-Phase beendet.
Beheben Sie die Ursache, also das Netz, den Corosync-Link oder den qnetd-Host. Erzwingen Sie keinen Quorum-Zustand, ohne die Auswirkungen in der Dokumentation Ihrer Version geprüft zu haben.
Quick Recap
Checkliste vor dem Produktivbetrieb
- Knotenzahl bestimmen und die passende QDevice-Empfehlung der eigenen Version prüfen.
- qnetd-Host außerhalb der Clusterknoten-Ausfalldomäne platzieren und Port 5403 freigeben.
- Corosync-Netze getrennt von Storage- und Backupverkehr führen.
- Für jeden HA-Gast festhalten, auf welchen Knoten seine Disks verfügbar sind.
- Replikationsintervalle als möglichen Datenverlust bewerten.
- Befehle, Paketnamen und HA-Zeiten gegen die installierte Version abgleichen.
“
Product prices and availability are accurate as of the date/time indicated and are subject to change. Any price and availability information displayed on Amazon at the time of purchase will apply.

