Startseite/Technologien/RDMA erklärt: Datenübertragung zwischen Servern ohne CPU-Beteiligung
Technologien

RDMA erklärt: Datenübertragung zwischen Servern ohne CPU-Beteiligung

RDMA ermöglicht es Servern, Daten direkt zwischen den Arbeitsspeichern zu verschieben, ohne die CPU zu belasten. Das reduziert Latenzen und erhöht die Effizienz bei großen Datenmengen, etwa in HPC-Clustern oder KI-Infrastrukturen. Der Beitrag erklärt Funktionsweise, Vorteile und Einsatzgebiete von RDMA sowie Unterschiede zu klassischen TCP/IP-Netzwerken.

21. Aug. 2026
6 Min
RDMA erklärt: Datenübertragung zwischen Servern ohne CPU-Beteiligung

RDMA (Remote Direct Memory Access) verändert die Art und Weise, wie moderne Server große Datenmengen zwischen Rechenknoten bewegen. Während bei herkömmlicher Netzwerkübertragung ein Großteil der Arbeit über das Betriebssystem und die CPU läuft - mit Datenkopien, Netzwerk-Stack-Verarbeitung und Buffer-Handling - sorgt RDMA dafür, dass der Netzwerkadapter Daten direkt zwischen den Speicherbereichen zweier Server verschiebt, ohne dass der Prozessor jeden Datenblock einzeln verarbeitet. Das reduziert Kopiervorgänge, entlastet die CPU und minimiert Latenzen beim Datenaustausch.

Was ist RDMA und warum ist diese Technologie wichtig?

RDMA steht für Remote Direct Memory Access. Die Hauptidee: Die Netzwerkkarte eines Computers kann Daten direkt in einen dafür freigegebenen Bereich des Arbeitsspeichers eines anderen Computers übertragen.

Im Gegensatz zur klassischen Netzwerkkommunikation, bei der Anwendungen Daten an das Betriebssystem weitergeben, die dann durch den Netzwerkstack, Systempuffer und Treiber gehen, wird bei RDMA vieles übersprungen. Jeder dieser Schritte kostet Zeit und verbraucht Ressourcen, insbesondere bei tausenden oder Millionen Netzwerkoperationen.

RDMA verkürzt diesen Weg: Ein RNIC (RDMA Network Interface Card) übernimmt die Datenübertragung eigenständig mittels DMA (Direct Memory Access), sodass die Hardware direkt mit dem Arbeitsspeicher arbeitet, ohne dass die CPU jeden Block manuell verschiebt.

Zero-Copy und Kernel Bypass

  • Zero-Copy: Daten müssen nicht mehrfach zwischen verschiedenen Puffern kopiert werden. Der Adapter liest oder schreibt direkt aus/in den Speicher des Anwendungsprozesses.
  • Kernel Bypass: Die Beteiligung des Betriebssystemkerns an Netzwerkoperationen wird minimiert, was Kontextwechsel reduziert und Latenzen senkt.

Wichtig: "RDMA arbeitet ohne CPU-Beteiligung" ist nicht wörtlich zu nehmen - die CPU wird für das Starten und Konfigurieren von Verbindungen und Speicherregistrierung benötigt, aber nicht für das Kopieren einzelner Datenblöcke während der Übertragung.

Wie funktioniert RDMA: Der Datenweg zwischen Servern

Speicherregistrierung

Damit RDMA direkt auf den RAM zugreifen kann, muss der gewünschte Speicherbereich registriert und dem RDMA-Adapter zugewiesen werden. Die Betriebssysteme teilen dem Adapter die physischen Speicheradressen mit und vergeben spezielle Zugriffsschlüssel, die den Zugriff auf den Bereich kontrollieren.

Nach der Speicherregistrierung erstellt die Anwendung Operation Queues und eine Verbindung zum Zielknoten. Den Großteil der Datenbewegung übernimmt der Netzwerkadapter.

RDMA NIC und Direktübertragung in den RAM

Der Datenweg sieht vereinfacht so aus:

  • RAM des Servers → RDMA-Adapter → Netzwerk → RDMA-Adapter des Zielservers → RAM

Die Anwendung legt die Operation in eine Send Queue; der Adapter liest die Daten per DMA, bildet Netzwerkpakete und sendet sie an den Zielknoten, wo der empfangende Adapter sie direkt in den Ziel-RAM schreibt. Die CPU muss nicht jeden Block verschieben, sondern startet nur die Operation und kann sich anderen Aufgaben widmen.

Für die Kommunikation werden Send Queues und Completion Queues genutzt. So lassen sich viele Netzwerkoperationen ohne häufige Kernelzugriffe abwickeln.

Welche RDMA-Operationen gibt es?

  • RDMA Write: Der sendende Server schreibt Daten direkt in einen freigegebenen Speicherbereich des Zielservers.
  • RDMA Read: Ein Knoten fordert Inhalte aus dem registrierten Speicher des anderen Servers an und erhält sie direkt.
  • Send/Receive: Ähnlich wie klassische Nachrichtenübertragung, bei der der Empfänger einen Puffer vorbereitet.

RDMA Read/Write sind einseitig - der Ziel-CPU muss beim Zugriff nicht aktiv eingreifen. Send/Receive erfordern mehr Interaktion, eignen sich aber für Kommandos oder kleine Nachrichten.

RDMA vs. klassische TCP-Datenübertragung

Der Unterschied wird am Datenpfad deutlich:

  • Klassisch: Anwendung → OS-Kernel → TCP/IP → Treiber → Netzwerkkarte → Netzwerk → Zielserver (umgekehrt)
  • RDMA: Registrierter Speicher → RDMA-Adapter → Netzwerk → RDMA-Adapter → Registrierter Speicher

Vorteile: Weniger Kopiervorgänge, weniger Kontextwechsel, zero-copy und kernel bypass. Besonders bei großen Datenmengen und hoher Frequenz entlastet das die CPU und beschleunigt den Datenaustausch.

TCP/IP bleibt universeller und einfacher einzurichten; RDMA erfordert spezielle Hardware und eine abgestimmte Infrastruktur, lohnt sich aber dort, wo Mikrosekunden-Latenzen und CPU-Entlastung entscheidend sind.

InfiniBand, RoCE und andere RDMA-Varianten

RDMA ist kein eigener Kabeltyp oder Einzelprotokoll, sondern ein Mechanismus, der auf verschiedenen Netzwerktechnologien laufen kann. Die wichtigsten sind InfiniBand und RoCE (RDMA over Converged Ethernet), seltener iWARP.

InfiniBand

Speziell für High-Performance-Computing entwickelt: extrem geringe Latenz, schnelle Datenübertragung zwischen vielen Knoten, Standard in Supercomputern und HPC-Clustern. Erfordert eigene Adapter (HCA), Switches und dedizierte Netzwerkinfrastruktur.

RDMA over Converged Ethernet (RoCE)

Ermöglicht RDMA über Ethernet-Infrastruktur mit kompatiblen Netzwerkkarten und Switches. Zwei Versionen:

  • RoCE v1: Läuft direkt auf der Ethernet-Schicht, ist aber auf ein Ethernet-Segment begrenzt.
  • RoCE v2: Packt RDMA in UDP/IP - kann also über geroutete Netzwerke hinweg genutzt werden (UDP-Port 4791).

Für stabile Übertragung braucht RoCE gut konfiguriertes Netzwerk mit QoS, ECN und ggf. Priority Flow Control, da Hochgeschwindigkeits-RDMA-Datenverkehr sehr empfindlich auf Verluste und Überlastungen reagiert.

iWARP

Läuft über TCP/IP und funktioniert in normalen Ethernet-Netzwerken ohne spezielle lossless-Konfiguration, ist aber in HPC-Umgebungen weniger verbreitet.

Wo wird RDMA eingesetzt und warum ist es für moderne Rechenzentren wichtig?

RDMA ergibt vor allem dort Sinn, wo Server permanent große Datenmengen austauschen und jede zusätzliche Latenz die Gesamtleistung beeinflusst. Beispiele:

  • High Performance Computing (HPC): Wissenschaftliche/technische Cluster, wo viele Knoten ständig synchronisieren und Zwischenergebnisse austauschen.
  • Verteilte Speichersysteme: Zugriff auf entfernte Speicher (z.B. NVMe over Fabrics), wo RDMA für schnelle, direkte Übertragung sorgt.
  • Große Datenbanken und Big Data: Reduzierte Latenz verbessert die Abfrage- und Verarbeitungsgeschwindigkeit.
  • Künstliche Intelligenz und GPU-Cluster: Besonders bei Training großer Modelle müssen tausende GPUs permanent Daten austauschen. Hier verhindert RDMA, dass leistungsstarke GPUs auf Daten warten müssen.

Mehr dazu, warum das Netzwerk einer der Schlüsselfaktoren für große GPU-Cluster ist, finden Sie im Beitrag AI Fabric: Das Netzwerk für KI-Training und LLM-Skalierung.

Für GPUs gibt es ergänzend GPUDirect RDMA, das ermöglicht, dass der Netzwerkadapter direkt mit dem GPU-Speicher kommuniziert - noch weniger Kopiervorgänge, noch niedrigere Latenz.

Auch die Speicheranordnung im Server spielt eine Rolle: In NUMA-Architekturen hat der Zugriff auf verschiedene RAM-Bänke unterschiedliche Latenz. Eine ungünstige Platzierung von Adapter, CPU und Speicher kann die Vorteile einer schnellen Netzwerkverbindung einschränken. Mehr dazu im Artikel zur NUMA-Serverarchitektur.

Fazit: RDMA entfaltet seinen größten Nutzen, wenn drei Bedingungen erfüllt sind: viele Daten, kritische Latenz und teures CPU-Zeitbudget. Für klassische Unternehmensnetzwerke ist es meist zu komplex, aber für Supercomputer, verteilte Speicher oder große GPU-Cluster kann es entscheidend für die Systemleistung sein.

Fazit

RDMA löst eines der Hauptprobleme leistungsfähiger Serversysteme: Die CPU muss nicht mehr an jedem Schritt der Netzwerkdatenübertragung beteiligt sein. Nach der initialen Einrichtung übernimmt der RDMA-Adapter via DMA die direkte Übertragung zwischen den Speichern der Knoten.

Die wichtigsten Vorteile: niedrige Latenz, zero-copy, kernel bypass und reduzierte CPU-Last. Besonders spürbar ist das in Umgebungen mit dauerhaftem, großvolumigem Datenaustausch: HPC-Cluster, verteilte Speicher, große Datenbanken oder KI-Infrastrukturen.

RDMA ersetzt klassische TCP/IP-Netzwerke jedoch nicht. Für die meisten Anwendungen sind die Vielseitigkeit und Einfachheit von Ethernet und TCP wichtiger als minimale Latenzen. RDMA erfordert kompatible Hardware, spezielle Software und (bei RoCE) ein gut konfiguriertes Netzwerk.

Die Wahl für RDMA sollte getroffen werden, wenn der Datenaustausch zwischen Servern zum Flaschenhals wird - dann bringt die Entlastung der CPU und der direkte Speicherpfad oft weit mehr als ein CPU- oder Netzwerk-Upgrade.

Tags:

rdma
datenübertragung
server
netzwerktechnologien
hpc
roce
infiniBand
zero-copy

Ähnliche Artikel