Inferenz ist die Phase, in der ein neuronales Netz nach dem Training reale Aufgaben löst - von Bilderkennung bis Textgenerierung. Erfahren Sie, wie Inferenz funktioniert, worin sie sich vom Training unterscheidet und was die Geschwindigkeit beeinflusst. Der Beitrag beleuchtet auch Herausforderungen, Unterschiede zwischen Cloud- und lokaler Inferenz sowie praktische Anwendungen moderner KI-Modelle.
Inference bei neuronalen Netzen ist die Phase, in der eine bereits trainierte KI nach Abschluss des Trainings praktisch eingesetzt wird. Nachdem die Modellparameter angepasst wurden, beginnt der praktische Nutzen: Genau jetzt beantwortet das neuronale Netz Fragen, erkennt Objekte auf Bildern, wandelt Sprache in Text um oder liefert Vorhersagen.
Während des Inference-Prozesses lernt das Modell in der Regel nicht mehr und verändert seine Parameter nicht. Es nimmt neue Daten entgegen, leitet sie durch seine trainierte Struktur und liefert ein Ergebnis. Jeder Aufruf einer Sprachmodell-API, die Gesichtserkennung durch ein Smartphone oder die Objekterkennung durch eine Kamera ist im Grunde ein separater Inferenzdurchlauf.
Inference bei neuronalen Netzen beschreibt den Vorgang, bei dem ein bereits trainiertes Modell sein erworbenes Wissen nutzt, um neue Daten zu verarbeiten. Das Training entspricht dem Lernen von Inhalten, die Inferenz ist das Lösen von Aufgaben auf Basis dieser Kenntnisse.
Wird ein Modell etwa mit zahlreichen Bildern von Katzen und Hunden trainiert, lernt es charakteristische Muster zu erkennen. Bekommt das neuronale Netz anschließend ein unbekanntes Foto, analysiert es dieses, um herauszufinden, welches Objekt dargestellt ist - das ist die Inferenz.
Auch bei generativen Modellen bleibt das Prinzip gleich, auch wenn das Ergebnis anders aussieht: Ein Sprachmodell erhält einen Textprompt und nutzt seine gelernten Parameter, um die wahrscheinlichste Fortsetzung zu bestimmen. Ein Bildgenerator erstellt auf Basis einer Beschreibung ein neues Bild.
Im Training durchläuft das neuronale Netz zahlreiche Beispiele, vergleicht Ergebnisse mit Zielwerten und passt seine Gewichte an - diese Parameter können in modernen Modellen millionen- oder milliardenfach vorhanden sein.
Nach Abschluss des Trainings werden diese Werte gespeichert. Das Modell befindet sich dann in einem Zustand, der es ermöglicht, die erlernten Muster ohne erneutes Training zu nutzen.
Bei der Inferenz durchlaufen neue Eingabedaten die gleichen Schichten, aber die Gewichte bleiben unverändert. Die Architektur und die trainierten Parameter bilden die Grundlage - es sind keine weiteren Trainingsdaten nötig, um neue Anfragen zu beantworten.
Die Begriffe sind eng verwandt: Inference bezeichnet den Prozess, bei dem das trainierte Modell ausgeführt wird, während die Vorhersage das konkrete Ergebnis beschreibt.
Bei einem Bildklassifikator ist die Vorhersage beispielsweise die Wahrscheinlichkeit, dass ein Objekt auf einem Foto zu sehen ist. Ein Computer-Vision-System liefert Koordinaten erkannter Objekte, ein Prognosemodell gibt einen erwarteten Zahlenwert aus.
Für Sprachmodelle ist das Inferenz-Ergebnis die Wahrscheinlichkeit der nächsten möglichen Tokens, auf deren Basis der Text Schritt für Schritt entsteht. "Vorhersage" muss also nicht immer eine Zukunftsprognose sein - sie kann auch die Klassifizierung eines Objekts oder die Fortsetzung einer Sequenz meinen.
Bei der Inferenz verarbeitet das neuronale Netz Eingabedaten und leitet sie sequentiell durch seine trainierte Architektur. Die Daten können aus Text, Bildern, Ton oder Zahlen bestehen. Im Inneren werden sie in numerische Werte umgewandelt und durchlaufen zahlreiche mathematische Operationen.
Dieser Prozess dauert meist nur einen Sekundenbruchteil bis wenige Sekunden, komplexe Modelle oder große Anfragen können jedoch deutlich mehr Rechenleistung erfordern. Im Gegensatz zum Training werden keine Fehler berechnet oder Gewichte angepasst - das Modell nutzt ausschließlich die schon gefundenen Parameter.
Vereinfacht lässt sich Inferenz als Kette darstellen: Eingabedaten → Datenvorverarbeitung → Berechnungen durch das neuronale Netz → Ergebnis. Die genaue Ausprägung jedes Schritts hängt vom Modelltyp ab.
Ein neuronales Netz besteht aus mehreren Schichten, die mathematische Operationen und trainierte Parameter enthalten. Neue Anfragen werden zunächst in eine numerische Darstellung umgewandelt, mit der das Modell arbeiten kann.
Diese Werte durchlaufen die Schichten der Netzstruktur. Auf jeder Ebene werden sie mit Gewichten multipliziert, addiert und mithilfe von Aktivierungsfunktionen oder anderen Mechanismen transformiert. Moderne Modelle führen dabei viele Matrixoperationen durch - das ist der Hauptteil der Rechenlast.
Der entscheidende Unterschied zum Training liegt in der Richtung: Bei der Inferenz wandern die Daten vorwärts durch das Netz, vom Eingang zum Ergebnis. Das rückwärtige Ausbreiten des Fehlers (Backpropagation) zur Anpassung der Gewichte entfällt.
Die Architektur bestimmt, wie diese Berechnungen organisiert sind. Aktuelle Sprachmodelle basieren oft auf der Transformer-Architektur, bei der der Attention-Mechanismus Zusammenhänge zwischen unterschiedlichen Teileingaben berücksichtigt.
Mehr zur Funktionsweise dieser Architektur erfahren Sie im Beitrag Wie Transformer-Architekturen moderne Sprachmodelle revolutionieren.
Die letzte Schicht des Modells wandelt die interne Darstellung in ein ergebnisorientiertes Format um, das zur jeweiligen Aufgabe passt. Bei einem Klassifikator können das Wahrscheinlichkeiten mehrerer Klassen sein - zum Beispiel erkennt das Modell ein Bild zu 92% als Katze, zu 6% als Hund, zu 2% als anderes Objekt.
In Computer-Vision-Systemen können die Ausgaben Koordinaten, Segmentierungs-Masken oder Tiefenkarten sein. Ein Spracherkennungsmodell wandelt Audiodaten in eine Abfolge von Zeichen oder Tokens um.
Bei generativen Netzen ist der Prozess meist komplexer: Ein Sprachmodell generiert den Text Schritt für Schritt, wobei für jedes Token erneut eine Inferenz erfolgt.
Die Anzahl der Parameter beeinflusst dabei den Rechenaufwand und Speicherbedarf. Größere Modelle können komplexere Zusammenhänge abbilden, benötigen aber für jeden Lauf mehr Ressourcen.
Mehr dazu, was diese Parameter genau bedeuten, lesen Sie im Artikel Was bedeuten Parameter bei neuronalen Netzwerken?.
Bei Sprachmodellen läuft die Inferenz anders ab als bei Klassifikatoren oder Vorhersagemodellen. LLM-Inferenz ist ein sequentieller Prozess: Die KI erhält eine Eingabe, wandelt sie in Tokens um, verarbeitet diese und generiert die Antwort Schritt für Schritt.
Der Nutzer sendet eine Nachricht - das Modell sucht keine fertige Antwort in einer Datenbank, sondern berechnet, welcher Token mit der höchsten Wahrscheinlichkeit als nächstes folgt. Nach jedem neuen Token beginnt der Prozess von vorn, bis die Antwort komplett ist.
Deshalb besteht eine einzige Antwort oft aus vielen aufeinanderfolgenden Berechnungsschritten.
Vor der Verarbeitung muss der Text in ein Format gebracht werden, das das Modell versteht. Das geschieht durch Tokenisierung: Der Text wird in kleine Einheiten (Tokens) zerlegt, die ganze Wörter, Teile davon, Satzzeichen oder andere Fragmente sein können. Jedem Token wird eine numerische ID zugeordnet, die dem Modell als Input dient.
Für Menschen ist ein kurzer Satz wenige Wörter, für das Modell jedoch meist eine längere Abfolge von Tokens. Je länger der Input, desto mehr Daten muss das Modell bei der Inferenz berücksichtigen.
Mehr zu diesem Prozess finden Sie im Artikel Tokens in neuronalen Netzwerken: Bedeutung und Funktionsweise.
Nach der Verarbeitung der Eingabesequenz berechnet das Modell die Wahrscheinlichkeiten für die nächsten möglichen Tokens. Beispielsweise erhält eine Fortsetzung eine Wahrscheinlichkeit von 40%, eine andere 20%, der Rest verteilt sich auf andere Optionen.
Das System wählt den nächsten Token nach den eingestellten Regeln und fügt ihn dem bisherigen Text hinzu. Die vollständige Sequenz wird erneut als Grundlage für die nächste Berechnung genutzt.
So entsteht die Antwort Stück für Stück, bis entweder das Ziel erreicht, ein Längenlimit überschritten oder ein End-Token generiert wird. Dieser schrittweise Prozess wird für Nutzer oft sichtbar, wenn der Text im Interface nach und nach erscheint.
Jeder neue Token erfordert einen weiteren Generationsschritt. Eine kurze Antwort ist daher meist günstiger und schneller berechnet als ein langer Text mit Tausenden von Wörtern.
Neben der Antwortlänge beeinflusst auch die Kontextgröße die Rechenlast. Je mehr Text das Modell als Kontext erhält, desto mehr Informationen müssen pro Berechnungsschritt berücksichtigt werden. Lange Chatverläufe oder große Dokumente erhöhen den Speicher- und Rechenbedarf.
Moderne LLMs nutzen verschiedene Optimierungen, um nicht bei jedem Schritt die gesamte Sequenz neu zu berechnen - etwa indem Zwischenergebnisse gespeichert und für die nächsten Tokens wiederverwendet werden.
Dennoch gilt: Je größer das Modell, je länger der Kontext und je mehr Text generiert werden soll, desto höher der Ressourcenbedarf für die Inferenz.
Training und Inferenz nutzen dasselbe Modell, verfolgen aber unterschiedliche Ziele: Beim Training werden die Parameter angepasst, bei der Inferenz werden die erworbenen Kenntnisse auf neue Daten angewendet.
Das Training benötigt meist deutlich mehr Ressourcen - das Modell verarbeitet große Datenmengen, vergleicht die Ergebnisse mit den Zielwerten und passt die Gewichte schrittweise an.
Die Inferenz beginnt erst nach dem Training. Die Gewichte bleiben fixiert, das Modell berechnet lediglich das Ergebnis für eine spezifische Eingabe.
Im Training erhält das neuronale Netz Beispiele und gibt eine eigene Vorhersage ab. Das System berechnet, wie sehr dieses Ergebnis vom Ziel abweicht, und ermittelt daraus den Fehler.
Der Fehler wird dann zurück durch das Netzwerk propagiert. Die Gewichte werden so angepasst, dass die nächste Vorhersage besser wird. Dieser Zyklus wird unzählige Male wiederholt.
Das Training ermöglicht es dem Modell, Muster und Zusammenhänge zu erkennen - bei Sprachmodellen etwa die Beziehung zwischen Tokens, bei Computer Vision die Erkennung visueller Merkmale, bei Vorhersagemodellen statistische Abhängigkeiten.
Wird ein trainiertes Modell für neue Aufgaben angepasst, spricht man von Feinabstimmung (Fine-Tuning). Mehr dazu lesen Sie im Artikel Fine-Tuning vs. RAG: Sprachmodelle optimal anpassen.
Bei der Inferenz wird kein Fehler berechnet und keine Gewichte angepasst. Das Modell erhält Eingabedaten, leitet sie durch seine Schichten und erstellt das Resultat.
Beispielsweise erhält ein Bildklassifikator die Pixelwerte eines Bildes und gibt auf Basis der trainierten Parameter die wahrscheinlichste Objektklasse aus. Bei Sprachmodellen wird ähnlich die Wahrscheinlichkeit des nächsten Tokens berechnet.
Da die Rückpropagation entfällt, ist die Inferenz meist deutlich ressourcensparender als ein Trainingsschritt. Doch bei Modellen mit Milliarden von Parametern kann auch ein einzelner Lauf viel Rechenleistung und Speicher beanspruchen.
Der Unterschied zeigt sich besonders in der Infrastruktur: Das Training großer Modelle erfolgt auf riesigen Clustern, während die Inferenz laufend Nutzeranfragen möglichst schnell verarbeiten muss. Nach dem Training stellt sich daher die Frage, wie Modelle effizient und performant in den Einsatz gebracht werden können.
Die Inference-Geschwindigkeit bestimmt, wie schnell ein Modell Eingaben verarbeiten und Antworten liefern kann. Bei Chatbots ist dies die Verzögerung vor der Antwort und die Geschwindigkeit der Textgenerierung, bei Computer Vision die Bildrate pro Sekunde, bei autonomen Geräten die Reaktionszeit.
Die Leistung hängt nicht nur von der Rechenleistung ab, sondern auch von Modellgröße, Architektur, verfügbarem Speicher, Bandbreite zwischen den Komponenten und den eingesetzten Optimierungsmethoden.
Je mehr Parameter ein Netzwerk besitzt, desto mehr Berechnungen sind für eine Inferenz nötig. Die Parameter müssen im (Video-)Speicher gehalten und zu den Recheneinheiten übertragen werden.
Große Modelle können also durch die Speicherbandbreite limitiert werden - wenn die Datenübertragung zum Engpass wird, bleibt ein Teil der Hardware ungenutzt.
Auch die Architektur beeinflusst die Performance: Zwei Modelle mit ähnlicher Größe können sich in der Geschwindigkeit stark unterscheiden, je nachdem, welche Operationen sie ausführen.
Typische Optimierungen zur Beschleunigung sind Quantisierung, geringere Rechengenauigkeit oder spezielle Modellformate. Der Wechsel von 32- auf 16- oder 8-Bit-Zahlen kann Speicherbedarf und Rechenzeit senken, sofern die Hardware dies unterstützt.
Neuronale Netze nutzen massiv Matrixoperationen. Daher sind Prozessoren mit hoher Parallelität wie GPUs besonders geeignet - sie erledigen viele identische Rechnungen gleichzeitig und werden sowohl fürs Training als auch für die Inferenz eingesetzt.
In Smartphones, Notebooks und Co. kommen zunehmend NPUs (Neural Processing Units) zum Einsatz. Sie sind auf KI-Aufgaben optimiert, besonders energieeffizient und ermöglichen lokale Inferenz ohne ständige Cloud-Anbindung.
In Rechenzentren werden noch speziellere Beschleuniger für maschinelles Lernen verwendet. Sie führen typische Matrixoperationen schneller und sparsamer aus als Universalprozessoren.
Bei Cloud-Inferenz sendet das Endgerät Daten an einen Server mit installiertem Modell. Die Hauptberechnungen erfolgen auf leistungsfähigen GPUs oder Spezial-Hardware, das Ergebnis wird zurückgeschickt.
So lassen sich sehr große Modelle nutzen, die auf einem Smartphone oder Notebook nicht laufen würden. Allerdings ist man von der Internetverbindung und der Übertragungsdauer abhängig.
Bei der lokalen Inferenz läuft das Modell direkt auf dem Gerät - auf CPU, GPU oder NPU, ohne Daten an ein Rechenzentrum zu senden. Das reduziert Latenz und ermöglicht bestimmte Aufgaben sogar offline.
Allerdings ist die lokale Inferenz durch Arbeitsspeicher, Performance und Energieverbrauch limitiert. Daher kommen auf mobilen Geräten oft verkleinerte, optimierte Modelle zum Einsatz.
In der Praxis ergänzen sich Cloud- und lokale Inferenz zunehmend: Einfache Aufgaben werden lokal erledigt, komplexe Anfragen an die Cloud weitergeleitet. So lässt sich Latenz reduzieren, Serverlast senken und gleichzeitig Zugang zu leistungsstarken Modellen bewahren.
Inference bei neuronalen Netzen ist die Phase, in der das trainierte Modell reale Aufgaben löst. Die Parameter bleiben dabei in der Regel unverändert: Das Netz verarbeitet neue Daten, leitet sie durch seinen Aufbau und liefert Vorhersagen, Klassifizierungen oder generierte Antworten.
Bei Sprachmodellen ist die Inferenz ein sequentieller Prozess der Token-Generierung. Die Antwortgeschwindigkeit hängt daher von der Modellgröße, der Kontextlänge, der eingesetzten Hardware und Optimierungen ab. Dieser Schritt entscheidet, wie schnell und wirtschaftlich KI in echten Anwendungen funktioniert.
Das Training verleiht dem Modell seine Fähigkeiten, die Inferenz erschließt ihren praktischen Nutzen. Fortschritte im Bereich künstliche Intelligenz hängen somit nicht nur von der Entwicklung größerer Modelle ab, sondern auch davon, wie sie schneller, günstiger und näher am Nutzer eingesetzt werden können - in der Cloud, auf Computern oder direkt auf dem Smartphone.