Wissensdistillation ist eine Methode, bei der ein großes neuronales Netz sein Wissen an ein kleineres, effizienteres Modell überträgt. Das kompakte Netz profitiert so von der Leistungsfähigkeit des Lehrermodells, benötigt aber deutlich weniger Ressourcen. Besonders bei Sprachmodellen und Geräten mit begrenztem Speicher ist dieser Ansatz entscheidend für schnelle, günstige und praxisnahe KI-Anwendungen.
Wissensdistillation ist eine Methode des Trainings von neuronalen Netzen, bei der ein großes und komplexes Modell einen Teil seines Wissens an ein kompakteres Modell weitergibt. Das große Netzwerk fungiert als Lehrer, das kleine als Schüler. Ziel dieses Ansatzes ist es, ein Modell zu erhalten, das weniger Speicher und Rechenleistung benötigt, aber dennoch einen Großteil der ursprünglichen Qualität beibehält.
Gerade bei modernen neuronalen Netzen mit Milliarden von Parametern ist das besonders relevant. Zwar lassen sich solche Modelle auf leistungsstarken Servern und spezialisierten Beschleunigern ausführen, doch die Nutzung auf Smartphones, Notebooks oder anderen Geräten gestaltet sich deutlich schwieriger. Die Distillation ermöglicht es, Teile der Fähigkeiten des großen Modells auf eine leichtere Architektur zu übertragen.
Beim klassischen Training erhält ein neuronales Netz Eingabedaten sowie die richtigen Antworten. Beispielsweise wird der Modell ein Bild einer Katze gezeigt, und das richtige Label ist "Katze". Der Algorithmus passt dann schrittweise die Netzwerkparameter so an, dass die Wahrscheinlichkeit für die richtige Antwort steigt.
Bei der Wissensdistillation kommt eine zusätzliche Informationsquelle hinzu - ein bereits trainiertes großes Modell. Es analysiert die gleichen Daten und zeigt dem kleinen Modell nicht nur die korrekte Antwort, sondern auch seine eigenen Einschätzungen zu möglichen Alternativen.
So könnte das große Modell ein Bild wie folgt bewerten: Katze - 85%, Tiger - 8%, Hund - 5%, andere - 2%. Im klassischen Dataset würde das kleine Modell nur das Label "Katze" sehen. Durch Distillation erfährt es jedoch, welche Objekte das große Modell als ähnlich einschätzt, und erhält somit deutlich mehr Kontext.
Die Größe eines neuronalen Netzes begrenzt die Menge an Mustern, die es speichern und nutzen kann. Wird eine kleine Architektur einfach auf denselben Daten wie das große Modell trainiert, ist das Ergebnis meist schlechter.
Das große Modell entwickelt im Laufe des Trainings interne Repräsentationen von Zusammenhängen zwischen Objekten, Wörtern und Merkmalen. Ein Teil dieses Wissens kann durch seine Antworten an das kleinere Modell weitergegeben werden.
Die Aufgabe der Distillation ist es daher nicht, schlicht das Ergebnis zu kopieren. Das kleine Modell versucht, das Verhalten der leistungsstärkeren Lösung nachzuahmen und so mehr Informationen aus denselben Trainingsbeispielen zu gewinnen.
Im klassischen Ansatz werden zwei neuronale Netze verwendet: Teacher Model (Lehrer) und Student Model (Schüler).
Das Teacher-Modell ist in der Regel deutlich größer, bereits trainiert und erzielt eine hohe Qualität bei der gewünschten Aufgabe. Während der Distillation werden seine Parameter meist nicht mehr verändert - es dient als reine Wissensquelle.
Das Student-Modell besitzt eine kompaktere Architektur und weniger Parameter. Beim Training vergleicht es seine eigenen Antworten nicht nur mit den korrekten Werten aus dem Datensatz, sondern auch mit den Ergebnissen des Lehrers.
So kann die teure Lehrermodell nur in der Trainingsphase genutzt werden. Nach dem Training bleibt in der realen Anwendung nur der Schüler, der schneller arbeitet und weniger Ressourcen benötigt.
Der Kern der Distillation besteht darin, dass das Student-Modell nicht nur die korrekten Antworten, sondern auch das Verhalten des Teacher-Modells nachbildet. Beide Netze erhalten dieselben Eingabedaten, und die Antworten des Schülers werden mit denen des Lehrers verglichen.
Im Training wird der Fehler aus mehreren Quellen berechnet: Einerseits, wie sehr die Antwort des Schülers von der korrekten Kennzeichnung abweicht, andererseits, wie stark seine Wahrscheinlichkeitsverteilung von der des großen Modells differiert. Die Parameter des kleinen Netzes werden so angepasst, dass beide Fehler minimiert werden.
Stellen wir uns eine Bilderkennung vor. Im Datensatz hat ein Foto eines Autos nur das Label "Auto". Für klassisches Training genügt das: Das Modell soll die höchste Wahrscheinlichkeit dem richtigen Klasse zuordnen.
Das Teacher-Modell kann eine viel detailliertere Einschätzung geben, zum Beispiel: Auto - 90%, LKW - 6%, Bus - 3%, andere Klassen unter 1%.
Genau diese Verteilung wird bei der Distillation genutzt. Der Schüler sieht nicht nur die richtige Antwort, sondern auch, welche Alternativen der Lehrer als ähnlich betrachtet. Dadurch erhält er Informationen über Zusammenhänge zwischen den Klassen, die im klassischen Label fehlen.
Bei Sprachmodellen ist das Prinzip ähnlich: Statt Klassen werden mögliche nächste Token betrachtet. Das große Modell zeigt dem Schüler, welche Wörter oder Wortteile es für eine bestimmte Fortsetzung am passendsten hält.
Wenn das Modell nur die finale Antwort liefert, gehen viele Informationen über den Entscheidungsprozess verloren. Zwei Beispiele können dasselbe Label haben, werden vom Netz aber unterschiedlich wahrgenommen.
So kann das Teacher-Modell bei einem Hauskatzenfoto nahezu alle anderen Optionen ausschließen, während bei einem Bild einer großen Wildkatze die Wahrscheinlichkeit für "Tiger" oder "Leopard" deutlich steigt - das Label bleibt jedoch beides Mal "Katze".
Diese sekundären Wahrscheinlichkeiten werden auch als "weiche Labels" oder soft targets bezeichnet. Sie helfen dem Schüler, nicht nur die Grenze zwischen richtig und falsch, sondern auch die relative Ähnlichkeit verschiedener Optionen zu erkennen.
Dadurch kann das Training eines kleinen Netzes durch ein großes oft effektiver sein, als klassisches Training auf den Rohdaten.
Um dem Schüler mehr Informationen zu vermitteln, wird die Wahrscheinlichkeitsverteilung des Lehrers oft künstlich "weicher" gemacht. Dafür wird der Parameter Temperature genutzt.
Im Standardmodus dominiert oft eine Wahrscheinlichkeit deutlich - etwa 98% für eine Klasse, der Rest erhält minimale Anteile. In solch einer scharfen Verteilung ist wenig zusätzliche Information enthalten.
Eine erhöhte Temperatur macht die Wahrscheinlichkeiten flacher: Die Hauptoption bleibt am wahrscheinlichsten, aber die anderen Werte wachsen an. So kann der Schüler besser erkennen, welche Alternativen der Lehrer für mehr oder weniger passend hält.
Nach dem Training wird die erhöhte Temperatur nicht mehr benötigt - sie ist vor allem ein Werkzeug zur Wissensübertragung, danach arbeitet das kompakte Netz eigenständig.
Das wichtigste praktische Ziel der Distillation ist die Komprimierung neuronaler Netze, ohne komplett auf die Qualität des großen Modells zu verzichten. Statt bei jeder Anfrage ein komplexes System mit Milliarden Parametern auszuführen, können Entwickler ein kompakteres Modell trainieren und dort einsetzen, wo Geschwindigkeit, Kosten und Speicherbedarf entscheidend sind.
Distillation unterscheidet sich damit deutlich von einer bloßen Reduktion der Netzwerkarchitektur. Wird einfach die Zahl der Schichten oder Parameter verringert, sinkt die Qualität meist spürbar. Bei der Distillation wird das kleine Modell jedoch gezielt darauf trainiert, das Verhalten des mächtigen Lehrers nachzuahmen, weshalb viele Fähigkeiten erhalten bleiben.
Die Parameteranzahl bestimmt direkt, wie viel Speicher für Modellbetrieb und -speicherung benötigt wird. Je kompakter das Netz, desto leichter passt es in RAM oder Grafikspeicher eines Geräts.
Das ist insbesondere für Smartphones, Notebooks, Embedded Systeme und andere Geräte wichtig, bei denen keine Dutzenden Gigabyte für ein einzelnes Modell verfügbar sind. Nach der Distillation kann das Netz deutlich weniger Platz benötigen und auf günstigerer Hardware laufen.
Auch die Anforderungen an die Infrastruktur sinken: Kompakte Modelle benötigen weniger Rechenressourcen, sodass ein Server mehr Anfragen ohne zusätzliche Beschleuniger abarbeiten kann.
Unter Inferenz versteht man die Phase, in der das trainierte Netz Eingaben erhält und eine Antwort generiert. Je größer das Modell, desto mehr Operationen werden pro Anfrage nötig.
Weniger Parameter und Rechenaufwand bedeuten geringere Latenz. Das ist entscheidend für Anwendungen, bei denen Antworten nahezu in Echtzeit benötigt werden: Sprachassistenten, Übersetzer, Bilderkennung, Chatbots und KI-Apps für lokale Geräte.
Bei großen Online-Services bringt das nicht nur Geschwindigkeit: Sinkt der Rechenaufwand pro Anfrage, reduziert sich auch der Bedarf an Servern, Strom und Beschleunigern. Bei Millionen von Anfragen macht schon eine kleine Ersparnis pro Inferenz einen erheblichen Unterschied.
Distillation macht es nicht möglich, sämtliche Fähigkeiten eines großen Netzes in eine deutlich kleinere Architektur zu pressen. Das Student-Modell hat weniger Parameter und daher auch weniger Kapazität, komplexe Muster zu speichern.
Die Methode zielt vielmehr darauf ab, das nützlichste Verhalten des Lehrers zu bewahren und einen akzeptablen Kompromiss zwischen Qualität und Modellgröße zu erzielen. Je stärker das Modell verkleinert wird, desto schwieriger ist es, die ursprüngliche Genauigkeit zu halten.
Das Ergebnis hängt auch von der Architektur des Schülers, der Datenqualität und der Art der Wissensübertragung ab. Gut abgestimmte Distillation kann ein kompaktes Modell liefern, das deutlich bessere Leistung bringt als ein Modell gleicher Größe, das nur auf Rohdaten trainiert wurde.
Die Komprimierung von KI-Modellen mittels Distillation ist daher besonders dort sinnvoll, wo maximale Qualität nicht oberste Priorität hat. Oft ist eine etwas weniger präzise, aber dafür schnellere und günstigere Lösung in der Praxis vorteilhafter.
Distillation ist speziell bei modernen großen Sprachmodellen (LLM) gefragt. Ein großes Modell kann Dutzende oder Hunderte Milliarden Parameter enthalten, was massive GPU-Leistung, viel Speicher und eine ausgebaute Server-Infrastruktur nötig macht.
Für viele Anwendungen ist diese Rechenpower überdimensioniert. Soll eine App Nachrichten klassifizieren, Informationen extrahieren, Standardfragen beantworten oder lokal arbeiten, ist ein kompakteres Modell meist viel praktischer. Daher wird das große LLM als Lehrer verwendet, und auf seinen Antworten und Wahrscheinlichkeitsverteilungen wird ein kleineres Modell trainiert.
Bei der Distillation eines Sprachmodells erhält der Lehrer zahlreiche Textabfragen und generiert Antworten, die dann zusammen mit klassischen Trainingsbeispielen zum Training des Schülers genutzt werden.
Es können auch nicht nur fertige Texte übertragen werden. Haben Entwickler Zugriff auf die internen Ergebnisse des Modells, kann der Schüler anhand von Wahrscheinlichkeiten einzelner Token, Zwischenrepräsentationen oder anderen Signalen lernen. Je mehr Information vom Lehrer vorliegt, desto genauer lässt sich sein Verhalten reproduzieren.
So lernt das kleine Modell schrittweise, Antworten ähnlich wie der Lehrer zu generieren, trotz geringerer Größe. Die Architektur muss dabei nicht zwangsläufig dem großen Netz entsprechen.
Kompakte Sprachmodelle sind besonders dann nützlich, wenn geringer Energieverbrauch und schnelle Reaktionen wichtig sind. Sie laufen auf Notebooks, Smartphones, Einplatinencomputern und anderen Geräten ohne permanente Verbindung zu leistungsstarken Cloud-Servern.
Lokale Ausführung verringert zudem die Abhängigkeit von Internet und ermöglicht, Teile der Daten direkt auf dem Gerät zu verarbeiten. Für Unternehmen sind kleine Netze auch deshalb attraktiv, weil sie viele Anfragen mit geringeren Anforderungen an die Infrastruktur bedienen können.
Detaillierte Unterschiede zwischen kompakten und großen Sprachmodellen finden Sie im Beitrag Kleine Sprachmodelle (SLM) vs. LLM: Warum Unternehmen auf kompakte KI setzen.
Selbst eine erfolgreiche Wissensdistillation bei LLMs macht das kleine Modell nicht zu einer genauen Kopie des Lehrers. Der Schüler hat weniger Parameter und Rechenressourcen und kann daher nicht alle Muster und Fähigkeiten der deutlich größeren Architektur speichern.
Das Ergebnis hängt zudem davon ab, mit welchen Daten die Distillation erfolgte. Hat der Schüler nur Antworten des Lehrers zu einem begrenzten Aufgabenspektrum gesehen, reproduziert er dessen Verhalten in diesen Bereichen am besten. Bei neuen oder deutlich komplexeren Anfragen kann die Differenz größer ausfallen.
In der Praxis versucht man daher, nicht alle Fähigkeiten des ursprünglichen LLM zu übernehmen, sondern jene, die für das jeweilige Szenario am wichtigsten sind. So entsteht ein spezialisiertes, kompaktes Modell, das deutlich günstiger betrieben werden kann und dennoch die gewünschten Aufgaben gut löst.
Wissensdistillation ist nicht der einzige Weg, neuronale Netze kompakter und günstiger zu machen. Zur Modelloptimierung werden auch Quantisierung, Pruning, Architektur-Reduktion und weitere Methoden eingesetzt. Sie verfolgen ähnliche Ziele, funktionieren aber unterschiedlich.
Das Hauptmerkmal der Distillation ist, dass ein separates Student-Modell erstellt und trainiert wird. Es kann von Anfang an weniger Schichten, Parameter und Rechenblöcke haben, während das große Modell nur während des Trainings als Wissensquelle dient.
Bei der Quantisierung bleibt die Architektur des Modells meist erhalten, aber die Art der Zahlenspeicherung und -verarbeitung ändert sich. Statt 16- oder 32-Bit-Werten werden zum Beispiel 8-Bit-Formate verwendet.
Das verringert den Speicherbedarf und kann die Inferenz auf geeigneter Hardware beschleunigen, macht die Netzstruktur aber nicht unbedingt einfacher.
Distillation funktioniert anders: Entwickler nehmen ein kleines, separates Modell und trainieren es darauf, das Verhalten des großen zu imitieren. Am Ende wird nicht nur die Genauigkeit der Zahlen reduziert, sondern auch die gesamte Rechenkomplexität des Netzes.
Vereinfacht gesagt: Bei der Quantisierung wird ein bestehendes Netz effizienter repräsentiert, bei der Distillation wird auf Basis des Wissens eines großen Netzes ein neues, schlankes Modell trainiert.
Die Anzahl der Parameter spielt dabei eine Schlüsselrolle für Größe und Potenzial des Modells. Ausführlich wird dieses Thema im Artikel Was bedeuten Parameter bei neuronalen Netzwerken? Alles über Modellgröße, Training und Praxis behandelt.
Distillation und Quantisierung schließen sich nicht aus. In der Praxis wird oft zuerst ein kompakter Schüler durch das große Modell trainiert, und danach das Modell zusätzlich quantisiert.
Beispielsweise gibt das große Modell Wissen an einen Schüler mit weniger Parametern weiter. Nach dem Training werden die Gewichte des Schülers in ein kompakteres Zahlenformat überführt. So sinken Speicherbedarf und Rechenaufwand weiter.
Auch lässt sich Distillation mit Pruning kombinieren - dem Entfernen wenig signifikanter Verbindungen oder Elemente im Netz. Solche mehrstufigen Ansätze sind gerade für lokale KI und Systeme mit strikter Ressourcenbegrenzung besonders nützlich.
Allerdings kann zu aggressives Komprimieren zu spürbaren Qualitätseinbußen führen. Daher suchen Entwickler meist nach einem optimalen Gleichgewicht zwischen Modellgröße, Geschwindigkeit, Energieverbrauch und Antwortgenauigkeit.
Wissensdistillation ermöglicht es, einen Teil der Fähigkeiten großer neuronaler Netze in kompakte Modelle zu übertragen. Statt nur auf Rohdaten zu trainieren, erhält das Student-Modell zusätzliche Informationen vom Teacher: Antwortwahrscheinlichkeiten, Zusammenhänge zwischen Alternativen und andere vom großen System erzeugte Signale.
Dieser Ansatz hilft, Netze zu verkleinern, Speicherbedarf zu senken und die Inferenz zu beschleunigen. Besonders vorteilhaft ist Distillation für Sprachmodelle, die nach der Optimierung auf weniger leistungsfähigen Servern, Notebooks oder sogar Mobilgeräten laufen können.
Das kleine Modell wird dabei nie zur vollständigen Kopie des großen. Je stärker die Architektur reduziert wird, desto schwieriger ist es, alle Fähigkeiten des Lehrers zu bewahren. In der Praxis dient Distillation daher als Methode, ein Gleichgewicht zwischen Modellqualität, Geschwindigkeit und Rechenkosten zu finden. Falls Ressourcen weiterhin knapp sind, lässt sie sich zusätzlich mit Quantisierung und anderen Optimierungen kombinieren.