Embedding: wie KI Bedeutung in Zahlen fasst
Ein Embedding ist die Darstellung eines Textes, eines Bildes oder eines anderen Inhalts als Liste von Zahlen, als sogenannter Vektor. Das Besondere daran: Inhalte mit ähnlicher Bedeutung bekommen ähnliche Zahlen. So kann eine Maschine berechnen, wie nah sich zwei Texte inhaltlich sind, auch wenn sie kein einziges Wort gemeinsam haben. Embeddings sind die Grundlage für semantische Suche und für Systeme, die vor einer Antwort passende Dokumente heraussuchen.
Wie ein Embedding entsteht
Ein eigenes Modell, das Embedding-Modell, liest einen Text und gibt eine Zahlenreihe fester Länge zurück, meist mehrere Hundert bis einige Tausend Werte. Ein einzelner Wert hat für sich keine Bedeutung, die ein Mensch lesen könnte. Aussagekräftig ist die Lage des Vektors im Verhältnis zu anderen: Vektoren, die nah beieinander liegen, sollen ähnliche Bedeutungen haben.
Wie nah sich zwei Vektoren sind, wird mit einem Abstandsmaß berechnet, häufig mit der Kosinus-Ähnlichkeit. Sie misst, wie stark zwei Vektoren in dieselbe Richtung zeigen. Die Frage „Wie kündige ich meinen Vertrag?“ landet damit dicht bei einem Abschnitt über „Kündigungsfrist und Vertragsende“, obwohl beide anders formuliert sind.
Wofür Unternehmen Embeddings einsetzen
- Semantische Suche. Eine interne Wissenssuche findet das passende Dokument auch dann, wenn die Frage mit anderen Worten gestellt wird, als der Text sie verwendet.
- Antworten aus eigenen Dokumenten. Bei Retrieval-Augmented Generation, kurz RAG, sucht ein System zuerst per Embedding die passenden Abschnitte aus Handbüchern oder Verträgen und gibt sie dem Sprachmodell als Grundlage mit. Die Antwort stützt sich dann in erster Linie auf Ihre Unterlagen.
- Dubletten und Gruppen. Ähnliche Support-Anfragen, doppelte Produktbeschreibungen oder Beiträge zum selben Thema lassen sich automatisch erkennen und zusammenfassen.
- Empfehlungen und Zuordnung. Wer Inhalte nach Ähnlichkeit sortieren oder einer Kategorie zuordnen will, nutzt dafür den Abstand der Vektoren.
Wo die Vektoren gespeichert werden
Für wenige Hundert Dokumente genügt eine einfache Tabelle. Bei großen Beständen kommt eine Vektordatenbank zum Einsatz: ein Speicher, der die ähnlichsten Vektoren zu einer Anfrage schnell findet. Einige klassische Datenbanken bieten dafür Erweiterungen an, sodass nicht immer ein zusätzliches System nötig ist.
Grenzen und typische Missverständnisse
- Nähe ist nicht Wahrheit. Ein Embedding zeigt, dass zwei Texte ähnlich sind, nicht, dass einer davon richtig oder aktuell ist.
- Vektoren verschiedener Modelle sind nicht vergleichbar. Wer das Embedding-Modell wechselt, muss den gesamten Bestand neu berechnen.
- Die Aufteilung der Dokumente entscheidet mit. Ein ganzes Handbuch als ein einziger Vektor verwischt die Details, zu kleine Abschnitte verlieren den Zusammenhang.
- Sprache und Fachbegriffe wirken sich aus. Ein Modell, das überwiegend mit englischen Texten trainiert wurde, kann deutsche Fachbegriffe schlechter unterscheiden. Verlässlich ist nur ein Test mit Ihren eigenen Dokumenten und Fragen.
Datenschutz: wohin die Texte gehen
Um ein Embedding zu berechnen, muss der Text zum Embedding-Modell. Läuft das Modell bei einem Cloud-Anbieter, verlassen die Inhalte Ihr Unternehmen; bei personenbezogenen Daten ist das datenschutzrechtlich zu prüfen. Embedding-Modelle lassen sich auch auf eigener Hardware betreiben. Welche Variante passt, gehört zu den ersten Fragen einer KI-Implementierung.
Verwandte Begriffe
| Begriff | Worum es geht |
|---|---|
| Token | Die Einheit, in die ein Sprachmodell Text zerlegt. Tokens werden gezählt, Embeddings verglichen. |
| Vektordatenbank | Speicher für Embeddings mit schneller Ähnlichkeitssuche. |
| RAG | Verfahren, das per Embedding passende Dokumente sucht und dem Sprachmodell mitgibt. |
| Fine-Tuning | Verändert das Modell selbst, während Embeddings Inhalte auffindbar machen. |
| Agentische KI | Agenten nutzen oft eine Suche per Embedding, um die Informationen für den nächsten Schritt zu finden. |
Quellen
- Google for Developers, Machine Learning Glossary, Eintrag „embedding vector“, abgerufen am 14. September 2026
Diese Seite vertieft einen Eintrag aus dem KI-Glossar von minoka, dort finden Sie weitere Begriffe in Kurzform.
Häufige Fragen
Häufige Fragen
Was ist ein Embedding einfach erklärt?
Ein Embedding ist eine Zahlenreihe, die die Bedeutung eines Textes oder Bildes darstellt. Inhalte mit ähnlicher Bedeutung bekommen ähnliche Zahlen, sodass eine Maschine berechnen kann, wie nah sich zwei Inhalte sind.
Wofür werden Embeddings verwendet?
Vor allem für semantische Suche, für Systeme, die vor einer Antwort passende Dokumente heraussuchen (RAG), für das Erkennen von Dubletten und für Empfehlungen.
Kann man Embeddings verschiedener Modelle vergleichen?
Nein. Jedes Embedding-Modell erzeugt seinen eigenen Zahlenraum. Wer das Modell wechselt, muss alle gespeicherten Inhalte neu berechnen.
Müssen Texte für Embeddings an einen Cloud-Dienst gehen?
Nicht zwingend. Embedding-Modelle lassen sich auch auf eigener Hardware betreiben. Bei einem Cloud-Dienst verlassen die Texte das Unternehmen, was bei personenbezogenen Daten eine datenschutzrechtliche Prüfung verlangt.
Bevorzugte Quelle
minoka.de auf Google bevorzugen
Wenn Sie minoka.de als bevorzugte Quelle festlegen, zeigt Google Beiträge dieser Seite in Schlagzeilen, KI-Übersichten und im KI-Modus häufiger an. Ein Klick, ein Google-Konto, jederzeit in den Quelleneinstellungen widerrufbar.
Auf Google bevorzugenÖffnet die Quelleneinstellungen bei Google
