RAG (Retrieval-Augmented Generation)
RAG kombiniert ein Sprachmodell mit einer Suche über eigene Dokumente, damit Antworten auf aktuellem, firmeneigenem Wissen statt nur auf Trainingsdaten basieren.
RAG steht für Retrieval-Augmented Generation. Dabei sucht eine Anwendung vor der Modellausgabe passende Inhalte in einer angebundenen Wissensbasis.
Die gefundenen Textstellen werden dem Sprachmodell zusammen mit der Anfrage als Kontext bereitgestellt. Das Modell formuliert seine Antwort auf Grundlage dieses zusätzlichen Materials.
Wie RAG technisch funktioniert
Für einen typischen RAG-Aufbau werden Dokumente zunächst in geeignete Abschnitte zerlegt. Das können Inhalte aus Wikis, Handbüchern oder Ticketsystemen sein.
Die Abschnitte werden häufig als Embeddings in einer Vektordatenbank abgelegt und mit den erforderlichen Metadaten ergänzt.
Bei einer Anfrage sucht das System nach passenden Abschnitten. Dafür kann es die Anfrage als Embedding mit den gespeicherten Inhalten vergleichen und die Suche durch Filter oder weitere Ranking-Verfahren ergänzen.
Die ausgewählten Treffer werden dem Sprachmodell als Kontext übergeben. Idealerweise nennt die Anwendung zugleich die verwendeten Quellen.
Warum RAG in der Praxis relevant ist
Interne Dokumente und aktuelle Produktinformationen sind im Basismodell häufig nicht enthalten. RAG kann solche Inhalte zur Laufzeit bereitstellen, ohne die Modellparameter zu verändern.
Die Wissensbasis lässt sich unabhängig vom Modell aktualisieren. Für veränderliches Faktenwissen ist dieser Ansatz deshalb meist leichter nachvollziehbar und zu pflegen als ein Fine-Tuning.
Wo die Technik an Grenzen stößt
RAG kann Halluzinationen verringern, schließt sie aber nicht aus. Unpassende oder widersprüchliche Treffer können weiterhin zu falschen Schlussfolgerungen führen.
Die Qualität hängt von Dokumentaufbereitung, Suche und Auswahl der Treffer ab. Ein belastbares System benötigt außerdem Regeln für veraltete Inhalte, widersprüchliche Quellen und die nachvollziehbare Herkunft einer Antwort.
Bei sensiblen Dokumenten muss geprüft werden, welche Daten an Embedding-Modell, Vektordatenbank und Sprachmodell übertragen werden.
Verträge, Datenklassifikation und technische Schutzmaßnahmen bestimmen, ob ein externer Dienst, eine kontrollierte Cloud-Umgebung oder selbst betriebene Infrastruktur geeignet ist.
Verwandte Begriffe
Verwandte Begriffe
Embedding
Ein Embedding stellt Text, Bilder oder andere Daten als Zahlenvektor dar. Inhaltlich ähnliche Daten erhalten ähnliche Vektoren.
Begriff ansehen
Vektordatenbank
Eine Vektordatenbank speichert Embeddings und sucht Einträge anhand ihrer mathematisch bestimmten Ähnlichkeit.
Begriff ansehen
Halluzination
Eine Halluzination ist eine plausibel formulierte, aber sachlich falsche oder erfundene Ausgabe eines KI-Modells.
Begriff ansehen
Passende Themen
Passende Themen
Private AI Infrastructure
Wir klären, ob private KI-Infrastruktur für Ihren Anwendungsfall sinnvoll ist und welche Fragen zu Daten, Sicherheit und Betrieb vorab beantwortet werden müssen.
Übersicht ansehen
Passende Leistungen
Passende Leistungen
Infrastruktur
Für KI-, Automatisierungs- und Softwaresysteme, deren Daten, Verfügbarkeit und Betrieb klare technische Anforderungen stellen.
Übersicht ansehen
Was möchten Sie technisch klären oder umsetzen?
Schildern Sie kurz die Ausgangslage, Ihr Ziel und die beteiligten Systeme. Wir melden uns mit einer fachlichen Einschätzung und einem Vorschlag für den nächsten sinnvollen Schritt.