Kurz zusammengefasst
RAG, also Retrieval-Augmented Generation, ist ein Ansatz, bei dem das Sprachmodell zuerst relevante Passagen in Ihren Firmendokumenten sucht und erst daraus eine Antwort zusammensetzt. Dadurch antwortet es auf Basis Ihrer tatsächlichen Daten und kann zu jeder Information die Quelle nennen, sodass Sie die Aussage leicht selbst überprüfen.
- Antworten aus Ihren Dokumenten, nicht aus Allgemeinwissen — das Modell schöpft ausschließlich aus den Materialien, die Sie ihm zugänglich machen, und ignoriert, was es während des allgemeinen Trainings gelernt hat.
- Jede Antwort nennt eine Quelle zur Überprüfung — Sie erhalten einen konkreten Verweis auf die Passage des Dokuments, aus der die Information stammt, und müssen nicht suchen, woher das Modell geschöpft hat.
- Schränkt Halluzinationen ein — weil sich die Antwort aus dem aufgefundenen Text und nicht aus dem Gedächtnis des Modells zusammensetzt, sinkt das Risiko erfundener oder verzerrter Aussagen deutlich.
- Die Daten bleiben unter Ihrer Kontrolle — die Dokumente müssen nicht an öffentliche Cloud-Dienste gesendet werden, und wenn Sie einen lokalen Betrieb wählen, bleiben sie dauerhaft in Ihrer Infrastruktur.
Wie RAG funktioniert
Wenn Sie einem traditionellen großen Sprachmodell eine Frage stellen, antwortet es nur aus dem, was es beim Training gelernt hat — Ihre internen Dokumente kennt es nicht, und wenn es die Antwort nicht weiß, kann es sich diese ausdenken. RAG dreht dieses Prinzip um: Das Modell durchsucht zuerst Ihre Dokumente und antwortet erst danach.
In der Praxis bedeutet das, dass Ihre Dokumente in kleinere semantische Einheiten geteilt und in die Form sogenannter Vektorrepräsentationen überführt werden, die ihre Bedeutung beschreiben. Diese Repräsentationen werden in einer Vektordatenbank gespeichert. Stellen Sie dann eine Frage, sucht das System in der Datenbank die Passagen, die Ihrer Frage bedeutungsmäßig am nächsten sind. Das Modell setzt aus diesen Passagen eine zusammenhängende Antwort zusammen und fügt automatisch den Verweis auf das Quelldokument hinzu. Das Ergebnis ist eine Antwort, die auf Ihren Daten steht und sofort nachvollziehbar ist — kein Raten, kein Ausdenken.
Warum RAG Halluzinationen einschränkt
Halluzinationen des Modells entstehen vor allem dann, wenn die Antwort ausschließlich aus seinem inneren Gedächtnis generiert wird — das Modell versucht zu schätzen, was wahrscheinlich klingt, und hat nichts, worauf es sich stützen kann. Beim Einsatz von RAG erhält das Modell zu jeder Anfrage einen konkreten Textkontext, aus dem es schöpfen darf. Die Antwort entsteht so durch eine gesteuerte Synthese vorhandener Inhalte, nicht durch Generieren aus dem Nichts. Zugleich gilt: Befindet sich die Antwort nicht im bereitgestellten Kontext, lässt sich das Modell so einstellen, dass es diese Tatsache eingesteht, statt sich etwas auszudenken. Der Mensch kann zudem bei jeder Information sofort die ursprüngliche Quelle prüfen — die Antwort hört auf, eine Blackbox zu sein.
Wo sich RAG im Unternehmen lohnt
Den größten Nutzen bringt RAG dort, wo ein Unternehmen mit einem großen Volumen unstrukturierter Texte arbeitet, zu denen es einen schnellen und vertrauenswürdigen Zugang braucht. Typischerweise sind das Situationen, in denen das Suchen einer Information Minuten bis Dutzende Minuten dauert oder Wissen über mehrere Systeme hinweg erfordert.
- Interne Wissensdatenbank — Richtlinien, Betriebshandbücher, technische Dokumentation und das Firmen-Wiki in natürlicher Sprache zugänglich, ohne langwieriges Durchgehen.
- Suche in Verträgen und rechtlicher Dokumentation — sofortiges Auffinden einer konkreten Bestimmung oder Frist über Hunderte von Dokumenten hinweg, samt Verweis auf die genaue Passage.
- Unterstützung des Kunden- und Serviceteams — der Mitarbeiter stellt eine natürliche Frage und erhält eine Synthese aus Anleitungen, bekannten Lösungen und der Servicehistorie, samt Quelle.
- Intelligente Suche in Archiven — die Erschließung jahrelanger Archive aus E-Mails, Aufzeichnungen, Projektdokumentation und technischen Berichten, in denen sich mit der üblichen Volltextsuche schwer suchen lässt.
- Unterlagen für Antwortvorschläge — das Modell bereitet einen Antwortentwurf zu einer Ausschreibung, einer technischen Anfrage oder einer Reklamation vor, gestützt auf vorhandene Unterlagen und Zahlen aus der Dokumentation.
Wie wir RAG sicher einsetzen
Den Einsatz legen wir so an, dass er Ihrer Sicherheitspolitik entspricht und Sie wissen, wohin die Daten fließen und wo sie bleiben.
- Auswahl und Vorbereitung der Datenquellen — wir identifizieren die Dokumente, die in das System indexiert werden, richten Zugriffsrechte so ein, dass jeder Nutzer nur das sieht, wozu er berechtigt ist, und entscheiden über die Häufigkeit der Index-Aktualisierung.
- Wahl des Modells und lokaler Betrieb — das Modell wählen wir nach der Art der Daten und den Anforderungen an die Latenz. Es kann in Ihrer Infrastruktur oder in unserem privaten GPU-Labor in Brno laufen, sodass die Daten die bekannte Umgebung nicht verlassen und Sie sie keiner anonymen Cloud anvertrauen.
- Einrichtung von Quellenangaben und Ablehnungsregeln — wir definieren das Format der Quellenangaben und die Grenzen, hinter denen das Modell nicht antworten darf, damit es keine Annahmen aus dem Allgemeinwissen übernimmt.
- Pilot auf Ihren Daten und Übergang in den Betrieb — wir starten einen Prüfbetrieb an realen Anfragen, messen die Genauigkeit der Antworten und übergeben das System erst nach der Auswertung in den Routinebetrieb, in dem Sie es selbst pflegen können oder wir es weiter betreiben.
Warum ITHOPE
In achtzehn Jahren haben wir in Brno ein eigenes GPU-Labor und ein Team aufgebaut, das nicht nur die Modelle, sondern die gesamte umliegende Betriebskette versteht. RAG bedeutet bei uns kein Outsourcing in eine Blackbox — wir bauen die Lösung so, dass Sie sie verstehen und auditieren können.
- Eigenes GPU-Labor in Brno — die Modelle laufen lokal auf unserer Hardware, die wir vollständig verwalten, und Ihre Daten müssen nicht in öffentliche Cloud-Umgebungen wandern.
- Wir verstehen Daten und Betrieb — wir lösen den gesamten Kontext: von der Verwaltung der Dokumente und ihrer Sicherung über die Steuerung der Zugriffe bis zur Sicherheitspolitik, sodass das Ergebnis in Ihre IT-Umgebung passt.
- Wir bauen und betreiben — je nach Bedarf liefern wir ein einmaliges Umsetzungsprojekt oder übernehmen die langfristige Überwachung und Wartung, einschließlich der Aktualisierung der Modelle und der Neuindexierung der Daten.
- Mensch im Regelkreis und faire Empfehlung — wir glauben nicht an einen automatischen Einsatz ohne Prüfung. Stellen wir fest, dass RAG für Ihren Fall ein zu komplexes Werkzeug ist und eine einfachere Suche ausreicht, sagen wir es offen.
Vereinbaren wir eine Beratung
Wir bieten eine unverbindliche Beratung an, bei der wir gemeinsam Ihre aktuellen Dokumente, ihr Format, ihr Volumen und die typischen Anfragen durchgehen, die Sie vom System erwarten. Der Sinn ist nicht, sofort eine Technologie einzusetzen, sondern zuerst zu klären, ob Ihnen RAG wirklich Zeit spart oder ob ein anderer Ansatz ausreicht.
Wenn Sie ein breiterer Blick auf den Einsatz von KI im Unternehmen interessiert oder Sie die Kosten besser verstehen möchten, sehen Sie sich den Artikel Was KI für ein Unternehmen kostet an — und melden Sie sich dann bei uns.