Erklärung zur KI-Transparenz
Ziel
Typische LLMs haben den Vorteil, aber auch das Problem, dass sie auf einer unglaublich großen Menge an Daten trainiert wurden.
Das bedeutet, dass sie viel Wissen besitzen, aber oft nicht in der Lage sind, sehr spezifische Fragen zu beantworten.
In solchen Fällen sind LLMs sehr anfällig für Halluzinationen, d. h., sie erfinden einfach Dinge.
Eine Möglichkeit, die Leistung von LLMs bei sehr spezifischen Fragen zu verbessern, ist die Verwendung von Retrieval-Augmented-Generation (RAG).
Hier geben Benutzer benutzerdefinierte Dokumente an, die die Wissensbasis enthalten, über die sie später Fragen stellen möchten.
Bevor ein LLM auf eine Benutzeranfrage antwortet, werden die zuvor vom Benutzer bereitgestellten relevantesten Dokumente abgerufen und dem LLM als zusätzlicher Kontext zur Verfügung gestellt.
In unserem innovativen Ansatz fügen wir am Ende der Antwort einen Referenzabschnitt hinzu, in dem Sie den tatsächlichen Teil des Dokuments finden können, den unsere RAG mit Ihrer Frage verknüpft hat.
Da diese Referenzen direkt aus den vom Benutzer bereitgestellten Dokumenten zitiert werden, besteht keine Möglichkeit für Halluzinationen.
Allgemeine Funktionalität
Dieser Abschnitt skizziert kurz die einzelnen Schritte, die zur Verarbeitung einer RAG-Anfrage erforderlich sind.
Eingabe von Dokumenten
Um RAG nutzen zu können, muss ein Benutzer zunächst eine Wissensbasis – also eine Sammlung von Dokumenten – bereitstellen.
Diese Dokumente werden hochgeladen, in Markup konvertiert und dann in einer Datenbank indiziert.
Dort werden sie in Teile (Chunks) aufgeteilt und anschließend durch ein spezielles Embedding-Modell in einen Vektor umgewandelt.
Dieser Vektor wird in einer Vektor-Datenbank gespeichert.
Auf diese Weise muss jedes vom Benutzer bereitgestellte Dokument verarbeitet werden, um die Wissensbasis aufzubauen.
Diese Wissensbasis, auch „Arcana“ genannt, wird bei GWDG gespeichert, bis der Benutzer sie explizit löscht!
Einreichen von Anfragen
Sobald die allgemeine Wissensbasis erstellt ist, kann ein Benutzer Anfragen stellen.
Bevor diese Anfragen an das LLM gesendet werden, werden sie ebenfalls in eine Vektorrepräsentation umgewandelt, wobei dasselbe Embedding-Modell verwendet wird, das zur Erstellung der Wissensbasis im vorherigen Schritt verwendet wurde.
Dieser Vektor wird dann in einer Ähnlichkeitssuche in der zuvor erstellten Vektor-Datenbank verwendet, um Teile der zuvor erfassten Dokumente zu finden, die eine ähnliche Bedeutung haben.
Eine konfigurierbare Anzahl ähnlicher Vektoren wird zurückgegeben und zusammen mit der ursprünglichen Anfrage des Benutzers an das LLM weitergeleitet.
Generierung einer Antwort
Das LLM nutzt die zusätzlichen Informationen, um eine präzisere Antwort auf die Anfrage des Benutzers zu liefern.
Dies ist bereits viel weniger anfällig für Halluzinationen, aber diese sind immer noch möglich.
In unserem Ansatz geben wir explizite Referenzen auf die Dokumente an, die die von LLM verwendeten Teile enthalten, um die Antwort zu formulieren.
Diese Referenzen werden in einem speziellen Referenzkasten am Ende der Antwort angezeigt, der die tatsächlichen Zitate aus den ursprünglichen Dokumenten enthält, die vom Benutzer bereitgestellt wurden.
Daher ist eine Halluzination bei diesen Referenzen unmöglich.
Weitere Überlegungen
Zugriff auf die gespeicherten Dokumente
Die eingelesene Wissensbasis kann frei mit anderen Nutzern geteilt werden.
Dazu muss die Arcana-ID bereitgestellt werden.
WICHTIG: Dies gibt Nutzern vollen Zugriff auf Ihre Dokumente und kann (derzeit) nicht einzeln widerrufen werden!
Speicherung Ihrer Dokumente
Ihre indizierten Daten verbleiben zu allen Zeiten auf GWDG-Systemen.
Wir werden Ihre Dokumente nicht an Dritte weitergeben.
Verarbeitung Ihrer Anfragen
Die Verarbeitung Ihrer Anfragen – einschließlich der Generierung der Embeddings, des Abrufs relevanter Dokumente und der Durchführung der Inferenz – erfolgt vollständig auf GWDG-Hardware.
weder Ihre Anfragen noch Ihre indizierten Dokumente werden an Dritte weitergegeben.