Werkzeuge
Übersicht
Dieses Dokument beschreibt einen benutzerdefinierten, multimodalen Werkzeug-Server, der auf der GWDG-Infrastruktur gehostet wird. Er bietet zentrale KI-Funktionen: Bildgenerierung, Bildbearbeitung, Text-zu-Sprache (TTS) und Web-Suche, die direkt über die Chat AI-Oberfläche zugänglich sind. Diese Werkzeuge sind darauf ausgelegt, die Benutzerinteraktion zu bereichern, indem sie die dynamische Erstellung und Transformation von Medien innerhalb von Gesprächsworkflows ermöglichen.
Voraussetzungen
Um den Werkzeug-Server nutzen zu können, müssen folgende Bedingungen erfüllt sein:
- Standard-LLM: Das System sollte idealerweise Qwen3-30B-A3B-Instruct-2507 als aktives Sprachmodell verwenden, um optimale Leistung zu erzielen.
- Werkzeugaktivierung: Die Werkzeuge müssen in der Chat AI-Oberfläche aktiviert werden, indem das Feld „Werkzeuge aktivieren“ im Einstellungsfeld angekreuzt wird.
Die Web-Suche ist separat aktivierbar, da sie dazu führen kann, dass Daten an externe Diensteanbieter gesendet werden.
Um sie zu aktivieren, aktivieren Sie die Checkboxen „GWDG-Werkzeuge“ und „Web-Suche“ im Seitenleistenbereich, wie im folgenden Screenshot gezeigt.
Sobald aktiviert, kann der Agent Werkzeuge basierend auf dem Benutzerintention entdecken und aufrufen.
Verfügbare Werkzeuge
| Werkzeugname | Beschreibung |
|---|---|
generate_image | Generiert Bilder aus Textprompts mit dem FLUX.1-schnell-Modell |
edit_image | Führt Bearbeitungen an bestehenden Bildern durch (z. B. Inpainting, Maskierung, Stilübertragung) mit Qwen-Image-Edit-2511 |
speak_text | Konvertiert Text in Sprache mit dem XTTSv2-Modell |
web_search_preview | Nutzt einen Web-Suchdienst, z. B. Google, um zusätzliche Informationen zu einer von der KI bereitgestellten Anfrage bereitzustellen |
Web-Suche
Das Web-Suchwerkzeug ermöglicht es der KI, aktuelle Informationen aus dem Internet abzurufen, um ihre Antworten zu verbessern. Wenn aktiviert, kann die KI Suchanfragen basierend auf Ihrer Frage und dem gesamten Gesprächsverlauf generieren, diese an eine Suchmaschine (z. B. Google) senden und die abgerufenen Ergebnisse nutzen, um genauere und aktuellere Antworten zu liefern. Dies ist besonders nützlich für Themen, bei denen aktuelle oder sich schnell ändernde Informationen wichtig sind.
Die Web-Suche ist für extern gehostete Modelle nicht verfügbar. Sie müssen das Modell gegebenenfalls explizit auffordern, die Suche im Internet durchzuführen, damit ein solcher Werkzeugaufruf erfolgt.
Nutzungsszenario
Sobald die Werkzeuge aktiviert sind, folgt der Agent einem strukturierten Ablauf, um die Benutzereingabe zu interpretieren und das passende Werkzeug aufzurufen:
Werkzeug-Erkennung
Der Agent listet verfügbare Werkzeuge und deren Fähigkeiten auf.
Beispiel: „Welche Werkzeuge kann ich nutzen?“ → Agent antwortet mitgenerate_image,edit_image,speak_text.Werkzeug-Auswahl
Basierend auf dem Benutzerintention wählt der Agent das passende Werkzeug aus.
Beispiel: „Erstelle ein Bild eines leuchtenden Qualle im Weltraum“ → Agent wähltgenerate_image.Aufruf
Der Agent sendet eine strukturierte Eingabedatenmenge an den Werkzeug-Server.
Beispiel:Antwortverarbeitung
Der Agent erhält die Ausgabe und zeigt sie in der Benutzeroberfläche an oder speichert sie für weitere Verwendung.Weitere Beispiele
- „Ändere dieses Bild in Van-Gogh-Stil“ →
edit_image→ führt Stilübertragung durch
- „Erstelle Audio aus diesem Text: ‚Willkommen bei GWDG. Ihre Forschung zählt.‘“ →
speak_text→ spielt Audio ab
- „Ändere dieses Bild in Van-Gogh-Stil“ →




