Voice AI
Eines der herausragenden Angebote von KISSKI ist sein KI-basiertes Transkriptions- und Untertitelungsdienst, Voice AI. Mit Hochleistungsrechnen (HPC) nutzt Voice AI das Whisper-Modell (large-v2), um Audio schnell zu transkribieren und Videountertitel zu generieren. Auf 680.000 Stunden beschrifteten Daten trainiert, erreicht Whisper die Leistung professioneller menschlicher Transkribenten und bietet zuverlässige automatische Spracherkennung (ASR) und Sprachübersetzung über verschiedene Datensätze und Bereiche hinweg. Benutzer können zwischen Aufgaben wie Transkription und Übersetzung wählen, um ihre Bedürfnisse zu erfüllen. Besonders bemerkenswert ist, dass dieser KISSKI-Dienst kostenlos zur Verfügung steht.
Tipp
Sie benötigen ein Academic Cloud-Konto, um auf die KI-Dienste zugreifen zu können.
Verwenden Sie die federierte Anmeldung oder erstellen Sie ein neues Konto. Details finden Sie auf dieser Seite.
Dienstkomponenten
Dieser Dienst besteht aus zwei Hauptteilen:
- Verarbeitung hochgeladener Audio-Dateien: Verarbeitet Audio-Dateien, die von Nutzern hochgeladen wurden (<500 MB).
- Verarbeitung von Streaming-Audio: Erfasst und verarbeitet Streaming-Audio aus dem Browser (dieser Teil wird in Zukunft verfügbar sein).
Audio-Datei-Transkriptions-/Übersetzungs-Dienst
Wenn Sie ein Academic Cloud-Konto besitzen, kann die Web-Oberfläche auch einfach hier erreicht werden.

Die Plattform bietet intuitive, integrierte Funktionen, die für eine nahtlose Audioverarbeitung konzipiert sind:
- Eingabesprache: Wählen Sie die Sprache des hochgeladenen Audios für die Transkription.
- Textformat: Wählen Sie das Ausgabeformat, das Text, SRT oder VTT sein kann.
- Sprecher-Diariisierung: Aktivieren Sie die WhisperX-Diariisierung, um Sprecher in der Transkription zu identifizieren und zu kennzeichnen.
- Datei auswählen: Laden Sie Ihre Audio-Datei hoch, die im Format wav, mp3 oder mp4 vorliegen kann.
- KI-generierte Zusammenfassung: Bietet eine präzise Zusammenfassung Ihrer Transkription oder Übersetzung mithilfe von Chat AI. Die Ausgabe wird ausschließlich im IndexedDB des Benutzers gespeichert.
- Ausgabe löschen: Löschen Sie die Transkriptionsergebnisse sofort und dauerhaft.
- Hell/Dunkelmodus (Sonne/Mond-Button): Wechseln Sie zwischen hellen und dunklen Modus.
- Fußzeile: Enthält „Datenschutzerklärung“, „Nutzungsbedingungen“, „FAQ“, Kontakt und die Möglichkeit, zwischen Deutsch und Englisch zu wechseln.
Kernfunktionen
- Transkription von englischsprachigem Audio mit angehängten Zeitstempeln (abhängig vom gewählten Ausgabeformat).
- Transkription von nicht-englischsprachigem Audio, unterstützt mehrere Sprachen, einschließlich Deutsch.
- Übersetzung von Audio aus verschiedenen Sprachen ins Englische.
- Sprecher-Diariisierung mit WhisperX.
- Zusammenfassung.
So nutzen Sie den Dienst
- Wählen Sie die Eingabesprache des Audios.
- Wählen Sie das Ausgabeformat (Normaler Text/SRT/VTT).
- Aktivieren Sie die Diariisierung, falls Sie Sprecherbezeichnungen wünschen.
- Laden Sie Audio-Dateien in verschiedenen Formaten wie mp3, mp4, flac oder wav hoch.
- Wählen Sie zwischen Transkription oder Übersetzung.
- Die Ausgabe kann heruntergeladen werden, sobald die Transkription abgeschlossen ist.
- Eine Zusammenfassung der Transkription/Übersetzung kann auf Anfrage erstellt werden.
Streaming-Audio-Transkriptions-Dienst (Beta)
Dieser browserbasierte Tool bietet Echtzeit-Transkription oder Übersetzung ins Englische während Meetings und Vorlesungen, was Klarheit, Zugänglichkeit und Engagement erhöht – besonders in lauten oder mehrsprachigen Umgebungen. Er unterstützt gehörlose und schwerhörige Teilnehmer, Sprachlernende sowie alle, die bessere Notizen oder eine bessere Inhaltsüberprüfung benötigen. Keine Installation erforderlich, funktioniert in jedem Browser. Transkriptionen und Zusammenfassungen werden in einer gemeinsamen Etherpad Lite-URL gespeichert, die beim Sitzungsbeginn generiert wird, was gemeinsame Bearbeitung und Überprüfung ermöglicht. Etherpad Lite ist ein Open-Source-Editor, der mehreren Nutzern erlaubt, gleichzeitig am selben Dokument zu arbeiten, wodurch die Kommunikation inklusiver und effizienter wird.
Intuitive, integrierte Funktionen umfassen:
- Sitzung starten: Beginnt die Transkription und generiert eine Pad-URL.
- Sitzung beenden: Beendet die aktuelle Sitzung.
- Modus: Wählen Sie zwischen Transkription oder Übersetzung ins Englische.
- Gesprochene Sprache: Standardmäßig automatische Erkennung, oder manuelle Auswahl einer Sprache.
- Untertitel-Overlay: Öffnet ein abgetrenntes Fenster, um Untertitel über jede Webseite zu zeigen.
- Finalisieren & Zusammenfassen: Generiert eine Zusammenfassung direkt im Pad.
- Hell/Dunkelmodus: Wechseln Sie zwischen hellen und dunklen Themen (Sonne/Mond-Symbol).
- Fußzeile: Enthält Links zu Datenschutzerklärung, Nutzungsbedingungen, Impressum, FAQ, Hilfe, Kontakt und Sprachwechsel (Englisch/Deutsch).
Datenschutz und Flexibilität gewährleisten
Wir legen Wert auf Sicherheit, um Zuverlässigkeit, regulatorische Compliance und Geschäftskontinuität zu gewährleisten. Der Datenschutz der Nutzer steht im Mittelpunkt unserer Gestaltung. Audio- und Gesprächseingaben werden unmittelbar nach der Transkription oder Übersetzung gelöscht.
Ausnahmen:
- Transkriptions-Ergebnisse: Auf unserem Datenübertragungs-Knoten gespeichert, nach 30 Tagen gelöscht. Voice AI Ausgaben können auch über eine spezielle Löschschaltfläche sofort und dauerhaft gelöscht werden.
- Live-Transkriptions-Ergebnisse (zukünftige Funktion): In MySQL gespeichert, automatisch nach 24 Stunden gelöscht.
- Nutzungsaufzeichnung: Wir protokollieren Anzahl der Anfragen und Zeitstempel pro Benutzer für Systemüberwachung und Abrechnung.
Anerkennung
Jakob Hördt für die Entwicklung des Proxys.
Marcel Hellkamp für die Entwicklung des BBB-Audio-Untertitelungs-Codes.
Ali Doost Hosseini für den Kong-Gateway.
Johannes Biermann für technische Unterstützung.
Autor
Narges Lux
Weitere Dienste
Falls Sie Fragen haben, lesen Sie zunächst die FAQ.
Falls Sie spezifischere Fragen haben, kontaktieren Sie uns gerne unter support@gwdg.de.
