Das Mittelstand-Digital Zentrum Fokus Mensch hat daher einen Demonstrator für multilinguale Live- und nachträgliche Transkription mit Speech-to-Text-Modellen entwickelt.
Der Transkriptions-Demonstrator bündelt zwei Nutzungsarten in einer gemeinsamen Anwendung: die nachträgliche Transkription vorhandener Audio- und Videoaufnahmen sowie die Live-Transkription laufender Veranstaltungen. Dies ermöglicht eine automatisierte, nahezu in Echtzeit verfügbare Überführung von Sprache in geschriebenen Text – in einer großen Bandbreite an Sprachen und ohne zusätzliche Hardware. Professionelle Dolmetsch- und Untertitelungsdienste sind zwar verfügbar, aber personalintensiv und bei kurzfristigen oder mehrsprachigen Formaten kaum flächendeckend einsetzbar; moderne Speech-to-Text-Modelle eröffnen hier neue Möglichkeiten, KMU dabei zu unterstützen, ihre Formate barrierearm zugänglich zu machen.
Technische Umsetzung:
Der Demonstrator kombiniert die beiden quelloffenen Werkzeuge Whisper von OpenAI und die darauf aufbauende Erweiterung WhisperLive von Collabora in einer schlanken Anwendung. Für die nachträgliche Transkription können Audio- oder Videodateien hochgeladen werden; das Modell erkennt die Sprache automatisch oder nach manueller Auswahl und erzeugt ein durchsuchbares Textprotokoll. Für die Live-Transkription wird das Mikrofonsignal direkt an ein im Hintergrund laufendes Modell gestreamt, das laufend aktualisierte Textausgaben liefert. Beide Modelle unterstützen eine große Bandbreite an Sprachen und lassen sich lokal betreiben, was für KMU auch aus Datenschutzsicht ein relevanter Vorteil ist.
Anpassungsmöglichkeiten:
Der Demonstrator ist modular aufgebaut und lässt sich leicht an spezifische Anforderungen anpassen. Unternehmen können beispielsweise zwischen automatischer Spracherkennung und manueller Sprachauswahl wählen, die Modellgröße an die verfügbare Rechenleistung anpassen oder die erzeugten Transkripte in bestehende Dokumentations- und Untertitelungsprozesse überführen. Zusätzlich lässt sich ein kollaborativer Betriebsmodus konfigurieren, in dem die automatisch erzeugten Echtzeit-Transkriptionen direkt durch Mitarbeitende geprüft und angepasst werden. Dies ermöglicht eine nahtlose Integration in bestehende Systeme und Prozesse.
Einsatzmöglichkeiten in der Praxis:
Der Transkriptions-Demonstrator eignet sich besonders für KMU, die mehrsprachige Veranstaltungen, Schulungen oder Kundenkommunikation durchführen und diese barrierearm zugänglich machen möchten. Besonders relevant ist er für Agenturen und Dienstleister im Bereich Barrierefreiheit, Dolmetschen und Übersetzen, die automatisierte Transkriptionswerkzeuge in ihre bestehenden Prozesse integrieren wollen, sowie für Bildungseinrichtungen und Unternehmen, die Meetings, Schulungen oder Webinare nachvollziehbar dokumentieren möchten. Erprobt wurde der Demonstrator im Rahmen eines Praxisprojekts mit der Agentur Orelon, die sich auf barrierefreie Kommunikation und Dolmetschdienste für Veranstaltungen und Bildung spezialisiert hat. Dabei wurden beide Betriebsarten systematisch getestet: Ausgewählte Videos wurden sowohl live als auch nachträglich transkribiert und anschließend durch Mitarbeitende von Orelon bewertet.
Fazit:
Mit dem Transkriptions-Demonstrator bietet das Mittelstand-Digital Zentrum Fokus Mensch KMU ein leistungsfähiges Werkzeug, um den Herausforderungen barrierefreier und mehrsprachiger Kommunikation zu begegnen. Die Ergebnisse des Praxisprojekts zeigen, dass vollständig automatisierte Live-Transkriptionen für professionelle Einsatzszenarien noch zu fehleranfällig sind – insbesondere bei Fachterminologie, Dialekten und überlappenden Sprechbeiträgen. Der kollaborative Ansatz, bei dem Mensch und Modell in Echtzeit zusammenarbeiten, erwies sich hingegen als deutlich tragfähiger und bildet eine vielversprechende Grundlage für weiterführende Optimierungen.