Audio transkribieren

Sprache mit KI in Text umwandeln (Whisper)

Keine Datenbank: AIMRAN speichert weder deine Dateien noch Texte oder Ergebnisse

Was ist Audio transkribieren?

Dieses Tool verwandelt das Gesprochene in einer Audio- oder Videodatei in geschriebenen Text: Interviews, Vorlesungen, Meetings, Sprachnachrichten oder Videos, für die du Untertitel brauchst.

Es nutzt Whisper, ein KI-Modell zur Spracherkennung. Du kannst zwischen einem schnellen und einem genaueren Modus wählen und das Ergebnis als Text oder als Untertiteldatei mit den Zeiten jedes Satzes herunterladen.

So funktioniert es

  1. Lade die Audio- oder Videodatei hoch, die du transkribieren möchtest.
  2. Wähle das Modell: Schnell oder Genau.
  3. Wähle die Sprache: Automatisch, Spanisch oder Englisch.
  4. Klicke auf Transkribieren und warte, bis es fertig ist.
  5. Kopiere oder lade den Text herunter, oder lade die Untertitel als SRT oder VTT herunter.

Vorteile

Technische Details

Die Transkription nutzt die Modelle Whisper tiny (etwa 45 MB) und Whisper base (etwa 80 MB) von onnx-community, auf 8 Bit quantisiert und mit Transformers.js ausgeführt, mit WebGPU-Beschleunigung, wenn verfügbar, und sonst über die CPU (WASM). Das Modell wird nur beim ersten Mal heruntergeladen. Das Audio wird dekodiert, auf Mono heruntergemischt und auf 16 kHz neu abgetastet, die Eingabe, die Whisper erwartet. Die Sprache kann automatisch erkannt oder auf Spanisch oder Englisch festgelegt werden. Du erhältst den vollständigen Text sowie Segmente mit Start und Ende, exportierbar als TXT, SubRip (.srt) und WebVTT (.vtt). Audio unter 0,3 s wird nicht verarbeitet. Limit von 300 MB pro Datei; lange Aufnahmen können mehrere Minuten dauern.

Häufige Fragen

Wie wandle ich Audio kostenlos in Text um?

Lade die Audiodatei hoch, wähle Modell und Sprache und klicke auf Transkribieren. Danach kannst du den Text kopieren oder als TXT herunterladen.

Kann ich Untertitel für ein Video erstellen?

Ja. Lade das Video hoch, transkribiere es und lade die SRT- oder VTT-Datei herunter, die die Zeiten jedes Satzes enthält.

Was ist der Unterschied zwischen dem Modell Schnell und Genau?

Schnell nutzt Whisper tiny: kleinerer Download und schnelleres Ergebnis, mit etwas weniger Genauigkeit. Genau nutzt Whisper base: Es dauert länger, macht aber weniger Fehler.

In welchen Sprachen funktioniert es?

Du kannst Spanisch oder Englisch festlegen oder Automatisch lassen, damit das Modell die Sprache erkennt.

Warum dauert es beim ersten Mal länger?

Weil das KI-Modell (45 oder 80 MB) heruntergeladen wird. Danach ist es bereits verfügbar und startet schneller.

Weitere Tools: Audio