Untertitel-Generator — SRT & VTT automatisch aus Video oder Audio erstellen (kostenlos)
Video oder Audio hochladen und in wenigen Minuten präzise Untertitel in 99 Sprachen mit wortgenauen Zeitstempeln erhalten. Export als SRT, VTT oder TXT — oder mit eigenem Style direkt ins Video einbrennen. 30 Minuten gratis, keine Kreditkarte nötig (subtitle generator auf deutsch).
Unterstützte Formate:
Neu bei Transkription und Untertitelung? Sehen Sie unsere Erklärung Was ist Transkription?
Kurz erklärt
Der VexaScribe-Untertitel-Generator (auto subtitle generator) wandelt jede Audio- oder Videodatei in SRT, VTT, TXT oder eingebrannte Untertitel um — angetrieben von OpenAI Whisper Large-v3 in 99 Sprachen. Auf Deutsch erreicht das Modell laut FLEURS-Benchmark rund 4,5 % Wortfehlerrate (WER). 30 Minuten kostenlos, danach ab 2 $/Monat für 200 Minuten bis 20 $/Monat für 6.000 Minuten — entspricht etwa 0,60 $ bis 0,20 $ pro Stunde Video.
Was ist ein Untertitel-Generator?
Ein Untertitel-Generator ist ein KI-gestütztes Werkzeug, das gesprochene Sprache aus Audio- oder Videodateien erkennt, sie in Text umwandelt und mit exakten Zeitstempeln versieht. Das Ergebnis ist eine Untertiteldatei (typischerweise SRT oder VTT), die synchron zum Bild eingeblendet werden kann — oder direkt in das Video „eingebrannt" wird (Burn-in / Hardcoded Subtitles), sodass sie fester Bestandteil des Bildes werden.
Für Creator, Marketing-Teams, Redaktionen und Hochschulen ersetzt automatische Untertitelung die klassische, oft stundenlange manuelle Arbeit. VexaScribe nutzt OpenAI Whisper Large-v3 — ein Spracherkennungsmodell, das auf 680.000 Stunden Audio in 99 Sprachen trainiert wurde und dabei eine der branchenweit besten Genauigkeiten für Deutsch erreicht.
Untertitel vs. Closed Captions — worin liegt der Unterschied?
Im deutschsprachigen Raum werden die Begriffe oft synonym verwendet, es gibt jedoch einen wichtigen Unterschied — vor allem für Barrierefreiheit nach BITV 2.0 bzw. WCAG 2.1:
| Format | Inhalt | Einsatz |
|---|---|---|
| Untertitel (Subtitles) | Nur Dialog — für Zuschauer:innen, die den Ton hören können | Sprachübersetzung, Sound-off-Feeds in Social Media |
| Untertitel für Hörgeschädigte (Closed Captions, UT) | Dialog + [Musik], [Applaus], [Türklingel], Sprecher-Labels | Barrierefreiheit nach BITV 2.0, WCAG 2.1 SC 1.2.2 / 1.2.4 |
VexaScribe erzeugt beide Varianten: einfache Untertitel oder — mit ein paar Klicks im Editor — barrierefreie Fassungen mit Sprecher-Labels und nonverbalen Ereignissen wie [Applaus] oder [Musik].
Beispiel-Ausgabe: SRT- und VTT-Untertitel
So sieht ein exportierter Untertitel aus einer deutschen Aufnahme aus — Zeitstempel im SRT-Format (Sekunden,Millisekunden), UTF-8, direkt kompatibel mit YouTube Studio, Premiere Pro, DaVinci Resolve und VLC.
Ehrliche Preise — kein Abo-Zwang
Ein einstündiges Video kostet im Basic-Plan (5 $/Monat) rund 0,30 $ zum Untertiteln — inklusive SRT-, VTT- und TXT-Export. Keine Vertragslaufzeit, monatlich kündbar.
Alle Preise ansehen →Manuelle Untertitelung vs. VexaScribe
Manuelle Untertitelung (Aegisub, Subtitle Edit)
- ✗5–8 Stunden Arbeit pro Stunde Audio — Cues manuell setzen und timen
- ✗Timing-Fehler bei jedem Schnitt fallen sofort auf
- ✗Jede Sprache muss separat übersetzt und erneut getimt werden
- ✗Kein Sprecherwechsel-Erkennung — muss manuell markiert werden
- ✗Sonderzeichen, Umlaute, Encoding-Fehler bei .srt üblich
Am besten für Kunstprojekte, sehr kurze Clips oder Fälle mit extrem schlechter Audioqualität
VexaScribe (automatisch mit Whisper Large-v3)
- ✓5–10 Minuten pro Stunde Audio — automatisch mit wortgenauem Timing
- ✓99 Sprachen aus einem Upload, Sprache wird automatisch erkannt
- ✓Bis zu 50 Sprecher:innen automatisch identifiziert und gelabelt
- ✓SRT- und VTT-Export UTF-8-sauber, Umlaute und ß korrekt kodiert
- ✓Editor zum Nachbessern, Cues splitten, Sprecher umbenennen
Am besten für YouTube-Kanäle, Social-Media-Reels, Podcasts, E-Learning, Marketing-Videos, Konferenz-Mitschnitte
So funktioniert der Untertitel-Generator (3 Schritte)
1. Video oder Audio hochladen
Datei per Drag-and-Drop: MP3, WAV, M4A, FLAC (Audio) oder MP4, MOV, MKV, WebM (Video) bis 5 GB. Bei Videos wird die Tonspur automatisch extrahiert.
2. KI erkennt Sprache & timet die Cues
Whisper Large-v3 erkennt Deutsch (inkl. Österreichisch und teils Schweizerdeutsch) automatisch und produziert wortgenaue Zeitstempel. Verarbeitung dauert 20–40 % der Mediendauer.
3. SRT / VTT herunterladen oder einbrennen
Export als SRT, VTT oder TXT — oder Untertitel mit eigener Schrift, Farbe, Position und Karaoke-Effekt direkt ins Video einbrennen (Burn-in).
Welches Untertitelformat für welche Plattform?
Jede Plattform behandelt Untertitel unterschiedlich. Instagram Reels und YouTube Shorts akzeptieren keine Sidecar-SRT-Dateien bei nativem Upload — hier müssen Untertitel direkt ins Video eingebrannt werden. Longform-Videos und Desktop-Plattformen bevorzugen SRT.
| Plattform | Lieferformat | Hinweis |
|---|---|---|
| YouTube (Longform) | SRT | Upload im YouTube Studio → Untertitel. VTT wird ebenfalls akzeptiert. |
| YouTube Shorts | Einbrennen (Burn-in) | Sidecar-SRTs werden vom vertikalen UI beschnitten — für Zuverlässigkeit direkt ins Video einbrennen. |
| Instagram Reels | Einbrennen | Instagram akzeptiert bei Reels kein SRT-Upload (help.instagram.com). Nur einbrennen. |
| TikTok | Einbrennen oder SRT-Basis | Der TikTok-Editor akzeptiert eine SRT-Basis; die meisten Creator brennen für die Style-Kontrolle ein. |
| LinkedIn Video | SRT | SRT-Upload im LinkedIn-Video-Composer. |
| Facebook Video | SRT | Upload über den Creator Studio → Untertitel. |
| Vimeo | SRT oder VTT | Der Vimeo-Player unterstützt beide; SRT ist am einfachsten. |
| Podcast-Plattformen | TXT | TXT für Show Notes und Episoden-Transkripte (Apple Podcasts, Spotify). |
| Unternehmens-LMS | SRT oder VTT | Die meisten LMS (Cornerstone, Docebo, Canvas) akzeptieren beides. VTT bei Bedarf für Positionierung. |
Verifiziert am 3. August 2026 gegen die offiziellen Hilfeseiten von YouTube, Instagram, TikTok, LinkedIn und Vimeo.
SRT-Datei erstellen — kostenlos aus Audio oder Video
Was ist eine SRT-Datei?
SRT (SubRip Text) ist das am weitesten verbreitete Untertitel-Format — eine einfache Textdatei mit nummerierten Cues und Zeitstempeln im Format HH:MM:SS,mmm --> HH:MM:SS,mmm. Kompatibel mit YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve, VLC und praktisch jedem Video-Editor. Wer eine SRT-Datei erstellen möchte (srt untertitel erstellen bzw. untertitel srt erstellen), braucht dafür kein spezielles Programm — VexaScribe erledigt das direkt im Browser.
Kostenlos aus Audio oder Video erstellen — 3 Schritte
- Datei hochladen (MP3, WAV, M4A, MP4, MOV — bis 5 GB)
- KI transkribiert automatisch — Whisper large-v3 erzeugt Wort-für-Wort-Zeitstempel
- Als SRT herunterladen — mit Cue-Splitting (max. 80 Zeichen / 5 Sekunden, Netflix-Standard)
Erste 30 Minuten gratis, keine Anmeldung erforderlich.
Beispiel: Ausgabe einer SRT-Datei
1
00:00:00,120 --> 00:00:03,540
Willkommen zur Präsentation über KI-basierte Untertitelung.
2
00:00:03,780 --> 00:00:07,200
Ich bin Anna Schmidt und wir starten mit den Grundlagen.
3
00:00:07,420 --> 00:00:11,180
SRT-Dateien sind das Standard-Format für Video-Untertitel weltweit.Diese Datei können Sie direkt in YouTube Studio, Premiere Pro oder Final Cut Pro importieren.
Eingebrannte Untertitel gestalten (Burn-in)
Wenn Sie Untertitel direkt ins Video einbrennen (Hardcoded Subtitles), haben Sie die volle Kontrolle über jedes visuelle Detail. Typische Presets für Social-Media-Reels und YouTube Shorts:
- • Schriftart: Inter, Roboto, Montserrat oder Impact (Broadcast-Style). Eigene Fonts per Upload möglich.
- • Größe: 24–48 pt auf vertikalem 1080×1920-Frame; 32–60 pt für aggressive Social-Media-Styles.
- • Farbe: Weißer Text mit schwarzer Kontur oder Markenfarbe mit Schlagschatten für hohe Lesbarkeit.
- • Position: Unteres Drittel (Standard), zentriert oder oberes Drittel — um TikTok-/Reels-UI-Overlays zu vermeiden.
- • Karaoke- / Wort-Highlight: Das gerade gesprochene Wort wird hervorgehoben — analog zu CapCut- und VEED-Presets.
- • Hintergrund: Transparent, deckend oder halbtransparente Pille hinter jedem Cue.
Eingebrannte Untertitel sind vor allem für vertikale Kurzvideos (Reels, Shorts, TikTok) sinnvoll, da über 85 % der Nutzer:innen ohne Ton scrollen und Plattformen dort keine externen Untertitel akzeptieren.
Sprachabdeckung und Genauigkeit
VexaScribe nutzt OpenAI Whisper Large-v3, das 99 Sprachen abdeckt. Die Genauigkeit variiert je nach Sprache und Audioqualität. Die folgende Tabelle zeigt die Wortfehlerrate (WER) auf dem FLEURS-Benchmark — je niedriger, desto besser.
| Sprache | Whisper Large-v3 WER |
|---|---|
| Deutsch (FLEURS) | ~4,5 % |
| Englisch | ~4,2 % |
| Spanisch | ~4 % |
| Französisch | ~4 % |
| Italienisch | ~5 % |
| Niederländisch | ~6 % |
| Portugiesisch | ~5 % |
| Polnisch | ~6 % |
| Türkisch | ~7 % |
| Japanisch | ~7 % |
| Arabisch | ~8 % |
Quelle: Radford et al., Robust Speech Recognition via Large-Scale Weak Supervision, arXiv:2212.04356, Tabelle 5. WER gemessen auf FLEURS-/CommonVoice-Benchmarks. Reale Aufnahmen mit Hintergrundgeräuschen, starken Akzenten oder Fachterminologie zeigen naturgemäß höhere WER-Werte.
Untertitel nachbearbeiten (Editor)
Jedes Untertitelprojekt öffnet sich in einem Editor mit synchronem Videopreview. Sie können:
- • Missverstandene Wörter per Klick korrigieren — Zeitstempel werden automatisch angepasst.
- • Cues an Wortgrenzen splitten oder zusammenführen für bessere Lesbarkeit.
- • Sprecher umbenennen (z. B. „Moderator", „Gast 1") — Labels bleiben im SRT-Export erhalten.
- • Cue-Dauer anpassen, um dramatische Pausen oder schnelle Dialoge korrekt abzubilden.
- • Non-verbale Notation wie [Applaus] oder [Musik] für Barrierefreiheit einfügen.
- • Erneut als SRT, VTT, TXT oder gerendertes MP4 exportieren — ohne die Transkription neu zu berechnen.
Für YouTube-spezifische Untertitel-Extraktion (bestehende Untertitel herunterladen statt neu generieren) siehe YouTube Transkript.
Kernfunktionen im Überblick
Alles, was Sie für professionelle Untertitel aus Video oder Audio brauchen — in einem Tool.
99 Sprachen inkl. Deutsch
Whisper Large-v3 mit ~4,5 % WER auf Deutsch (FLEURS). Automatische Spracherkennung — kein manuelles Umstellen nötig.
SRT, VTT, TXT & Burn-in
Alle gängigen Untertitelformate aus einem Upload. Für YouTube, Vimeo, LinkedIn, DaVinci Resolve, Premiere Pro und CapCut.
Bis zu 50 Sprecher:innen
Automatische Sprechererkennung labelt jede:n Sprecher:in — beste Genauigkeit bei 2 bis 6 Sprecher:innen.
Wortgenaue Zeitstempel
Cue-Start und -Ende liegen auf tatsächlichen Wortgrenzen, nicht auf interpolierten Segmentmitten.
Editor mit Videopreview
Korrekturen per Klick, Sprecher umbenennen, Cues splitten — Änderungen sofort im Preview sichtbar.
Datei-Größe bis 5 GB
Lange Konferenzmitschnitte, Vorlesungen oder Interviews werden ohne Zerlegung verarbeitet.
Häufig gestellte Fragen
Wie erstelle ich Untertitel aus Audio?
Laden Sie Ihre Audio- oder Videodatei per Drag-and-Drop oder über den Dateibrowser in VexaScribe hoch. Unsere KI-Transkriptions-Engine verarbeitet die Datei, erkennt gesprochene Wörter mit präzisen Zeitstempeln und erstellt eine Untertiteldatei. Nach Abschluss können Sie als SRT- oder VTT-Format exportieren — beide sind kompatibel mit YouTube, TikTok, LinkedIn und den meisten Videobearbeitungsprogrammen. Der gesamte Vorgang dauert bei den meisten Dateien nur wenige Minuten.
Wie erstelle ich eine SRT-Datei kostenlos aus einem Video?
Mit VexaScribe: MP4, MOV oder WebM hochladen → automatische Transkription mit Whisper large-v3 → SRT-Export mit Cue-Splitting nach Netflix-Standard (max. 80 Zeichen / 5 Sekunden). Erste 30 Minuten gratis, keine Kreditkarte erforderlich. Die Ausgabe ist kompatibel mit YouTube Studio, Premiere Pro, Final Cut Pro, DaVinci Resolve und VLC — Sie können die SRT-Datei direkt importieren, ohne manuelle Nachbearbeitung des Timings.
Welche Untertitelformate unterstützt VexaScribe?
VexaScribe exportiert Untertitel in den Formaten SRT (SubRip) und VTT (WebVTT). SRT ist das am weitesten verbreitete Format und funktioniert mit YouTube, Premiere Pro, DaVinci Resolve, Final Cut Pro und den meisten Social-Media-Plattformen. VTT ist das web-native Format für HTML5-Videoplayer und wird ebenfalls von YouTube und anderen Plattformen akzeptiert.
Wie genau sind KI-generierte Untertitel?
Die Genauigkeit hängt von der Audioqualität, Hintergrundgeräuschen und der Deutlichkeit des Sprechers ab. Bei klaren Aufnahmen mit minimalen Hintergrundgeräuschen liefert VexaScribe in der Regel eine hohe Genauigkeit, die für den professionellen Einsatz geeignet ist. Sie können Untertitel im integrierten Editor überprüfen und bearbeiten, bevor Sie sie exportieren. Bei Inhalten mit starken Akzenten oder Fachbegriffen empfiehlt sich eine kurze Überprüfung.
Kann ich Untertitel in verschiedenen Sprachen erstellen?
Ja, VexaScribe erstellt Untertitel in 99 Sprachen, darunter Englisch, Spanisch, Französisch, Deutsch, Portugiesisch, Italienisch, Chinesisch, Japanisch, Koreanisch, Arabisch, Hindi und viele weitere. Die Sprache wird automatisch aus dem Audio erkannt, oder Sie können sie manuell angeben, um die besten Ergebnisse zu erzielen.
Was ist der Unterschied zwischen SRT- und VTT-Untertiteldateien?
SRT (SubRip) ist das am häufigsten verwendete Untertitelformat — einfach, universell und von praktisch jeder Videoplattform und jedem Editor akzeptiert. VTT (WebVTT) ist das neuere web-native Format, das zusätzliche Gestaltungsmöglichkeiten wie Schriftfarbe und Positionierung unterstützt. Für die meisten Anwendungsfälle ist SRT die sicherere Wahl. Wählen Sie VTT, wenn Sie Web-Wiedergabe oder benutzerdefinierte Gestaltung benötigen.
Kann ich Untertitel vor dem Download bearbeiten?
Ja. Nach der Transkription können Sie das vollständige Transkript im integrierten Editor von VexaScribe überprüfen und bearbeiten. Korrigieren Sie Wörter, passen Sie das Timing an, benennen Sie Sprecher um und exportieren Sie dann die korrigierte Version als SRT oder VTT. So erhalten Sie Untertitel in professioneller Qualität ohne manuelles Timing.
Welche Video- und Audioformate kann ich hochladen?
VexaScribe akzeptiert alle gängigen Audioformate (MP3, WAV, M4A, FLAC, OGG, AAC) und Videoformate (MP4, MOV, AVI, MKV, WebM). Bei Videodateien wird die Audiospur automatisch extrahiert. Dateien bis zu 5 GB werden unterstützt.
Was kostet die Untertitelerstellung?
Die Untertitelerstellung nutzt die gleiche Preisgestaltung wie die Transkription. Die kostenlose Testversion umfasst 30 Minuten. Bezahlpläne beginnen bei 2 $/Monat für 200 Minuten (Starter), 5 $/Monat für 1.000 Minuten (Basic), 10 $/Monat für 2.500 Minuten (Pro) und 20 $/Monat für 6.000 Minuten (Studio). Ein 1-stündiges Video kostet im Basic-Plan etwa 0,30 $ für die Untertitelung.
Wie werden die Untertitel-Cues dimensioniert? Sind sie auf dem Bildschirm lesbar?
VexaScribe verarbeitet jeden Untertitel-Export mit einem wortbasierten Cue-Splitting-Algorithmus. Cues sind auf ca. 80 Zeichen und 5 Sekunden begrenzt (10 Sekunden harte Obergrenze) — entsprechend dem lesbaren Web-Untertitelbereich, der von Descript, Sonix und Vimeo verwendet wird. Splits bevorzugen Satzgrenzen, dann Kommas, dann Wortgrenzen. Sprecher-Labels bleiben bei jedem Split erhalten. Dateien importieren sauber in YouTube, Premiere Pro, Final Cut Pro, DaVinci Resolve und VLC ohne manuelle Nachbearbeitung.
Bleiben die Untertitel synchron mit der tatsächlichen Sprache?
Ja. VexaScribe verwendet echte Wort-für-Wort-Zeitstempel der Transkriptions-Engine — die Cue-Start- und Endzeiten liegen auf tatsächlichen Wortgrenzen, nicht auf interpolierten Schätzungen über einen langen Segment. Dramatische Pausen in der Sprache (motivierende Reden, Hörbücher) bleiben erhalten: der Cue bleibt auf dem Bildschirm über die Stille hinweg, statt einen Sub-Sekunden-Blitz gefolgt von einem leeren Bildschirm zu erzeugen.
Verwandte Seiten
MP3 zu Text
MP3-Audiodateien direkt in Text umwandeln — für Podcasts, Diktate, Voice Memos.
Video zu Text
MP4, MOV, MKV oder WebM in Text konvertieren — Tonspur wird automatisch extrahiert.
Audio transkribieren
Alle Audioformate transkribieren — WAV, M4A, FLAC, OGG und mehr.
Meeting-Transkription
Zoom-, Teams- und Google-Meet-Aufnahmen mit Sprecher-Labels transkribieren.
VexaScribe nutzt OpenAI Whisper Large-v3 für die Sprach-zu-Text-Umwandlung. Auf dem FLEURS-Benchmark erreicht das Modell für Deutsch ~4,5 % Wortfehlerrate (Radford et al., „Robust Speech Recognition via Large-Scale Weak Supervision“, arXiv:2212.04356, Tabelle 5). Reale Genauigkeit hängt von Audioqualität, Sprecheranzahl, Akzenten und Fachterminologie ab. „OpenAI“ und „Whisper“ sind Marken der jeweiligen Rechteinhaber. YouTube, TikTok, Instagram, LinkedIn, Vimeo, Premiere Pro, Final Cut Pro und DaVinci Resolve sind Marken der jeweiligen Anbieter — sie stehen in keinerlei geschäftlicher Verbindung zu VexaScribe.