Whisper Transkription: Der komplette Guide zu OpenAIs Spracherkennung

Der Modell-Hub für Whisper: alle Versionen im Vergleich, deutsche WER-Werte, Installations-Wege und wann eine gehostete Alternative besser passt — kompakt und mit Quellen.

Whisper Large V3 TurboSprecher-Erkennung inkl.30 Min. gratis

Unterstützte Formate:

MP3WAVM4AMP4OPUSFLAC

Was ist Whisper — in 45 Wörtern

Whisper ist ein Open-Source-Spracherkennungsmodell von OpenAI, veröffentlicht September 2022. Es transkribiert und übersetzt Audio in 99 Sprachen, ist unter MIT-Lizenz frei nutzbar und existiert in 7 Größen von 39M (tiny) bis 1,55B Parametern (large-v3).

Was ist Whisper?

Whisper ist eine Familie automatischer Spracherkennungsmodelle (ASR), entwickelt von OpenAI und erstmals im September 2022 veröffentlicht. Das Modell wurde mit rund 680.000 Stunden mehrsprachigem Audio trainiert — davon etwa 117.000 Stunden nicht-englisches Material — und basiert auf einer Encoder-Decoder-Transformer-Architektur (siehe Whisper-Paper, arXiv:2212.04356).

Der Code ist unter MIT-Lizenz auf GitHub verfügbar; die Modellgewichte liegen auf Hugging Face. Whisper kann nicht nur transkribieren, sondern auch übersetzen (jede der 99 Sprachen → Englisch), Sprache automatisch erkennen und Zeitstempel auf Segment-Ebene liefern. Native Diarization ist nicht enthalten.

Whisper Modell-Versionen im Vergleich

Whisper existiert in sieben Größen. Die Wahl hängt davon ab, wie viel VRAM du hast, wie schnell die Transkription sein soll und welche Genauigkeit du brauchst. Für Deutsch sind medium, large-v2, large-v3 und large-v3-turbo praxisrelevant.

tiny, base, small — Einstieg und Edge

Die kleinen Modelle (39M–244M Parameter) laufen auf jedem Handy oder Raspberry Pi. Sie sind ideal für Prototypen, On-Device-Anwendungen und nicht-kritische Transkriptionen. Für Deutsch ist die WER bei tiny mit ~13 % zu hoch für produktiven Einsatz; small (~6 %) ist ein vernünftiger Einstieg.

medium, large-v2, large-v3 — Produktion

medium (769M) läuft auf einer 8-GB-GPU und liefert für Deutsch ~5 % WER — für viele Anwendungen ausreichend. large-v2 (1,55B) und large-v3 (November 2023) senken die WER auf ~4,5 % und behandeln Umlaute, Fachbegriffe und Zahlen deutlich robuster. large-v3 verbessert vor allem non-English-Sprachen jenseits von Deutsch.

large-v3-turbo — schnell und fast so gut

Im Release v20240930 (Oktober 2024) hat OpenAI large-v3-turbo veröffentlicht — eine destillierte Version von large-v3 mit reduzierten Decoder-Layern (32 → 4). Ergebnis: rund 8× schneller bei minimaler Qualitätsregression auf non-English-Sprachen. Für Deutsch liegt die WER bei ~4,7 %. Der VRAM-Bedarf sinkt von ~10 GB auf ~6 GB. Für die meisten produktiven Anwendungen ist turbo aktuell die beste Wahl.

Vergleichstabelle

ModellParameterVRAMRel. SpeedDeutsche WER
tiny39M~1 GB32×~13 %
base74M~1 GB16×~9 %
small244M~2 GB~6 %
medium769M~5 GB~5 %
large-v21 550M~10 GB~4,5 %
large-v31 550M~10 GB~4,5 %
large-v3-turbo809M~6 GB~4,7 %

WER-Werte für Deutsch basieren auf Common Voice DE und variieren je nach Audioqualität. Quellen: Whisper Paper (arXiv:2212.04356), Modellkarte Hugging Face. Stand August 2026.

Wie gut ist Whisper auf Deutsch?

WER-Benchmarks (Common Voice DE, FLEURS DE)

Im Whisper-Paper (Radford et al., 2022, Tabelle 8 & Anhang) erreicht large-v2 auf FLEURS DE eine WER von ca. 4,5 %; auf Common Voice 9 DE liegt sie bei ~6 %. large-v3 verbessert vor allem Sprachen mit weniger Trainingsdaten — für Deutsch bleibt die WER auf sauberem Audio nahezu identisch, robuster wird das Modell aber bei Hintergrundgeräuschen und Codeswitching (deutsch/englisch gemischt, typisch in Meetings).

Bekannte Schwächen

  • Halluzinationen bei Stille: Bei langen Ruhephasen oder Musik-Overlays generiert Whisper manchmal erfundene Sätze (oft Sätze aus dem Trainingsset wie „Vielen Dank fürs Zuschauen"). Voice-Activity-Detection als Vorstufe entschärft das.
  • Dialekte: Bairisch, Schwyzerdütsch oder starke österreichische Färbung erhöhen die WER spürbar (empirisch 10–20 %). Hochdeutsch mit leichtem Akzent wird gut behandelt.
  • Umlaute und Eszett: ä, ö, ü, ß werden korrekt ausgegeben — hier gibt es praktisch keine Probleme.
  • Zahlen und Fachbegriffe: Medizin- und Rechtsbegriffe sowie mehrstellige Zahlen sind fehleranfälliger als Alltagssprache.

Whisper installieren

Es gibt vier gängige Wege, Whisper lokal auszuführen — je nach Hardware und Anspruch.

pip install (offizieller Weg)

Die von OpenAI empfohlene Referenz-Installation, benötigt Python 3.8+ und ffmpeg im PATH:

pip install -U openai-whisper
whisper audio.mp3 --language de --model medium

Für GPU-Beschleunigung: CUDA-fähige PyTorch-Version passend zur CUDA-Version installieren. Details in der offiziellen README.

whisper.cpp (CPU-optimiert, keine GPU nötig)

whisper.cpp ist eine C++-Portierung, die auf reiner CPU-Basis läuft und Apple Silicon (M-Serie) via Metal beschleunigt. Ideal für MacBooks ohne CUDA-GPU. Die Genauigkeit ist identisch zur Original-Implementierung; die Geschwindigkeit hängt stark vom Prozessor ab.

faster-whisper (CTranslate2, 4× schneller)

faster-whisper nutzt CTranslate2 und ist laut Herstellerangabe rund 4× schneller als openai-whisper bei gleicher WER, mit deutlich geringerem VRAM-Bedarf. Für Batch-Transkription auf einer einzelnen GPU meist die schnellste Option.

Windows vs. Mac vs. Linux

  • Linux: am einfachsten. Python, ffmpeg und CUDA-Toolkit sind über den Paketmanager schnell installiert.
  • Mac (Apple Silicon): whisper.cpp mit Metal-Backend liefert die beste Performance ohne dedizierte GPU.
  • Windows: braucht ffmpeg-Setup (Chocolatey oder manuell) und CUDA-Treiber. Alternative: WSL2 + Linux-Installation.

Whisper API vs. Whisper lokal

Beide Wege nutzen dasselbe Modell — die Unterschiede liegen bei Kosten, Latenz, Datenschutz und Skalierung.

AspektWhisper APIWhisper lokal
Kosten0,006 USD/Min. — siehe OpenAI-Transkription Deep-Dive0 € Software, aber Hardware & Strom
LatenzNetzwerk + VerarbeitungNur Verarbeitung (schneller bei starker GPU)
DatenschutzAudio verlässt Rechner (US-Server)Audio bleibt lokal
SkalierungAutomatisch, RatenlimitsNur eigene Hardware

Whisper Echtzeit / Streaming

Warum Whisper nativ nicht streamt

Whisper wurde für 30-Sekunden-Segmente trainiert und verarbeitet Audio als komplette Blöcke — es gibt kein token-by-token Streaming out of the box. Für Batch-Transkription ist das kein Problem, für Live-Untertitel schon.

whisper_streaming und WhisperLive

Die Community hat zwei Projekte gebaut, die Streaming simulieren: whisper_streaming (chunk-basiert mit LocalAgreement-Policy) und WhisperLive (WebSocket-Server + VAD). Beide funktionieren gut für Demo- und Prototypen-Zwecke; für produktives Live-Streaming mit SLA ist eine speziell dafür gebaute Lösung wie VexaScribe Live-Transkription meist die pragmatischere Wahl.

Whisper Alternativen

Whisper ist nicht die einzige Option. Kurzvergleich der wichtigsten Alternativen für deutschsprachige Transkription:

LösungSelbst-HostingPreisSprecher-ErkennungDE-Genauigkeit
Whisper (open source)JaGratis (MIT)Nein (extern nötig)~95 %
AssemblyAINein (SaaS)ab ~0,37 USD/Std.Ja~93 %
DeepgramNein (SaaS)ab ~0,26 USD/Std.Ja~92 %
VexaScribeNein (SaaS)30 Min. gratis, ab 2 USDJa, bis 50~95 %

Wann Whisper NICHT die richtige Wahl ist

Whisper ist stark — aber nicht universell. Diese Fälle sprechen gegen Whisper:

  • Du brauchst Sprecher-Erkennung out of the box. Whisper hat keine native Diarization. Du müsstest pyannote-audio oder ähnliches zusätzlich einsetzen und die Ergebnisse zusammenführen.
  • Du brauchst echtes Live-Streaming. Whisper ist batch-orientiert; die Community-Streaming-Projekte sind Workarounds, keine Produktivlösungen.
  • Du hast keine GPU und kein Interesse an CLI-Setup. CPU-only-Transkription eines einstündigen Meetings dauert auf einem MacBook Air schnell mehrere Stunden.
  • Du brauchst Produktions-SLA. Open-Source-Software hat keinen Support-Vertrag. Für regulierte Branchen oder unternehmenskritische Workflows ist ein kommerzieller Anbieter mit SLA meist Pflicht.

Whisper ohne Setup nutzen — VexaScribe

Whisper Large V3 Turbo integriert. Sprecher-Erkennung inklusive. 30 Minuten kostenlos, ohne Anmeldung.

Häufige Fragen

Was ist Whisper von OpenAI?

Whisper ist ein Open-Source-Spracherkennungsmodell von OpenAI, veröffentlicht im September 2022. Es transkribiert und übersetzt Audio in 99 Sprachen und wurde mit rund 680.000 Stunden multilingualem Audio trainiert. Das Modell steht unter MIT-Lizenz und ist auf GitHub sowie Hugging Face frei verfügbar.

Ist Whisper kostenlos?

Ja. Whisper ist unter MIT-Lizenz frei nutzbar — auch kommerziell. Du kannst das Modell lokal installieren und ohne API-Gebühren ausführen. Kosten entstehen nur durch die eigene Hardware (GPU) oder wenn du die OpenAI-Whisper-API nutzt (0,006 USD pro Minute, Stand August 2026).

Welche Whisper-Version ist die beste für Deutsch?

Für höchste Genauigkeit auf Deutsch: large-v2 oder large-v3 (WER ~4,5 %). Für schnelleres Prozessieren bei nahezu gleicher Qualität: large-v3-turbo (WER ~4,7 %, aber 8× schneller). Für Edge-Geräte oder CPU-only-Systeme: small oder medium sind ein guter Kompromiss.

Wie genau ist Whisper auf Deutsch (WER)?

Auf sauberem Studio-Audio erreicht Whisper large-v3 eine Word Error Rate (WER) von etwa 4,5 % für Standarddeutsch (Common Voice DE). Bei Alltagsaufnahmen mit Hintergrundgeräuschen liegt die WER typischerweise zwischen 5 % und 9 %. Dialekte wie Bairisch oder Schwyzerdütsch senken die Genauigkeit spürbar.

Kann Whisper in Echtzeit transkribieren?

Nicht nativ. Whisper arbeitet in 30-Sekunden-Segmenten und ist batch-orientiert. Für Live-Transkription gibt es Community-Projekte wie whisper_streaming und WhisperLive, die Streaming durch Chunking simulieren. Für produktives Echtzeit-Streaming ist eine speziell dafür gebaute Lösung meist die bessere Wahl.

Erkennt Whisper mehrere Sprecher (Diarization)?

Nein. Whisper transkribiert Sprache zu Text, unterscheidet aber nicht, wer wann spricht. Für Sprecher-Erkennung musst du zusätzlich Tools wie pyannote-audio einsetzen und die Ergebnisse zusammenführen. VexaScribe bringt Diarization (bis zu 50 Sprecher) direkt integriert mit.

Whisper lokal oder API — was ist besser?

Lokal: kostenlos, maximale Privatsphäre, keine Ratenlimits — dafür GPU nötig und selbst gewartet. API: kein Setup, sofort skalierbar, aber Kosten pro Minute und Audio verlässt deinen Rechner. Faustregel: unter 10 Stunden pro Monat → API, darüber und mit GPU → lokal.

Was ist der Unterschied zwischen large-v3 und turbo?

large-v3-turbo (Oktober 2024) ist eine destillierte Version von large-v3 mit reduzierten Decoder-Layern. Ergebnis: rund 8× schneller bei minimalem Qualitätsverlust. Die Modellgröße sinkt von 1,55 Mrd. auf 809 Mio. Parameter, der VRAM-Bedarf von ~10 GB auf ~6 GB. Für die meisten Anwendungen ist turbo die beste Wahl.