OpenAI Transkription API — Whisper API, GPT-4o-transcribe & Mini im Vergleich (2026)
OpenAI bietet drei Transkriptions-Endpunkte: die klassische Whisper API (whisper-1), die neuere gpt-4o-transcribe (Streaming + höchste Qualität) und gpt-4o-mini-transcribe (günstig und schnell). Dieser Guide vergleicht Preise, Latenz, Sprachunterstützung und DSGVO-Optionen für EU-Entwickler.
Unterstützte Formate:
Die OpenAI Transkription API in 50 Wörtern
Die OpenAI Transkription API umfasst drei Endpunkte: whisper-1 (klassisch, kein Streaming, 0,006 USD/Min), gpt-4o-transcribe (höchste Qualität, Streaming, teurer) und gpt-4o-mini-transcribe (günstiger, schnellere Latenz). Für DSGVO-Compliance kann Azure OpenAI (Frankfurt oder Sweden Central) statt api.openai.com genutzt werden.
OpenAI Transkription auf einen Blick
Stand: 2026-08-09- 3 Endpunkte: whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe
- 99 Sprachen inkl. Deutsch, WER ~4,5 %
- Max. Dateigröße: 25 MB pro Request
- Streaming: nur gpt-4o-transcribe & mini
- EU-Residenz: Azure OpenAI Frankfurt / Sweden Central oder OpenAI EU Data Zones (Enterprise)
Die drei OpenAI-Endpunkte im Vergleich
OpenAI bietet drei Wege, Audio in Text zu wandeln. Die Wahl hängt von Latenz-Anforderung, Budget und gewünschter Qualität ab.
Whisper API (whisper-1) — klassisch, batch-only
Der ursprüngliche Transkriptions-Endpunkt, verfügbar seit März 2023. Nutzt intern das Whisper large-v2-Modell, arbeitet batch-orientiert (kein Streaming). Preis 0,006 USD pro Audio-Minute (Preisliste, Stand August 2026). Beste Wahl für einfache Batch-Transkription mit vorhersehbarer Kostenkalkulation. Endpunkt: POST /v1/audio/transcriptions.
gpt-4o-transcribe — höchste Qualität, multimodal, Streaming
Auf GPT-4o basierend, unterstützt Streaming und liefert laut OpenAI höhere Genauigkeit bei komplexen Aufnahmen (mehrere Sprecher, Hintergrundgeräusche, Fachbegriffe). Steuerung über Prompt-Instruktionen möglich — z. B. „Gib medizinische Fachbegriffe korrekt wieder". Abrechnung token-basiert (Audio-Input-Tokens + Text-Output-Tokens), damit variabler als whisper-1. Aktuelle Preise siehe platform.openai.com/docs/pricing. Verfügbarkeit und Modell-Details unter platform.openai.com/docs/models.
gpt-4o-mini-transcribe — günstig, schnell
Die abgespeckte Variante von gpt-4o-transcribe: schnellere Latenz, deutlich geringere Kosten, kleine Genauigkeitsregression. Beste Wahl für Voice-Bots, Echtzeit-Assistenten und Anwendungen, in denen Latenz vor Perfektion geht. Ebenfalls Streaming-fähig.
Vergleichstabelle
| Endpunkt | Modell | Streaming | Preis pro Min | Sprachen | Best For |
|---|---|---|---|---|---|
| whisper-1 | Whisper large-v2 | Nein | 0,006 USD | 99 | Batch, vorhersehbare Kosten |
| gpt-4o-transcribe | GPT-4o (Audio) | Ja | aktuell etwa 0,006 USD (token-basiert) | 99 | Höchste Qualität, Prompting |
| gpt-4o-mini-transcribe | GPT-4o mini (Audio) | Ja | günstiger (token-basiert) | 99 | Low-Latency, Voice-Bots |
Preise können sich ändern — bei platform.openai.com/docs/pricing verifizieren. Stand: 2026-08-09.
Preise — was kostet OpenAI Transkription wirklich?
whisper-1 wird pro Audio-Minute abgerechnet — einfach zu kalkulieren. Die gpt-4o-Endpunkte rechnen token-basiert; das macht die Kosten schwerer vorhersagbar, weil sie mit Länge und Struktur des Outputs variieren. Faustregel:
| Volumen | whisper-1 | gpt-4o-transcribe (Schätzung) |
|---|---|---|
| 10 Stunden/Monat | ~3,60 USD | ~3,60–5,50 USD |
| 100 Stunden/Monat | ~36 USD | ~36–55 USD |
| 1000 Stunden/Monat | ~360 USD | ~360–550 USD |
Stand: 2026-08-09. Preise können sich ändern — bitte bei api.openai.com/pricing verifizieren. Schätzungen für gpt-4o-transcribe basieren auf typischen Deutsch-Ausgaben (~150 Wörter/Min).
Code-Beispiele
Alle Beispiele nutzen den offiziellen openai-SDK v1+. Der Endpunkt heißt in allen SDKs audio.transcriptions.create.
Python — whisper-1
from openai import OpenAI
client = OpenAI()
with open("audio.mp3", "rb") as f:
transcript = client.audio.transcriptions.create(
model="whisper-1",
file=f,
language="de",
response_format="verbose_json",
)
print(transcript.text)Node.js — whisper-1
import OpenAI from "openai";
import fs from "fs";
const client = new OpenAI();
const transcript = await client.audio.transcriptions.create({
model: "whisper-1",
file: fs.createReadStream("audio.mp3"),
language: "de",
response_format: "verbose_json",
});
console.log(transcript.text);curl — whisper-1
curl https://api.openai.com/v1/audio/transcriptions \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: multipart/form-data" \
-F file="@audio.mp3" \
-F model="whisper-1" \
-F language="de"Python — gpt-4o-transcribe mit Streaming
from openai import OpenAI
client = OpenAI()
with open("audio.mp3", "rb") as f:
stream = client.audio.transcriptions.create(
model="gpt-4o-transcribe",
file=f,
language="de",
response_format="text",
stream=True,
)
for event in stream:
if hasattr(event, "delta"):
print(event.delta, end="", flush=True)DSGVO und EU-Datenresidenz
Die reguläre api.openai.com läuft primär auf US-Infrastruktur. DSGVO-Konformität ist über den EU-US Data Privacy Framework grundsätzlich möglich, aber prüfbedürftig. Für strikte EU-Residenz gibt es zwei Wege:
OpenAI EU Data Zones
Für Enterprise-Kunden bietet OpenAI seit Anfang 2025 EU Data Zones — Audio und Metadaten werden ausschließlich in europäischen Rechenzentren verarbeitet. Details und Sicherheitsdokumentation unter trust.openai.com. Nicht für alle Tarife verfügbar — bei Sales-Team anfragen.
Azure OpenAI Frankfurt / Sweden Central
Der Azure OpenAI Service stellt whisper-1 und gpt-4o-transcribe in den Regionen Germany West Central (Frankfurt) und Sweden Central bereit — Daten verlassen die EU nicht. Rechnungsstellung über den bestehenden Azure-Vertrag mit AVV. Verfügbarkeit pro Modell und Region unter learn.microsoft.com/azure/ai-services/openai/concepts/models.
Entscheidungsbaum
- Nicht-personenbezogene Aufnahmen: api.openai.com direkt ist meist ausreichend.
- Personenbezogene Daten, kleines Volumen: api.openai.com mit AVV nach EU-US Data Privacy Framework.
- Strikte EU-Residenz (Enterprise): OpenAI EU Data Zones oder Azure OpenAI Frankfurt/Sweden.
- Höchste Datensouveränität: Whisper selbst hosten (siehe Whisper-Guide).
Praktische Grenzen und Fallstricke
- 25 MB Datei-Limit: Größere Aufnahmen müssen in Chunks aufgeteilt werden — bevorzugt an Stille-Grenzen (pydub, VAD). Details unter platform.openai.com/docs/guides/speech-to-text.
- Rate Limits: Requests pro Minute hängen von der Nutzungsstufe ab (Tier 1 → Tier 5). Bei Batch-Verarbeitung sollten Sie exponential backoff einbauen.
- Response Formats: `json`, `verbose_json` (mit Segment-Zeitstempeln), `text`, `srt`, `vtt`. `verbose_json` ist für Editor-Workflows die vielseitigste Wahl.
- Language auto-detection: Ohne language-Parameter erkennt Whisper die Sprache aus den ersten 30 Sekunden. Bei kurzen deutschen Aufnahmen (<30 s) empfiehlt sich das explizite Setzen von `language="de"` — sonst Fehl-Detektion möglich.
- Halluzinationen bei Stille: Whisper kann bei längeren Ruhephasen erfundene Sätze ausgeben. Voice-Activity- Detection (VAD) als Vorstufe reduziert das.
Whisper API vs. lokales Whisper — Entscheidungsmatrix
OpenAI Whisper API
- Kein Setup, sofort einsatzbereit
- Automatische Skalierung
- Kosten pro Minute (0,006 USD)
- Audio verlässt Rechner (US, ggf. EU-Zone)
- Ratenlimits pro Tier
- 25 MB pro Datei
Whisper lokal
- Einmaliges Setup (Python + GPU)
- Skaliert nur mit eigener Hardware
- Keine laufenden Kosten
- Audio bleibt lokal — höchste Datensouveränität
- Keine Ratenlimits
- Keine Dateigrößen-Beschränkung
Faustregel: unter ~10 Stunden pro Monat → API, darüber und mit vorhandener GPU → lokal. Details und Installations-Anleitung im Whisper-Transkription-Guide.
Wann OpenAI API nicht die richtige Wahl ist
Die OpenAI-API deckt viele Fälle ab, ist aber nicht immer optimal. Die wichtigsten Alternativen:
AssemblyAI & Deepgram
Beide bieten native Sprecher-Erkennung, PII-Redaktion und Streaming ohne die 25-MB-Grenze. Deepgram punktet mit sehr niedriger Latenz, AssemblyAI mit starken Zusatzmodulen (Kapitelerkennung, Entitätsextraktion). Beide sind US-basiert, bieten aber Enterprise-EU-Optionen.
Azure Speech-to-Text (nicht Azure OpenAI)
Der klassische Azure-Speech-Dienst hat Diarization out-of-the-box, EU-Regionen und Custom-Speech-Training für Fachvokabular. Für deutsche Enterprise-Umgebungen mit bestehendem Microsoft-Vertrag oft die pragmatischste Wahl.
Self-hosted Whisper
Für hohe Volumen ohne laufende Kosten und mit voller Datensouveränität. Setup und Installation im Whisper-Transkription-Guide.
Häufige Fragen
Was ist der Unterschied zwischen whisper-1 und gpt-4o-transcribe?
whisper-1 ist der klassische Transkriptions-Endpunkt: Batch-Verarbeitung, kein Streaming, feste Kosten pro Audio-Minute (0,006 USD, Stand August 2026). gpt-4o-transcribe basiert auf GPT-4o, unterstützt Streaming (Token-für-Token-Ausgabe), liefert laut OpenAI höhere Genauigkeit bei komplexen Aufnahmen und kann mit Prompt-Instruktionen gesteuert werden. gpt-4o-mini-transcribe ist die günstigere und schnellere Variante mit leicht geringerer Qualität.
Was kostet die OpenAI Transkription pro Minute?
Stand 2026-08-09: whisper-1 kostet 0,006 USD pro Audio-Minute. gpt-4o-transcribe und gpt-4o-mini-transcribe werden token-basiert abgerechnet (Audio-Input-Tokens plus Text-Output-Tokens), die effektiven Minuten-Preise variieren dadurch. gpt-4o-mini-transcribe ist etwas günstiger als whisper-1, gpt-4o-transcribe teurer. Aktuelle Preise unter platform.openai.com/docs/pricing.
Ist die OpenAI Transkription DSGVO-konform?
Die reguläre api.openai.com läuft auf US-Servern; DSGVO-Compliance ist grundsätzlich über den EU-US Data Privacy Framework möglich, aber prüfungsbedürftig. Für strikte EU-Datenresidenz bieten OpenAI EU Data Zones (Enterprise) sowie Azure OpenAI Service mit Deployments in Frankfurt oder Sweden Central eine Alternative. In beiden Fällen bleiben Audio-Daten in der EU.
Wie groß darf die Audiodatei bei OpenAI maximal sein?
Der Transkriptions-Endpunkt akzeptiert maximal 25 MB pro Datei. Größere Aufnahmen müssen vor dem Upload in Chunks aufgeteilt werden — typisch ist eine Aufteilung an Stille-Grenzen mit pydub, ffmpeg oder VAD-basierten Bibliotheken. Nach der Transkription werden die Text-Chunks wieder zusammengefügt.
Welche Sprachen unterstützt die OpenAI Whisper API?
Die Whisper-Familie unterstützt 99 Sprachen — inklusive Deutsch, das zu den bestunterstützten gehört. Die Sprache kann per language-Parameter (ISO 639-1, z. B. `de`) explizit vorgegeben werden. Ohne Angabe erkennt Whisper die Sprache automatisch anhand der ersten 30 Sekunden. Für Deutsch empfiehlt sich die explizite Angabe, um Fehl-Detektion bei kurzen Aufnahmen zu vermeiden.
Unterstützt die OpenAI API Sprecher-Erkennung (Diarization)?
Nein. Weder whisper-1 noch gpt-4o-transcribe liefern native Sprecher-Trennung. Wer Diarization braucht, muss zusätzlich Bibliotheken wie pyannote-audio einsetzen und die Ergebnisse manuell zusammenführen. Alternativ nutzen Anbieter wie AssemblyAI, Deepgram oder VexaScribe integrierte Diarization out-of-the-box.
Welche Ausgabeformate liefert die OpenAI Transkription?
Der response_format-Parameter unterstützt: `json` (Text im JSON-Wrapper), `verbose_json` (mit Segment-Zeitstempeln und Confidence), `text` (nur Roh-Text), `srt` (SubRip-Untertitel), `vtt` (WebVTT). Für Editier-Workflows meist `verbose_json`; für Untertitel direkt `srt` oder `vtt`.
Wann ist die OpenAI API die falsche Wahl?
Wenn Sie native Diarization brauchen (Otter, VexaScribe, AssemblyAI, Deepgram sind besser). Wenn Sie strikte EU-Datenresidenz ohne Zusatzsetup benötigen (Azure OpenAI Frankfurt oder EU-native Anbieter). Wenn Sie unbegrenztes Volumen ohne laufende Kosten wollen (Whisper selbst hosten). Und wenn Sie eine No-Code-Oberfläche brauchen — dann ist eine SaaS-Lösung wie VexaScribe pragmatischer.
No-Code Alternative: VexaScribe für Nicht-Entwickler
Sie brauchen eine Transkription, aber keine API-Integration? VexaScribe bietet die gleiche Whisper-Qualität über eine Web-Oberfläche — mit Sprecher-Erkennung, EU-Hosting und Export als DOCX/SRT/TXT. Ideal für Marketing-, HR- und Legal-Teams. Siehe Audio transkribieren.
Verwandte Ratgeber
Whisper Transkription
Kompletter Guide zu OpenAIs Whisper-Modell — Versionen, Installation, deutsche WER-Benchmarks.
Audio transkribieren
No-Code-Alternative: MP3, WAV, M4A hochladen und deutsches Transkript in Sekunden erhalten.
Kostenlose Transkription
10 kostenlose Transkriptions-Tools im ehrlichen Vergleich — Freiminuten, DSGVO und Genauigkeit.
Live-Transkription
Echtzeit-Transkription für Meetings und Streams — browserbasiert, ohne API-Setup.