OpenAI Transkription API — Whisper API, GPT-4o-transcribe & Mini im Vergleich (2026)

OpenAI bietet drei Transkriptions-Endpunkte: die klassische Whisper API (whisper-1), die neuere gpt-4o-transcribe (Streaming + höchste Qualität) und gpt-4o-mini-transcribe (günstig und schnell). Dieser Guide vergleicht Preise, Latenz, Sprachunterstützung und DSGVO-Optionen für EU-Entwickler.

Whisper APIgpt-4o-transcribeAzure Frankfurt

Unterstützte Formate:

MP3WAVM4AMP4OPUSFLAC

Die OpenAI Transkription API in 50 Wörtern

Die OpenAI Transkription API umfasst drei Endpunkte: whisper-1 (klassisch, kein Streaming, 0,006 USD/Min), gpt-4o-transcribe (höchste Qualität, Streaming, teurer) und gpt-4o-mini-transcribe (günstiger, schnellere Latenz). Für DSGVO-Compliance kann Azure OpenAI (Frankfurt oder Sweden Central) statt api.openai.com genutzt werden.

OpenAI Transkription auf einen Blick

Stand: 2026-08-09
  • 3 Endpunkte: whisper-1, gpt-4o-transcribe, gpt-4o-mini-transcribe
  • 99 Sprachen inkl. Deutsch, WER ~4,5 %
  • Max. Dateigröße: 25 MB pro Request
  • Streaming: nur gpt-4o-transcribe & mini
  • EU-Residenz: Azure OpenAI Frankfurt / Sweden Central oder OpenAI EU Data Zones (Enterprise)

Die drei OpenAI-Endpunkte im Vergleich

OpenAI bietet drei Wege, Audio in Text zu wandeln. Die Wahl hängt von Latenz-Anforderung, Budget und gewünschter Qualität ab.

Whisper API (whisper-1) — klassisch, batch-only

Der ursprüngliche Transkriptions-Endpunkt, verfügbar seit März 2023. Nutzt intern das Whisper large-v2-Modell, arbeitet batch-orientiert (kein Streaming). Preis 0,006 USD pro Audio-Minute (Preisliste, Stand August 2026). Beste Wahl für einfache Batch-Transkription mit vorhersehbarer Kostenkalkulation. Endpunkt: POST /v1/audio/transcriptions.

gpt-4o-transcribe — höchste Qualität, multimodal, Streaming

Auf GPT-4o basierend, unterstützt Streaming und liefert laut OpenAI höhere Genauigkeit bei komplexen Aufnahmen (mehrere Sprecher, Hintergrundgeräusche, Fachbegriffe). Steuerung über Prompt-Instruktionen möglich — z. B. „Gib medizinische Fachbegriffe korrekt wieder". Abrechnung token-basiert (Audio-Input-Tokens + Text-Output-Tokens), damit variabler als whisper-1. Aktuelle Preise siehe platform.openai.com/docs/pricing. Verfügbarkeit und Modell-Details unter platform.openai.com/docs/models.

gpt-4o-mini-transcribe — günstig, schnell

Die abgespeckte Variante von gpt-4o-transcribe: schnellere Latenz, deutlich geringere Kosten, kleine Genauigkeitsregression. Beste Wahl für Voice-Bots, Echtzeit-Assistenten und Anwendungen, in denen Latenz vor Perfektion geht. Ebenfalls Streaming-fähig.

Vergleichstabelle

EndpunktModellStreamingPreis pro MinSprachenBest For
whisper-1Whisper large-v2Nein0,006 USD99Batch, vorhersehbare Kosten
gpt-4o-transcribeGPT-4o (Audio)Jaaktuell etwa 0,006 USD (token-basiert)99Höchste Qualität, Prompting
gpt-4o-mini-transcribeGPT-4o mini (Audio)Jagünstiger (token-basiert)99Low-Latency, Voice-Bots

Preise können sich ändern — bei platform.openai.com/docs/pricing verifizieren. Stand: 2026-08-09.

Preise — was kostet OpenAI Transkription wirklich?

whisper-1 wird pro Audio-Minute abgerechnet — einfach zu kalkulieren. Die gpt-4o-Endpunkte rechnen token-basiert; das macht die Kosten schwerer vorhersagbar, weil sie mit Länge und Struktur des Outputs variieren. Faustregel:

Volumenwhisper-1gpt-4o-transcribe (Schätzung)
10 Stunden/Monat~3,60 USD~3,60–5,50 USD
100 Stunden/Monat~36 USD~36–55 USD
1000 Stunden/Monat~360 USD~360–550 USD

Stand: 2026-08-09. Preise können sich ändern — bitte bei api.openai.com/pricing verifizieren. Schätzungen für gpt-4o-transcribe basieren auf typischen Deutsch-Ausgaben (~150 Wörter/Min).

Code-Beispiele

Alle Beispiele nutzen den offiziellen openai-SDK v1+. Der Endpunkt heißt in allen SDKs audio.transcriptions.create.

Python — whisper-1

from openai import OpenAI
client = OpenAI()

with open("audio.mp3", "rb") as f:
    transcript = client.audio.transcriptions.create(
        model="whisper-1",
        file=f,
        language="de",
        response_format="verbose_json",
    )
print(transcript.text)

Node.js — whisper-1

import OpenAI from "openai";
import fs from "fs";
const client = new OpenAI();

const transcript = await client.audio.transcriptions.create({
    model: "whisper-1",
    file: fs.createReadStream("audio.mp3"),
    language: "de",
    response_format: "verbose_json",
});
console.log(transcript.text);

curl — whisper-1

curl https://api.openai.com/v1/audio/transcriptions \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: multipart/form-data" \
  -F file="@audio.mp3" \
  -F model="whisper-1" \
  -F language="de"

Python — gpt-4o-transcribe mit Streaming

from openai import OpenAI
client = OpenAI()

with open("audio.mp3", "rb") as f:
    stream = client.audio.transcriptions.create(
        model="gpt-4o-transcribe",
        file=f,
        language="de",
        response_format="text",
        stream=True,
    )
    for event in stream:
        if hasattr(event, "delta"):
            print(event.delta, end="", flush=True)

DSGVO und EU-Datenresidenz

Die reguläre api.openai.com läuft primär auf US-Infrastruktur. DSGVO-Konformität ist über den EU-US Data Privacy Framework grundsätzlich möglich, aber prüfbedürftig. Für strikte EU-Residenz gibt es zwei Wege:

OpenAI EU Data Zones

Für Enterprise-Kunden bietet OpenAI seit Anfang 2025 EU Data Zones — Audio und Metadaten werden ausschließlich in europäischen Rechenzentren verarbeitet. Details und Sicherheitsdokumentation unter trust.openai.com. Nicht für alle Tarife verfügbar — bei Sales-Team anfragen.

Azure OpenAI Frankfurt / Sweden Central

Der Azure OpenAI Service stellt whisper-1 und gpt-4o-transcribe in den Regionen Germany West Central (Frankfurt) und Sweden Central bereit — Daten verlassen die EU nicht. Rechnungsstellung über den bestehenden Azure-Vertrag mit AVV. Verfügbarkeit pro Modell und Region unter learn.microsoft.com/azure/ai-services/openai/concepts/models.

Entscheidungsbaum

  • Nicht-personenbezogene Aufnahmen: api.openai.com direkt ist meist ausreichend.
  • Personenbezogene Daten, kleines Volumen: api.openai.com mit AVV nach EU-US Data Privacy Framework.
  • Strikte EU-Residenz (Enterprise): OpenAI EU Data Zones oder Azure OpenAI Frankfurt/Sweden.
  • Höchste Datensouveränität: Whisper selbst hosten (siehe Whisper-Guide).

Praktische Grenzen und Fallstricke

  • 25 MB Datei-Limit: Größere Aufnahmen müssen in Chunks aufgeteilt werden — bevorzugt an Stille-Grenzen (pydub, VAD). Details unter platform.openai.com/docs/guides/speech-to-text.
  • Rate Limits: Requests pro Minute hängen von der Nutzungsstufe ab (Tier 1 → Tier 5). Bei Batch-Verarbeitung sollten Sie exponential backoff einbauen.
  • Response Formats: `json`, `verbose_json` (mit Segment-Zeitstempeln), `text`, `srt`, `vtt`. `verbose_json` ist für Editor-Workflows die vielseitigste Wahl.
  • Language auto-detection: Ohne language-Parameter erkennt Whisper die Sprache aus den ersten 30 Sekunden. Bei kurzen deutschen Aufnahmen (<30 s) empfiehlt sich das explizite Setzen von `language="de"` — sonst Fehl-Detektion möglich.
  • Halluzinationen bei Stille: Whisper kann bei längeren Ruhephasen erfundene Sätze ausgeben. Voice-Activity- Detection (VAD) als Vorstufe reduziert das.

Whisper API vs. lokales Whisper — Entscheidungsmatrix

OpenAI Whisper API

  • Kein Setup, sofort einsatzbereit
  • Automatische Skalierung
  • Kosten pro Minute (0,006 USD)
  • Audio verlässt Rechner (US, ggf. EU-Zone)
  • Ratenlimits pro Tier
  • 25 MB pro Datei

Whisper lokal

  • Einmaliges Setup (Python + GPU)
  • Skaliert nur mit eigener Hardware
  • Keine laufenden Kosten
  • Audio bleibt lokal — höchste Datensouveränität
  • Keine Ratenlimits
  • Keine Dateigrößen-Beschränkung

Faustregel: unter ~10 Stunden pro Monat → API, darüber und mit vorhandener GPU → lokal. Details und Installations-Anleitung im Whisper-Transkription-Guide.

Wann OpenAI API nicht die richtige Wahl ist

Die OpenAI-API deckt viele Fälle ab, ist aber nicht immer optimal. Die wichtigsten Alternativen:

AssemblyAI & Deepgram

Beide bieten native Sprecher-Erkennung, PII-Redaktion und Streaming ohne die 25-MB-Grenze. Deepgram punktet mit sehr niedriger Latenz, AssemblyAI mit starken Zusatzmodulen (Kapitelerkennung, Entitätsextraktion). Beide sind US-basiert, bieten aber Enterprise-EU-Optionen.

Azure Speech-to-Text (nicht Azure OpenAI)

Der klassische Azure-Speech-Dienst hat Diarization out-of-the-box, EU-Regionen und Custom-Speech-Training für Fachvokabular. Für deutsche Enterprise-Umgebungen mit bestehendem Microsoft-Vertrag oft die pragmatischste Wahl.

Self-hosted Whisper

Für hohe Volumen ohne laufende Kosten und mit voller Datensouveränität. Setup und Installation im Whisper-Transkription-Guide.

Häufige Fragen

Was ist der Unterschied zwischen whisper-1 und gpt-4o-transcribe?

whisper-1 ist der klassische Transkriptions-Endpunkt: Batch-Verarbeitung, kein Streaming, feste Kosten pro Audio-Minute (0,006 USD, Stand August 2026). gpt-4o-transcribe basiert auf GPT-4o, unterstützt Streaming (Token-für-Token-Ausgabe), liefert laut OpenAI höhere Genauigkeit bei komplexen Aufnahmen und kann mit Prompt-Instruktionen gesteuert werden. gpt-4o-mini-transcribe ist die günstigere und schnellere Variante mit leicht geringerer Qualität.

Was kostet die OpenAI Transkription pro Minute?

Stand 2026-08-09: whisper-1 kostet 0,006 USD pro Audio-Minute. gpt-4o-transcribe und gpt-4o-mini-transcribe werden token-basiert abgerechnet (Audio-Input-Tokens plus Text-Output-Tokens), die effektiven Minuten-Preise variieren dadurch. gpt-4o-mini-transcribe ist etwas günstiger als whisper-1, gpt-4o-transcribe teurer. Aktuelle Preise unter platform.openai.com/docs/pricing.

Ist die OpenAI Transkription DSGVO-konform?

Die reguläre api.openai.com läuft auf US-Servern; DSGVO-Compliance ist grundsätzlich über den EU-US Data Privacy Framework möglich, aber prüfungsbedürftig. Für strikte EU-Datenresidenz bieten OpenAI EU Data Zones (Enterprise) sowie Azure OpenAI Service mit Deployments in Frankfurt oder Sweden Central eine Alternative. In beiden Fällen bleiben Audio-Daten in der EU.

Wie groß darf die Audiodatei bei OpenAI maximal sein?

Der Transkriptions-Endpunkt akzeptiert maximal 25 MB pro Datei. Größere Aufnahmen müssen vor dem Upload in Chunks aufgeteilt werden — typisch ist eine Aufteilung an Stille-Grenzen mit pydub, ffmpeg oder VAD-basierten Bibliotheken. Nach der Transkription werden die Text-Chunks wieder zusammengefügt.

Welche Sprachen unterstützt die OpenAI Whisper API?

Die Whisper-Familie unterstützt 99 Sprachen — inklusive Deutsch, das zu den bestunterstützten gehört. Die Sprache kann per language-Parameter (ISO 639-1, z. B. `de`) explizit vorgegeben werden. Ohne Angabe erkennt Whisper die Sprache automatisch anhand der ersten 30 Sekunden. Für Deutsch empfiehlt sich die explizite Angabe, um Fehl-Detektion bei kurzen Aufnahmen zu vermeiden.

Unterstützt die OpenAI API Sprecher-Erkennung (Diarization)?

Nein. Weder whisper-1 noch gpt-4o-transcribe liefern native Sprecher-Trennung. Wer Diarization braucht, muss zusätzlich Bibliotheken wie pyannote-audio einsetzen und die Ergebnisse manuell zusammenführen. Alternativ nutzen Anbieter wie AssemblyAI, Deepgram oder VexaScribe integrierte Diarization out-of-the-box.

Welche Ausgabeformate liefert die OpenAI Transkription?

Der response_format-Parameter unterstützt: `json` (Text im JSON-Wrapper), `verbose_json` (mit Segment-Zeitstempeln und Confidence), `text` (nur Roh-Text), `srt` (SubRip-Untertitel), `vtt` (WebVTT). Für Editier-Workflows meist `verbose_json`; für Untertitel direkt `srt` oder `vtt`.

Wann ist die OpenAI API die falsche Wahl?

Wenn Sie native Diarization brauchen (Otter, VexaScribe, AssemblyAI, Deepgram sind besser). Wenn Sie strikte EU-Datenresidenz ohne Zusatzsetup benötigen (Azure OpenAI Frankfurt oder EU-native Anbieter). Wenn Sie unbegrenztes Volumen ohne laufende Kosten wollen (Whisper selbst hosten). Und wenn Sie eine No-Code-Oberfläche brauchen — dann ist eine SaaS-Lösung wie VexaScribe pragmatischer.

No-Code Alternative: VexaScribe für Nicht-Entwickler

Sie brauchen eine Transkription, aber keine API-Integration? VexaScribe bietet die gleiche Whisper-Qualität über eine Web-Oberfläche — mit Sprecher-Erkennung, EU-Hosting und Export als DOCX/SRT/TXT. Ideal für Marketing-, HR- und Legal-Teams. Siehe Audio transkribieren.