Home/Sprache zu Text
Verifiziert August 2026

Sprache zu Text — Kostenlos online in Deutsch

Live-Diktat im Browser oder MP3/WAV-Upload — 99 Sprachen inklusive Deutsch mit ~95% Genauigkeit (Whisper large-v3 auf FLEURS DE-Benchmark: 4,5% WER). Sprecher-Labels für bis zu 50 Stimmen, Export als TXT/DOCX/SRT/VTT. Ehrliche Übersicht der nativen OS-Optionen (Windows Voice Access, macOS Diktieren, iOS/Android System-Diktat) und klare Weiterleitung zu /de/diktieren für Diktier-App-Vergleich.

Von VexaScribe Editorial · Veröffentlicht · Verifiziert

4,5%
WER auf Deutsch
Whisper FLEURS DE
99
Sprachen
Whisper large-v3
50
Sprecher
Diarisierung inklusive
30 Min
gratis
Ohne Kreditkarte

Kurze Antwort

Sprache zu Text konvertieren: Lade deine Audio-Datei (MP3, WAV, M4A, FLAC, OGG) in VexaScribe hoch oder klicke auf das Mikrofon-Symbol für Live-Diktat. Whisper large-v3 verarbeitet 99 Sprachen inklusive Deutsch mit ~95% Genauigkeit (FLEURS DE-Benchmark: 4,5% WER). Sprecher-Erkennung für bis zu 50 Stimmen, Export als TXT / DOCX / SRT / VTT. Erste 30 Minuten kostenlos ohne Kreditkarte. Für Diktier-App-Vergleich (Apple Diktat, Wispr Flow, Word Diktieren, Dragon) siehe /de/diktieren.

Sprache aufnehmen und in Text umwandeln

Zwei Wege — je nachdem was du gerade hast:

Du hast deine Stimme (jetzt)

Klicke unten auf "Live-Diktat starten". Text erscheint in Echtzeit während du sprichst. Funktioniert in Chrome, Edge, Safari.

Live-Diktat starten →

Du hast eine Audio-Datei

Datei per Drag & Drop hochladen. 5 GB max, 99 Sprachen, Sprecher-Labels enthalten. 30 Minuten gratis.

Datei hochladen →

In 4 Schritten: Audio-Datei in Text umwandeln

  1. Datei hochladen oder Link einfügen. MP3, WAV, M4A, FLAC, OGG, AAC oder Video (MP4, MOV) direkt reinziehen. Alternativ Google Drive-, YouTube- oder HTTPS-Link einfügen.
  2. Sprache automatisch erkennen lassen. Whisper large-v3 erkennt Deutsch, Österreichisch und Schweizerdeutsch automatisch aus 99 unterstützten Sprachen.
  3. Auf Transkription warten. Eine 1-Stunden-Datei braucht typischerweise 5-10 Minuten. Der Fortschritt wird im Browser angezeigt — du musst den Tab nicht offen lassen.
  4. Sprecher prüfen und exportieren. Diarisierung für bis zu 50 Stimmen (am besten mit 2-6 klar unterscheidbaren Sprechern). Namen und Zahlen gegen das Audio prüfen — hier macht KI die meisten Fehler. Export als TXT (nur Text), DOCX (Transkript mit Sprecher-Labels + Zeitstempeln), SRT/VTT (Video-Untertitel) oder JSON.

Sprache zu Text vs Text zu Sprache — bist du auf der richtigen Seite?

Häufige Verwechslung. Beide arbeiten mit Sprache — aber in entgegengesetzte Richtungen.

FeatureInputOutputTypische Tools
Sprache zu Text (STT — diese Seite)Audio (Stimme oder Datei)Geschriebener TextVexaScribe, Apple Diktat, Web Speech API
Text zu Sprache (TTS)Geschriebener TextGesprochene AudioElevenLabs Voice, NaturalReaders, Amazon Polly

Schnelltest: Hast du Audio und willst Text → STT (richtige Seite). Hast du Text und willst Audio → TTS (anderes Tool).

Genauigkeit auf Deutsch (FLEURS-Benchmark)

Whisper large-v3 auf FLEURS Deutsch: 4,5% WER

Primärquelle: OpenAI Whisper paper (Radford et al., 2022, arXiv:2212.04356) auf dem FLEURS-Benchmark. Was das bedeutet: ~95 von 100 Wörtern korrekt transkribiert bei sauberem Audio.

Realistische Genauigkeit variiert nach Audio-Typ:

  • Sauberes Deutsch (Studio, Podcast): 92-95% (Whisper large-v3)
  • Dialekte (Bayerisch, Sächsisch, Schweizerdeutsch): ~85-92% — Whisper wurde primär auf Hochdeutsch trainiert
  • Fachvokabular (Medizin, Recht, Technik): 75-85% — Eigennamen und Fachtermini sind die häufigsten Fehler
  • Verrauschte Umgebung: 80-90%
  • Überlappende Sprecher: variabel — braucht manuelle Prüfung

Für tiefere Whisper-Genauigkeits-Analyse siehe /how-accurate-is-whisper (EN) und /what-is-automatic-speech-recognition (EN).

Native OS: Windows, Mac, iPhone, Android

Windows, Mac, iPhone und Android haben alle integrierte Sprache-zu-Text-Funktionen. Für Live-Diktat in ein Textfeld sind diese oft die schnellste kostenlose Option.

OSToolAktivieren mitGenauigkeitFunktioniert in
Windows 11Voice Access / DiktierenWin+H~85-90%Jedem Textfeld
macOSDiktierenFn Fn~88-92%Jedem Textfeld
iOSTastatur-DiktatMikrofon-Symbol auf Tastatur~90-93%Jedem Textfeld
AndroidGoogle Voice TypingMikrofon auf Gboard~90-93%Jedem Textfeld

Wann VexaScribe stattdessen sinnvoll ist: du hast eine Audio-Datei zum Hochladen (Podcast-Folge, Meeting-Aufnahme, Interview), du brauchst Sprecher-Labels für mehrere Stimmen, du brauchst eine Sprache die dein OS nicht unterstützt, oder du willst DOCX/SRT/VTT-Export. Natives Diktat ist textfeld-only und einsprecher-only.

Kostenlose vs. Bezahlte Optionen

Vollständig kostenlos

Web Speech API in Chrome/Edge/Safari (Live-Browser-Diktat). Apple Diktat (iOS/Mac). Windows Voice Access (Win+H). Gboard-Mikrofon (Android). Google Docs Voice Typing (Chrome desktop). Google Recorder auf Pixel (on-device). Alle unbegrenzt und ohne Registrierung.

Kostenlose Testphase, dann bezahlt

VexaScribe: 30 Minuten gratis (keine Kreditkarte), danach ab 2€/Monat für 200 Minuten. Otter: ~300 Min/Monat free-tier. Wispr Flow: kostenlose Testphase, dann ab 15$/Monat.

Unbegrenzt kostenlos (mit Setup)

OpenAI Whisper lokal installiert — 100% kostenlos, unbegrenzt, offline. Benötigt Python-Setup (~15 Minuten Installation). Anleitung: /whisper-install-guide (EN).

Professionell / hohe Genauigkeit

Dragon Anywhere (149,99$/Jahr) für medizinisches/juristisches Vokabular. Wispr Flow Pro (15$/Monat) für Cross-Platform-Diktat. VexaScribe für File-Upload mit Sprecher-Labels für Interviews.

Nach Gerät (kompakt)

Kurzübersicht — siehe Native OS-Tabelle oben für Details.

  • Windows: Win+H. Für erweiterte Steuerung: Voice Access in Einstellungen → Barrierefreiheit → Sprache.
  • Mac: Fn+Fn. Für mehr Optionen (MacWhisper, SuperWhisper, WhisperKit): siehe /speech-to-text-mac (EN).
  • iPhone: Mikrofon-Symbol auf Tastatur. Für iOS Voice Memos: siehe /iphone-voice-memo-transcription (EN).
  • Android: Mikrofon auf Gboard. Pixel-Geräte haben zusätzlich Live Transcribe on-device.
  • Chrome (Browser-Extension): Web Speech API läuft nativ in Chrome/Edge/Safari. Chrome Web Store hat Extensions für erweiterte Funktionen.

Suchst du etwas Spezifisches?

Diese Seite ist die STT-Umbrella. Für spezifischere Intents haben wir dedizierte Seiten:

Häufige Fragen

Wie kann ich Sprache zu Text umwandeln?

Zwei Wege: (1) Live-Diktat im Browser — klicke auf das Mikrofon-Symbol in einem Tool wie VexaScribe, spreche, und der Text erscheint sofort. Funktioniert in Chrome, Edge und Safari. (2) Datei-Upload — ziehe eine MP3-, WAV-, M4A-, FLAC- oder OGG-Datei in VexaScribe. Whisper large-v3 verarbeitet 99 Sprachen inklusive Deutsch, mit Sprecher-Labels für bis zu 50 Stimmen. Für System-weites Diktat in jedem Textfeld: nutze Windows Voice Access (Win+H), macOS Diktieren (Fn+Fn), oder das Tastatur-Mikrofon auf iPhone/Android.

Welche App verwandelt Sprache in Schrift?

Kostenlos und integriert: Apple Diktat (iPhone/Mac, offline auf Apple Silicon), Windows Voice Access (Win+H), Google Docs Voice Typing (Chrome desktop, Ctrl+Shift+S), Gboard-Mikrofon (Android). Für Datei-Upload mit Sprecher-Labels und 99 Sprachen: VexaScribe (30 Min gratis, danach ab 2€/Monat). Für unbegrenzt und offline auf dem eigenen Rechner: OpenAI Whisper lokal installiert (open-source, Python-Setup erforderlich). Für Diktier-App-Vergleich siehe /de/diktieren.

Welches Programm wandelt Sprache in Text um?

Betriebssystem-integriert: Windows 11 (Voice Access, Win+H), macOS (Diktieren, Fn+Fn), Microsoft Word 365 (Menü → Diktieren, plattformübergreifend). Web-basierte Tools: VexaScribe (Whisper large-v3, 30 Min gratis, Datei-Upload + Live-Mic), Speechnotes, Web Speech API im Chrome-Browser. Kommerzielle Diktier-Software: Wispr Flow (ab 15$/Monat), Dragon Anywhere (149,99$/Jahr, professionelle Anpassungen). Für Dictier-App-Vergleich siehe /de/diktieren.

Was ist die beste Sprache zu Text App?

Kommt auf den Use-Case an. Für kostenloses Live-Diktat in jedem Textfeld: Apple Diktat (iOS/Mac), Windows Voice Access, Gboard (Android) — alle offline auf modernen Geräten. Für Datei-Upload mit Sprecher-Erkennung: VexaScribe (Whisper large-v3, ~95% deutsche Genauigkeit auf FLEURS-Benchmark, bis zu 50 Sprecher). Für professionelle Genauigkeit mit medizinischem/juristischem Vokabular: Dragon Anywhere. Für System-weites Cross-Platform-Diktat: Wispr Flow. Google Recorder ist kostenlos auf Pixel-Geräten (on-device).

Ist Sprache zu Text kostenlos?

Ja, mehrere Wege. Vollständig kostenlos: Apple Diktat (iOS/Mac), Windows Voice Access (Win+H), Google Docs Voice Typing (Chrome desktop), Gboard (Android), Web Speech API im Browser. Für Datei-Upload: VexaScribe gibt 30 Minuten gratis ohne Kreditkarte, danach ab 2€/Monat für 200 Minuten. Für unbegrenzt kostenlos: OpenAI Whisper lokal installiert (100% frei, offline, benötigt Python-Setup — siehe /whisper-install-guide).

Wie genau ist Sprache zu Text auf Deutsch?

Whisper large-v3 erreicht auf dem FLEURS Deutsch-Benchmark rund 4,5% Word Error Rate — das entspricht etwa 95 von 100 Wörtern korrekt bei sauberem Audio. Native OS-Diktierfunktionen erreichen 85-92% je nach Plattform und Sprache. Genauigkeit sinkt bei Dialekten (Bayerisch, Sächsisch, Schweizerdeutsch), Fachvokabular (Medizin, Recht, Technik), verrauschter Umgebung und überlappenden Sprechern. Für professionelle Nutzung (Legal, Medical) sollten Transkripte immer geprüft werden.

Welche Audio-Formate werden unterstützt?

VexaScribe akzeptiert alle wichtigen Audio-Formate: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, AIFF. Auch Video-Dateien (MP4, MOV, AVI, MKV, WebM) werden akzeptiert — der Audio-Track wird automatisch extrahiert. Maximale Dateigröße: 5 GB. Für sehr lange Aufnahmen empfiehlt sich Segmentierung. Format-spezifische Anleitungen: /de/mp3-zu-text (MP3), /de/audio-transkribieren (allgemein), /de/video-zu-text (Video mit Ton).

Funktioniert Sprache zu Text offline?

Kommt auf das Tool an. Offline-fähig: macOS Diktieren (offline auf Apple Silicon nach Sprachpaket-Download), Windows Voice Access, iOS/Android System-Diktat auf modernen Geräten mit heruntergeladenem Sprachpaket. OpenAI Whisper lokal installiert läuft 100% offline. Cloud-basiert (Internet erforderlich): VexaScribe, Web Speech API im Browser, Google Cloud STT. Für vertrauliche Aufnahmen (Legal, Medical, HR) empfiehlt sich eine offline-fähige Option oder lokale Whisper-Installation.

Was ist der Unterschied zu Text zu Sprache (TTS)?

Genau umgekehrte Richtung. Sprache zu Text (STT — diese Seite): Audio-Input → geschriebener Text. Tools: VexaScribe, Web Speech API, Apple Diktat. Text zu Sprache (TTS): geschriebener Text → gesprochene Audio. Tools: ElevenLabs Voice, NaturalReaders, Amazon Polly. Merke: hast du Audio und willst Text (STT — richtige Seite), oder hast du Text und willst Audio (TTS — anderes Tool)?

Verwandte Seiten