VexaScribe-Funktionen

VexaScribe — KI-Transkription in 99 Sprachen. Sprechererkennung, Zeitstempel, KI-Zusammenfassungen und integrierte Transkript-Übersetzung (133 Sprachen). Laden Sie Dateien hoch oder senden Sie einen Meeting-Bot zu Zoom, Google Meet oder Teams. Ab $2/Mo.

Was VexaScribe ist, in 80 Wörtern

VexaScribe ist eine Web-App, die Audio- und Videodateien in durchsuchbare, mit Zeitstempeln und Sprecher-Labels versehene Transkripte umwandelt — angetrieben von OpenAI Whisper. Legen Sie eine Datei ab (bis zu 5 GB), fügen Sie eine YouTube-/TikTok-/Instagram-/Direkt-URL ein oder senden Sie einen Bot zu Ihrem Zoom-, Google Meet- oder Teams-Meeting. Sie erhalten in ~5–10 Minuten pro Stunde Audio ein Transkript in 99 Sprachen, optional eine KI-Zusammenfassung mit Aufgaben, sowie Exporte in TXT, DOCX, SRT, VTT oder JSON. 30 Minuten kostenlos, danach $2–$20/Mo. Keine Kreditkarte für den Start nötig.

Kernfunktionen

99 Sprachen unterstützt

Transkribieren Sie Audio und Video in 99 Sprachen mit automatischer Spracherkennung. Von Englisch bis Japanisch, Spanisch bis Arabisch — wir decken es ab.

Sprechererkennung

Die automatische Sprechererkennung identifiziert und kennzeichnet unterschiedliche Stimmen. Perfekt für Interviews, Podcasts und Meetings mit mehreren Teilnehmern.

Zeitstempel

Jedes Transkript enthält präzise Zeitstempel. Klicken Sie auf einen Zeitstempel, um zu genau diesem Moment im Audio zu springen. Unverzichtbar für Navigation und Video-Untertitel.

5 Exportformate

Exportieren Sie als TXT (reiner Text), DOCX (Word), SRT oder VTT (Video-Untertitel) oder JSON (strukturierte Daten mit Zeitstempeln). Wählen Sie das Format, das zu Ihrem Workflow passt.

Schnelle Verarbeitung

KI-gestützte Transkription ist in Minuten fertig, nicht in Stunden. Eine 1-Stunden-Aufnahme wird typischerweise in 5–10 Minuten verarbeitet.

Integrierter Editor

Überprüfen und bearbeiten Sie Ihre Transkripte direkt im Browser. Korrigieren Sie Fehler, benennen Sie Sprecher um und feilen Sie an Ihrem Transkript vor dem Export.

Meeting-Bot

Senden Sie einen KI-Bot zu Ihren Zoom-, Google Meet- oder Teams-Meetings. Er zeichnet auf, transkribiert und erstellt strukturierte Zusammenfassungen mit Aufgaben und Entscheidungen. Verbraucht 3× Transkriptions-Credits.

KI-Zusammenfassungen

Verwandeln Sie jedes Transkript in strukturierte Kernpunkte, Aufgaben, Kapitelmarker und Entscheidungen. Funktioniert bei Meetings, Vorlesungen, Interviews und Podcasts. In allen kostenpflichtigen Tarifen enthalten.

Transkript-Übersetzung

Übersetzen Sie jedes Transkript in 133 Sprachen über Google Translate — keine Zusatzkosten, kein Drittanbieter-Konto nötig. In allen Tarifen verfügbar.

Bulk-Upload — 50 Dateien auf einmal

Laden Sie bis zu 50 Audio- oder Videodateien auf einmal hoch. Alle werden parallel verarbeitet — nicht nacheinander. Formate frei mischen und alles als ZIP herunterladen.

KI-Chat mit Ihrem Transkript

Stellen Sie natürlichsprachliche Fragen zu jeder Transkription, die Ihnen gehört, und erhalten Sie Antworten, die durch direkte Zitate aus dem Audio belegt sind. „Welche Aufgaben wurden vergeben?“, „Was hat Sarah entschieden?“, „Finde das stärkste Zitat zu X“ — Fragen, für die Sie normalerweise eine Aufnahme erneut ansehen müssten, werden zu einer einzigen Abfrage. Jede Antwort enthält klickbare Zeitstempel-Zitate, die den Audioplayer zum exakten Moment des Zitats spulen. Zitate werden serverseitig gegen das tatsächliche Transkript validiert — die KI ist auf Ihre Aufnahme beschränkt und kann weder einen Zeitstempel noch ein Zitat erfinden. Konversationen bleiben 90 Tage erhalten, mit Multi-Turn-Kontext und Unterstützung für 99 Sprachen (fragen Sie in einer Sprache über eine Aufnahme in einer anderen). Verfügbar in den kostenpflichtigen Tarifen.

Unterstützte Formate

Audioformate

MP3WAVM4AFLACOGGAACWMAOPUS

Videoformate

MP4MOVAVIMKVWebMWMVFLV

Exportformate (5)

TXT

Reiner Text

DOCX

Word-Dokument

SRT

Untertitel

VTT

Web-Untertitel

JSON

Strukturierte Daten

Angetrieben von fortschrittlicher KI

VexaScribe nutzt hochmoderne Spracherkennungsmodelle, die mit Millionen Stunden Audio trainiert wurden. Dieselbe Technologie hinter Sprachassistenten, angepasst für präzise Transkription.

95 %

Genauigkeit bei klarem Audio

99

Unterstützte Sprachen

5–10 Min

Verarbeitungszeit pro Stunde

Funktionsverfügbarkeit nach Tarif

Alle Tarife enthalten eine kostenlose Testphase. Keine Kreditkarte für den Start erforderlich.

FunktionKostenlose TestphaseStarter ($2/Mo)Pro ($10/Mo)
Audio- & Video-Transkription
99 Sprachen unterstützt
Sprechererkennung
Zeitstempel
Export: TXT, DOCX, SRT, VTT, JSON
Transkript-Übersetzung (133 Sprachen)
Integrierter Editor
KI-Zusammenfassungen
Meeting-Bot (Zoom, Google Meet, Teams)
Bulk-Transkription

Von einer URL transkribieren — kein Herunterladen nötig

Fügen Sie einen Link ein und erhalten Sie ein Transkript. Wir übernehmen den Download im Hintergrund. Gleiche Genauigkeit, gleiches Ergebnis, gleiche Minutenkosten wie bei einem Datei-Upload — Sie sparen sich den Schritt „erst Video herunterladen, dann hochladen“.

QuelleStatusWas akzeptiert wird
YouTube✓ LiveJede öffentliche Video-URL. Audio wird extrahiert und mit Sprechererkennung transkribiert. Fällt auf Untertitel zurück, falls der Audio-Download fehlschlägt.
TikTok✓ LiveJede öffentliche TikTok-Video-URL — sowohl kurze Reels-artige Clips als auch längere Videos funktionieren.
Instagram✓ LiveÖffentliche Reels, Videobeiträge und Video-Stories. Fotobeiträge liefern eine klare Fehlermeldung „kein Videoinhalt“.
Direkt-URL✓ LiveJeder HTTPS-Link zu einer Audio- oder Videodatei — Podcast-MP3, S3-Link, Google-Drive-Freigabe, Telegram-Bot-Download, Dropbox usw.
Spotify⏳ Bald verfügbarErkannt, aber noch nicht gebaut. Fügen Sie einen Link ein und eine „Für früheren Start abstimmen“-Aufforderung erscheint, damit wir nach Nachfrage priorisieren können.

Kostenmodell: URL-Uploads werden aus demselben monatlichen Minuten-Pool wie Datei-Uploads abgezogen — 1 Minute Audio = 1 Minute aus Ihrem Tarif. Keine separate URL-Stufe.

Was VexaScribe nicht macht

Fünf Dinge, für die VexaScribe wirklich nicht gebaut ist, jeweils mit dem Werkzeug, das wir tatsächlich empfehlen würden. Wenn Ihr Anwendungsfall in dieser Liste steht, sparen Sie sich die Test-Anmeldung.

Keine Live-Untertitelung in Echtzeit

Transkripte werden nach dem Upload generiert, nicht während Sie sprechen. Eine 1-Stunden-Datei benötigt 5–10 Minuten zur Verarbeitung — gut für Meetings, die Sie im Nachhinein ansehen, falsch für Live-Events.

Stattdessen nutzen: Otter Live, die integrierten Untertitel von Google Meet oder Web Captioner für kostenlose browserbasierte Live-Untertitel.

Keine öffentliche REST-API

VexaScribe ist eine Web-App für Menschen, kein Backend-Dienst. Es gibt keine Entwickler-API, kein SDK und keinen Webhook für programmatische Uploads.

Stattdessen nutzen: OpenAI Whisper API ($0.006/min), Deepgram Nova-3 (~$0.0043/min) oder AssemblyAI (~$0.012/min).

Keine Videobearbeitung

Sie können SRT/VTT-Untertitel exportieren, um sie in Ihren Editor einzufügen, aber VexaScribe schneidet keine Clips, entfernt keine Füllwörter und brennt keine Untertitel ins Video ein.

Stattdessen nutzen: Descript oder Vrew für transkriptbasierte Videobearbeitung; Premiere/Final Cut/DaVinci für klassische NLE-Workflows.

Kein individuelles Vokabular-Tuning

Sie können kein Wörterbuch mit Markennamen, Medikamentennamen oder technischem Fachjargon hochladen, um das Modell entsprechend zu beeinflussen. Whisper wird unverändert eingesetzt, ohne Feinabstimmung pro Konto.

Stattdessen nutzen: AssemblyAIs „word boost“ oder Deepgrams „keywords“-Parameter für Domänen mit vielen Eigennamen.

Kein On-Premise / Enterprise-Self-Hosting

Audio wird in unserer Cloud verarbeitet — es gibt keine air-gapped oder HIPAA-BAA-signierte Bereitstellung. Für Anwalt-Mandant-Gespräche, klinische Therapie oder klassifizierte Inhalte, bei denen ein Leck direkte rechtliche Haftung schafft, ist kein Cloud-Werkzeug (auch unseres nicht) die richtige Wahl.

Stattdessen nutzen: installieren Sie OpenAI Whisper lokal (kostenlos, läuft auf Ihrem Rechner, Audio verlässt ihn nie), oder für rechtssichere 100 % Genauigkeit nutzen Sie menschliche Transkription (Rev, GoTranscript) für $1.25–$1.99/min.

Ehrliche Genauigkeit — was die Zahlen wirklich bedeuten

VexaScribe nutzt OpenAI Whisper (speziell Modelle der large-v3-Klasse). Marketingseiten sagen gerne „99 % Genauigkeit“ — das ist nicht ehrlich. Die reale Whisper-Genauigkeit hängt stark von Audioqualität, Akzent und Anzahl der Sprecher ab. Damit können Sie rechnen.

Transkriptionsgenauigkeit (Whisper)

  • Sauberes Studio-Englisch, ein Sprecher~92–97 %
  • Akzentuiertes Englisch (nicht-muttersprachlich, regional)~85–92 %
  • Laute Umgebungen (Café, Telefon, im Freien)~80–90 %
  • Sauberes Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Niederländisch~88–94 %
  • Koreanisch, Japanisch, Indonesisch, Türkisch, Arabisch, Polnisch~85–92 %

Quelle: Open ASR Leaderboard + Whisper-Paper-Benchmarks (LibriSpeech, FLEURS, Common Voice).

Genauigkeit der Sprechererkennung

  • 2 Sprecher, keine Überlappung95 %+
  • 3–4 Sprecher, gelegentliche Überlappung~88–94 %
  • 5–6 Sprecher, Meeting-Dynamik~80–90 %
  • 7–15 Sprecher, Panel oder Fokusgruppe~70–82 %
  • Bis zu 50 Sprecher (maximal unterstützt)variabel

Beste Genauigkeit mit 2–6 klar unterscheidbaren Sprechern. Sie können Sprecher 1/2/3 später im Editor umbenennen.

Was wirklich den Unterschied macht

Drei Dinge, die mehr zählen als die Wahl des „besten“ Transkriptionswerkzeugs:

  1. Ein anständiges Mikrofon (USB-Headset oder Ansteckmikro schlagen Laptop-Mikros um 5–15 Genauigkeitspunkte).
  2. Ein Sprecher nach dem anderen — Überlappung zerstört sowohl Transkription als auch Sprechererkennung.
  3. Geringe Hintergrundgeräusche. Nehmen Sie in einem geschlossenen Raum auf, nicht neben einem Ventilator oder Lüftungsauslass.

Wenn Sie rechtssichere 100 % Genauigkeit brauchen (Gerichtsakten, regulierte Forschung), nutzen Sie menschliche Transkriptionsdienste wie Rev oder GoTranscript für $1.25–$1.99/min. KI bringt Sie zu ~95 % zu 1–2 % der Kosten — passend für die meisten Anwendungsfälle, falsch für einige.

Funktions-FAQ

Welche Sprachen unterstützt VexaScribe und wie genau sind sie?

99 Sprachen, alle angetrieben von OpenAI Whisper. Die Genauigkeit hängt von der Sprache und der Audioqualität ab: ~92–97 % bei sauberem englischen Audio (laut Open ASR Leaderboard), ~88–94 % bei sauberem Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch und Niederländisch, sowie ~85–92 % bei Koreanisch, Japanisch, Indonesisch, Türkisch, Polnisch und Arabisch. Stark akzentuierte Sprache, überlappende Sprecher oder laute Umgebungen senken diese Zahlen um 5–10 Punkte. Die Sprache wird automatisch erkannt oder Sie können sie manuell festlegen.

Hat VexaScribe eine öffentliche REST-API?

Noch nicht — VexaScribe ist eine Web-App, kein API-Produkt. Wenn Sie Transkription in Ihre eigene Software integrieren müssen, nutzen Sie die OpenAI Whisper API ($0.006/min), Deepgram (~$0.0043/min bei Nova-3) oder AssemblyAI (~$0.012/min). Alle drei bieten ordentliche SDKs und Dokumentation. Wenn Sie einen No-Code-Workflow möchten, der Dateien hochlädt und Transkripte herunterlädt, ist VexaScribe die richtige Wahl — nur eben nicht per API.

Welche Dateiformate kann VexaScribe transkribieren?

Audio: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, OPUS. Video: MP4, MOV, AVI, MKV, WebM, WMV, FLV. Die Tonspur wird automatisch aus Videodateien extrahiert — kein separater Konvertierungsschritt. Exporte: TXT, DOCX, SRT, VTT, JSON.

Wie groß darf eine hochgeladene Datei sein?

Bis zu 5 GB pro Datei, das entspricht etwa 90 Stunden MP3 bei 128 kbps oder rund 8 Stunden 1080p-Video. Das liegt weit über der 25-MB-Grenze der meisten kostenlosen Konverter-Websites und der ~200-MB-Grenze der Gratisstufe von Otter. Für Dateien größer als 5 GB teilen Sie die Datei in Audacity oder ffmpeg und laden die Teile separat hoch.

Trainiert VexaScribe KI-Modelle mit meinem Audio?

Nein. Ihr Audio und Ihre Transkripte werden nicht zum Training irgendeines Modells verwendet — weder unseres noch das von OpenAI (wir nutzen Whisper über die API, die nicht mit Eingaben trainiert). Sie können jede Datei jederzeit aus Ihrem Dashboard löschen, und sowohl Audio als auch Transkript werden entfernt. Audio wird während der Übertragung (TLS) und im Ruhezustand verschlüsselt. Für Anwalt-Mandant-, klinische oder klassifizierte Inhalte, bei denen ein Leck direkte rechtliche Haftung verursachen würde, installieren Sie stattdessen OpenAI Whisper lokal — kein Cloud-Werkzeug, auch unseres nicht, ist dieses Risiko wert.

Was ist in der kostenlosen Testphase enthalten?

30 Minuten Transkriptions-Guthaben, alle 99 Sprachen, Sprechererkennung, Zeitstempel, jedes Exportformat (TXT/DOCX/SRT/VTT/JSON), der integrierte Editor, Bulk-Upload (bis zu 50 Dateien) und Transkript-Übersetzung in 133 Sprachen. Keine Kreditkarte erforderlich. KI-Zusammenfassungen und der Meeting-Bot (Zoom/Google Meet/Teams) sind kostenpflichtig — sie beginnen bei $2/Mo im Starter-Tarif.

Bereit, mit dem Transkribieren zu beginnen?

Testen Sie VexaScribe kostenlos mit 30 Minuten Transkription. Keine Kreditkarte erforderlich.