VexaScribe-Funktionen
VexaScribe — KI-Transkription in 99 Sprachen. Sprechererkennung, Zeitstempel, KI-Zusammenfassungen und integrierte Transkript-Übersetzung (133 Sprachen). Laden Sie Dateien hoch oder senden Sie einen Meeting-Bot zu Zoom, Google Meet oder Teams. Ab $2/Mo.
Was VexaScribe ist, in 80 Wörtern
VexaScribe ist eine Web-App, die Audio- und Videodateien in durchsuchbare, mit Zeitstempeln und Sprecher-Labels versehene Transkripte umwandelt — angetrieben von OpenAI Whisper. Legen Sie eine Datei ab (bis zu 5 GB), fügen Sie eine YouTube-/TikTok-/Instagram-/Direkt-URL ein oder senden Sie einen Bot zu Ihrem Zoom-, Google Meet- oder Teams-Meeting. Sie erhalten in ~5–10 Minuten pro Stunde Audio ein Transkript in 99 Sprachen, optional eine KI-Zusammenfassung mit Aufgaben, sowie Exporte in TXT, DOCX, SRT, VTT oder JSON. 30 Minuten kostenlos, danach $2–$20/Mo. Keine Kreditkarte für den Start nötig.
Kernfunktionen
99 Sprachen unterstützt
Transkribieren Sie Audio und Video in 99 Sprachen mit automatischer Spracherkennung. Von Englisch bis Japanisch, Spanisch bis Arabisch — wir decken es ab.
Sprechererkennung
Die automatische Sprechererkennung identifiziert und kennzeichnet unterschiedliche Stimmen. Perfekt für Interviews, Podcasts und Meetings mit mehreren Teilnehmern.
Zeitstempel
Jedes Transkript enthält präzise Zeitstempel. Klicken Sie auf einen Zeitstempel, um zu genau diesem Moment im Audio zu springen. Unverzichtbar für Navigation und Video-Untertitel.
5 Exportformate
Exportieren Sie als TXT (reiner Text), DOCX (Word), SRT oder VTT (Video-Untertitel) oder JSON (strukturierte Daten mit Zeitstempeln). Wählen Sie das Format, das zu Ihrem Workflow passt.
Schnelle Verarbeitung
KI-gestützte Transkription ist in Minuten fertig, nicht in Stunden. Eine 1-Stunden-Aufnahme wird typischerweise in 5–10 Minuten verarbeitet.
Integrierter Editor
Überprüfen und bearbeiten Sie Ihre Transkripte direkt im Browser. Korrigieren Sie Fehler, benennen Sie Sprecher um und feilen Sie an Ihrem Transkript vor dem Export.
Meeting-Bot
Senden Sie einen KI-Bot zu Ihren Zoom-, Google Meet- oder Teams-Meetings. Er zeichnet auf, transkribiert und erstellt strukturierte Zusammenfassungen mit Aufgaben und Entscheidungen. Verbraucht 3× Transkriptions-Credits.
KI-Zusammenfassungen
Verwandeln Sie jedes Transkript in strukturierte Kernpunkte, Aufgaben, Kapitelmarker und Entscheidungen. Funktioniert bei Meetings, Vorlesungen, Interviews und Podcasts. In allen kostenpflichtigen Tarifen enthalten.
Transkript-Übersetzung
Übersetzen Sie jedes Transkript in 133 Sprachen über Google Translate — keine Zusatzkosten, kein Drittanbieter-Konto nötig. In allen Tarifen verfügbar.
Bulk-Upload — 50 Dateien auf einmal
Laden Sie bis zu 50 Audio- oder Videodateien auf einmal hoch. Alle werden parallel verarbeitet — nicht nacheinander. Formate frei mischen und alles als ZIP herunterladen.
KI-Chat mit Ihrem Transkript
Stellen Sie natürlichsprachliche Fragen zu jeder Transkription, die Ihnen gehört, und erhalten Sie Antworten, die durch direkte Zitate aus dem Audio belegt sind. „Welche Aufgaben wurden vergeben?“, „Was hat Sarah entschieden?“, „Finde das stärkste Zitat zu X“ — Fragen, für die Sie normalerweise eine Aufnahme erneut ansehen müssten, werden zu einer einzigen Abfrage. Jede Antwort enthält klickbare Zeitstempel-Zitate, die den Audioplayer zum exakten Moment des Zitats spulen. Zitate werden serverseitig gegen das tatsächliche Transkript validiert — die KI ist auf Ihre Aufnahme beschränkt und kann weder einen Zeitstempel noch ein Zitat erfinden. Konversationen bleiben 90 Tage erhalten, mit Multi-Turn-Kontext und Unterstützung für 99 Sprachen (fragen Sie in einer Sprache über eine Aufnahme in einer anderen). Verfügbar in den kostenpflichtigen Tarifen.
Unterstützte Formate
Audioformate
Videoformate
Exportformate (5)
Reiner Text
Word-Dokument
Untertitel
Web-Untertitel
Strukturierte Daten
Anwendungsfälle
Meeting-Transkription
KI-Bot tritt Zoom-, Google Meet- oder Teams-Meetings bei
Podcast-Transkription
Verwandeln Sie Episoden in Show Notes und Blogbeiträge
Interview-Transkription
Transkribieren mit Sprechererkennung
Vorlesungs-Transkription
Wandeln Sie Unterrichtsaufnahmen in Lernnotizen um
Video zu Text
Transkripte extrahieren und Untertitel erstellen
MP3 zu Text
Audiodateien in Textdokumente umwandeln
Audio-Transkription
Allgemeine Audio-zu-Text-Konvertierung
Angetrieben von fortschrittlicher KI
VexaScribe nutzt hochmoderne Spracherkennungsmodelle, die mit Millionen Stunden Audio trainiert wurden. Dieselbe Technologie hinter Sprachassistenten, angepasst für präzise Transkription.
Genauigkeit bei klarem Audio
Unterstützte Sprachen
Verarbeitungszeit pro Stunde
Funktionsverfügbarkeit nach Tarif
Alle Tarife enthalten eine kostenlose Testphase. Keine Kreditkarte für den Start erforderlich.
| Funktion | Kostenlose Testphase | Starter ($2/Mo) | Pro ($10/Mo) |
|---|---|---|---|
| Audio- & Video-Transkription | ✓ | ✓ | ✓ |
| 99 Sprachen unterstützt | ✓ | ✓ | ✓ |
| Sprechererkennung | ✓ | ✓ | ✓ |
| Zeitstempel | ✓ | ✓ | ✓ |
| Export: TXT, DOCX, SRT, VTT, JSON | ✓ | ✓ | ✓ |
| Transkript-Übersetzung (133 Sprachen) | ✓ | ✓ | ✓ |
| Integrierter Editor | ✓ | ✓ | ✓ |
| KI-Zusammenfassungen | — | ✓ | ✓ |
| Meeting-Bot (Zoom, Google Meet, Teams) | — | ✓ | ✓ |
| Bulk-Transkription | ✓ | ✓ | ✓ |
Von einer URL transkribieren — kein Herunterladen nötig
Fügen Sie einen Link ein und erhalten Sie ein Transkript. Wir übernehmen den Download im Hintergrund. Gleiche Genauigkeit, gleiches Ergebnis, gleiche Minutenkosten wie bei einem Datei-Upload — Sie sparen sich den Schritt „erst Video herunterladen, dann hochladen“.
| Quelle | Status | Was akzeptiert wird |
|---|---|---|
| YouTube | ✓ Live | Jede öffentliche Video-URL. Audio wird extrahiert und mit Sprechererkennung transkribiert. Fällt auf Untertitel zurück, falls der Audio-Download fehlschlägt. |
| TikTok | ✓ Live | Jede öffentliche TikTok-Video-URL — sowohl kurze Reels-artige Clips als auch längere Videos funktionieren. |
| ✓ Live | Öffentliche Reels, Videobeiträge und Video-Stories. Fotobeiträge liefern eine klare Fehlermeldung „kein Videoinhalt“. | |
| Direkt-URL | ✓ Live | Jeder HTTPS-Link zu einer Audio- oder Videodatei — Podcast-MP3, S3-Link, Google-Drive-Freigabe, Telegram-Bot-Download, Dropbox usw. |
| Spotify | ⏳ Bald verfügbar | Erkannt, aber noch nicht gebaut. Fügen Sie einen Link ein und eine „Für früheren Start abstimmen“-Aufforderung erscheint, damit wir nach Nachfrage priorisieren können. |
Kostenmodell: URL-Uploads werden aus demselben monatlichen Minuten-Pool wie Datei-Uploads abgezogen — 1 Minute Audio = 1 Minute aus Ihrem Tarif. Keine separate URL-Stufe.
Was VexaScribe nicht macht
Fünf Dinge, für die VexaScribe wirklich nicht gebaut ist, jeweils mit dem Werkzeug, das wir tatsächlich empfehlen würden. Wenn Ihr Anwendungsfall in dieser Liste steht, sparen Sie sich die Test-Anmeldung.
Keine Live-Untertitelung in Echtzeit
Transkripte werden nach dem Upload generiert, nicht während Sie sprechen. Eine 1-Stunden-Datei benötigt 5–10 Minuten zur Verarbeitung — gut für Meetings, die Sie im Nachhinein ansehen, falsch für Live-Events.
Stattdessen nutzen: Otter Live, die integrierten Untertitel von Google Meet oder Web Captioner für kostenlose browserbasierte Live-Untertitel.
Keine öffentliche REST-API
VexaScribe ist eine Web-App für Menschen, kein Backend-Dienst. Es gibt keine Entwickler-API, kein SDK und keinen Webhook für programmatische Uploads.
Stattdessen nutzen: OpenAI Whisper API ($0.006/min), Deepgram Nova-3 (~$0.0043/min) oder AssemblyAI (~$0.012/min).
Keine Videobearbeitung
Sie können SRT/VTT-Untertitel exportieren, um sie in Ihren Editor einzufügen, aber VexaScribe schneidet keine Clips, entfernt keine Füllwörter und brennt keine Untertitel ins Video ein.
Stattdessen nutzen: Descript oder Vrew für transkriptbasierte Videobearbeitung; Premiere/Final Cut/DaVinci für klassische NLE-Workflows.
Kein individuelles Vokabular-Tuning
Sie können kein Wörterbuch mit Markennamen, Medikamentennamen oder technischem Fachjargon hochladen, um das Modell entsprechend zu beeinflussen. Whisper wird unverändert eingesetzt, ohne Feinabstimmung pro Konto.
Stattdessen nutzen: AssemblyAIs „word boost“ oder Deepgrams „keywords“-Parameter für Domänen mit vielen Eigennamen.
Kein On-Premise / Enterprise-Self-Hosting
Audio wird in unserer Cloud verarbeitet — es gibt keine air-gapped oder HIPAA-BAA-signierte Bereitstellung. Für Anwalt-Mandant-Gespräche, klinische Therapie oder klassifizierte Inhalte, bei denen ein Leck direkte rechtliche Haftung schafft, ist kein Cloud-Werkzeug (auch unseres nicht) die richtige Wahl.
Stattdessen nutzen: installieren Sie OpenAI Whisper lokal (kostenlos, läuft auf Ihrem Rechner, Audio verlässt ihn nie), oder für rechtssichere 100 % Genauigkeit nutzen Sie menschliche Transkription (Rev, GoTranscript) für $1.25–$1.99/min.
Ehrliche Genauigkeit — was die Zahlen wirklich bedeuten
VexaScribe nutzt OpenAI Whisper (speziell Modelle der large-v3-Klasse). Marketingseiten sagen gerne „99 % Genauigkeit“ — das ist nicht ehrlich. Die reale Whisper-Genauigkeit hängt stark von Audioqualität, Akzent und Anzahl der Sprecher ab. Damit können Sie rechnen.
Transkriptionsgenauigkeit (Whisper)
- Sauberes Studio-Englisch, ein Sprecher~92–97 %
- Akzentuiertes Englisch (nicht-muttersprachlich, regional)~85–92 %
- Laute Umgebungen (Café, Telefon, im Freien)~80–90 %
- Sauberes Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch, Niederländisch~88–94 %
- Koreanisch, Japanisch, Indonesisch, Türkisch, Arabisch, Polnisch~85–92 %
Quelle: Open ASR Leaderboard + Whisper-Paper-Benchmarks (LibriSpeech, FLEURS, Common Voice).
Genauigkeit der Sprechererkennung
- 2 Sprecher, keine Überlappung95 %+
- 3–4 Sprecher, gelegentliche Überlappung~88–94 %
- 5–6 Sprecher, Meeting-Dynamik~80–90 %
- 7–15 Sprecher, Panel oder Fokusgruppe~70–82 %
- Bis zu 50 Sprecher (maximal unterstützt)variabel
Beste Genauigkeit mit 2–6 klar unterscheidbaren Sprechern. Sie können Sprecher 1/2/3 später im Editor umbenennen.
Was wirklich den Unterschied macht
Drei Dinge, die mehr zählen als die Wahl des „besten“ Transkriptionswerkzeugs:
- Ein anständiges Mikrofon (USB-Headset oder Ansteckmikro schlagen Laptop-Mikros um 5–15 Genauigkeitspunkte).
- Ein Sprecher nach dem anderen — Überlappung zerstört sowohl Transkription als auch Sprechererkennung.
- Geringe Hintergrundgeräusche. Nehmen Sie in einem geschlossenen Raum auf, nicht neben einem Ventilator oder Lüftungsauslass.
Wenn Sie rechtssichere 100 % Genauigkeit brauchen (Gerichtsakten, regulierte Forschung), nutzen Sie menschliche Transkriptionsdienste wie Rev oder GoTranscript für $1.25–$1.99/min. KI bringt Sie zu ~95 % zu 1–2 % der Kosten — passend für die meisten Anwendungsfälle, falsch für einige.
Funktions-FAQ
Welche Sprachen unterstützt VexaScribe und wie genau sind sie?
99 Sprachen, alle angetrieben von OpenAI Whisper. Die Genauigkeit hängt von der Sprache und der Audioqualität ab: ~92–97 % bei sauberem englischen Audio (laut Open ASR Leaderboard), ~88–94 % bei sauberem Spanisch, Französisch, Deutsch, Italienisch, Portugiesisch und Niederländisch, sowie ~85–92 % bei Koreanisch, Japanisch, Indonesisch, Türkisch, Polnisch und Arabisch. Stark akzentuierte Sprache, überlappende Sprecher oder laute Umgebungen senken diese Zahlen um 5–10 Punkte. Die Sprache wird automatisch erkannt oder Sie können sie manuell festlegen.
Hat VexaScribe eine öffentliche REST-API?
Noch nicht — VexaScribe ist eine Web-App, kein API-Produkt. Wenn Sie Transkription in Ihre eigene Software integrieren müssen, nutzen Sie die OpenAI Whisper API ($0.006/min), Deepgram (~$0.0043/min bei Nova-3) oder AssemblyAI (~$0.012/min). Alle drei bieten ordentliche SDKs und Dokumentation. Wenn Sie einen No-Code-Workflow möchten, der Dateien hochlädt und Transkripte herunterlädt, ist VexaScribe die richtige Wahl — nur eben nicht per API.
Welche Dateiformate kann VexaScribe transkribieren?
Audio: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, OPUS. Video: MP4, MOV, AVI, MKV, WebM, WMV, FLV. Die Tonspur wird automatisch aus Videodateien extrahiert — kein separater Konvertierungsschritt. Exporte: TXT, DOCX, SRT, VTT, JSON.
Wie groß darf eine hochgeladene Datei sein?
Bis zu 5 GB pro Datei, das entspricht etwa 90 Stunden MP3 bei 128 kbps oder rund 8 Stunden 1080p-Video. Das liegt weit über der 25-MB-Grenze der meisten kostenlosen Konverter-Websites und der ~200-MB-Grenze der Gratisstufe von Otter. Für Dateien größer als 5 GB teilen Sie die Datei in Audacity oder ffmpeg und laden die Teile separat hoch.
Trainiert VexaScribe KI-Modelle mit meinem Audio?
Nein. Ihr Audio und Ihre Transkripte werden nicht zum Training irgendeines Modells verwendet — weder unseres noch das von OpenAI (wir nutzen Whisper über die API, die nicht mit Eingaben trainiert). Sie können jede Datei jederzeit aus Ihrem Dashboard löschen, und sowohl Audio als auch Transkript werden entfernt. Audio wird während der Übertragung (TLS) und im Ruhezustand verschlüsselt. Für Anwalt-Mandant-, klinische oder klassifizierte Inhalte, bei denen ein Leck direkte rechtliche Haftung verursachen würde, installieren Sie stattdessen OpenAI Whisper lokal — kein Cloud-Werkzeug, auch unseres nicht, ist dieses Risiko wert.
Was ist in der kostenlosen Testphase enthalten?
30 Minuten Transkriptions-Guthaben, alle 99 Sprachen, Sprechererkennung, Zeitstempel, jedes Exportformat (TXT/DOCX/SRT/VTT/JSON), der integrierte Editor, Bulk-Upload (bis zu 50 Dateien) und Transkript-Übersetzung in 133 Sprachen. Keine Kreditkarte erforderlich. KI-Zusammenfassungen und der Meeting-Bot (Zoom/Google Meet/Teams) sind kostenpflichtig — sie beginnen bei $2/Mo im Starter-Tarif.
Bereit, mit dem Transkribieren zu beginnen?
Testen Sie VexaScribe kostenlos mit 30 Minuten Transkription. Keine Kreditkarte erforderlich.