Funkcje VexaScribe

VexaScribe — transkrypcja AI w 99 językach. Rozpoznawanie mówcy, znaczniki czasu, podsumowania AI oraz wbudowane tłumaczenie transkrypcji (133 języki). Prześlij pliki lub wyślij bota do spotkań Zoom, Meet czy Teams. Od $2/mies.

Czym jest VexaScribe w 80 słowach

VexaScribe to aplikacja webowa, która zamienia audio i wideo w przeszukiwalne, opatrzone znacznikami czasu transkrypcje z etykietami mówców — napędzana przez OpenAI Whisper. Upuść plik (do 5 GB), wklej link YouTube / TikTok / Instagram / bezpośredni URL albo wyślij bota na swoje spotkanie Zoom, Google Meet lub Teams. Otrzymasz transkrypcję w 99 językach w ok. 5–10 minut na godzinę nagrania, opcjonalne podsumowanie AI z listą działań oraz eksporty do TXT, DOCX, SRT, VTT lub JSON. 30 minut za darmo, potem $2–$20/mies. Bez karty kredytowej na start.

Kluczowe funkcje

Obsługa 99 języków

Transkrybuj audio i wideo w 99 językach z automatycznym wykrywaniem języka. Od angielskiego po japoński, od hiszpańskiego po arabski — mamy to pokryte.

Rozpoznawanie mówcy

Automatyczne rozpoznawanie mówcy identyfikuje i etykietuje różne głosy. Idealne do wywiadów, podcastów i spotkań z wieloma uczestnikami.

Znaczniki czasu

Każda transkrypcja zawiera precyzyjne znaczniki czasu. Kliknij dowolny znacznik, aby przejść do tego momentu w nagraniu. Niezbędne do nawigacji i napisów wideo.

5 formatów eksportu

Eksportuj jako TXT (zwykły tekst), DOCX (Word), SRT lub VTT (napisy wideo) albo JSON (dane strukturalne ze znacznikami czasu). Wybierz format, który pasuje do twojego przepływu pracy.

Szybkie przetwarzanie

Transkrypcja napędzana AI kończy się w minutach, a nie godzinach. Nagranie 1-godzinne przetwarza się zazwyczaj w 5–10 minut.

Wbudowany edytor

Przeglądaj i edytuj swoje transkrypcje bezpośrednio w przeglądarce. Popraw błędy, zmień nazwy mówców i dopracuj transkrypcję przed eksportem.

Bot do spotkań

Wyślij bota AI na swoje spotkania Zoom, Google Meet lub Teams. Nagrywa, transkrybuje i generuje strukturalne podsumowania z listą działań i decyzjami. Zużywa 3× kredyty transkrypcji.

Podsumowania AI

Zamień dowolną transkrypcję w strukturalne kluczowe punkty, listę działań, znaczniki rozdziałów i decyzje. Działa na spotkaniach, wykładach, wywiadach i podcastach. Wliczone we wszystkie płatne plany.

Tłumaczenie transkrypcji

Przetłumacz dowolną transkrypcję na 133 języki przez Google Translate — bez dodatkowych kosztów, bez konta zewnętrznego. Dostępne we wszystkich planach.

Przesyłanie zbiorcze — 50 plików naraz

Prześlij do 50 plików audio lub wideo za jednym razem. Wszystkie przetwarzane równolegle — nie po jednym. Mieszaj formaty swobodnie i pobierz wszystko jako ZIP.

Czat AI z twoją transkrypcją

Zadawaj naturalne pytania na temat dowolnej transkrypcji, którą posiadasz, i otrzymuj odpowiedzi poparte bezpośrednimi cytatami z nagrania. „Jakie zadania zostały przypisane?”, „Co zdecydowała Sarah?”, „Znajdź najmocniejszy cytat o X” — pytania, na które normalnie musiałbyś ponownie odtworzyć nagranie, stają się jednym zapytaniem. Każda odpowiedź zawiera klikalne cytowania ze znacznikami czasu, które przewijają odtwarzacz audio do dokładnego momentu wypowiedzenia cytatu. Cytowania są walidowane po stronie serwera względem rzeczywistej transkrypcji — AI jest ograniczona do twojego nagrania i nie może wymyślić znacznika ani cytatu. Rozmowy zachowywane są przez 90 dni, z kontekstem wielu tur i obsługą 99 języków (pytaj w jednym języku o nagranie w innym). Dostępne w płatnych planach.

Obsługiwane formaty

Formaty audio

MP3WAVM4AFLACOGGAACWMAOPUS

Formaty wideo

MP4MOVAVIMKVWebMWMVFLV

Formaty eksportu (5)

TXT

Zwykły tekst

DOCX

Dokument Word

SRT

Napisy

VTT

Napisy webowe

JSON

Dane strukturalne

Napędzane zaawansowaną AI

VexaScribe korzysta z najnowocześniejszych modeli rozpoznawania mowy trenowanych na milionach godzin nagrań. Ta sama technologia stojąca za asystentami głosowymi, dostosowana do dokładnej transkrypcji.

95%

Dokładność dla czystego audio

99

Obsługiwanych języków

5–10 min

Czas przetwarzania na godzinę

Dostępność funkcji według planu

Wszystkie plany obejmują darmowy okres próbny. Bez karty kredytowej na start.

FunkcjaOkres próbnyStarter ($2/mies.)Pro ($10/mies.)
Transkrypcja audio i wideo
Obsługa 99 języków
Rozpoznawanie mówcy
Znaczniki czasu
Eksport: TXT, DOCX, SRT, VTT, JSON
Tłumaczenie transkrypcji (133 języki)
Wbudowany edytor
Podsumowania AI
Bot do spotkań (Zoom, Meet, Teams)
Transkrypcja zbiorcza

Transkrybuj z adresu URL — bez pobierania

Wklej link i otrzymaj transkrypcję. Pobieranie obsłużymy w tle. Ta sama dokładność, ten sam wynik, ten sam koszt minutowy co przy przesyłaniu pliku — pomijasz krok „najpierw pobierz wideo, potem prześlij”.

ŹródłoStatusCo akceptuje
YouTube✓ DziałaDowolny publiczny URL wideo. Audio jest pobierane i transkrybowane z rozpoznawaniem mówcy. W razie niepowodzenia pobierania audio wraca do napisów.
TikTok✓ DziałaDowolny publiczny URL wideo TikTok — działają zarówno krótkie klipy w stylu Reels, jak i dłuższe filmy.
Instagram✓ DziałaPubliczne Reels, posty wideo i wideo Stories. Posty ze zdjęciami zwracają czytelny błąd „brak treści wideo”.
Bezpośredni URL✓ DziałaDowolny link HTTPS do pliku audio lub wideo — MP3 podcastu, link S3, udostępnienie Google Drive, pobranie z bota Telegram, Dropbox itp.
Spotify⏳ WkrótceRozpoznawane, ale jeszcze niezbudowane. Wklej link, a pojawi się monit „Zagłosuj, aby było wcześniej”, żebyśmy mogli priorytetyzować według popytu.

Model kosztów: Przesyłanie z URL czerpie z tej samej miesięcznej puli minut co przesyłanie plików — 1 minuta audio = 1 minuta z twojego planu. Brak osobnego poziomu dla URL.

Czego VexaScribe nie robi

Pięć rzeczy, do których VexaScribe naprawdę nie został zbudowany, wraz z narzędziem, które faktycznie polecilibyśmy w każdym przypadku. Jeśli twój scenariusz jest na tej liście, oszczędź sobie rejestracji do wersji próbnej.

Brak napisów na żywo w czasie rzeczywistym

Transkrypcje są generowane po przesłaniu, a nie podczas mówienia. Plik 1-godzinny przetwarza się 5–10 minut — dobre dla spotkań, które oglądasz później, złe dla wydarzeń na żywo.

Użyj zamiast tego: Otter Live, wbudowane napisy w Google Meet lub Web Captioner do darmowych napisów na żywo w przeglądarce.

Brak publicznego REST API

VexaScribe to aplikacja webowa dla ludzi, a nie usługa backendowa. Nie ma API dla deweloperów, SDK ani webhooka do programowego przesyłania.

Użyj zamiast tego: OpenAI Whisper API ($0.006/min), Deepgram Nova-3 (~$0.0043/min) lub AssemblyAI (~$0.012/min).

Brak edycji wideo

Możesz wyeksportować napisy SRT/VTT do wrzucenia do swojego edytora, ale VexaScribe nie wytnie klipów, nie usunie słów-wypełniaczy ani nie wypali napisów na wideo.

Użyj zamiast tego: Descript lub Vrew do edycji wideo opartej na transkrypcji; Premiere/Final Cut/DaVinci do tradycyjnych przepływów NLE.

Brak strojenia własnego słownika

Nie możesz przesłać słownika nazw marek, nazw leków ani technicznego żargonu, aby wpłynąć na model. Whisper jest używany jak jest, bez dostrajania per konto.

Użyj zamiast tego: „word boost” w AssemblyAI lub parametr „keywords” w Deepgram dla domen bogatych w nazwy własne.

Brak wdrożenia on-premise / enterprise self-hosting

Audio jest przetwarzane w naszej chmurze — nie ma dostępnego wdrożenia air-gapped ani podpisanego HIPAA-BAA. Dla treści adwokat-klient, terapii klinicznej lub materiałów tajnych, gdzie wyciek tworzy bezpośrednią odpowiedzialność prawną, żadne narzędzie chmurowe (w tym nasze) nie jest właściwym wyborem.

Użyj zamiast tego: zainstaluj OpenAI Whisper lokalnie (za darmo, działa na twojej maszynie, audio nigdy nie opuszcza urządzenia) lub dla 100% dokładności klasy prawnej użyj transkrypcji ludzkiej (Rev, GoTranscript) za $1.25–$1.99/min.

Uczciwa dokładność — co liczby naprawdę oznaczają

VexaScribe używa OpenAI Whisper (konkretnie modeli klasy large-v3). Strony marketingowe uwielbiają mówić „99% dokładności” — to nieuczciwe. Rzeczywista dokładność Whispera mocno zależy od jakości audio, akcentu i liczby mówców. Oto, czego można się spodziewać.

Dokładność transkrypcji (Whisper)

  • Czysty studyjny angielski, jeden mówca~92–97%
  • Angielski z akcentem (nie-natywny, regionalny)~85–92%
  • Głośne otoczenie (kawiarnie, telefon, plener)~80–90%
  • Czysty hiszpański, francuski, niemiecki, włoski, portugalski, niderlandzki~88–94%
  • Koreański, japoński, indonezyjski, turecki, arabski, polski~85–92%

Źródło: Open ASR Leaderboard + benchmarki z artykułu Whisper (LibriSpeech, FLEURS, Common Voice).

Dokładność rozpoznawania mówcy

  • 2 mówców, brak nakładania95%+
  • 3–4 mówców, sporadyczne nakładanie~88–94%
  • 5–6 mówców, dynamika spotkania~80–90%
  • 7–15 mówców, panel lub grupa fokusowa~70–82%
  • Do 50 mówców (maks. obsługiwane)zmienna

Najlepsza dokładność przy 2–6 wyraźnych mówcach. Możesz zmienić nazwy Mówca 1/2/3 w edytorze później.

Co robi realną różnicę

Trzy rzeczy, które mają większe znaczenie niż wybór „najlepszego” narzędzia do transkrypcji:

  1. Przyzwoity mikrofon (zestaw słuchawkowy USB lub krawatowy bije wbudowany laptopa o 5–15 punktów dokładności).
  2. Jeden mówca naraz — nakładanie zabija zarówno transkrypcję, jak i rozpoznawanie mówcy.
  3. Niski hałas w tle. Nagrywaj w zamkniętym pokoju, nie obok wentylatora ani kratki wentylacyjnej.

Jeśli potrzebujesz 100% dokładności klasy prawnej (pisma sądowe, regulowane badania), skorzystaj z ludzkich usług transkrypcji jak Rev czy GoTranscript za $1.25–$1.99/min. AI dowozi ~95% za 1–2% kosztów — dobrze w większości zastosowań, źle w niektórych.

FAQ o funkcjach

Jakie języki obsługuje VexaScribe i jak dokładne one są?

99 języków, wszystkie napędzane przez OpenAI Whisper. Dokładność zależy od języka i jakości audio: ~92–97% na czystym angielskim audio (według Open ASR Leaderboard), ~88–94% na czystym hiszpańskim, francuskim, niemieckim, włoskim, portugalskim i niderlandzkim oraz ~85–92% na koreańskim, japońskim, indonezyjskim, tureckim, polskim i arabskim. Mocno akcentowana mowa, nakładający się mówcy lub głośne otoczenie obniżają te liczby o 5–10 punktów. Język jest wykrywany automatycznie lub możesz wymusić go ręcznie.

Czy VexaScribe ma publiczne REST API?

Jeszcze nie — VexaScribe to aplikacja webowa, a nie produkt API. Jeśli musisz zintegrować transkrypcję z własnym oprogramowaniem, użyj OpenAI Whisper API ($0.006/min), Deepgram (~$0.0043/min na Nova-3) lub AssemblyAI (~$0.012/min). Wszystkie trzy mają solidne SDK i dokumentację. Jeśli chcesz przepływu no-code, który przesyła pliki i pobiera transkrypcje, VexaScribe pasuje idealnie — tylko nie przez API.

Jakie formaty plików może transkrybować VexaScribe?

Audio: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, OPUS. Wideo: MP4, MOV, AVI, MKV, WebM, WMV, FLV. Ścieżka audio jest wyodrębniana z plików wideo automatycznie — bez osobnego kroku konwersji. Eksport: TXT, DOCX, SRT, VTT, JSON.

Jak duży plik mogę przesłać?

Do 5 GB na plik, co odpowiada mniej więcej 90 godzinom MP3 przy 128 kbps lub około 8 godzinom wideo 1080p. To znacznie powyżej limitu 25 MB w większości darmowych konwerterów i ~200 MB w darmowej wersji Otter. Dla plików większych niż 5 GB podziel plik w Audacity lub ffmpeg i prześlij fragmenty osobno.

Czy VexaScribe trenuje modele AI na moim audio?

Nie. Twoje audio i transkrypcje nie są używane do trenowania żadnego modelu — ani naszego, ani OpenAI (używamy Whisper przez API, które nie trenuje na danych wejściowych). Możesz usunąć dowolny plik z panelu w dowolnej chwili, a zarówno audio, jak i transkrypcja zostaną usunięte. Audio jest szyfrowane w tranzycie (TLS) i w spoczynku. Dla treści adwokat-klient, klinicznych lub tajnych, gdzie wyciek stworzyłby bezpośrednią odpowiedzialność prawną, zainstaluj OpenAI Whisper lokalnie — żadne narzędzie chmurowe, w tym nasze, nie jest warte tego ryzyka.

Co obejmuje darmowy okres próbny?

30 minut kredytu transkrypcji, wszystkie 99 języków, rozpoznawanie mówcy, znaczniki czasu, wszystkie formaty eksportu (TXT/DOCX/SRT/VTT/JSON), wbudowany edytor, przesyłanie zbiorcze (do 50 plików) i tłumaczenie transkrypcji na 133 języki. Bez karty kredytowej. Podsumowania AI i bot do spotkań (Zoom/Meet/Teams) są tylko płatne — zaczynają się od $2/mies. w planie Starter.

Gotowy, aby zacząć transkrybować?

Wypróbuj VexaScribe za darmo z 30 minutami transkrypcji. Bez karty kredytowej.