Tính năng VexaScribe
VexaScribe — phiên âm bằng AI trên 99 ngôn ngữ. Nhận diện người nói, dấu thời gian, tóm tắt AI và dịch bản phiên âm tích hợp sẵn (133 ngôn ngữ). Tải lên tệp hoặc gửi bot cuộc họp đến Zoom, Meet hoặc Teams. Từ $2/tháng.
VexaScribe là gì, trong 80 chữ
VexaScribe là một ứng dụng web biến âm thanh và video thành các bản phiên âm có thể tìm kiếm, có dấu thời gian và nhãn người nói bằng OpenAI Whisper. Thả một tệp (tối đa 5 GB), dán liên kết YouTube / TikTok / Instagram / URL trực tiếp, hoặc gửi bot đến cuộc họp Zoom, Google Meet hoặc Teams của bạn. Nhận bản phiên âm trên 99 ngôn ngữ trong khoảng 5–10 phút cho mỗi giờ âm thanh, tóm tắt AI tùy chọn kèm hạng mục hành động và xuất ra TXT, DOCX, SRT, VTT hoặc JSON. 30 phút miễn phí, sau đó $2–$20/tháng. Không cần thẻ tín dụng để bắt đầu.
Tính năng cốt lõi
Hỗ trợ 99 ngôn ngữ
Phiên âm âm thanh và video trên 99 ngôn ngữ với tự động nhận diện ngôn ngữ. Từ tiếng Anh đến tiếng Nhật, tiếng Tây Ban Nha đến tiếng Ả Rập — chúng tôi lo hết.
Nhận diện người nói
Nhận diện người nói tự động xác định và gắn nhãn các giọng khác nhau. Hoàn hảo cho phỏng vấn, podcast và cuộc họp với nhiều người tham gia.
Dấu thời gian
Mỗi bản phiên âm đều có dấu thời gian chính xác. Nhấp vào bất kỳ dấu thời gian nào để nhảy đến thời điểm đó trong âm thanh. Thiết yếu cho điều hướng và phụ đề video.
5 định dạng xuất
Xuất ra TXT (văn bản thuần), DOCX (Word), SRT hoặc VTT (phụ đề video), hoặc JSON (dữ liệu có cấu trúc với dấu thời gian). Chọn định dạng phù hợp với quy trình của bạn.
Xử lý nhanh
Phiên âm bằng AI hoàn tất trong vài phút, không phải vài giờ. Bản ghi 1 giờ thường xử lý trong 5–10 phút.
Trình chỉnh sửa tích hợp
Xem lại và chỉnh sửa bản phiên âm trực tiếp trong trình duyệt. Sửa lỗi, đổi tên người nói và hoàn thiện bản phiên âm trước khi xuất.
Bot cuộc họp
Gửi bot AI đến cuộc họp Zoom, Google Meet hoặc Teams của bạn. Bot ghi lại, phiên âm và tạo tóm tắt có cấu trúc kèm hạng mục hành động và quyết định. Sử dụng 3× tín dụng phiên âm.
Tóm tắt AI
Biến bất kỳ bản phiên âm nào thành các điểm chính, hạng mục hành động, dấu chương và quyết định có cấu trúc. Hoạt động với cuộc họp, bài giảng, phỏng vấn và podcast. Bao gồm trong mọi gói trả phí.
Dịch bản phiên âm
Dịch bất kỳ bản phiên âm nào sang 133 ngôn ngữ qua Google Translate — không phí thêm, không cần tài khoản bên thứ ba. Có sẵn trên mọi gói.
Tải lên hàng loạt — 50 tệp cùng lúc
Tải lên tối đa 50 tệp âm thanh hoặc video một lượt. Tất cả được xử lý song song — không phải từng tệp một. Trộn định dạng tự do và tải xuống mọi thứ dưới dạng ZIP.
Trò chuyện AI với bản phiên âm của bạn
Đặt câu hỏi bằng ngôn ngữ tự nhiên về bất kỳ bản phiên âm nào bạn sở hữu và nhận câu trả lời được hậu thuẫn bằng trích dẫn trực tiếp từ âm thanh. “Những hạng mục hành động nào đã được giao?”, “Sarah đã quyết định gì?”, “Tìm trích dẫn mạnh nhất về X” — những câu hỏi mà bạn thường phải xem lại bản ghi để trả lời trở thành một truy vấn duy nhất. Mỗi câu trả lời đi kèm trích dẫn dấu thời gian có thể nhấp để tìm đến trình phát âm thanh chính xác thời điểm câu trích dẫn được nói. Trích dẫn được xác thực phía máy chủ so với bản phiên âm thực tế — AI bị ràng buộc vào bản ghi của bạn và không thể bịa ra dấu thời gian hay trích dẫn. Cuộc trò chuyện được lưu trong 90 ngày, với ngữ cảnh đa lượt và hỗ trợ 99 ngôn ngữ (hỏi bằng một ngôn ngữ về bản ghi bằng một ngôn ngữ khác). Có sẵn trên các gói trả phí.
Định dạng được hỗ trợ
Định dạng âm thanh
Định dạng video
Định dạng xuất (5)
Văn bản thuần
Tài liệu Word
Phụ đề
Phụ đề web
Dữ liệu có cấu trúc
Trường hợp sử dụng
Phiên âm cuộc họp
Bot AI tham gia cuộc họp Zoom, Meet hoặc Teams
Phiên âm podcast
Biến tập phát thành ghi chú show và bài blog
Phiên âm phỏng vấn
Phiên âm với nhận diện người nói
Phiên âm bài giảng
Chuyển bản ghi lớp học thành ghi chú học tập
Video sang văn bản
Trích xuất bản phiên âm và tạo phụ đề
MP3 sang văn bản
Chuyển tệp âm thanh thành tài liệu văn bản
Phiên âm âm thanh
Chuyển đổi âm thanh sang văn bản tổng quát
Được hỗ trợ bởi AI tiên tiến
VexaScribe sử dụng các mô hình nhận dạng giọng nói hàng đầu được huấn luyện trên hàng triệu giờ âm thanh. Cùng công nghệ đằng sau các trợ lý ảo, được điều chỉnh cho phiên âm chính xác.
Độ chính xác cho âm thanh rõ ràng
Ngôn ngữ được hỗ trợ
Thời gian xử lý mỗi giờ
Tính khả dụng của tính năng theo gói
Mọi gói đều bao gồm bản dùng thử miễn phí. Không cần thẻ tín dụng để bắt đầu.
| Tính năng | Dùng thử miễn phí | Starter ($2/tháng) | Pro ($10/tháng) |
|---|---|---|---|
| Phiên âm âm thanh & video | ✓ | ✓ | ✓ |
| Hỗ trợ 99 ngôn ngữ | ✓ | ✓ | ✓ |
| Nhận diện người nói | ✓ | ✓ | ✓ |
| Dấu thời gian | ✓ | ✓ | ✓ |
| Xuất: TXT, DOCX, SRT, VTT, JSON | ✓ | ✓ | ✓ |
| Dịch bản phiên âm (133 ngôn ngữ) | ✓ | ✓ | ✓ |
| Trình chỉnh sửa tích hợp | ✓ | ✓ | ✓ |
| Tóm tắt AI | — | ✓ | ✓ |
| Bot cuộc họp (Zoom, Meet, Teams) | — | ✓ | ✓ |
| Phiên âm hàng loạt | ✓ | ✓ | ✓ |
Phiên âm từ URL — không cần tải xuống
Dán một liên kết và nhận bản phiên âm. Chúng tôi xử lý việc tải xuống ở nền. Cùng độ chính xác, cùng kết quả, cùng chi phí phút như tải lên tệp — bạn bỏ qua bước “tải video xuống trước, rồi tải lên”.
| Nguồn | Trạng thái | Chấp nhận gì |
|---|---|---|
| YouTube | ✓ Live | Bất kỳ URL video công khai nào. Âm thanh được trích xuất và phiên âm với nhận diện người nói. Chuyển sang phụ đề nếu tải âm thanh thất bại. |
| TikTok | ✓ Live | Bất kỳ URL video TikTok công khai nào — cả clip ngắn kiểu Reels và video dài đều hoạt động. |
| ✓ Live | Reels công khai, bài đăng video và Stories video. Bài đăng ảnh trả về lỗi rõ ràng “không có nội dung video”. | |
| URL trực tiếp | ✓ Live | Bất kỳ liên kết HTTPS nào tới tệp âm thanh hoặc video — MP3 podcast, liên kết S3, chia sẻ Google Drive, tải xuống từ bot Telegram, Dropbox, v.v. |
| Spotify | ⏳ Sắp ra mắt | Được nhận dạng nhưng chưa xây dựng. Dán một liên kết và một cửa sổ “Bình chọn cho sớm hơn” sẽ xuất hiện để chúng tôi ưu tiên dựa trên nhu cầu. |
Mô hình chi phí: Tải lên qua URL rút từ cùng một quỹ phút hàng tháng như tải lên tệp — 1 phút âm thanh = 1 phút từ gói của bạn. Không có mức giá URL riêng.
Những gì VexaScribe không làm
Năm điều VexaScribe thực sự không được xây dựng để làm, kèm công cụ chúng tôi thực sự khuyên dùng trong mỗi trường hợp. Nếu trường hợp sử dụng của bạn nằm trong danh sách này, bạn có thể tiết kiệm thời gian đăng ký dùng thử.
Không có phụ đề trực tiếp theo thời gian thực
Bản phiên âm được tạo sau khi tải lên, không phải khi bạn đang nói. Tệp 1 giờ mất 5–10 phút để xử lý — phù hợp với cuộc họp bạn xem lại, không phù hợp với sự kiện trực tiếp.
Dùng thay thế: Otter Live, phụ đề tích hợp của Google Meet, hoặc Web Captioner cho phụ đề trực tiếp miễn phí trên trình duyệt.
Không có REST API công khai
VexaScribe là một ứng dụng web dành cho con người, không phải một dịch vụ backend. Không có API dành cho lập trình viên, không có SDK, không có webhook cho việc tải lên tự động.
Dùng thay thế: OpenAI Whisper API ($0.006/phút), Deepgram Nova-3 (~$0.0043/phút), hoặc AssemblyAI (~$0.012/phút).
Không có chỉnh sửa video
Bạn có thể xuất phụ đề SRT/VTT để đưa vào trình chỉnh sửa của mình, nhưng VexaScribe sẽ không cắt clip, loại bỏ từ đệm, hay khắc phụ đề vào video.
Dùng thay thế: Descript hoặc Vrew để chỉnh sửa video dựa trên bản phiên âm; Premiere/Final Cut/DaVinci cho quy trình NLE truyền thống.
Không có tinh chỉnh từ vựng tùy chỉnh
Bạn không thể tải lên một từ điển tên thương hiệu, tên thuốc hay thuật ngữ kỹ thuật để định hướng mô hình. Whisper được dùng nguyên bản, không có tinh chỉnh riêng cho từng tài khoản.
Dùng thay thế: “word boost” của AssemblyAI hoặc tham số “keywords” của Deepgram cho các lĩnh vực nhiều danh từ riêng.
Không có triển khai tại chỗ / tự lưu trữ doanh nghiệp
Âm thanh được xử lý trên đám mây của chúng tôi — không có triển khai cô lập mạng hay ký HIPAA-BAA. Đối với nội dung luật sư-khách hàng, trị liệu lâm sàng, hay tài liệu mật mà rò rỉ sẽ tạo trách nhiệm pháp lý trực tiếp, không có công cụ đám mây nào (kể cả của chúng tôi) là lựa chọn phù hợp.
Dùng thay thế: cài OpenAI Whisper cục bộ (miễn phí, chạy trên máy bạn, âm thanh không bao giờ rời máy), hoặc để đạt độ chính xác 100% cấp pháp lý hãy dùng phiên âm bằng con người (Rev, GoTranscript) với giá $1.25–$1.99/phút.
Độ chính xác trung thực — các con số thực sự có nghĩa gì
VexaScribe sử dụng OpenAI Whisper (cụ thể là các mô hình lớp large-v3). Các trang tiếp thị thích nói “độ chính xác 99%” — điều đó không trung thực. Độ chính xác Whisper thực tế phụ thuộc rất nhiều vào chất lượng âm thanh, giọng điệu và số người nói. Đây là những gì cần kỳ vọng.
Độ chính xác phiên âm (Whisper)
- Tiếng Anh studio sạch, một người nói~92–97%
- Tiếng Anh có giọng (không bản ngữ, vùng miền)~85–92%
- Môi trường ồn ào (quán cà phê, điện thoại, ngoài trời)~80–90%
- Tiếng Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha, Hà Lan sạch~88–94%
- Tiếng Hàn, Nhật, Indonesia, Thổ Nhĩ Kỳ, Ả Rập, Ba Lan~85–92%
Nguồn: Open ASR Leaderboard + benchmark của bài báo Whisper (LibriSpeech, FLEURS, Common Voice).
Độ chính xác nhận diện người nói
- 2 người nói, không chồng lấn95%+
- 3–4 người nói, thỉnh thoảng chồng lấn~88–94%
- 5–6 người nói, động lực cuộc họp~80–90%
- 7–15 người nói, hội thảo hoặc nhóm tập trung~70–82%
- Tối đa 50 người nói (hỗ trợ tối đa)thay đổi
Độ chính xác tốt nhất với 2–6 người nói riêng biệt. Bạn có thể đổi tên Người nói 1/2/3 trong trình chỉnh sửa sau đó.
Điều gì tạo khác biệt thực sự
Ba điều quan trọng hơn việc chọn công cụ phiên âm “tốt nhất”:
- Một micro tử tế (tai nghe USB hoặc mic gài áo hơn micro tích hợp của laptop 5–15 điểm độ chính xác).
- Một người nói mỗi lúc — chồng lấn phá hủy cả phiên âm lẫn nhận diện người nói.
- Tiếng ồn nền thấp. Ghi âm trong phòng đóng, không phải cạnh quạt hay lỗ thông gió HVAC.
Nếu bạn cần độ chính xác 100% cấp pháp lý (hồ sơ tòa án, nghiên cứu được quản lý), hãy dùng dịch vụ phiên âm bởi con người như Rev hoặc GoTranscript với giá $1.25–$1.99/phút. AI đưa bạn đến ~95% với 1–2% chi phí — phù hợp cho hầu hết trường hợp, không phù hợp với một số.
FAQ về tính năng
VexaScribe hỗ trợ những ngôn ngữ nào và độ chính xác ra sao?
99 ngôn ngữ, tất cả đều được vận hành bởi OpenAI Whisper. Độ chính xác phụ thuộc vào ngôn ngữ và chất lượng âm thanh: ~92–97% với âm thanh tiếng Anh sạch (theo Open ASR Leaderboard), ~88–94% với tiếng Tây Ban Nha, Pháp, Đức, Ý, Bồ Đào Nha và Hà Lan sạch, và ~85–92% với tiếng Hàn, Nhật, Indonesia, Thổ Nhĩ Kỳ, Ba Lan và Ả Rập. Giọng nói nặng, người nói chồng lấn hoặc môi trường ồn ào làm giảm những con số này 5–10 điểm. Ngôn ngữ được nhận diện tự động hoặc bạn có thể ép thủ công.
VexaScribe có REST API công khai không?
Chưa — VexaScribe là ứng dụng web, không phải sản phẩm API. Nếu bạn cần tích hợp phiên âm vào phần mềm của riêng mình, hãy dùng OpenAI Whisper API ($0.006/phút), Deepgram (~$0.0043/phút trên Nova-3), hoặc AssemblyAI (~$0.012/phút). Cả ba đều có SDK và tài liệu đầy đủ. Nếu bạn muốn quy trình không cần code để tải lên tệp và tải xuống bản phiên âm, VexaScribe là lựa chọn phù hợp — chỉ là không qua API.
VexaScribe có thể phiên âm những định dạng tệp nào?
Âm thanh: MP3, WAV, M4A, FLAC, OGG, AAC, WMA, OPUS. Video: MP4, MOV, AVI, MKV, WebM, WMV, FLV. Kênh âm thanh được tự động trích xuất từ tệp video — không có bước chuyển đổi riêng. Xuất: TXT, DOCX, SRT, VTT, JSON.
Tôi có thể tải lên tệp lớn cỡ nào?
Tối đa 5 GB mỗi tệp, tức khoảng 90 giờ MP3 ở 128 kbps hoặc khoảng 8 giờ video 1080p. Đó là vượt xa giới hạn 25 MB trên hầu hết các trang chuyển đổi miễn phí và giới hạn ~200 MB trên gói miễn phí của Otter. Với tệp lớn hơn 5 GB, hãy chia tệp trong Audacity hoặc ffmpeg và tải lên các phần riêng biệt.
VexaScribe có huấn luyện mô hình AI trên âm thanh của tôi không?
Không. Âm thanh và bản phiên âm của bạn không được dùng để huấn luyện bất kỳ mô hình nào — của chúng tôi lẫn của OpenAI (chúng tôi dùng Whisper qua API, không huấn luyện trên đầu vào). Bạn có thể xóa bất kỳ tệp nào khỏi bảng điều khiển bất cứ lúc nào, và cả âm thanh lẫn bản phiên âm đều bị xóa. Âm thanh được mã hóa khi truyền (TLS) và khi lưu trữ. Với nội dung luật sư-khách hàng, lâm sàng hay tài liệu mật mà rò rỉ sẽ tạo trách nhiệm pháp lý trực tiếp, hãy cài OpenAI Whisper cục bộ thay thế — không có công cụ đám mây nào, kể cả của chúng tôi, đáng để chấp nhận rủi ro đó.
Bản dùng thử miễn phí bao gồm những gì?
30 phút tín dụng phiên âm, tất cả 99 ngôn ngữ, nhận diện người nói, dấu thời gian, mọi định dạng xuất (TXT/DOCX/SRT/VTT/JSON), trình chỉnh sửa tích hợp, tải lên hàng loạt (tối đa 50 tệp) và dịch bản phiên âm sang 133 ngôn ngữ. Không cần thẻ tín dụng. Tóm tắt AI và bot cuộc họp (Zoom/Meet/Teams) chỉ có ở gói trả phí — bắt đầu từ $2/tháng trên gói Starter.
Sẵn sàng bắt đầu phiên âm?
Dùng thử VexaScribe miễn phí với 30 phút phiên âm. Không cần thẻ tín dụng.