Hướng dẫn lựa chọn năm 2026
10 Công cụ SRT-to-Speech tốt nhất năm 2026: So sánh giá, giọng & API
Cập nhật và kiểm tra thông tin lần cuối:
Trả lời nhanh
Công cụ SRT-to-speech phù hợp nhất phụ thuộc đầu ra bạn cần. TTSForFree là lựa chọn ưu tiên phụ đề có chi phí dễ tiếp cận cho dự án nhiều người nói, file SRT dài, hơn 1.800 giọng, API public cho single và multi-voice TTS, API SRT nhiều giọng và mức ước tính từ khoảng 0,43 USD cho mỗi giờ audio thành phẩm ở credit x1. SpeechGen có trình trả theo mức dùng trưởng thành, Vbee chuyên giọng Việt, ElevenLabs nhấn mạnh độ chân thực và nhân bản giọng, còn Narakeet mạnh về bài trình chiếu và video thuyết minh.
Lựa chọn nhanh
🏆 Tốt nhất tổng thể · 💰 Giá trị tốt nhất
TTSForFree
Chỉnh phụ đề chuyên dụng, nhiều nhà cung cấp cùng API cho single TTS, multi-voice TTS và job SRT nhiều giọng; mức trả phí từ 2,99 USD.
Tìm hiểu TTSForFree🧰 Trình chỉnh sửa tổng quát tốt nhất
SpeechGen
Trình TTS trưởng thành với chuyển phụ đề gốc, nhiều ngôn ngữ và hỗ trợ nhạc nền.
Tìm hiểu SpeechGen🇻🇳 Tốt nhất cho tiếng Việt
Vbee
Hệ sinh thái giọng Việt với phân loại vùng miền, sản phẩm doanh nghiệp và API.
Tìm hiểu Vbee🎤 Chất lượng giọng tốt nhất
ElevenLabs
Nền tảng audio AI cho giọng biểu cảm, nhân bản, giọng thương hiệu và dubbing nâng cao.
Tìm hiểu ElevenLabs📺 Tốt nhất cho bài trình chiếu
Narakeet
Audio từ SRT/VTT cùng thuyết minh bài trình chiếu, PowerPoint-to-video và tự động hóa video.
Tìm hiểu NarakeetAPI cho developer
Vì sao developer chọn TTSForFree
Dùng cùng một nền tảng cho tác vụ text đơn giản, nội dung nhiều người nói và tự động hóa phụ đề bám timestamp.
- API single TTS
- API Multi Voice
- API SRT-to-Speech
- API SRT nhiều người nói
- API trạng thái job bất đồng bộ và callback
Hỗ trợ quy trình API
TTSForFree cung cấp endpoint public cho single TTS, multi-voice TTS và SRT-to-speech. Mỗi block SRT có thể chọn một giọng khác nhau. Provider và model khả dụng thay đổi theo endpoint; tài liệu hiện tại ghi rõ giọng Gemini chưa được hỗ trợ trong chế độ SRT.
“Chưa được công bố công khai” nghĩa là nguồn đã xác minh chưa xác nhận trường này; không đồng nghĩa với “Không”.
| Công cụ | API tổng quát | API single TTS | API multi-voice TTS | API SRT-to-Speech | API SRT nhiều giọng |
|---|---|---|---|---|---|
| TTSForFree | Có | Có | Có | Có | Có |
| SpeechGen | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| Vbee | Có | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| ElevenLabs | Có | Có | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| Narakeet | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| Voicertool | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| SRT2Audio | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| Rask AI | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| Murf | Có | Hạn chế | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| HeyGen | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Chi phí ước tính mỗi giờ audio thành phẩm
So sánh tuyến tính bằng các mức giá SRT/audio gần nhất đã được công bố hoặc tính toán. Đơn vị là audio thành phẩm, không phải thời lượng video nguồn.
Ước tính ở mức credit x1
Ước tính ở cấp Pro
6 USD cho 30 phút thành phẩm
Gói Starter công bố; sản phẩm vẫn trong waitlist
Công cụ tập trung vào SRT/audio
Đây là nhóm so sánh gần nhất khi người dùng đã có phụ đề và chủ yếu cần audio được đồng bộ.
“Chưa được công bố công khai” nghĩa là nguồn đã xác minh chưa xác nhận trường này; không đồng nghĩa với “Không”.
| Công cụ | Phù hợp nhất cho | Tải SRT gốc | Tạo giọng theo timestamp | Quy trình nhiều người nói | Số lượng giọng | Ngôn ngữ | Mô hình giá | Giá trả phí khởi điểm | Chi phí ước tính mỗi giờ thành phẩm | Lựa chọn miễn phí | Xuất chỉ audio |
|---|---|---|---|---|---|---|---|---|---|---|---|
| TTSForFree | Quy trình làm nội dung ưu tiên phụ đề với chi phí dễ tiếp cận | Có | Có | Có | 1.800+ | 75+ | Gói credit; không bắt buộc đăng ký thuê bao hàng tháng | 2,99 USD | Khoảng 0,43 USD/giờ ở mức credit x1; khoảng 0,21 USD/giờ ở mức credit x0.5 | Có | Có |
| SpeechGen | Chỉnh sửa TTS đa dụng theo hình thức trả theo mức dùng | Có | Có | Hạn chế | Chưa được công bố công khai | 146 | Trả theo mức dùng; gói credit hết hạn sau tối đa một năm | Khoảng 4,99 USD | Khoảng 2,11 USD Standard; 4,22 USD Pro; 8,43 USD HD | Có | Có |
| Vbee | Sản xuất giọng đọc tiếng Việt chuyên nghiệp | Có | Chưa được công bố công khai | Chưa được công bố công khai | 400+ | 50+ | Gói credit theo tháng và theo năm | Chưa được công bố công khai | Chưa được công bố công khai | Có | Có |
| Narakeet | Bài trình chiếu, video thuyết minh và audio từ phụ đề | Có | Có | Chưa được công bố công khai | Khoảng 900 | Khoảng 100 | Mua dung lượng một lần, tính theo thời lượng được tạo | 6 USD | 12 USD cho mỗi giờ thành phẩm | Có | Có |
| Voicertool | Cần đánh giá thêm | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai |
| SRT2Audio | Người dùng đang đánh giá một sản phẩm audio SRT chuyên dụng còn trong waitlist | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Hạn mức theo gói được công bố; sản phẩm hiện trong waitlist | 29 USD Starter | 58 USD Starter; 41,40 USD Pro; 23,88 USD Business | Chưa được công bố công khai | Chưa được công bố công khai |
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Nền tảng dubbing, video và dịch vụ liền kề
Các sản phẩm này có thể bao gồm dịch video, avatar, lip-sync, rendering, nhân bản giọng hoặc chỉ cung cấp API. Số liệu theo giờ chỉ mang tính tham khảo, không phải bảng xếp hạng giá SRT audio ngang bằng.
“Chưa được công bố công khai” nghĩa là nguồn đã xác minh chưa xác nhận trường này; không đồng nghĩa với “Không”.
| Công cụ | Phù hợp nhất cho | Tải SRT gốc | Tạo giọng theo timestamp | Quy trình nhiều người nói | Số lượng giọng | Ngôn ngữ | Mô hình giá | Giá trả phí khởi điểm | Chi phí ước tính mỗi giờ thành phẩm | Lựa chọn miễn phí | Xuất chỉ audio |
|---|---|---|---|---|---|---|---|---|---|---|---|
| ElevenLabs | Độ chân thực của giọng, nhân bản giọng và dubbing nâng cao | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Nhiều ngôn ngữ; tổng số chính xác chưa được nêu tại đây | Gói tính theo credit; mức tiêu thụ thay đổi theo model | 6 USD Starter | Khoảng 12 USD Starter; 10,91 USD Creator; 9,90 USD Pro | Có | Có |
| Rask AI | Dubbing video đầy đủ thay vì chỉ chuyển SRT thành audio | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Gói dubbing video theo tháng hoặc năm | 60 USD/tháng, hoặc 50 USD/tháng khi thanh toán năm | Khoảng 144 USD theo tháng; 120 USD khi thanh toán năm | Chưa được công bố công khai | Chưa được công bố công khai |
| Murf | Sử dụng voice-agent API thay vì chỉnh sửa trong SRT Studio | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | API Falcon tính theo mức sử dụng | Mức API 0,01 USD/phút | 0,60 USD cho mỗi giờ được tạo | Chưa được công bố công khai | Chưa được công bố công khai |
| HeyGen | Tạo avatar và video đầy đủ | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Chưa được công bố công khai | Gói video/avatar; không quy đổi tại đây | Chưa được công bố công khai | Không nên quy đổi | Chưa được công bố công khai | Chưa được công bố công khai |
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Chi phí ước tính mỗi giờ audio thành phẩm: nhóm SRT/audio
Đơn vị là một giờ audio thành phẩm. Đây không phải một giờ video nguồn.
| Công cụ | Gói dùng để ước tính | Chi phí ước tính mỗi giờ audio thành phẩm | Phạm vi và ghi chú |
|---|---|---|---|
| TTSForFree | Từ 2,99 USD | ~0,43 USD/giờ ở mức credit x1 | Khoảng 7 giờ audio thành phẩm theo tỷ lệ credit hiện tại; chi phí thực tế thay đổi theo provider, cấp giọng, ngôn ngữ, tốc độ và số lần tạo lại. |
| SpeechGen | Gói đầu từ 4,99 USD | ~4,22 USD/giờ với Pro | Khoảng 71 phút ở Pro; Standard khoảng 2,11 USD/giờ và HD khoảng 8,43 USD/giờ. |
| Vbee | — | Chưa xác minh được | Trang giá công khai chưa trả về cách quy đổi gói và credit đủ rõ để tính ước lượng này. |
| Narakeet | 6 USD / 30 phút | 12 USD/giờ | Mua một lần; credit đã mua không hết hạn. |
| SRT2Audio Starter | 29 USD / 30 phút | 58 USD/giờ | Theo hạn mức công bố trên landing page; sản phẩm vẫn được mô tả là đang trong waitlist. |
| SRT2Audio Pro | 69 USD / 100 phút | 41,40 USD/giờ | Hạn mức Pro được công bố trên landing page; cần kiểm tra lại khả năng sử dụng. |
| SRT2Audio Business | 199 USD / 500 phút | 23,88 USD/giờ | Gói lớn nhất trong dữ liệu giá công bố được cung cấp. |
| Voicertool | — | Chưa xác minh được | Cần kiểm tra trực tiếp giá và quota hiện tại. |
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Tham khảo theo giờ: nền tảng dubbing, video và API
Các sản phẩm này có thể bao gồm dịch video, avatar, lip-sync, rendering, nhân bản giọng hoặc chỉ cung cấp API. Số liệu theo giờ chỉ mang tính tham khảo, không phải bảng xếp hạng giá SRT audio ngang bằng.
| Công cụ | Gói dùng để ước tính | Chi phí ước tính mỗi giờ audio thành phẩm | Phạm vi và ghi chú |
|---|---|---|---|
| ElevenLabs UI | Starter 6 USD / ~30 phút | ~12 USD/giờ | Creator khoảng 10,91 USD/giờ và Pro khoảng 9,90 USD/giờ; khả năng giọng và dubbing rộng hơn làm phạm vi khác biệt. |
| ElevenLabs API | Flash/Turbo | ~3,60 USD/giờ | API TTS được công bố khoảng 0,06 USD/phút; đây không phải giao diện chỉnh SRT hoàn chỉnh. |
| Rask AI | 60 USD / 25 phút | ~144 USD/giờ | Thanh toán năm ở mức 50 USD/tháng tương đương khoảng 120 USD/giờ. Rask là dịch vụ dubbing video rộng hơn. |
| Murf Falcon API | 0,01 USD/phút | 0,60 USD/giờ | Không so trực tiếp: đây là mốc voice-agent API, không phải quy trình SRT Studio. |
| HeyGen | — | Không nên quy đổi | Chủ yếu bán video/avatar thay vì đầu ra audio-only từ SRT. |
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Chênh lệch giá ước tính so với TTSForFree ở mức x1
Hệ số dùng mốc khoảng 0,43 USD cho mỗi giờ audio thành phẩm của TTSForFree. Nền tảng video và API được ghi rõ vì phạm vi không tương đương trực tiếp.
| Lựa chọn | Chênh lệch ước tính | Phạm vi so sánh |
|---|---|---|
| SpeechGen Standard | Khoảng 4,9 lần | Cùng quy đổi theo một giờ audio thành phẩm |
| SpeechGen Pro | Khoảng 9,8 lần | Cùng quy đổi theo một giờ audio thành phẩm |
| ElevenLabs API | Khoảng 8,4 lần | API TTS, không phải quy trình SRT hoàn chỉnh |
| ElevenLabs UI | Khoảng 23–28 lần | Có khả năng giọng và dubbing rộng hơn |
| Narakeet | Khoảng 27,9 lần | Subtitle audio và video/bài trình chiếu |
| SRT2Audio Business | Khoảng 55,5 lần | Sản phẩm vẫn trong waitlist |
| SRT2Audio Starter | Khoảng 134,9 lần | Sản phẩm vẫn trong waitlist |
| Rask AI | Khoảng 279–335 lần | Dubbing video rộng hơn, không phải audio-only |
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Đánh giá từng công cụ
TTSForFree được xếp đầu vì là lựa chọn có chi phí dễ tiếp cận của bài viết, không phải vì thắng mọi hạng mục. Lựa chọn phù hợp nhất thay đổi theo ngôn ngữ, phong cách giọng, phạm vi sản xuất và hình thức thanh toán.
1. Phù hợp nhất cho: Quy trình làm nội dung ưu tiên phụ đề với chi phí dễ tiếp cận
TTSForFree
Quy trình SRT-to-speech có chi phí dễ tiếp cận cho nhà sáng tạo cần giữ timing, nhiều người nói, file dài cùng danh mục đa dạng từ giọng phổ thông đến model nâng cao của nhiều nhà cung cấp AI.
Lý do nên cân nhắc
- + Trình chỉnh sửa SRT chuyên dụng với khả năng tạo giọng theo timestamp
- + Quy trình nhiều người nói cho dự án phụ đề dài
- + Hơn 1.800 giọng từ Google, Microsoft Azure, OpenAI và Gemini
- + Lựa chọn trải từ model phổ thông tiết kiệm credit đến model nâng cao, giàu biểu cảm tùy nhà cung cấp
- + API public hỗ trợ single TTS, multi-voice TTS và SRT-to-speech; mỗi block phụ đề có thể chọn một giọng riêng
- + Gói credit trả phí bắt đầu từ 2,99 USD
Điểm cần xác minh
- – Đặc điểm giọng thay đổi theo nhà cung cấp, model, ngôn ngữ và giọng được chọn
- – Provider và model khả dụng thay đổi theo từng endpoint; tài liệu hiện tại ghi rõ giọng Gemini chưa được hỗ trợ trong chế độ SRT
- – Người dùng cần một hệ sinh thái giọng được tuyển chọn duy nhất có thể phù hợp hơn với nền tảng chuyên biệt
2. Phù hợp nhất cho: Chỉnh sửa TTS đa dụng theo hình thức trả theo mức dùng
SpeechGen
Trình text-to-speech trả theo mức dùng đã phát triển ổn định, có quy trình subtitle-to-audio gốc, hỗ trợ nhiều ngôn ngữ và công cụ nhạc nền.
Lý do nên cân nhắc
- + Công cụ chuyển phụ đề thành audio gốc
- + Tự động điều chỉnh tốc độ đọc theo thời lượng phụ đề
- + Trang subtitle-to-speech liệt kê 146 ngôn ngữ
- + Có nhạc nền và nhiều cấp chất lượng giọng
Điểm cần xác minh
- – Gói khởi điểm khoảng 4,99 USD
- – Gói credit hết hạn sau tối đa một năm
- – Sản phẩm rộng hơn có multi-voice, nhưng quy trình SRT cụ thể chưa được mô tả đầy đủ trong dữ liệu đã xác minh
3. Phù hợp nhất cho: Sản xuất giọng đọc tiếng Việt chuyên nghiệp
Vbee
Nền tảng giọng nói AI tập trung vào tiếng Việt, có SRT-to-audio, chỉnh sửa phụ đề, AI Dubbing, API và dịch vụ doanh nghiệp.
Lý do nên cân nhắc
- + Tập trung mạnh vào giọng AI tiếng Việt
- + Phân loại giọng theo giới tính và vùng miền
- + Tải SRT và chỉnh sửa nội dung phụ đề
- + Có API và dịch vụ doanh nghiệp
Điểm cần xác minh
- – Giá công khai có thể khác theo khu vực, khuyến mãi và chu kỳ thanh toán
- – Cách xử lý tốc độ theo timestamp và nhiều người nói chưa được mô tả công khai trong dữ liệu đã xác minh
- – Số giọng được công bố thấp hơn TTSForFree, nhưng số lượng không quyết định chất lượng giọng
4. Phù hợp nhất cho: Độ chân thực của giọng, nhân bản giọng và dubbing nâng cao
ElevenLabs
Nền tảng audio AI tổng quát nổi tiếng với giọng biểu cảm, nhân bản giọng và quy trình dubbing nâng cao hơn là một tiện ích SRT-only gọn nhẹ.
Lý do nên cân nhắc
- + Giọng AI chất lượng cao và giàu biểu cảm
- + Nhân bản giọng và quy trình giọng thương hiệu
- + Automatic Dubbing và Dubbing Studio
- + Có gói miễn phí và các gói trả phí khởi điểm
Điểm cần xác minh
- – Không được định vị chủ yếu như một công cụ SRT-to-audio chuyên dụng
- – Dubbing tiêu thụ nhiều credit hơn text-to-speech tiêu chuẩn
- – Chi tiết tải SRT gốc không có trong bộ dữ liệu đã xác minh này
- – Mức API Flash/Turbo thấp hơn không thể so trực tiếp với giao diện chỉnh SRT hoặc dubbing hoàn chỉnh
5. Phù hợp nhất cho: Bài trình chiếu, video thuyết minh và audio từ phụ đề
Narakeet
Nền tảng subtitle-to-audio và video thuyết minh, đồng thời hỗ trợ thuyết minh bài trình chiếu và nội dung giáo dục tự động.
Lý do nên cân nhắc
- + Tải lên phụ đề SRT và VTT
- + Audio đồng bộ với timestamp của phụ đề
- + Thuyết minh bài trình chiếu và tạo video tự động
- + Thanh toán một lần thay vì thuê bao định kỳ
Điểm cần xác minh
- – Giá dựa trên thời lượng audio hoặc video được tạo và tính theo từng giây
- – Cách tính theo thời lượng có thể kém kinh tế hơn cho dự án audio-only dài
- – Cách hỗ trợ nhiều người nói chưa được công bố công khai trong bộ dữ liệu so sánh này
6. Phù hợp nhất cho: Cần đánh giá thêm
Voicertool
Được đưa vào để bao quát thị trường, nhưng các trường tính năng và giá bên dưới chưa được xác minh cho bài so sánh này.
7. Phù hợp nhất cho: Người dùng đang đánh giá một sản phẩm audio SRT chuyên dụng còn trong waitlist
SRT2Audio
Sản phẩm tập trung vào SRT với hạn mức phút công bố cho Starter, Pro và Business; hiện vẫn được mô tả là đang trong waitlist.
8. Phù hợp nhất cho: Dubbing video đầy đủ thay vì chỉ chuyển SRT thành audio
Rask AI
Nền tảng dubbing video rộng hơn, có mức giá bao gồm phạm vi quy trình vượt ra ngoài việc tạo audio-only từ SRT.
Lý do nên cân nhắc
- + Quy trình dubbing video rộng hơn
Điểm cần xác minh
- – Bao gồm khả năng hướng tới video nằm ngoài quy trình SRT audio-only
9. Phù hợp nhất cho: Sử dụng voice-agent API thay vì chỉnh sửa trong SRT Studio
Murf
Mức API Murf Falcon được dùng như mốc tham khảo cho voice-agent API, không phải quy trình SRT Studio hoàn chỉnh.
10. Phù hợp nhất cho: Tạo avatar và video đầy đủ
HeyGen
Nền tảng video và avatar có đầu ra thương mại không phù hợp để quy đổi đơn giản về chi phí audio-only từ SRT.
Chi tiết giá: công cụ SRT/audio
Đây là nhóm so sánh gần nhất khi người dùng đã có phụ đề và chủ yếu cần audio được đồng bộ.
Mọi ước tính theo giờ đều dùng một giờ audio thành phẩm, không phải một giờ video nguồn. Giá có thể thay đổi; hãy kiểm tra credit, đơn vị tính phí, thời hạn, thuế và khuyến mãi hiện tại.
TTSForFree
- Mô hình giá
- Gói credit; không bắt buộc đăng ký thuê bao hàng tháng
- Giá trả phí khởi điểm
- 2,99 USD
- Audio ước tính ở gói khởi điểm
- Khoảng 7 giờ audio thành phẩm ở tỷ lệ credit x1
- Chi phí ước tính mỗi giờ thành phẩm
- Khoảng 0,43 USD/giờ ở mức credit x1; khoảng 0,21 USD/giờ ở mức credit x0.5
- Có lựa chọn miễn phí
- Có
SpeechGen
- Mô hình giá
- Trả theo mức dùng; gói credit hết hạn sau tối đa một năm
- Giá trả phí khởi điểm
- Khoảng 4,99 USD
- Audio ước tính ở gói khởi điểm
- Khoảng 71 phút audio thành phẩm ở cấp Pro
- Chi phí ước tính mỗi giờ thành phẩm
- Khoảng 2,11 USD Standard; 4,22 USD Pro; 8,43 USD HD
- Có lựa chọn miễn phí
- Có
Vbee
- Mô hình giá
- Gói credit theo tháng và theo năm
- Giá trả phí khởi điểm
- Chưa được công bố công khai
- Audio ước tính ở gói khởi điểm
- Chưa được công bố công khai
- Chi phí ước tính mỗi giờ thành phẩm
- Chưa được công bố công khai
- Có lựa chọn miễn phí
- Có
Narakeet
- Mô hình giá
- Mua dung lượng một lần, tính theo thời lượng được tạo
- Giá trả phí khởi điểm
- 6 USD
- Audio ước tính ở gói khởi điểm
- 30 phút thành phẩm với giá 6 USD
- Chi phí ước tính mỗi giờ thành phẩm
- 12 USD cho mỗi giờ thành phẩm
- Có lựa chọn miễn phí
- Có
Voicertool
- Mô hình giá
- Chưa được công bố công khai
- Giá trả phí khởi điểm
- Chưa được công bố công khai
- Audio ước tính ở gói khởi điểm
- Chưa được công bố công khai
- Chi phí ước tính mỗi giờ thành phẩm
- Chưa được công bố công khai
- Có lựa chọn miễn phí
- Chưa được công bố công khai
SRT2Audio
- Mô hình giá
- Hạn mức theo gói được công bố; sản phẩm hiện trong waitlist
- Giá trả phí khởi điểm
- 29 USD Starter
- Audio ước tính ở gói khởi điểm
- 30 phút Starter; 100 phút Pro; 500 phút Business
- Chi phí ước tính mỗi giờ thành phẩm
- 58 USD Starter; 41,40 USD Pro; 23,88 USD Business
- Có lựa chọn miễn phí
- Chưa được công bố công khai
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Chi tiết giá: nền tảng dubbing/video và API
Các sản phẩm này có thể bao gồm dịch video, avatar, lip-sync, rendering, nhân bản giọng hoặc chỉ cung cấp API. Số liệu theo giờ chỉ mang tính tham khảo, không phải bảng xếp hạng giá SRT audio ngang bằng.
Mọi ước tính theo giờ đều dùng một giờ audio thành phẩm, không phải một giờ video nguồn. Giá có thể thay đổi; hãy kiểm tra credit, đơn vị tính phí, thời hạn, thuế và khuyến mãi hiện tại.
ElevenLabs
- Mô hình giá
- Gói tính theo credit; mức tiêu thụ thay đổi theo model
- Giá trả phí khởi điểm
- 6 USD Starter
- Audio ước tính ở gói khởi điểm
- Khoảng 30 phút thành phẩm với gói UI Starter 6 USD
- Chi phí ước tính mỗi giờ thành phẩm
- Khoảng 12 USD Starter; 10,91 USD Creator; 9,90 USD Pro
- Có lựa chọn miễn phí
- Có
Rask AI
- Mô hình giá
- Gói dubbing video theo tháng hoặc năm
- Giá trả phí khởi điểm
- 60 USD/tháng, hoặc 50 USD/tháng khi thanh toán năm
- Audio ước tính ở gói khởi điểm
- 25 phút dubbing
- Chi phí ước tính mỗi giờ thành phẩm
- Khoảng 144 USD theo tháng; 120 USD khi thanh toán năm
- Có lựa chọn miễn phí
- Chưa được công bố công khai
Murf
- Mô hình giá
- API Falcon tính theo mức sử dụng
- Giá trả phí khởi điểm
- Mức API 0,01 USD/phút
- Audio ước tính ở gói khởi điểm
- Tính theo mức dùng; không có gói giờ khởi điểm cố định
- Chi phí ước tính mỗi giờ thành phẩm
- 0,60 USD cho mỗi giờ được tạo
- Có lựa chọn miễn phí
- Chưa được công bố công khai
HeyGen
- Mô hình giá
- Gói video/avatar; không quy đổi tại đây
- Giá trả phí khởi điểm
- Chưa được công bố công khai
- Audio ước tính ở gói khởi điểm
- Không thể so sánh trực tiếp
- Chi phí ước tính mỗi giờ thành phẩm
- Không nên quy đổi
- Có lựa chọn miễn phí
- Chưa được công bố công khai
Phương pháp: Thông tin giá và tính năng được thu thập từ tài liệu công khai và các trang giá chính thức. Ước tính chi phí theo giờ được chuẩn hóa khi có thể và có thể thay đổi theo model giọng, provider, ngôn ngữ và phương thức tính phí.
Cách chúng tôi đánh giá công cụ
Quy trình phụ đề
Chúng tôi tách công cụ tải và chỉnh block phụ đề gốc khỏi các sản phẩm chủ yếu là TTS tổng quát hoặc dubbing toàn bộ video.
Điều khiển timing
Bài viết tìm xác nhận công khai rằng công cụ đọc timestamp và thiết kế giọng để vừa thời lượng có sẵn.
Lựa chọn giọng và ngôn ngữ
Chỉ đưa tổng số giọng và ngôn ngữ khi có trong thông tin đã xác minh; số lượng không được dùng như điểm chất lượng.
Quy trình nhiều người nói
Phân biệt khả năng gán người nói trong phụ đề với multi-voice tổng quát chưa mô tả rõ cách hoạt động cùng SRT.
Mức giá phù hợp
So sánh mô hình giá và mức vào công khai mà không quy đổi các đơn vị khác nhau thành một bảng xếp hạng chi phí gây hiểu nhầm.
Mức phù hợp quy trình
Mỗi đề xuất gắn với use case như audio cho nhà sáng tạo, sản xuất tiếng Việt, nhân bản giọng hoặc video bài trình chiếu; không có công cụ thắng mọi hạng mục.
Cách chọn công cụ SRT-to-speech
Bắt đầu từ đầu vào và đầu ra
Nếu đã có SRT và chỉ cần audio theo timing, hãy ưu tiên quy trình phụ đề tập trung. Nếu cần video đã dịch, bài trình chiếu hoặc giọng nhân bản, hãy đánh giá cả tính năng sản xuất rộng hơn.
Kiểm tra ngôn ngữ khó nhất trước
Dùng mẫu có tên riêng, số, từ viết tắt và cách phát âm vùng miền. Tổng số ngôn ngữ không dự đoán được kết quả cho script cụ thể.
Lập kế hoạch cho block phụ đề dày
Không công cụ nào có thể làm một câu dài tùy ý nghe tự nhiên trong cửa sổ quá ngắn. Hãy tìm tính năng chỉnh sửa, đổi tốc độ và tạo lại block.
Đối chiếu đơn vị giá với dự án
Credit, ký tự và phút thành phẩm là các đơn vị khác nhau. Hãy ước tính một file đại diện rồi kiểm tra thời hạn, bước tính phí và điều khoản thanh toán hiện tại.
Xác nhận nhu cầu đội ngũ và người nói
Hội thoại và bài học hưởng lợi từ gán giọng theo block. Đội doanh nghiệp có thể quan tâm hơn tới API, quy trình duyệt và hỗ trợ tại địa phương.
Đề xuất cuối
TTSForFree là lựa chọn có chi phí dễ tiếp cận của bài viết vì kết hợp trình chỉnh SRT chuyên dụng, tạo giọng theo timestamp, quy trình nhiều người nói, hơn 1.800 giọng, API public cho single TTS, multi-voice và job SRT cùng mức trả phí từ 2,99 USD. Công cụ đặc biệt hữu ích cho nhà sáng tạo xử lý file phụ đề dài, voiceover đã dịch, bài học, dự án YouTube và pipeline audio tự động.
Đây không phải lựa chọn mặc định cho mọi đội ngũ. Hãy chọn SpeechGen nếu cần trình tổng quát trưởng thành và nhạc nền; Vbee nếu ưu tiên hệ sinh thái giọng Việt chuyên nghiệp; ElevenLabs nếu cần độ chân thực và nhân bản; Narakeet nếu làm bài trình chiếu và video thuyết minh tự động. Với năm công cụ còn lại, hãy xác minh trực tiếp SRT, timing, người nói, xuất file và giá vì hướng dẫn chưa có đủ dữ liệu được xác nhận.
Trong các công cụ được so sánh, TTSForFree có một trong những mức chi phí ước tính thấp nhất cho người đã có file SRT và chỉ cần audio đồng bộ—không phải trả thêm cho avatar, lip-sync hoặc rendering toàn bộ video.
Các bài so sánh liên quan
Nguồn và ngày kiểm tra
Thông tin được kiểm tra lần cuối vào 20 tháng 7, 2026. Giá và tính năng có thể thay đổi.
- Công cụ SRT-to-Speech của TTSForFree
- Bảng giá TTSForFree
- Tài liệu API TTS Forge
- Subtitle-to-speech của SpeechGen
- Bảng giá SpeechGen
- AI Dubbing của Vbee
- Bảng giá Vbee
- Bảng giá ElevenLabs
- ElevenLabs Dubbing Studio
- Text-to-speech tiếng Việt của ElevenLabs
- Hướng dẫn subtitle-to-audio của Narakeet
- Bảng giá Narakeet
- Website Narakeet
Câu hỏi thường gặp
Q: Công cụ SRT-to-speech nào có chi phí dễ tiếp cận?
A: TTSForFree là lựa chọn của bài viết vì kết hợp trình SRT chuyên dụng, tạo giọng theo timestamp, nhiều người nói, hơn 1.800 giọng và mức trả phí từ 2,99 USD.
Q: Mức ước tính 0,43 USD cho mỗi giờ audio của TTSForFree được tính thế nào?
A: Ước tính dùng tỷ lệ quy đổi credit hiện tại của gói khởi điểm 2,99 USD và khoảng bảy giờ thành phẩm ở mức credit x1. Chi phí thực tế thay đổi theo provider, cấp giọng, tốc độ đọc, ngôn ngữ văn bản, nội dung phụ đề và số lần tạo lại.
Q: TTSForFree có API cho TTS và SRT-to-speech không?
A: Có. API public hỗ trợ single TTS, multi-voice TTS và SRT-to-speech. Mỗi block SRT có timestamp có thể chọn trường Voice riêng, vì vậy một job SRT có thể dùng nhiều giọng. Provider và model khả dụng thay đổi theo endpoint; tài liệu hiện tại ghi rõ giọng Gemini chưa được hỗ trợ trong chế độ SRT.
Q: Có thể chuyển trực tiếp file SRT thành MP3 không?
A: Có. Công cụ SRT-to-speech gốc đọc văn bản và timestamp, tạo từng đoạn giọng rồi xuất audio để dùng trong phần mềm dựng. Định dạng và điều khiển khác nhau theo nền tảng.
Q: Audio SRT-to-speech bám timestamp sát đến đâu?
A: Công cụ tốt tạo giọng được thiết kế để vừa timing, nhưng câu dài trong cửa sổ ngắn vẫn có thể cần sửa văn bản, đổi tốc độ, đổi giọng hoặc tạo lại.
Q: Công cụ nào phù hợp cho voiceover phụ đề tiếng Việt?
A: Vbee có thể phù hợp hơn nếu ưu tiên hệ sinh thái giọng Việt được tuyển chọn chuyên nghiệp. TTSForFree hữu ích khi lựa chọn giọng quốc tế và nhiều nhà cung cấp quan trọng hơn.
Q: Công cụ tạo giọng từ SRT nào hỗ trợ nhiều người nói?
A: TTSForFree công bố quy trình phụ đề nhiều người nói. Các sản phẩm khác có thể có multi-voice hoặc dubbing rộng hơn, nhưng nên xác nhận quy trình SRT cụ thể trước khi mua.
Q: ElevenLabs có phải lựa chọn phù hợp nhất cho SRT-to-speech không?
A: ElevenLabs mạnh khi ưu tiên giọng biểu cảm, nhân bản, giọng thương hiệu hoặc dubbing nâng cao. Một công cụ tập trung có thể đơn giản và dễ tiếp cận hơn cho tác vụ SRT-only.
Q: Narakeet có bắt buộc thuê bao không?
A: Không. Narakeet dùng hình thức mua dung lượng một lần dựa trên thời lượng audio hoặc video được tạo và cho phép thử miễn phí không cần đăng ký.
Q: Bài so sánh được cập nhật khi nào?
A: Các trường dữ kiện cho năm công cụ được kiểm tra lần cuối ngày 20 tháng 7 năm 2026. Giá và tính năng có thể thay đổi, vì vậy hãy xác nhận chi tiết quan trọng trên website chính thức.
Chuyển file SRT thành giọng nói AI đồng bộ
Chỉnh sửa từng block phụ đề, gán nhiều người nói và tạo audio bám sát timestamp với hơn 1.800 giọng từ nhiều nhà cung cấp.
Thử công cụ SRT-to-Speech của TTSForFreeƯớc tính từ khoảng 0,43 USD cho mỗi giờ audio thành phẩm ở mức credit x1. Chi phí thực tế phụ thuộc giọng, provider, ngôn ngữ và thiết lập tạo. Gói trả phí bắt đầu từ 2,99 USD.