Model hiện tại
2.5 + 3.1 Preview
Hiện docs có Flash, Pro và Gemini 3.1 Flash TTS.
🔒 Dữ liệu bản miễn phí có thể được dùng để cải thiện AI. Nâng cấp Pro để bảo mật tuyệt đối
Đánh giá provider Gemini text-to-speech
Gemini TTS tạo giọng tự nhiên và điều hướng cách đọc bằng prompt. Khả năng sáng tạo rất đáng chú ý, nhưng preview limit, generation time, độ ổn định với đoạn dài và voice consistency phải được test theo workload thật.
Gemini TTS phù hợp cho narration biểu cảm, dialogue và thử nghiệm đa ngôn ngữ khi tone, pace và delivery dễ mô tả bằng ngôn ngữ tự nhiên hơn SSML. Nó không thay thế mọi workload TTS truyền thống: request dài, nhiều subtitle cue tách rời, quota preview và độ đồng nhất giọng đều có trade-off vận hành.
Model hiện tại
2.5 + 3.1 Preview
Hiện docs có Flash, Pro và Gemini 3.1 Flash TTS.
Style control
Prompt tự nhiên
Mô tả tone, pace, accent, emotion và delivery.
Multi-speaker
Tối đa 2
Guide chính thức cho cấu hình hai speaker.
Snapshot production
Median 5,2 giây
20 request Gemini thành công, 34–520 ký tự.
Gemini TTS là nhóm model speech generation điều khiển bằng prompt của Google. API nhận text và trả audio, trong khi prompt ngôn ngữ tự nhiên có thể hướng dẫn style, accent, pace và tone. Nó khác Google Cloud TTS, nơi workflow thường là chọn exact voice và áp dụng SSML hoặc numeric controls.
Guide chính thức hiện liệt kê Gemini 3.1 Flash TTS Preview, Gemini 2.5 Flash Preview TTS và Gemini 2.5 Pro Preview TTS cho single-speaker và multi-speaker. Multi-speaker hỗ trợ tối đa hai speaker. Context TTS chung được ghi là 32k tokens, nhưng safe limit ở cấp ứng dụng có thể nhỏ hơn nhiều.
TTS For Free hiện dùng Gemini 2.5 Flash TTS cho các workflow text, multi-voice và subtitle được hỗ trợ. Tool text công khai áp dụng giới hạn bảo thủ 1.500 ký tự mỗi request Gemini và một structured style tag để người dùng review generation ngắn trước.
Cả ba model đều prompt-controllable và hỗ trợ single-speaker cùng two-speaker. Trạng thái preview có nghĩa behavior, quota và availability có thể thay đổi.
| Model | Trạng thái | Single / multi-speaker | Streaming | Nên bắt đầu test cho |
|---|---|---|---|---|
| Gemini 3.1 Flash TTS Preview | Preview | Có / tối đa 2 | Có | TTS controllable mới, ưu tiên latency |
| Gemini 2.5 Flash Preview TTS | Preview | Có / tối đa 2 | Không streaming chung | Expressive speech tối ưu giá |
| Gemini 2.5 Pro Preview TTS | Preview | Có / tối đa 2 | Không streaming chung | Narration fidelity cao và direction phức tạp |
Thông tin model được kiểm tra từ Gemini speech generation guide ngày 16/07/2026. Hãy kiểm tra exact model ID trước khi deploy.
Control chính thức của Gemini là prompt ngôn ngữ tự nhiên. Bạn có thể yêu cầu whisper nhỏ, giải thích hội thoại ấm, giọng excited nhanh hơn hoặc direction riêng cho hai speaker. Instruction ngắn và cụ thể thường dễ review hơn một đoạn dài có nhiều yêu cầu xung đột.
TTS For Free cũng hỗ trợ structured tag như [sad] hoặc [whisper] làm workflow shortcut. Tag không được mô tả là universal Gemini API syntax; ứng dụng diễn giải direction cho voice được chọn. Workflow công khai hiện chỉ cho một tag mỗi request để giảm instruction xung đột.
Anh tưởng em sẽ không bao giờ quay lại.
Đọc nhỏ, buồn nhưng kiềm chế và chậm hơn một chút. Anh tưởng em sẽ không bao giờ quay lại.
[sad] Anh tưởng em sẽ không bao giờ quay lại. Dùng một tag rõ cho đoạn ngắn rồi review kết quả.
Maya nói gấp nhưng vẫn kiềm chế. Noah trả lời bình tĩnh nhưng ngập ngừng trước cụm cuối. Giữ giọng hai người ổn định trong toàn đoạn.
Gemini TTS tính text input tokens và audio output tokens thay vì ký tự. Google ghi audio tương ứng 25 tokens mỗi giây, nhờ đó có thể ước tính output-only cost mỗi phút.
| Model | Text input / 1M tokens | Audio output / 1M tokens | Output ước tính / phút | Batch |
|---|---|---|---|---|
| Gemini 2.5 Flash TTS | $0,50 | $10,00 | Khoảng $0,015 | $0,25 input / $5 output |
| Gemini 3.1 Flash TTS Preview | $1,00 | $20,00 | Khoảng $0,030 | $0,50 input / $10 output |
| Gemini 2.5 Pro TTS | $1,00 | $20,00 | Khoảng $0,030 | $0,50 input / $10 output |
Giá mỗi phút chỉ gồm audio output: 60 giây × 25 tokens/giây × output price. Input tokens, retry, platform cost và dịch vụ khác được tính thêm.
Snapshot lấy từ 20 log request Iapetus-Gemini thành công ngày 10–11/07/2026. Integration Gemini hiện tại của TTS For Free sử dụng Gemini 2.5 Flash TTS.
Log thành công
20
Mẫu chỉ gồm request đã hoàn thành.
Độ dài input
34–520 ký tự
Request text ngắn và trung bình.
Median
5,2 giây
Thời gian xử lý request quan sát.
P95 / maximum
9,9 / 39,5 giây
Một request 520 ký tự là outlier lớn.
Gemini thường cho giọng tự nhiên ngay cả khi không thêm emotion tag, nên người dùng ưu tiên nó cho text và dubbing cần biểu cảm.
Trong log nội bộ, model chậm hơn Google Cloud truyền thống với request ngắn vì còn xử lý delivery và style. Hai mẫu không match độ dài nên không được xem là benchmark đối đầu.
Khi subtitle cue hoặc multi-voice line được gọi riêng, giữ voice identity giống hệt trở nên khó hơn. Nên preview một chuỗi câu đại diện trước khi generate cả file.
Nội dung dài hoặc nhiều tag cần kiểm tra thiếu cụm từ và instruction xung đột. Split có thể tăng reliability, nhưng chunk quá nhỏ lại làm mất context và consistency.
Snapshot này không gồm request lỗi và không tách queue, network hay inference time. P95 chỉ dựa trên 20 log thành công; outlier 39,5 giây cần được điều tra chứ không nên khái quát.
Mô tả emotional range, pace và tone mà không cần xây SSML phức tạp.
Dùng direction một hoặc hai speaker cho podcast, truyện và cảnh nhân vật.
Tạo sample đại diện rồi đổi Google, Azure hoặc OpenAI nếu consistency, speed hay pronunciation phù hợp hơn.
Cần validate tier limit, generation time và retry trước khi dùng preview model ở concurrency cao.
Chạy text-completion check với nội dung dài và nhiều instruction trước khi accept output.
Test một chuỗi nhiều dòng vì mỗi generation riêng có thể tạo voice drift nghe được.
Lợi thế chính của Gemini là prompt control. Cloud TTS truyền thống có thể nhanh và dễ dự đoán hơn cho workload lặp lại, còn creator platform có workflow voice cloning sâu hơn.
| Tiêu chí | Gemini TTS | Google Cloud TTS | Azure TTS | OpenAI TTS | ElevenLabs |
|---|---|---|---|---|---|
| Control chính | Prompt tự nhiên | Voice + SSML | SSML + style hỗ trợ | Instructions tự nhiên | Voice, model, settings và tags |
| Cách tính phí | Text + audio tokens | Ký tự theo dòng voice | Ký tự / tier | Token theo model | Credits / usage / plan |
| Multi-speaker | Tối đa 2 theo docs TTS | Tùy model/workflow | Multiple voice và SSML | Tùy model/workflow | Tùy model/product |
| Trọng tâm | Creative prompted speech | Tạo speech nhanh, lặp lại | Expressive enterprise | Conversational prompted speech | Creator và brand voice |
Tool dưới đây chỉ hiển thị Gemini voices có trên TTS For Free. Hãy giữ test đầu tiên ngắn, dùng một style direction rõ và nghe xem model có đọc đủ text, giữ giọng ổn định hay không.
Vượt hạn mức 102 ký tự! Reset lúc .
Chọn ngôn ngữ, voice và tạo audio.
So sánh Gemini với Google, Azure và OpenAI trong cùng giao diện.
Mở trangTạo dialogue theo vai và thêm style tag rõ cho từng segment.
Mở trangTạo audio có timing từ subtitle và test consistency giữa cue.
Mở trangDùng ChatGPT hoặc Gemini để chuẩn bị subtitle có emotion tag.
Mở trangSo sánh Gemini prompt control với Google character-billed nhanh.
Mở trangXem voice generation nằm ở đâu trong translation, timing, QA và mixing.
Mở trangA: Gemini TTS là nhóm model text-to-speech điều khiển bằng prompt của Google, dùng để tạo audio một hoặc nhiều speaker từ text.
A: Guide chính thức hiện liệt kê Gemini 3.1 Flash TTS Preview, Gemini 2.5 Flash Preview TTS và Gemini 2.5 Pro Preview TTS.
A: Có. Guide hiện tại hỗ trợ multi-speaker với tối đa hai speaker được cấu hình.
A: API chính thức dùng prompt ngôn ngữ tự nhiên để hướng dẫn tone, pace, accent và style. TTS For Free có thêm tag ngắn làm workflow helper.
A: Giá tính theo text input và audio output tokens. Theo giá hiện tại, audio output khoảng $0,015/phút cho Gemini 2.5 Flash và $0,03/phút cho 3.1 Flash hoặc 2.5 Pro, chưa tính input và retry.
A: Model có thể tạo nội dung dài, nhưng request dài hoặc nhiều instruction cần kiểm tra generation time, bỏ text và consistency. TTS For Free dùng safe limit nhỏ hơn.
A: Mỗi cue tạo riêng là một generation mới. Voice identity và delivery có thể thay đổi, nên cần test một chuỗi đại diện trước khi chạy toàn file.