KHUYẾN MÃISự trở lại World Cup – Tặng thêm 20% credits cho tất cả gói Pro đến hết 31/07/2026
Nâng cấp

🔒 Dữ liệu bản miễn phí có thể được dùng để cải thiện AI. Nâng cấp Pro để bảo mật tuyệt đối

Đánh giá provider Gemini text-to-speech

Gemini TTS: Model, Cảm Xúc, Giá Và Trải Nghiệm Thực Tế

Gemini TTS tạo giọng tự nhiên và điều hướng cách đọc bằng prompt. Khả năng sáng tạo rất đáng chú ý, nhưng preview limit, generation time, độ ổn định với đoạn dài và voice consistency phải được test theo workload thật.

Model và giá được kiểm tra ngày 16/07/2026Model hiện tại: 2.5 + 3.1 PreviewStyle control: Prompt tự nhiênMulti-speaker: Tối đa 2

Kết luận nhanh

Gemini TTS phù hợp cho narration biểu cảm, dialogue và thử nghiệm đa ngôn ngữ khi tone, pace và delivery dễ mô tả bằng ngôn ngữ tự nhiên hơn SSML. Nó không thay thế mọi workload TTS truyền thống: request dài, nhiều subtitle cue tách rời, quota preview và độ đồng nhất giọng đều có trade-off vận hành.

Phù hợp

  • Narration sáng tạo và emotion điều khiển bằng prompt
  • Dialogue một hoặc hai speaker
  • Prototype cần giọng tự nhiên mà không viết SSML phức tạp
  • Team chấp nhận test và retry output preview

Điểm cần test

  • !Preview model có thể thay đổi và rate limit chặt hơn
  • !Chậm hơn TTS truyền thống với request ngắn trong mẫu nội bộ
  • !Voice identity có thể drift khi từng subtitle line là request riêng
  • !Input dài hoặc nhiều instruction cần kiểm tra bỏ câu/rút ngắn

Model hiện tại

2.5 + 3.1 Preview

Hiện docs có Flash, Pro và Gemini 3.1 Flash TTS.

Style control

Prompt tự nhiên

Mô tả tone, pace, accent, emotion và delivery.

Multi-speaker

Tối đa 2

Guide chính thức cho cấu hình hai speaker.

Snapshot production

Median 5,2 giây

20 request Gemini thành công, 34–520 ký tự.

Gemini TTS là gì?

Gemini TTS là nhóm model speech generation điều khiển bằng prompt của Google. API nhận text và trả audio, trong khi prompt ngôn ngữ tự nhiên có thể hướng dẫn style, accent, pace và tone. Nó khác Google Cloud TTS, nơi workflow thường là chọn exact voice và áp dụng SSML hoặc numeric controls.

Guide chính thức hiện liệt kê Gemini 3.1 Flash TTS Preview, Gemini 2.5 Flash Preview TTS và Gemini 2.5 Pro Preview TTS cho single-speaker và multi-speaker. Multi-speaker hỗ trợ tối đa hai speaker. Context TTS chung được ghi là 32k tokens, nhưng safe limit ở cấp ứng dụng có thể nhỏ hơn nhiều.

TTS For Free hiện dùng Gemini 2.5 Flash TTS cho các workflow text, multi-voice và subtitle được hỗ trợ. Tool text công khai áp dụng giới hạn bảo thủ 1.500 ký tự mỗi request Gemini và một structured style tag để người dùng review generation ngắn trước.

Các model Gemini TTS hiện tại

Cả ba model đều prompt-controllable và hỗ trợ single-speaker cùng two-speaker. Trạng thái preview có nghĩa behavior, quota và availability có thể thay đổi.

ModelTrạng tháiSingle / multi-speakerStreamingNên bắt đầu test cho
Gemini 3.1 Flash TTS PreviewPreviewCó / tối đa 2TTS controllable mới, ưu tiên latency
Gemini 2.5 Flash Preview TTSPreviewCó / tối đa 2Không streaming chungExpressive speech tối ưu giá
Gemini 2.5 Pro Preview TTSPreviewCó / tối đa 2Không streaming chungNarration fidelity cao và direction phức tạp

Thông tin model được kiểm tra từ Gemini speech generation guide ngày 16/07/2026. Hãy kiểm tra exact model ID trước khi deploy.

Emotion, style prompt và structured tags

Control chính thức của Gemini là prompt ngôn ngữ tự nhiên. Bạn có thể yêu cầu whisper nhỏ, giải thích hội thoại ấm, giọng excited nhanh hơn hoặc direction riêng cho hai speaker. Instruction ngắn và cụ thể thường dễ review hơn một đoạn dài có nhiều yêu cầu xung đột.

TTS For Free cũng hỗ trợ structured tag như [sad] hoặc [whisper] làm workflow shortcut. Tag không được mô tả là universal Gemini API syntax; ứng dụng diễn giải direction cho voice được chọn. Workflow công khai hiện chỉ cho một tag mỗi request để giảm instruction xung đột.

Input thường

Anh tưởng em sẽ không bao giờ quay lại.

Direction tự nhiên

Đọc nhỏ, buồn nhưng kiềm chế và chậm hơn một chút. Anh tưởng em sẽ không bao giờ quay lại.

Tag trong workflow TTS For Free

[sad] Anh tưởng em sẽ không bao giờ quay lại. Dùng một tag rõ cho đoạn ngắn rồi review kết quả.

Direction hai speaker

Maya nói gấp nhưng vẫn kiềm chế. Noah trả lời bình tĩnh nhưng ngập ngừng trước cụm cuối. Giữ giọng hai người ổn định trong toàn đoạn.

Gemini TTS giá bao nhiêu?

Gemini TTS tính text input tokens và audio output tokens thay vì ký tự. Google ghi audio tương ứng 25 tokens mỗi giây, nhờ đó có thể ước tính output-only cost mỗi phút.

ModelText input / 1M tokensAudio output / 1M tokensOutput ước tính / phútBatch
Gemini 2.5 Flash TTS$0,50$10,00Khoảng $0,015$0,25 input / $5 output
Gemini 3.1 Flash TTS Preview$1,00$20,00Khoảng $0,030$0,50 input / $10 output
Gemini 2.5 Pro TTS$1,00$20,00Khoảng $0,030$0,50 input / $10 output

Giá mỗi phút chỉ gồm audio output: 60 giây × 25 tokens/giây × output price. Input tokens, retry, platform cost và dịch vụ khác được tính thêm.

Kinh nghiệm chạy Gemini TTS trên TTS For Free

Snapshot lấy từ 20 log request Iapetus-Gemini thành công ngày 10–11/07/2026. Integration Gemini hiện tại của TTS For Free sử dụng Gemini 2.5 Flash TTS.

Log thành công

20

Mẫu chỉ gồm request đã hoàn thành.

Độ dài input

34–520 ký tự

Request text ngắn và trung bình.

Median

5,2 giây

Thời gian xử lý request quan sát.

P95 / maximum

9,9 / 39,5 giây

Một request 520 ký tự là outlier lớn.

Gemini thường cho giọng tự nhiên ngay cả khi không thêm emotion tag, nên người dùng ưu tiên nó cho text và dubbing cần biểu cảm.

Trong log nội bộ, model chậm hơn Google Cloud truyền thống với request ngắn vì còn xử lý delivery và style. Hai mẫu không match độ dài nên không được xem là benchmark đối đầu.

Khi subtitle cue hoặc multi-voice line được gọi riêng, giữ voice identity giống hệt trở nên khó hơn. Nên preview một chuỗi câu đại diện trước khi generate cả file.

Nội dung dài hoặc nhiều tag cần kiểm tra thiếu cụm từ và instruction xung đột. Split có thể tăng reliability, nhưng chunk quá nhỏ lại làm mất context và consistency.

Snapshot này không gồm request lỗi và không tách queue, network hay inference time. P95 chỉ dựa trên 20 log thành công; outlier 39,5 giây cần được điều tra chứ không nên khái quát.

Khi nào nên dùng Gemini TTS

Narration biểu cảm

Mô tả emotional range, pace và tone mà không cần xây SSML phức tạp.

Dialogue và storytelling

Dùng direction một hoặc hai speaker cho podcast, truyện và cảnh nhân vật.

So sánh provider

Tạo sample đại diện rồi đổi Google, Azure hoặc OpenAI nếu consistency, speed hay pronunciation phù hợp hơn.

Khi cần thận trọng

Hàng nghìn request realtime nhỏ

Cần validate tier limit, generation time và retry trước khi dùng preview model ở concurrency cao.

Mọi từ phải được đọc đủ tuyệt đối

Chạy text-completion check với nội dung dài và nhiều instruction trước khi accept output.

Voice identity hoàn hảo giữa các cue

Test một chuỗi nhiều dòng vì mỗi generation riêng có thể tạo voice drift nghe được.

So sánh Gemini TTS với provider khác

Lợi thế chính của Gemini là prompt control. Cloud TTS truyền thống có thể nhanh và dễ dự đoán hơn cho workload lặp lại, còn creator platform có workflow voice cloning sâu hơn.

Tiêu chíGemini TTSGoogle Cloud TTSAzure TTSOpenAI TTSElevenLabs
Control chínhPrompt tự nhiênVoice + SSMLSSML + style hỗ trợInstructions tự nhiênVoice, model, settings và tags
Cách tính phíText + audio tokensKý tự theo dòng voiceKý tự / tierToken theo modelCredits / usage / plan
Multi-speakerTối đa 2 theo docs TTSTùy model/workflowMultiple voice và SSMLTùy model/workflowTùy model/product
Trọng tâmCreative prompted speechTạo speech nhanh, lặp lạiExpressive enterpriseConversational prompted speechCreator và brand voice

Thử Gemini TTS trước khi tự xây API

Tool dưới đây chỉ hiển thị Gemini voices có trên TTS For Free. Hãy giữ test đầu tiên ngắn, dùng một style direction rõ và nghe xem model có đọc đủ text, giữ giọng ổn định hay không.

Vượt hạn mức 102 ký tự! Reset lúc .

🔊 Bạn đang dùng TTS tiêu chuẩn.Người dùng miễn phí có giới hạn ký tự mỗi ngày và số voice nâng cao. Nâng cấp để dùng voice cao cấp, ổn định hơn và không bị giới hạn dài đoạn.

Chọn ngôn ngữ, voice và tạo audio.

Không tìm thấy giọng nào cho "Tất cả"
Cấu hình giọng đọc

Hướng dẫn sử dụng

Tiếp tục workflow Gemini TTS

Text to Speech

So sánh Gemini với Google, Azure và OpenAI trong cùng giao diện.

Mở trang

Multi-Voice TTS

Tạo dialogue theo vai và thêm style tag rõ cho từng segment.

Mở trang

SRT to Speech

Tạo audio có timing từ subtitle và test consistency giữa cue.

Mở trang

AI Emotional Dubbing

Dùng ChatGPT hoặc Gemini để chuẩn bị subtitle có emotion tag.

Mở trang

Google Cloud TTS

So sánh Gemini prompt control với Google character-billed nhanh.

Mở trang

Workflow AI Dubbing

Xem voice generation nằm ở đâu trong translation, timing, QA và mixing.

Mở trang

Nguồn chính thức

Câu hỏi thường gặp

Q: Gemini TTS là gì?

A: Gemini TTS là nhóm model text-to-speech điều khiển bằng prompt của Google, dùng để tạo audio một hoặc nhiều speaker từ text.

Q: Hiện có những model Gemini TTS nào?

A: Guide chính thức hiện liệt kê Gemini 3.1 Flash TTS Preview, Gemini 2.5 Flash Preview TTS và Gemini 2.5 Pro Preview TTS.

Q: Gemini TTS có tạo nhiều speaker không?

A: Có. Guide hiện tại hỗ trợ multi-speaker với tối đa hai speaker được cấu hình.

Q: Gemini TTS điều khiển cảm xúc thế nào?

A: API chính thức dùng prompt ngôn ngữ tự nhiên để hướng dẫn tone, pace, accent và style. TTS For Free có thêm tag ngắn làm workflow helper.

Q: Gemini TTS giá bao nhiêu?

A: Giá tính theo text input và audio output tokens. Theo giá hiện tại, audio output khoảng $0,015/phút cho Gemini 2.5 Flash và $0,03/phút cho 3.1 Flash hoặc 2.5 Pro, chưa tính input và retry.

Q: Gemini TTS có phù hợp text dài không?

A: Model có thể tạo nội dung dài, nhưng request dài hoặc nhiều instruction cần kiểm tra generation time, bỏ text và consistency. TTS For Free dùng safe limit nhỏ hơn.

Q: Vì sao giọng Gemini thay đổi giữa các dòng subtitle?

A: Mỗi cue tạo riêng là một generation mới. Voice identity và delivery có thể thay đổi, nên cần test một chuỗi đại diện trước khi chạy toàn file.