
Google, 23 Eylül 2026’da Gemini 3.8 Flash TTS ve Gemini 3.8 Flash-Lite TTS adlı iki metinden sese (text-to-speech) modelini duyurdu. Resmi blog yazısını Leland Rechis ve Alan Cowen, Gemini Audio ekibi adına imzaladı. Şirket, ikiliyi bugüne kadarki en ifadeli ses üretim modelleri olarak konumlandırıyor.
Flash TTS yaratıcı yönlendirme ve karakter tasarımı için; oyun, sesli kitap, podcast ve etkileşimli medyada doğal dil istemleriyle sıfırdan ses üretmeye odaklanıyor. Flash-Lite TTS ise yüksek hacimli dublaj, sesli içerik ve ifadeli ses ajanları için maliyet ve ölçek odaklı. Google’a göre modeller, 3.5 Live Translate, 3.5 Transcribe, 3.8 Live ve 3.8 Live Extended Thinking’in ardından Gemini Audio ailesini tamamlıyor.
Ses stüdyosu tarafında doğal dil istemleriyle rol, aksan ve ses karakteri tasarlanabiliyor; 2000’den fazla hazır üretim sesi ve bölgesel çeşitler (örneğin Meksika İspanyolcası, Quebec Fransızcası, İskoç İngilizcesi) listeleniyor. Yaklaşık 30 saniyelik örnekten ses kopyalama, yerleşik onay doğrulaması ile sunuluyor. Üretilen her ses klibinin SynthID filigranı ve C2PA kimlik bilgisi taşıdığı belirtiliyor. Satır satır performans kontrolü, iki konuşmacılı sahneler ve vokal patlamalar / geri kanal tepkileri de duyuruda yer alıyor.
Gemini API dokümantasyonuna göre Flash TTS 130 dil, Flash-Lite TTS 101 dil destekliyor. Dağıtım: her iki model bugün Gemini API ve Google AI Studio’da; Flash TTS ayrıca Gemini Notebook’ta, Flash-Lite Google Vids’te açılıyor. Kurumsal API (Gemini Enterprise) yakında gelecek deniyor. AI Studio üzerinden ses kopyalama Illinois, Teksas, AEA, Birleşik Krallık, İsviçre ve Hindistan’da kullanılamıyor.
Google, Hume AI Voice Design Benchmark’ta Flash TTS’nin genel sıralamada 71,4 puanla birinci ve aksan modellemede 60,8 ile önde olduğunu; Overall Quality Index’te Flash TTS ve Flash-Lite’ın sırasıyla birinci ve ikinci olduğunu aktarıyor. Bu skorlar satıcı duyurusuna bağlıdır; bağımsız tekrar ölçüm değildir. Agora, LiveKit, Pipecat, Vercel gibi geliştirici platformları ve Figma, HeyGen, Linguana, Wondercraft, 99.co, Ollang gibi ortakların entegrasyonları da duyuruda anılıyor.
Kapak temsili bir stüdyo mikrofonu görüntüsüdür; Google ürün arayüzü değildir.
Kaynaklar
- Google Blog — Gemini 3.8 text-to-speech
- Gemini API — gemini-3.8-flash-tts
- Gemini API — gemini-3.8-flash-lite-tts
- SGH — Gemini 3.8 Live çıkışı
- SGH — Claude Opus 5.5 çıkışı
- SGH — Grok 4.7 model çıkışı
Sık sorulan sorular
Gemini 3.8 Flash TTS ile Flash-Lite TTS farkı nedir?
Google’a göre Flash TTS yaratıcı yönlendirme ve karakter sesi için; Flash-Lite TTS yüksek hacim ve maliyet verimliliği için konumlanıyor. API belgesinde dil desteği Flash’ta 130, Flash-Lite’ta 101 olarak geçiyor.
Modeller nerede kullanılabiliyor?
Duyuruya göre her iki model Gemini API ve Google AI Studio’da açıldı; Flash TTS Gemini Notebook’ta, Flash-Lite Google Vids’te sunuluyor. Kurumsal API yakında gelecek deniyor.
Ses kopyalama her yerde açık mı?
Google, AI Studio üzerinden ses kopyalamanın Illinois, Teksas, AEA, Birleşik Krallık, İsviçre ve Hindistan’da kullanılamadığını belirtiyor. Onay doğrulaması, SynthID ve C2PA güvenlik önlemleri olarak anılıyor.


