Sesli yapay zeka asistanlarının en büyük sorunu uzun süredir aynıydı: sessizlik. Bir şey sorduğunuzda model düşünür, siz beklersiniz, sonra cevap gelir. Bu birkaç saniyelik boşluk, konuşmanın doğal akışını her seferinde bozuyordu.
Google, 15 Eylül 2026'da duyurduğu iki yeni modelle tam olarak bu sorunu hedefliyor. Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking, şirketin "bugüne kadarki en gelişmiş canlı diyalog modelleri" olarak tanımladığı sistemler. Mart ayında çıkan 3.1 Flash Live'ın halefi olan bu modeller, yapay zekayla konuşmayı daha sezgisel ve akıllı hale getirmeyi amaçlıyor.
İki Model, İki Farklı İş
Google bu sefer tek bir model yerine, birbirini tamamlayan iki sürüm çıkardı.
Gemini 3.8 Live, günlük kullanım ve ölçek için tasarlanmış. Odağı hız ve maliyet verimliliği. Akıcı diyalog yeteneğini görsel bağlamla (visual grounding) birleştiriyor — yani kamera görüntüsünü neredeyse gerçek zamanlı işleyebiliyor, siz bir şeye bakarken onun hakkında konuşabiliyorsunuz.
Gemini 3.8 Live Extended Thinking ise çok adımlı akıl yürütme gerektiren karmaşık işler için geliştirilmiş. Google'ın yeni duyurduğu Gmail Live (sohbet tabanlı arama), Docs Live (taslak oluşturma ve düzenleme) ve Keep Live (not alma) gibi yüksek karmaşıklıktaki senaryolar bu modelle çalışıyor.
"Düşünürken Konuşmak" Ne Demek?
Extended Thinking'in en dikkat çekici özelliği paralel muhakeme. Model aynı anda hem akıl yürütüyor hem konuşuyor.
Pratikte şöyle işliyor: Siz bir istek iletiyorsunuz, model "Hemen kontrol ediyorum..." gibi erken sözel ipuçlarıyla isteği aldığını doğal bir şekilde teyit ediyor. Arka planda çok adımlı işlemler yürürken de size canlı olarak ilerleme anlatımı yapıyor. Konuşma hiçbir noktada kesilmiyor.
Standart Gemini 3.8 Live'da da benzer bir mantık var: araç ve API çağrıları arka planda çalışırken sohbet devam ediyor. Kullanıcı görevlerin bitmesini sessizlik içinde beklemiyor.
Kıyaslama Sonuçları
Google'ın paylaştığı bağımsız test sonuçları, Extended Thinking'i sesli modellerin zirvesine yerleştiriyor:
| Test | Sonuç |
|---|---|
| Artificial Analysis – Speech to Speech Quality Index | 82,6 puan (genel sıralamada 1.) |
| Big Bench Audio (akıl yürütme) | %97,7 |
| τ-Voice (ajan tipi görev tamamlama) | %68,6 |
| Sierra τ-Voice-banking | %35,1 |
Standart Gemini 3.8 Live ise kullanıcı tercihine dayanan Speech Agent Arena sıralamasında ikinci sırada yer aldı — üstelik maliyet verimliliğinden ödün vermeden.
Buradaki asıl mesaj şu: Google artık sadece "daha akıllı model" yarışında değil, "aynı anda hızlı, ucuz ve akıllı model" yarışında iddialı olduğunu göstermeye çalışıyor.
97 Dil ve Konuşma Ortasında Dil Değiştirme
Her iki model de 97 dili destekliyor. Daha ilginci, konuşmanın ortasında dil geçişini otomatik algılayıp sorunsuz devam edebilmeleri. Türkçe başlayıp İngilizce bir terim sorduğunuzda ya da iki dilli bir ortamda konuştuğunuzda modelin takılmaması anlamına geliyor bu.
Türkiye gibi çok dilli içerik üretiminin yaygın olduğu pazarlar için bu özellik, çağrı merkezi ajanları ve müşteri hizmetleri otomasyonu tarafında doğrudan karşılığı olan bir gelişme.
Nerede Kullanılabilir?
Dağıtım oldukça geniş tutulmuş:
- Geliştiriciler için: Her iki model de Gemini API ve Google AI Studio üzerinden kullanıma açıldı.
- Kurumsal: Gemini Enterprise'da özel ön izleme kapsamında erişilebiliyor.
- Search Live: Standart Gemini 3.8 Live, AI Mode'daki Search Live deneyimini güçlendiriyor — adım adım, gerçek zamanlı sorun giderme yardımı sunuyor.
- Gemini Live: Extended Thinking sürümü Gemini uygulamasına dağıtılmaya başladı.
- Workspace: Extended Thinking'in Docs erişimi Google AI Pro ve Ultra abonelerini, Gmail ve Keep erişimi ise tüm Google AI abonelerini kapsıyor.
Üretilen tüm seslere, yapay zeka içeriğinin tespit edilebilmesi için SynthID filigranı ekleniyor.
Fiyatlandırma
Standart modelde ses girdisi dakika başına 0,005 dolar, ses çıktısı ise 0,018 dolar olarak açıklandı. Extended Thinking sürümünde akıl yürütme token'ları ile video ve belge gibi ek girdiler ayrıca ücretlendiriliyor.
Dakika bazlı fiyatlandırma, sesli ajan geliştirenler için maliyet hesabını token tahminine göre çok daha öngörülebilir kılıyor. Bir çağrı merkezi senaryosunda ortalama görüşme süresini biliyorsanız, aylık maliyeti doğrudan hesaplayabilirsiniz.
Geliştiriciler İçin Ne Anlama Geliyor?
Bu duyurunun altında yatan asıl hikâye, Google'ın yayın temposu. Gemini 3.8 Live, Gemini 3.8 Flash ve 3.8 Flash Cyber modellerinden yalnızca iki hafta sonra geldi. Yaz ortasından bu yana yaklaşık üç haftada bir büyük bir Gemini sürümü çıkıyor.
Pratik sonucu şu: sesli ajan geliştirenler için artık "gecikme sorununu nasıl gizleriz" problemi büyük ölçüde modelin kendi tarafında çözülmüş durumda. Uygulama katmanında kurgulanan sahte bekleme sesleri, "düşünüyorum" animasyonları ve benzeri geçici çözümlere olan ihtiyaç azalıyor.
Görsel bağlam desteğiyle birlikte de yeni bir senaryo grubu açılıyor: teknik destek (kamerayı arızalı cihaza tutup konuşmak), saha operasyonları, eğitim ve erişilebilirlik uygulamaları.
Sonuç
Gemini 3.8 Live, çarpıcı bir "yeni yetenek" duyurusu değil. Daha çok, sesli yapay zekanın demo aşamasından üretim aşamasına geçtiğinin göstergesi. Gecikmeyi düşürmek, maliyeti öngörülebilir kılmak ve konuşmayı kesintisiz tutmak — bunlar araştırma başlıkları değil, ürünleştirme başlıkları.
Sesli bir asistan ya da müşteri hizmetleri ajanı kurmayı düşünüyorsanız, Gemini API ve AI Studio üzerinden her iki modeli de test edip kendi senaryonuzda hangisinin daha mantıklı olduğunu görmek şu an için en hızlı yol.




