Google, konuşurken düşünen Gemini 3.8 Live'ı çıkardı
Google iki canlı ses modeli duyurdu. Extended Thinking sürümü konuşmayı kesmeden akıl yürütebiliyor ve arka planda görev çalıştırabiliyor.
Ne duyuruldu?
Google 15 Eylül'de Gemini 3.8 Live ve Gemini 3.8 Live Extended Thinking adlı iki canlı konuşma modelini tanıttı. 3.8 Live ölçek ve maliyet verimliliği için tasarlandı. Akıcı konuşmayı görsel algıyla birleştiriyor, görsel girdiyi de neredeyse gerçek zamanlı işleyebiliyor.
Extended Thinking çok adımlı akıl yürütme isteyen işler için. Bu model aynı anda düşünüp konuşabiliyor: "Hemen kontrol edeyim" gibi sözlü işaretler veriyor, arka planda çalışan bir görevin ne durumda olduğunu da konuşurken anlatıyor. İki model de desteklenen 97 dil arasında, konuşmanın ortasında dili algılayıp geçiş yapabiliyor.
Test sonuçları
Google'ın paylaştığı sonuçlara göre Extended Thinking, Artificial Analysis'in konuşmadan konuşmaya kalite endeksinde 82,6 puanla ilk sırada. Ajan görevlerini tamamlama becerisini ölçen tau-Voice testinde %68,6, Sierra'nın bankacılık senaryolu tau-Voice-banking testinde %35,1, Big Bench Audio'da %97,7 aldı. 3.8 Live ise Speech Agent Arena'da ikinci sırada.
Nerede kullanılabiliyor?
İki model de Gemini API ve Google AI Studio üzerinden geliştiricilere açık; Google Arama'daki Search Live'da da kullanılıyor. Gemini Enterprise'da özel önizleme aşamasındalar. Extended Thinking, Gemini uygulamasındaki Gemini Live'da Pro ve Ultra abonelerine açılıyor, iş hesaplarında Gmail, Docs ve Keep'e de geliyor. Google fiyat açıklamadı. Modellerin ürettiği bütün seslere kulağın duymadığı bir SynthID filigranı ekleniyor.
İşletmeler için anlamı
Sesli bir ajanın işe yaraması büyük ölçüde konuşmanın akışına bağlı. Arayanı bekletmemesi, sözü kesilince dağılmaması ve bir şeyi kontrol ederken sessiz kalmaması gerekiyor. Google'ın yeni modelleri, OpenAI'ın 10 Eylül'de API'ye açtığı GPT-Live-1 ile aynı sorunu hedefliyor. Google'ın andığı ortaklar arasında Salesforce, ServiceNow ve LiveKit var. Gecikmenin bu ürünlerde neden belirleyici olduğunu latency yazımızda anlattık.