Voice-to-Voice Nedir? STT, LLM ve TTS Zincirinin Sonu
    AI Çağrı Merkezi

    Voice-to-Voice Nedir? STT, LLM ve TTS Zincirinin Sonu

    Sesli yapay zeka ajanlarının çoğu üç ayrı modeli arka arkaya diziyor. Sesten sese çalışan mimari bu zinciri ortadan kaldırıyor. Farkın teknik nedenini ve konuşmaya yansımasını anlatıyoruz.

    Sesli yapay zeka ajanlarının çoğu, dışarıdan bakınca aynı işi yapar: telefonu açar, konuşur, cevap verir. İçeriden bakıldığında ise iki farklı mimari vardır ve aradaki fark, konuşmanın nasıl hissettirdiğini belirler.

    Bu yazıda iki mimariyi ayrıntısıyla ele alıyoruz — pazarlama diliyle değil, sinyalin izlediği yolla.

    Zincirli mimari: üç model arka arkaya

    Yaygın kurulum üç ayrı bileşenden oluşur:

    1. STT (Speech to Text). Gelen ses yazıya çevrilir.
    2. LLM (Dil Modeli). Yazılı metin modele verilir, model yazılı cevap üretir.
    3. TTS (Text to Speech). Yazılı cevap sese dönüştürülüp müşteriye çalınır.

    Bu yapının bir mantığı var: her bileşen kendi alanında olgun, ayrı ayrı değiştirilebilir ve kurması görece kolaydır. Uzun süre sesli ajan kurmanın tek yolu buydu.

    Ama zincirin doğasından gelen üç sorunu var.

    Birincisi, her halka kendi gecikmesini ekler. Ses yazıya çevrilene kadar beklenir, model cevabı üretene kadar beklenir, ses sentezlenene kadar beklenir. Üstelik çoğu kurulumda TTS, cümle tamamlanmadan çalmaya başlayamaz.

    İkincisi, ses yazıya çevrildiği anda bilginin bir kısmı silinir. Yazı, sesin taşıdığı her şeyi taşımaz. "Tamam" kelimesi metinde tek bir kelimedir; seste ise onay, tereddüt, sitem veya alay olabilir. Modele giden metin bunların hiçbirini içermez.

    Üçüncüsü, zincir tek yönlüdür. Model konuşmaya başladıktan sonra, karşı taraf araya girdiğinde bunun modele ulaşması ve üretimin durdurulup yeni girdinin işlenmesi ayrı bir mekanizma gerektirir. Bu mekanizma çalışsa bile arada boşluk oluşur.

    Sesten sese mimari: tek model, doğrudan ses

    Sesten sese çalışan modelde ara dönüşüm yoktur. Model ses girdisini doğrudan alır ve ses çıktısını doğrudan üretir. Metin, konuşmanın zorunlu bir durağı olmaktan çıkar.

    Bunun üç sonucu var:

    Dönüşüm gecikmeleri ortadan kalkar. Bekleyecek üç adım yerine tek bir işlem vardır. Kendi telefon hattımızdaki ölçümde model yanıtını 0,65 saniyede hazırlıyor — iki bağımsız ölçümde 659 ve 624 milisaniye. Bu sayı modelin cevabı oluşturma süresidir; müşterinin yaşadığı toplam bekleme, sesin gidip gelmesini de içerir.

    Sesin taşıdığı bilgi korunur. Tonlama, vurgu, hız, duraklama ve tereddüt modele ulaşır. Müşteri "evet" derken emin mi, isteksiz mi — bu ayrım metne çevrildiğinde kaybolur, seste kalır.

    Çıktı da ses olarak üretilir. Model cevabını yazıp sonra seslendirmez; doğrudan konuşur. Vurgunun cümlenin neresine düşeceği, nerede duraklanacağı üretimin kendi parçasıdır.

    Farkın konuşmaya yansıması

    Teknik farkın müşteri tarafında dört görünür sonucu var.

    Araya girildiğinde durabilmek. İnsan konuşmasında araya girme sık ve doğaldır. Müşteri "evet ama benim sorum şu ki" diye lafa girdiğinde ajanın susup dinlemeye geçmesi gerekir. Sesten sese mimaride gelen ses zaten sürekli işlenmektedir.

    Doğal duraklamayı sabırla karşılamak. İnsan cümle ortasında durur, düşünür, devam eder. Zincirli sistemler bu duraklamayı çoğu zaman "cümle bitti" diye yorumlar ve müşterinin sözünü keser. Bu, sahada en çok şikayet üreten davranıştır.

    Tonlamayı taşıyabilmek. Cevabın robotik değil, konuşma gibi çıkması sadece hoşluk meselesi değil — müşterinin karşısındakini dinlemeye devam etme süresini belirler.

    Kısa cevapları hızlı verebilmek. "Evet, kargonuz yola çıktı" gibi kısa bir cevabın üç dönüşüm adımından geçmesi, cevabın kendisinden uzun sürer.

    Sesten sese mimarinin kolay olmayan tarafı

    Dürüst olmak gerekirse bu mimarinin bedelleri de var; kurulum kararı verirken bilmek gerekir.

    Ara metin otomatik gelmez. Zincirli sistemde STT çıktısı zaten döküm olarak elinizdedir. Sesten sese mimaride döküm ayrıca üretilmelidir. Kayıt, arşiv ve kalite denetimi ihtiyacı olan işletmeler için bu ihmal edilemez; biz dökümü ayrı bir akışta üretiyoruz.

    Bileşen değiştirme esnekliği azalır. Zincirde TTS sağlayıcısını beğenmezseniz değiştirirsiniz. Tek modelde böyle bir ayrıştırma yoktur.

    Hata ayıklama farklıdır. Zincirde hatanın hangi halkada olduğunu görmek görece kolaydır. Tek modelde yanlış cevabın kaynağını bulmak, bilgi tabanı ve konuşma kuralları üzerinden çalışmayı gerektirir.

    Bu üç kalem çözülebilir sorunlardır ve karşılığında alınan şey — konuşmanın gerçekten konuşma gibi olması — çoğu senaryoda bu maliyeti fazlasıyla karşılar. Ama "her açıdan üstün" demek doğru olmaz; mimari bir tercihtir ve tercihin bedeli vardır.

    Hangi mimariyi kullandığınızı nasıl anlarsınız

    Elinizdeki sistemin hangi yapıda olduğunu satıcıya sormadan da anlayabilirsiniz. Üç hızlı test:

    1. Cümlesini kesin. Susuyor mu, cümlesini bitiriyor mu?
    2. Cümle ortasında iki saniye susun. Sizin sözünüzü kesiyor mu?
    3. Kısa bir soru sorun. "Açık mısınız?" gibi. Cevap gecikmesi, uzun sorulardakiyle aynı mı?

    Bu testleri ve beş tanesini daha 6 Ağustos yazısında ayrıntılı ele alıyoruz.

    Sesli ajanın nasıl konuştuğunu doğrudan duymak isterseniz demo sayfasından kendinizi aratabilirsiniz.

    — Yazı sonu