Türkçe konuşma tanımanın zor tarafları
Bir model "%95 doğruluk" diyorsa, bu Türkçe telefon konuşması için söylenmemiştir. Doğruluğu düşüren beş sebep ve her birinin çözümü.

Konuşma tanıma sağlayıcılarının vitrininde hep yüksek bir doğruluk oranı yazar. O rakam genellikle İngilizce, geniş bant ses ve okunmuş metin üzerinden ölçülmüştür.
Sizin kullanacağınız ortam ise şu: Türkçe, telefon kalitesinde ses, doğaçlama konuşma, arka planda gürültü. Dört değişkenin dördü de doğruluğu aşağı çeker. Bu yazı, nerede ve neden düştüğünü anlatıyor.
1. Ekler kelimeyi sürekli değiştiriyor
Türkçe sondan eklemeli. Bir kök, onlarca farklı yüzeyle karşınıza çıkar:
*bayilik · bayiliği · bayiliğiniz · bayiliğinizden · bayiliğinizdeki · bayiliğinizdekilerden*
İngilizcede bir kelime genelde bir ya da iki biçimde bulunur. Türkçede aynı anlam onlarca farklı ses dizisine yayılır. Bu, modelin her biçimi ayrı ayrı öğrenmesi gerektiği anlamına gelir ve kelime hata oranını doğal olarak yükseltir.
Pratik sonuç: transkriptte kelimeyi düz metin olarak aramak işe yaramaz. "bayilik" araması "bayiliğinizden" geçen cümleyi bulmaz. Arama ve kural eşleştirmesi kök üzerinden yapılmalı.
2. Karışık dil
Türkiye'de iş konuşması saf Türkçe değil. Gerçek bir cümle şuna benziyor:
"Şimdi bu lead'i CRM'e girdim ama follow-up'ı ne zaman yapacağız, meeting'i buraya mı book edelim?"
Bu cümlede Türkçe dilbilgisi, İngilizce kelime kökleri ve Türkçe ekler iç içe. Model dili "Türkçe" olarak ayarlanmışsa İngilizce kökleri yanlış yazar; "İngilizce" ayarlanmışsa cümlenin çatısını kaybeder.
Çözüm: bu kelimeleri özel sözlüğe, sizin sektörünüzde nasıl yazılmasını istiyorsanız o biçimde eklemek. Karar sizin — "lead" mi yazacak, "aday" mı? Sistem tutarlı olduğu sürece ikisi de doğru.
3. Rakamlar
Sesli ajanların en çok hata yaptığı yer burası ve maalesef en çok önem taşıyan yer de burası.
| Söylenen | Sık görülen hatalı çıktı | Sorun |
|---|---|---|
| "beş yüz bin" | "5 100 000" | Basamak birleştirme |
| "iki bin yirmi altı" | "2000 26" | Yıl mı sayı mı belirsizliği |
| "otuz iki elli" | "3250" / "32 50" | Telefon numarası kalıbı |
| "yüz elli metrekare" | "150 m2" / "yüz elli metre kare" | Birim yazımı |
Yatırım tutarı, metrekare, telefon numarası — bir bayilik görüşmesinin en kritik verileri hep rakam. Model bunları kaçırdığında transkript okunabilir görünür ama içindeki bilgi yanlıştır ki bu, hiç yazılmamış olmasından tehlikelidir.
4. Marka ve özel isimler
Model sizin markanızı tanımıyor. Sektörünüzdeki markaları da tanımıyor. Kişi ve yer adlarını sık karıştırıyor.
Bunun etkisi sandığınızdan büyük: rakip markanın adının geçtiği bir cümle, marka adı yanlış yazıldığı için "rakip anıldı" sinyalini tetiklemez. Yani model hatası doğrudan bir iş sinyali kaybına dönüşür.
Çözüm: özel sözlük. Çoğu sağlayıcı, tanınmasını istediğiniz kelimeleri önceden bildirmenize izin veriyor. Listeye girmesi gerekenler:
- Kendi marka ve ürün adlarınız
- Sektörünüzdeki başlıca rakip markalar
- Sık geçen il ve ilçe adları
- Sektöre özel terimler ve kısaltmalar
- Kampanya ve paket isimleri
Bu liste bir kez yazılıp unutulacak bir şey değil; yeni kampanya çıktıkça büyür. Bakımı yapılmayan sözlük, birkaç ay içinde işe yaramaz hale gelir.
5. Telefon kalitesi ve üst üste konuşma
Telefon hattı sesi dar bir banda sıkıştırır. Yüksek frekanslar kırpılır ve bu, tam da Türkçedeki *s · ş · f · h* gibi seslerin ayırt edildiği bölgedir. "şirket" ile "sirket" arasındaki fark hattın kestiği yerde durur.
İkinci sorun üst üste konuşma. Gerçek görüşmelerde insanlar birbirinin sözünü keser. Tek kanala karışmış iki ses, konuşmacı ayrımını bozar — ve konuşmacı ayrımı bozulunca müşterinin söylediği bir itiraz temsilcinin söylediği gibi kaydedilir.
Çözüm: mümkünse çift kanallı kayıt almak. Her tarafın sesi ayrı kanalda tutulduğunda konuşmacı ayrımı tahmin işi olmaktan çıkar. Operatörünüz destekliyorsa, bu tek ayar transkript kalitesini gözle görülür şekilde yükseltir.
Doğruluğu nasıl ölçersiniz
Sağlayıcının verdiği rakamı değil, kendi rakamınızı ölçün. Yöntem basit:
- 1.Gerçek görüşmelerinizden 20-30 tanesini seçin, farklı temsilciler ve farklı bölgelerden olsun.
- 2.Bunları elle yazıya dökün. Sıkıcı ama tek doğru referans budur.
- 3.Modelin çıktısıyla karşılaştırıp kelime hata oranını hesaplayın.
- 4.Hataları sınıflandırın: rakam mı, marka mı, ek mi, konuşmacı ayrımı mı?
- 5.En büyük sınıfa yönelik düzeltme yapın — genelde ilk düzeltme özel sözlüktür.
- 6.Aynı 30 kaydı tekrar ölçün. İyileşme yoksa yaptığınız şey işe yaramamıştır.
Bu döngüyü iki kez çevirmek, sağlayıcı değiştirmekten daha fazla kazandırır.
Sonuç
Türkçe konuşma tanıma çözülmüş bir problem değil, ama yönetilebilir bir problem. Doğruluğu düşüren sebeplerin çoğu modelin kendisinde değil, kurulumun etrafında: sözlük yok, kanal tek, rakamlar doğrulanmıyor, kimse ölçmüyor.
Transkript doğru çıktıktan sonra asıl iş başlıyor: Bir görüşmeden ne çıkarılabilir?
Kendi görüşmelerinizde ne var, görmek ister misiniz?
Callsense, konuşmalardaki niyeti, itirazı ve sonraki adımı görünür kılıyor. Kapsam görüşmesi 30 dakika sürüyor ve teknik hazırlık gerektirmiyor.
Kapsam görüşmesi