Speech-to-Text
Gerçek çağrı koşulları için Türkçe konuşma tanıma
Mank Speech-to-Text, laboratuvar kayıtları için değil; gürültülü, sıkıştırılmış, aksanlı ve doğal akışlı gerçek çağrı sesleri için geliştirildi. Model, kurumun kendi ses verisiyle uyarlanabilir.
Gerçek çağrı sesi neden laboratuvar verisinden zordur?
- Hat sıkıştırması ve dar bant ses, yüksek frekanslı bilgiyi kaybettirir.
- Arka plan gürültüsü, çağrı merkezi ortamı ve üst üste konuşma birlikte görülür.
- Aksan, ağız ve konuşma hızı farkları geniş bir dağılım oluşturur.
- Doğal konuşmada duraksama, kendini düzeltme ve yarım cümle sıktır.
- Kurum sözlüğü, ürün adları ve kısaltmalar genel modellerde yer almaz.
Karşılaştırmalı doğruluk kanıtı
Aşağıdaki tablo yalnızca metodolojisi yayınlanabilir hâle geldiğinde sonuç gösterir.
Karşılaştırma verisi
Gerçek Bankacılık Çağrı Merkezi Verisi Benchmark- Test tarihi
- August 2026
- SEKTÖREL VERİ
- Banking
- Veri kümesi süresi
- 25 Saat
- Segment sayısı
- 24938
| Model | WER |
|---|---|
| Mank STT | %19,42 |
| Deepgram Nova 3 | %25,12 |
| ElevenLabs Scribe v2 | %29,21 |
| AssemblyAI Universal 3 Pro | %31,11 |
| Speechmatics Enhanced | %39,27 |
| Qwen3 ASR 1.7B | %41,91 |
| Whisper Large v3 | %44,75 |
Sonuçlar yalnızca belirtilen test kümesi, tarih ve model sürümü için geçerlidir. Farklı ses kalitesi, hat koşulu ve konuşma tipinde sonuçlar değişebilir.
Kullanım alanları
Çağrı transkripsiyonu ve arşiv aranabilirliği
Kalite izleme ve zorunlu anons kontrolü
Konu, niyet ve sonuç etiketleme
Voice AI için gerçek zamanlı metne dönüştürme
Operasyon raporlaması ve eğilim analizi
Kendi ses verinizle ölçelim
En anlamlı karşılaştırma, kurumun kendi ses verisi üzerinde yapılan testtir. Sınırlı bir veri kümesiyle kontrollü bir değerlendirme planlayabiliriz.
