İçeriğe geç

Speech-to-Text

Gerçek çağrı koşulları için Türkçe konuşma tanıma

Mank Speech-to-Text, laboratuvar kayıtları için değil; gürültülü, sıkıştırılmış, aksanlı ve doğal akışlı gerçek çağrı sesleri için geliştirildi. Model, kurumun kendi ses verisiyle uyarlanabilir.

Gerçek çağrı sesi neden laboratuvar verisinden zordur?

  • Hat sıkıştırması ve dar bant ses, yüksek frekanslı bilgiyi kaybettirir.
  • Arka plan gürültüsü, çağrı merkezi ortamı ve üst üste konuşma birlikte görülür.
  • Aksan, ağız ve konuşma hızı farkları geniş bir dağılım oluşturur.
  • Doğal konuşmada duraksama, kendini düzeltme ve yarım cümle sıktır.
  • Kurum sözlüğü, ürün adları ve kısaltmalar genel modellerde yer almaz.

Karşılaştırmalı doğruluk kanıtı

Aşağıdaki tablo yalnızca metodolojisi yayınlanabilir hâle geldiğinde sonuç gösterir.

Karşılaştırma verisi

Gerçek Bankacılık Çağrı Merkezi Verisi Benchmark
Test tarihi
August 2026
SEKTÖREL VERİ
Banking
Veri kümesi süresi
25 Saat
Segment sayısı
24938
Karşılaştırma verisi
ModelWER
Mank STT%19,42
Deepgram Nova 3%25,12
ElevenLabs Scribe v2%29,21
AssemblyAI Universal 3 Pro%31,11
Speechmatics Enhanced%39,27
Qwen3 ASR 1.7B%41,91
Whisper Large v3%44,75

Sonuçlar yalnızca belirtilen test kümesi, tarih ve model sürümü için geçerlidir. Farklı ses kalitesi, hat koşulu ve konuşma tipinde sonuçlar değişebilir.

Kullanım alanları

Çağrı transkripsiyonu ve arşiv aranabilirliği
Kalite izleme ve zorunlu anons kontrolü
Konu, niyet ve sonuç etiketleme
Voice AI için gerçek zamanlı metne dönüştürme
Operasyon raporlaması ve eğilim analizi

Kendi ses verinizle ölçelim

En anlamlı karşılaştırma, kurumun kendi ses verisi üzerinde yapılan testtir. Sınırlı bir veri kümesiyle kontrollü bir değerlendirme planlayabiliriz.

Hemen Deneyin