Patientdesk.ai, Türkçe ses modelleri Alania ve Duyu'yu tanıttı

Patientdesk.ai, Y Combinator destekli yatırım sonrası Türkçe odaklı sesli yapay zeka modelleri Alania ve Duyu'yu kullanıma sundu.

WBH Editör28 Eylül 2026 ~2 dk okuma

Şubat ayında Y Combinator liderliğinde tohum öncesi turda 1 milyon dolar yatırım alan Patientdesk.ai, şimdi de Türkçe için özel olarak geliştirilmiş iki yeni ses modelini duyurdu. Şirketin Alania adını verdiği model, yazılı metinleri sese dönüştürürken, Duyu ise konuşmaları yazıya aktarıyor. Bu iki model, tek bir hesap ve API anahtarı üzerinden erişilebilir durumda ve lansmana özel olarak bir ay boyunca ücretsiz kullanılabiliyor.

Patientdesk.ai'ın bu yeni modelleri geliştirme motivasyonu, piyasadaki mevcut sesli yapay zeka çözümlerinin büyük çoğunluğunun İngilizce verilerle eğitilmiş olmasından kaynaklanıyor. Türkçe'nin eklemeli yapısı, özel isimlerin farklı telaffuzu, telefon görüşmelerindeki düşük ses kalitesi ve konuşma sırasında geçen e-posta adresleri veya telefon numaraları gibi unsurlar, İngilizce ağırlıklı modellere zorluk çıkarabiliyor. Patientdesk.ai, ABD'deki kliniklerin telefon görüşmelerini yanıtlayan sesli asistanını geliştirirken edindiği tecrübeyi Alania ve Duyu'yu Türkçe için eğitmekte kullandığını belirtiyor.

Şirketin paylaştığı verilere göre, konuşmayı yazıya dönüştüren Duyu modeli, açık Türkçe okuma testi FLEURS'ta yüzde 4,71 gibi düşük bir kelime hata oranına ulaştı. Bu oran, OpenAI'ın Whisper large-v3 modelinin aynı testteki yüzde 5,04'lük hata oranından daha iyi bir performans sergilediğini gösteriyor. Patientdesk.ai'ın kendi oluşturduğu, telefon kalitesindeki sesler ve iletişim bilgilerini içeren test setinde ise Duyu'nun hata oranı yüzde 9,87 olarak kaydedildi. Bu testte ElevenLabs'in Scribe v2 modeli yüzde 10,4 hata oranı elde etti. Duyu, kaydedilmiş ses dosyalarının yanı sıra canlı konuşmaları da gerçek zamanlı olarak metne dönüştürebiliyor.

Alania modeli ise Türkçe metinleri doğal ve akıcı bir sesle okumaya odaklanıyor. Modelin, cümlenin tamamlanmasını beklemeden sesi akış halinde gönderebilmesi, özellikle telefon görüşmeleri ve sesli asistanlar gibi düşük gecikmenin kritik olduğu senaryolar için büyük önem taşıyor. Platformda şu an için tek bir ses seçeneği bulunsa da, randevu, soru sorma veya sakinleştirme gibi farklı tonlama seçenekleri sunuluyor.

Her iki model de yaygın kullanılan OpenAI API formatıyla uyumlu olduğu için geliştiriciler, mevcut uygulamalarına kolayca entegre edebilir. Patientdesk.ai, modellerin tarayıcı üzerinden denenmesine ve geliştiricilerin API anahtarı oluşturmasına olanak tanıyor. Şirket ayrıca, araştırma topluluğuna yönelik Antalia-1 adında deneysel bir Türkçe metinden sese modelini de açık kaynak olarak yayınladı. Bu modelin ağırlıkları, kodu ve teknik raporuyla birlikte yaklaşık 5 saatlik Türkçe ses veri seti de paylaşıldı.

Bunlara da göz at