YazılarYazma araçları
Sesli not dökümü neden bir metin mesajı değil
Düz dikte, sesli notu metne çevirir ama dolgu sözcüklerini, yarım kalan cümleleri ve aklına geliş sırasını çoğu zaman olduğu gibi bırakır. Araştırmanın söylediği ve bir yeniden yazım adımının kattığı.
Yazan: Samet Durgun · Subtext'in kurucu ortağı · 15 dk okuma
· Güncellendi: 10 Ekim 2026
Konuşma, yazılı metnin çoğunlukla taşımadığı dolgu sözcükleri, yarım bırakılmış başlangıçlar ve cümle ortasında yapılan düzeltmeler içerir. Bu yüzden bir sesli notun düz dökümü henüz bir mesaj değildir. Telefonlar söylediğini yazıya döker, Otter da, WhatsApp’ın transkriptleri de, açık konuşma modelleri üzerine kurulu uygulamalar da, ama dağınık bir sesli notun dökümü yine dağınık bir mesajdır. İçindeki “um” seslerini, yarı yolda yaptığın düzeltmeyi ve şeyleri aklına geldikleri sırayla dizişini olduğu gibi tutar. Bir sesli notu net bir metin mesajına çeviren uygulamanın, yazıya dökmenin ardından ikinci bir işi de yapması gerekir. Ne demek istediğini anlaması ve onu yazması gerekir.
Yazının ilk yarısı araştırmayı anlatıyor. Dilbilimciler konuşulan dille yazılı dilin nasıl ayrıştığını ölçtü, konuşma tanıma araştırmacıları yazıya dökmenin nerede ve kimde başarısız olduğunu ölçtü, birkaç çalışma da insanların neden sesli not gönderdiğini ve alıcıların neden ertelediğini sordu. İkinci yarı, insanların zaten sahip olduğu dikte araçlarının ne yaptığını, bir yeniden yazım adımının ne kattığını ve Subtext’in bir sesli notla ne yaptığını anlatıyor.
Sesin, yazılmış bir taslağın ve bir sohbetin ekran görüntüsünün yanında üç giriş yolundan biri olan Subtext’in kurucu ortağı olarak bu sorunun cevabında çıkarım sahibiyim. Aşağıdaki her kaynağı açıp okudum. Yalnızca özetine ulaşabildiğim yerde bunu söylüyorum ve ondan hiçbir rakam aktarmıyorum.
Konuşma, yazıdan farklı üretilir
Kendiliğinden konuşma, yazının dışarıda bıraktığı malzemeyle dolu. Elizabeth Shriberg’in kendiliğinden konuşulan Amerikan İngilizcesinin birkaç derleminde akıcılık bozulmalarını taradığı çalışma, oranın sözcüklerin yüzde onuna ve sözcelerin üçte birinden fazlasına kadar çıktığını söylüyor1. Bunlar dolgulu duraklamalar (“uh”, “um”), tekrarlar (“I I think”), bir sözcüğün cümle ortasında başkasıyla değiştirildiği düzeltmeler ve Shriberg’in silmeler altında topladığı, bir yan cümlenin yarıda bırakılıp baştan başlandığı yanlış başlangıçlar. İncelediği iki insandan insana derlemde, gayriresmî telefon konuşmalarında ve seyahat planlama aramalarında, sözcük başına oran yaklaşık yüzde altıydı1. Bu oran, Shriberg’in aynı derlemlere ilişkin SRI makalesinde elle etiketlenen 40.515 ve 12.762 sözcüklük örneklemlere dayanıyor2. Bas konuş düğmesiyle bilgisayara konuşan insanlardan oluşan bir derlemde oran yüzde birin altına düştü ve düşüşün bir kısmını düğmeye bağlıyor. Konuşanlar ifadeyi önce planlayıp sonra kaydedebiliyordu1. Sesli notta bir kez dokunup konuşuyorsun, planlama da yüksek sesle oluyor.
Dolgu sözcükleri ve konuşanlar arasındaki fark
Dolgu sözcükleri gürültü değil, onları ayıklamanın zor olmasının bir sebebi de bu. Herbert Clark ve Jean Fox Tree, birkaç büyük derlemden yola çıkarak “uh” ile “um”un kendi başına birer sözcük olduğunu, diğerleri gibi planlandığını ve üretildiğini, konuşanın sıradaki sözcüğü ararken ya da ne diyeceğine karar verirken kısa ya da uzun bir gecikmeyi duyurmak için kullanıldığını savundu3. Konuşandan konuşana da çok değişiyorlar. London-Lund derleminde, 1961 ile 1976 arasında kaydedilmiş, çoğu akademisyenler arasındaki 50 İngiliz yüz yüze konuşmadan yaklaşık 170.000 sözcükte, her biri 1.000’den fazla sözcük üreten 65 konuşanın dolgu oranı 1.000 sözcükte 1,2 ile 88,5 arasında değişiyor, ortanca 17,33. Bazı dökümler neredeyse temiz çıkıyor, bazılarında her on iki sözcükte bir dolgu var.
Akıcılık bozulması, planlamanın en yoğun olduğu yerlerde de yoğunlaşıyor. Shriberg, daha önceki çalışmalara atıfla, bunun bir öbeğin başında daha olası olduğunu belirtiyor1. Sesli notta bu, mesajın ne için olduğuna hâlâ karar verdiğin açılış. Yazıda o açılışı kimse görmeden silebilirsin. Sesli notta, mesajın tamamını yeniden kaydetmediğin sürece genellikle olduğu gibi gider.
Konuşma tanıma hataları konuşana göre nasıl değişiyor
Yazıya dökme, konuştuğun hataların üstüne kendi hatalarını ekliyor. Bulduğum en net ölçüm, PNAS’ta yayımlanan 2020 tarihli bir çalışma. Çalışma Amazon, Apple, Google, IBM ve Microsoft’un beş ticari konuşma tanıyıcısını, 42 beyaz ve 73 siyah Amerikalı konuşanın 19,8 saatlik röportaj sesi üzerinde çalıştırdı4. Ortalama sözcük hata oranı beyaz konuşanlarda 0,19, siyah konuşanlarda 0,35 çıktı ve her sistemde fark vardı. En iyi performansı gösteren Microsoft 0,15 ve 0,27 aldı. En kötüsü Apple 0,23 ve 0,45 aldı. Siyah konuşanların kliplerinin %20’sinden fazlasında sözcüklerin en az yarısı yanlış çıktı, beyaz konuşanların kliplerinde bu oran %2’nin altındaydı4. Yazarlar farkı sesi sözcüğe eşleyen akustik modellere bağlıyor ve eğitim verisinde siyah konuşanlardan çok az ses bulunmasına işaret ediyor.
Aynı makaledeki ikinci bir örüntü sesli notlar için önemli. Sistemler erkek konuşanlarda biraz daha kötü performans gösterdi, yazarlar bunu daha gayriresmî bir tarza, daha kısa ve daha indirgenmiş telaffuzlara ve daha çok akıcılık bozulmasına bağlıyor4, yani bir arkadaşına attığın sesli notun üslubuna.
Aksanlar, ikinci diller ve kimsenin söylemediği sözcükler
Konuşma tanıma, aksanlarda ve ikinci dil konuşmasında da daha kötü çalışıyor. JASA Express Letters’ta 2024’te yayımlanan bir makale, OpenAI’nin Whisper modelini İngilizce aksanlar üzerinde test etti ve ana dili İngilizce olanlar için ikinci dili İngilizce olanlara göre daha yüksek doğruluk, Amerikan İngilizcesi için İngiliz ya da Avustralya İngilizcesine göre daha iyi sonuç, okunan konuşmada da sohbete göre daha iyi sonuç bildirdi5. Yalnızca özete ulaşabildim, bu yüzden yönü aktarıyorum, rakam vermiyorum. Whisper 680.000 saatlik sesle eğitildi ve yazarları modellerin insanın “accuracy and robustness” düzeyine yaklaştığını söylüyor6. Kendi belgeleri de “performance varies widely depending on the language” diyor7. Konuşanlar üzerinden alınan ortalama, ikinci dilinde yorgun halde kaydettiğin bir sesli not hakkında pek bir şey söylemez. O dil İngilizceyse, doğru bir mesaj ana dili İngilizce olan bir okura yine de sert gelebilir ve bir döküm bunu sana göstermez.
Whisper ayrıca kimsenin söylemediği sözcükler ekleyebiliyor. 2024 tarihli bir çalışma, ABD kurumlarında kaydedilmiş, afazisi olan ve olmayan 437 katılımcıdan 13.140 kısa İngilizce klibi, Nisan ve Mayıs 2023’te OpenAI’nin barındırılan Whisper API’sinden geçirdi. Dökümlerin yaklaşık yüzde biri, seste olmayan bütün öbekler ya da cümleler içeriyordu ve bunların %38’i, şiddet ya da yetki konusunda yanlış bir iddia gibi, en az bir açık zarar taşıyordu. Uzun duraklamaları olan klipler daha büyük risk altındaydı. Whisper’ın metin uydurduğu 187 klipte Google, Amazon, Microsoft, AssemblyAI ve RevAI karşılaştırılabilir hiçbir uydurma üretmedi. Klipler röportajdı, sesli not değil, çalışma da API’yi 2023’teki hâliyle test etti8.
İnsanlar neden sesli not gönderiyor
İnsanlar sesli not gönderiyor, çünkü gönderen için hızlı. Bulduğum en büyük çalışma Ulm Üniversitesi’nden. Çoğu Amerika Birleşik Devletleri’nde olmak üzere Amazon Mechanical Turk üzerinden toplanmış 1.003 kişiyle yapılan 2020 tarihli bir anket ve altı yoğun kullanıcıyla iki haftalık bir saha çalışması9. Ankette katılımcıların %83’ü sesli mesaj almıştı ve %73’ü göndermişti. Gönderme nedenleri, sesli mesaj kaydetmiş kişilerin 735 açık uçlu cevabından alındı ve dört temada toplandı. Tema sayıları 735 cevabın toplamından fazla, yani bazı cevaplar birden fazla temaya girdi. Kolaylık, çünkü telefonda konuşmak yazmaktan iyi, 359 kez anıldı. Sesin taşıyıp metnin kaybettiği ton ve duygu, 229. Araba kullanmak gibi yazmanın zahmetli ya da güvensiz olduğu durumlar, 203. Ve sesli isteyen ya da onu daha kolay bulan alıcı, 34.
Bir laboratuvar çalışması hızı ölçtü. İçlerinden 24’ü ana dili İngilizce olan 48 üniversite öğrencisi bir iPhone’da kısa cümleleri kopyaladı. İngilizce konuşma girişi dakikada 153 sözcükle, klavye dakikada 52 sözcükle, yani 2,93 kat hızlı çalıştı, ama konuşma son metinde biraz daha fazla düzeltilmemiş hata bıraktı, klavyedeki %0,35’e karşı %0,55. Görev hazır cümleleri kopyalamaktı, bu da bir mesaj yazmak hakkında pek bir şey söylemiyor. Yazarlardan ikisi Baidu’da çalışıyordu ve Baidu’nun sunucu tarafı tanıyıcısı Deep Speech 2, 2017’de yayımlanan bu makalede bir iPhone 6 Plus uygulaması üzerinden test edildi10.
Sesli notlar emeği gönderenden alıcıya kaydırıyor
Ulm saha çalışmasında iki hafta boyunca kaydedilen 438 sesli mesaj 1,5 saniyeden yedi dakikanın biraz üzerine kadar uzanıyordu ve ortanca süre 17,5 saniyeydi9. Yazarlar ayrıca, alıcı daha onu duymadan ödenen bir bedele de dikkat çekiyor. Ses geçici olduğu için bir kaydı gözden geçirmek ve düzenlemek zahmetli, dil sürçmesi de mesajın tamamını yeniden kaydetmek demek9. Saha çalışmalarındaki on iki iptal edilmiş kaydın beşi tam olarak buydu.
Yazarların ifadesiyle sesli mesajlar “shift the effort necessary for communication towards the receiver”, yani iletişim için gereken çabayı alıcıya kaydırıyor9. Mesajı oluşturmak hızlı, içeriğe ulaşmak, aynı içerikteki bir metni okumaktan daha çok zaman ve çaba istiyor ve saha katılımcılarının çoğu işte sesli mesajları erteledi, çünkü bir metin bir bakışta kavranabilir, bir kayıt kavranamaz. 2020’de önerdikleri çözüm otomatik dökümlerdi, böylece bir kaydın içine gömülmüş randevunun tarihi ve yeri tarayarak bulunabilirdi.
Alıcılar neden sesli notları erteliyor
Alıcılar göz gezdiremiyor, bu yüzden duyduklarına geri dönüyor. Aynı saha çalışmasında insanlar aldıkları bir sesli mesajı ortalama 1,37 kez çaldı ve bir mesaj 13 kez çalındı9. Okumak tekrarı gerektirmiyor. 190 çalışma ve 18.573 katılımcıdan oluşan 2019 tarihli bir meta analiz, İngilizce kurgu dışı metnin ortalama sessiz okuma hızını dakikada 238 sözcük olarak veriyor11. Konuşma hızı büyük bir telefon derleminde, tüm görüşme sayıldığında dakikada yaklaşık 196 sözcük, konuşanın kendi sıraları içinde ise yaklaşık 164 sözcük12. Okuyan kişi ayrıca hızı kendisi belirliyor ve doğrudan soruya atlayabiliyor. Dinleyici sözcükleri konuşanın hızında ve konuşanın sırasıyla alıyor.
İnsanlar bunlara pek hevesli değil ve almaya göndermekten biraz daha hevesli. 5 ve 6 Mayıs 2022’de uygulanan ve o Haziran’da yayımlanan, 2.149 Birleşik Krallık yetişkininden oluşan bir YouGov anketi, içlerindeki akıllı telefon kullanıcılarına, yani 1.956 kişiye sesli notları sordu. Bunların %16’sı göndermeyi seviyor, %36’sı sevmiyordu. Almak için %22 seviyor, %25 sevmiyor ve %29 kararsızdı13. Yalnızca 18 ile 24 yaş arasında almayı sevenler sevmeyenlerden fazlaydı, %43’e %28, bu grupta bile yarısı göndermeyi sevmiyordu, sevenler %30’du. Tüm akıllı telefon kullanıcıları içinde %63 hiç sesli not göndermemişti.
Bir sesli not ne kadar uzun olursa fazla uzun olur?
Mayıs 2022’de Birleşik Krallık akıllı telefon kullanıcılarıyla yapılan bir YouGov anketinde, cevap verenlerin %65’i bir dakikalık sesli notun fazla uzun olduğunu söyledi ve almayı sevmeyip cevap verenlerin %57’si 30 saniyelik bir nottan bile bıkkınlık duyuyordu. Tüm akıllı telefon kullanıcıları arasında %27 sınırın nerede olduğunu bilmiyordu. Uzun bir mesajı nasıl almayı tercih ettikleri sorulduğunda %78 metni, %14 sesli notu seçti, bu yalnızca belirtilmiş bir tercihi kaydeder13. Bazı göndericiler, kaydın karşıdakine yük bindirdiğini biliyor gibi. Almanya ve İspanya’daki WhatsApp sohbetlerinin 2024 tarihli bir analizi, insanların ses tercihini mesajdan önce, mesajın içinde ve sonrasında gerekçelendirdiğini buldu. Yazarlar bu gerekçelendirmelerin sosyal bir iş gördüğünü, buna sesli notu özür dilemeye değer bir şey olarak çerçevelemenin de dahil olduğunu söylüyor14. Bu üç kaynağa bakınca gönderen emekten tasarruf ediyor, alıcı bunun bedelini ödüyor ve bazı göndericiler bunun için özür diliyor.
Apple’ın Dikte özelliği sesli notla ne yapıyor
Dikte sana sözcükleri söylediğin sırayla verir ve Apple’ın Dikte’si için işin tamamı bu. Apple’ın iOS 27 için iPhone kılavuzu, Dikte’yi telefonda, internet bağlantısı olmadan, birçok dilde işlenen ve dilin desteklediği yerlerde virgülleri, noktaları ve soru işaretlerini kendiliğinden ekleyen bir özellik olarak anlatıyor15. En yeni telefonlarda cihaz üstündeki bir model yazımı, noktalamayı ve büyük harf kullanımını iyileştiriyor, İngilizce olarak. Geri kalan her şey sesli bir komut. “new line” diyorsun, “delete” deyip ardından ifadeyi söylüyorsun. Cihaz üstünde işlenme iddiasının bir şartı var. Apple’ın gizlilik sayfasına göre, Klavye Ayarları Dikte’nin cihazda işlendiğini göstermiyorsa, dikte ettiklerin Apple’ın sunucularına gönderiliyor ve Siri’yi ve Dikte’yi İyileştir’i seçmedikçe saklanmıyor. Sayfa ayrıca Apple’ın istek geçmişini ve dökümleri, Apple Hesabına değil rastgele bir aygıt tanımlayıcısına bağlı olarak, iki yıla kadar saklayabileceğini söylüyor16. Sayfa ikisinin birbirine nasıl oturduğunu söylemiyor. Yeniden yazmak, Apple’ın ayrı Yazma Araçları’nın işi ve onlar bir metnin karşı tarafa nasıl ulaşacağına dair bir okuma sunmuyor.
Google ve Microsoft’un sesle yazma özellikleri ne yapıyor
Google’ın temel Gboard sesle yazma özelliği, Apple’ın Dikte’si gibi, sözcükleri söylediğin gibi veriyor. Mikrofona dokun, yazılmasını istediğini söyle ve noktalamayı sesli söyle, ancak sesle yazma ve noktalama her dilde mevcut değil17. Pixel 6 ve sonrasında bulunan İleri seviye sesle yazma özelliği konuşurken noktalama ekliyor. Pixel 9’da (9a hariç) ve sonrasında sesli bir komut, dikte ettiğini düzeltebiliyor, yeniden ifade edebiliyor, kısaltabiliyor ya da uzatabiliyor. Google bunun cihazda, İngilizce, Fransızca, İtalyanca, Japonca ve İspanyolcada çalıştığını, Almancanın ise yakında geleceğini söylüyor18. Windows’ta Microsoft’un yardım sayfası, Copilot+ PC özelliği olan Akıcı dikte’nin, sen konuşurken dilbilgisini, noktalamayı ve dolgu sözcüklerini düzelttiğini söylüyor19. İleri seviye sesle yazma yalnızca sesli bir komut verdiğinde yeniden yazıyor. Akıcı dikte komut olmadan çalışıyor ama yalnızca Copilot+ PC’lerde ve yardım sayfası mesajın yeniden sıralanmasından söz etmiyor. Burada andığım Apple, Google ve Microsoft yardım sayfalarında, dağınık bir sesli notun tamamını varsayılan olarak gönderilebilir bir mesaja çeviren bir özellik bulamadım.
Döküm uygulamaları ve mesajlaşma uygulamaları ne yapıyor
Bir döküm uygulaması olan Otter, telefon klavyesinin bir adım ötesine geçiyor. Konuşmadan metne sayfası, konuşmacı etiketleri ve zaman damgaları olan bir dökümü, öne çıkanlarla otomatik oluşturulmuş bir özeti ve çıkarılmış ana noktalarla eylem maddelerini anlatıyor20. Otter’ın yardım merkezi desteklenen diller olarak İngilizce, İspanyolca, Fransızca, Almanca, Japonca ve Çince’yi (Basitleştirilmiş) sıralıyor21, bu da konuşmadan metne sayfasının söylediğinden fazla. Toplantılar için yapılmış, bu yüzden söyleneni yoğunlaştırıyor ve bu iki sayfada, senin göndermek istediğini taslak hâline getiren bir özellik bulamadım. Açık konuşma modelleri bazı uygulamaların altında duruyor. Whisper’ın kendisi bir döküm ve bir dil etiketi üretiyor7. Üzerine kurulu uygulamalar değişiyor. MacWhisper, dökümün üstüne dolgu sözcüğü temizleme, özetler ve özel prompt’lar eklediğini duyuruyor ve bu adım için yerel ya da bulut modeller sunuyor22.
Mesajlaşma uygulamaları aldığın sesli notları yazıya dökmeye başladı. WhatsApp sesli mesaj transkriptlerini Kasım 2024’te ekledi. Transkriptler cihazda üretiliyor, bu yüzden WhatsApp’ın kendisi okuyamıyor, Ayarlar ve Sohbetler altından açılıyor ve mesaja uzun basarak tetikleniyor23. Yazı, transkriptlerin birkaç seçili dille başladığını söylüyor ve güncel listeyi doğrulayamadım. Bu, Ulm yazarlarının tespit ettiği tarama sorununu, dilin kapsandığı yerde çözüyor. Elde ettiğin şey, başkasının yüksek sesle düşünmesinin dökümü. Bir toplantıda okuyabilirsin, ama cevabı yine de senin yazman gerekiyor.
Bir yeniden yazım adımı ne katıyor
Bir yeniden yazım adımı, yazmak zahmetsiz olsaydı yazacağın mesaja dökümü çeviriyor. Clark ve Fox Tree’nin anlattığı dolgu sözcüklerini atıyor, Shriberg’in sınıflandırmasındaki tekrarları ve yanlış başlangıçları toparlıyor ve yarı yolda yaptığın düzeltmeyi, düzelttiği şeyin yerine koyarak olması gereken yere yerleştiriyor. Sıralamayı da değiştiriyor. Konuşulan açıklamalar çoğu zaman aklına geldiği gibi geliyor, önce bağlam, istek en sonda ya da önce istek, gerekçeler peşinden. Yazılı bir mesaj asıl noktayla başlayabilir.
Adımın dokunmaması gereken iki şey var. Birincisi anlam. Sesli notunu başka bir isteğe dönüştüren bir yeniden yazım dökümden daha kötü, çünkü döküm en azından senin söylediğini söylemişti. İkincisi ton. Sıcaksan, sertsen ya da şaka yapıyorsan yazılı versiyon da aynı kişi olmalı. Buradaki hata türü, yeniden yazımın kibar ama jenerik döndüğü, yapay zekâ mesajlarını robot gibi mi gösteriyor yazısındaki türle aynı.
Bir dökümün hiç vermek zorunda kalmadığı bir yargı da var. Sesli notta söylediklerinin bir kısmı alıcı için değil, senin içindi. Bir şeyden söz edip etmemeyi yüksek sesle düşünmek, onu söylemek istediğin anlamına gelmiyor. Bir yeniden yazım adımı neyin mesaj, neyin taslak olduğuna karar vermek zorunda ve bu karar iki yönde de yanlış gidebilir, ya kendini vazgeçirmeye çalıştığın bir cümleyi tutarak ya da kastettiğin bir cümleyi atarak. Hiçbir araçta, Subtext dahil, bunun ne sıklıkta olduğunu ölçen bir çalışma bulamadım.
Subtext bir sesli notla ne yapıyor
Subtext uygulamada kaydettiğin sesli notu yazıya döküyor, sonra mesajı kastettiğinden yola çıkarak yazıyor ve her biri senin kastettiğin gibi ulaşma olasılığına dair göndermeye hazır puanı taşıyan en fazla üç versiyon veriyor. Versiyonlar anlamını ve kişiliğini koruyacak şekilde kurulmuş. İlk taslakta biri sorunları düzelterek kelimelerine yakın kalıyor, biri daha sıcak bir cilalama ya da farklı bir yaklaşım, biri de daha kapsamlı bir yeniden yazım. İfade kastettiğinden daha soğuk ya da keskin okunuyorsa uygulama sorunu adlandırıyor ve kusurlu kelimeleri işaretliyor. Senin yerine hiçbir şey gönderilmiyor.
Modelin talimatları yazıya dökmeden kalan kusurları kapsıyor ve bunu yazmadan önce backend prompt’larını okudum. Bir mesaj dikte edilmiş diye işaretlendiğinde modele yanlış duyulmuş ya da birleşmiş sözcükler, tuhaf noktalama ve başıboş dolgu beklemesi, bunların içinden amaçlanan ifadeyi okuması ve bunları senin yaptığın bir hata gibi işaretlemeden sessizce düzeltmesi söyleniyor. Prompt modele ne yapması söylendiğini gösteriyor. Subtext’in ses yazıya dökmesine ya da yeniden yazmasına dair bağımsız bir değerlendirme bulamadım, bu yüzden bunların hepsi uygulamanın gösterdiğine ve prompt’larının ile gizlilik politikasının söylediğine dayanıyor. Yukarıdaki çalışmaların hiçbiri Subtext’in sesini yazıya döken konuşma modeli Deepgram’ı test etmediği için aksan, ikinci dil konuşması ve gündelik üslup hata örüntülerinin ona ne kadar geçtiğini söyleyemem, o yüzden göndermeden önce mesajı geri oku.
Subtext’te bir ses kaydına ne oluyor?
Subtext, bir ses kaydını yazıya dökmek için Deepgram’a gönderiyor, yani ses telefondan çıkıyor. 26 Temmuz 2026’da güncellenen gizlilik politikası birkaç sağlayıcıyı adlandırıyor. Bunların arasında ses kayıtları için Deepgram, metin, görüntüler ve ses dökümleri için Anthropic, hesaplar ve konuşmalar için Google Firebase ve yalnızca sesli okumayı açarsan OpenAI var. Politika ayrıca web araması açıkken isteğinden türetilen arama terimlerinin Anthropic üzerinden üçüncü taraf arama sağlayıcılarına gittiğini ve web aramasını uygulamanın ayarlarından kapatabileceğini ekliyor24. Gönderdiğin hiçbir şeyin bir yapay zekâ modelini eğitmek için kullanılmadığını ve yapay zekâ sağlayıcılarının hiçbirinin bunun üzerinde eğitim yapamayacağını söylüyor, Subtext ayrıca ses için Deepgram’ın model iyileştirmeden çıkma seçeneğini ayarlıyor. Subtext’in bir konuşmanın kendi kopyasını sunucularından son kullanımından beş gün sonra, sabitlediysen 90 gün sonra sildiğini söylüyor. Deepgram’ın, bu seçenek ayarlıyken, sesi yalnızca yazıya dökmek için gereken süre kadar tuttuğunu, Anthropic’in girdileri ve çıktıları 30 gün içinde sildiğini, işaretlenmiş istekleri iki yıla kadar ve ilgili güvenlik puanlarını yedi yıla kadar tutabileceğini söylüyor. Subtext’in hiçbiriyle sıfır saklama anlaşması olmadığını söylüyor24. Diğer asistanların metnini nasıl ele aldığı hangi yapay zekâ yazma asistanlarının mesajlarınla eğitildiği yazısında karşılaştırılıyor.
Subtext hangi dilleri destekliyor?
Subtext mesajı konuştuğun dilde yazıyor, 17+ dilde ve dilin ayırt ettiği yerlerde kullandığın resmiyet düzeyini koruyor. Almanca bir sesli not Almanca bir mesaj olarak geri geliyor. Aldığın bir sesli notun özeti, geldiği dilde yazılıyor. Google Play editörleri bu akışı bir “Hot Tip” yazısında öne çıkardı. Yazı mikrofon simgesine dokunmayı, konuşmayı, tekrar dokunmayı ve orijinalin nasıl geldiğine dair etiketlerle ve bir kopyalama düğmesiyle düzeltilmiş bir mesaj almayı anlatıyor25. Sayfayı 4 Ekim 2026’da açtığımda Alman mağazasındaki liste 295 yorumdan 4,3 yıldız ve 50.000’den fazla indirme gösteriyordu, bu yalnızca bir Google Play sayısı, yıldız değeri ülkeye göre değişiyor. Subtext’i kullanmak ücretli, başlamak için birkaç analiz ücretsiz. Kaydedilmiş bir sesli not gönderebileceğin bir mesaj olarak geri geliyor.
Biri sana uzun bir sesli mesaj gönderdiyse nasıl cevap verirsin?
Subtext başkalarının sana gönderdiği sesli mesajları da okuyor ve düz bir dökümün yeterliye en çok yaklaştığı taraf bu. WhatsApp’ın cihaz üstündeki transkripti, dilinin kapsandığı yerde iki dakikalık bir kaydı okumana izin veriyor23. Yapmadığı şey, kişinin senden ne istediğini söylemek. Ulm çalışmasının kendi örneği, sesin içine gömülmüş bir tarih ve yerdi9. Bir arkadaştan ya da yöneticiden gelen uzun bir sesli not da aynı biçimde, soru bir yerlerde, ortalara doğru, gerekçeler de etrafında. Cevap vermekte takılan insanlar için okuma adımı, bir cevabın takıldığı beş yerden biri ve Ulm saha katılımcılarının çoğu işte sesli mesajları erteledi, çünkü bir kayıt bir bakışta kavranamaz9.
Aldığın bir sesli mesajı Subtext’e bırak, yazıya döküyor, kişinin senden ne istediğini tek satırda özetliyor ve iki ila beş eylem maddesi ekliyor. Sonra konuyu devam ettiren bir cevap taslağı hazırlayabiliyor ve göndericinin tonunu etiketlemiyor. Backend prompt’ları, eklediğin bir ses dosyasını büyük olasılıkla karşı tarafın sana gönderdiği bir dosya olarak ele alıyor ve model kimin kim olduğundan emin değilse sorması söyleniyor. Özet yalnızca altındaki yazıya dökme kadar iyi ve tek satır bağlamı olmadan zor okunuyor, bu mesaj ne anlama geliyor yazısının gösterdiği gibi. Belirgin bir aksan ya da gürültülü bir kayıtta yazıya dökme, stüdyoda kaydedilmiş temiz bir İngilizceye göre daha fazla hata taşıyacak, bu yüzden önemli bir şeye cevap vermeden önce orijinali çal. Metin ve ekran görüntüleri aynı özet adımından geçiyor, yani aldığın bir mesaj aynı tek satırlık özeti alıyor.
En yakın deneyler eski ve küçük
Bir yeniden yazım adımına ya da özete bulduğum en yakın iki deney 2003 ve 2005’ten ve ikisi de küçük. 2003’te DARPA tarafından finanse edilen bir deneyde, ana dili İngilizce olan 28 kişi telefon ve yayın konuşmasından 150 ile 250 sözcüklük pasajları, birebir dökümler ve elle temizlenmiş dökümler olarak okudu. Okurlar temizlenmiş metni anlamayı daha kolay buldu ama sorulara daha doğru ya da daha hızlı cevap vermedi, yazarlar bunu okurların zaten en üst puana yakın olmasıyla açıklıyor. Kusurlu tanıyıcı çıktısının otomatik temizlenmesi, temizlenmemiş versiyondan daha zor bulunma eğilimindeydi, yalnızca çok az farkla26. Temizleme akıcılık bozulmalarını kaldırdı ve noktalamayı düzeltti ama metni bir mesaja dönüştürecek şekilde yeniden yazmadı.
2005’te 16 kişi, otomatik çıkarılan özetlerden 15 telesekreter mesajı hakkındaki soruları cevapladı. Tanınan konuşmadan kurulan özetlerde arayanın adı zamanın %57’sinde doğru çıktı, insan dökümlerinden kurulan özetlerde %94. Aramanın nedeni ise iki özet türünde de aynı ölçüde iyi iletildi, %78. Özet tanınan konuşmadan geldiğinde insanlar orijinal sesi daha sık istedi, zamanın %53’ünde, %30’a karşı27. Bunlar 2005 konuşma tanımasıyla yapılmış telesekreter mesajlarının çıkarmaya dayalı özetleriydi, bu yüzden çalışma yalnızca bir beklenti belirliyor. İkisi de birinin göndereceği bir mesajı ölçmedi.
Kanıtın bittiği yer
Güçlü kanıt iki uçta. Konuşulan dil, yazının taşımadığı ölçülmüş bir oranda akıcılık bozulması taşıyor ve konuşma tanıma bazı konuşanlar için diğerlerinden daha çok hata yapıyor, yukarıdaki rakamlar bunu gösteriyor. Orta kısım daha ince. Yeniden yazılmış bir sesli notun ham bir dökümden ne kadar daha iyi ulaştığını ya da bir yeniden yazımın yolda anlamı ne sıklıkla değiştirdiğini ölçen bir çalışma bulamadım. Sesli mesajlaşma araştırması bir avuç çalışmadan ibaret, en büyüğü bir ABD kitlesel çalışma platformundan alınmış anket örneklemi ve altı kişilik bir saha çalışması. YouGov anketi tek bir ülke ve tek bir yıl. Sesli not çalışmaları da cihaz üstü dökümlerden önce yapıldı, bu yüzden anlattıkları emek kayması artık kısmen mesajlaşma uygulamalarının kendisi tarafından kapatıldı.
Pratikte iş nasıl konuştuğuna bağlı. Temiz cümlelerle konuşuyorsan dikte yeter ve telefonunda zaten var. O derlemlerdeki konuşanlar gibi konuşuyorsan, Clark ve Fox Tree’nin saydığı dolgu sözcükleriyle ve Shriberg’in kataloglayıp sıraladığı yeniden başlamalarla, bir döküm alıcıya taslak sürecini olduğu gibi teslim eder, onu mesaja çeviren de bir yeniden yazım adımıdır. Subtext bu adımı yapan uygulamalardan biri, hem kaydettiğin hem aldığın sesli not için, derdin sürekli düzenleyip durduğun bir cevapsa kısa bir cevap neden bir saat sürüyor bu döngüyü anlatıyor. Subtext'i tarayıcıda deneKurmak için telefonunun kamerasıyla okut.Subtext'i tarayıcıda dene
Kaynaklar
Yazıda geçtikleri sıraya göre numaralandırıldı. Sayfalar 4 ve 5 Ekim 2026’da kontrol edildi, Subtext gizlilik politikası ise 10 Ekim 2026’da yeniden açıldı.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153 ila 169. Amerikan İngilizcesi konuşma derlemi çalışması; akıcılık bozulmalarının oranları ve türleri.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. Konferans bildirisi; PDF’de yıl yok ve atıf yaptığı kaynaklar 1996’ya kadar uzanıyor. Elle etiketlenmiş derlemler, 30 konuşandan 40.515 sözcük (Switchboard) ve 523 konuşandan 12.762 sözcük (AMEX, SRI çalışanları ile seyahat acentaları arasındaki aramalar). DARPA ve NSF tarafından finanse edilmiş. . 5 Ekim 2026’da kontrol edildi.
- Clark, H. H., ve Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73 ila 111. London-Lund derleminden konuşan başına dolgu oranları.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., ve Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684 ila 7689. Beş ticari sistem, 42 beyaz ve 73 siyah konuşan, 19,8 saatlik ses.
- Graham, C., ve Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. Yalnızca özet; kontrol edildiğinde tam metne ulaşılamadı.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., ve Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv ön baskısı.
- OpenAI. Whisper README. GitHub. . 4 Ekim 2026’da kontrol edildi.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., ve Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). ABD kurumlarında kaydedilmiş, afazisi olan ve olmayan 437 katılımcıdan 13.140 ses parçası, Nisan ve Mayıs 2023’te Whisper API’sinden geçirildi. Pulitzer Center ve Cornell’in Center for Social Sciences birimi tarafından finanse edilmiş.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., ve Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. 1.003 kişilik anket ve 6 kişiyle iki haftalık saha çalışması.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., ve Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. Aralık 2017’de yayımlandı. 48 üniversite öğrencisiyle laboratuvar çalışması, dil başına 24, bir iPhone’da cümle kopyalama. İki yazar Baidu USA’da çalışıyordu, Baidu’nun sunucu tarafı konuşma sistemi Deep Speech 2 bir Baidu sunucusunda çalıştı ve bir iPhone 6 Plus uygulaması üzerinden test edildi.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 190 çalışma, 18.573 katılımcı.
- Yuan, J., Liberman, M., ve Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard telefon konuşmaları.
- YouGov. How many Britons like voice notes? 14 Haziran 2022. 2.149 Birleşik Krallık yetişkininden oluşan anket, saha çalışması 5 ve 6 Mayıs 2022, 1.956’sı akıllı telefon kullanıcısı; uzunluk rakamları cevap veren katılımcıların oranları. Sonuç tabloları adresinde. https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. 4 ve 5 Ekim 2026’da kontrol edildi. Yüzdeler YouGov’un makale metnini izliyor, sonuç tabloları yuvarlama nedeniyle sevmeyenler için biraz farklı toplamlar veriyor.
- Sampietro, A., ve König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51 ila 71. Alman ve İspanyol WhatsApp sohbetleri; özet yayıncının Crossref kaydı üzerinden okundu, tam metin ücretli.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . 4 Ekim 2026’da kontrol edildi.
- Apple. Siri, Dictation & Privacy. Legal, son güncelleme 14 Eylül 2026. . 5 Ekim 2026’da kontrol edildi.
- Google. Type with your voice. Gboard Help. . 4 Ekim 2026’da kontrol edildi.
- Google. Use advanced voice typing features. Gboard Help. . 5 Ekim 2026’da kontrol edildi.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . 5 Ekim 2026’da kontrol edildi.
- Otter.ai. Convert Speech to Text. . 4 Ekim 2026’da kontrol edildi.
- Otter.ai. Supported languages. Otter Help Center, makale 6 Mayıs 2026’da düzenlendi. . 5 Ekim 2026’da kontrol edildi.
- MacWhisper. Homepage. Pazarlama sayfası, tarihsiz, bu yüzden ürünün neyi reklam ettiğini gösteriyor, nasıl performans gösterdiğini değil. . 5 Ekim 2026’da kontrol edildi.
- WhatsApp. Introducing Voice Message Transcripts. 21 Kasım 2024. . 4 Ekim 2026’da kontrol edildi.
- Subtext, Koşullar, gizlilik ve hesabın. Gizlilik politikasının son güncellemesi 26 Temmuz 2026. 10 Ekim 2026’da kontrol edildi.
- Google Play. Hot Tip: Speak your mind with Subtext. . 4 Ekim 2026’da kontrol edildi, liste açtığım her mağazada 295 yorum ve 50K+ indirme, Alman mağazasında ise 4,3 yıldız gösteriyordu.
- Jones, D. A., ve altı eş yazar (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585 ila 1588. Ana dili İngilizce olan 32 kişi alındı, 28’i analiz edildi. DARPA tarafından Hava Kuvvetleri sözleşmesi F19628-00-C-0002 kapsamında desteklenmiş.
- Koumpis, K., ve Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). 16 katılımcı ve 15 telesekreter mesajıyla anlama testi; rakamlar yazarın barındırdığı PDF’den okundu. EPSRC ROPA ödülü GR/R23954 tarafından finanse edilmiş.