블로그글쓰기 도구
음성 메모를 받아쓴 글은 아직 문자 메시지가 아니에요
받아쓰기는 음성 메모를 글로 옮기지만 군말, 말 다시 시작하기, 생각난 순서는 대개 그대로 남겨요. 연구가 말해주는 것과 다시 쓰기 단계가 더하는 것을 정리했어요.
글 Samet Durgun · Subtext 공동 창업자 · 17분 읽기
· 2026년 10월 10일 업데이트
말에는 군말, 말 다시 시작하기, 말하다 중간에 고쳐 말하기가 섞여 있어요. 완성된 글에는 대개 없는 것들이죠. 그래서 음성 메모를 그대로 받아쓴 글은 아직 메시지가 아니에요. 휴대폰도 말한 내용을 글자로 옮겨주고, Otter나 WhatsApp의 텍스트 변환, 오픈 음성 모델로 만든 앱도 마찬가지예요. 하지만 횡설수설한 음성 메모를 받아쓴 글은 여전히 횡설수설한 메시지예요. “um”도, 말하다 중간에 한 정정도, 어쩌다 떠오른 순서도 그대로 남아요. 음성 메모를 명확한 문자 메시지로 바꿔주는 앱은 받아쓰기 다음에 두 번째 일을 해야 해요. 당신이 무슨 뜻이었는지 파악해서 그걸 써주는 일이에요.
전반부는 연구예요. 언어학자들은 말하는 언어가 글과 어떻게 다른지 측정했고, 음성 인식 연구자들은 받아쓰기가 어디서 누구에게 틀리는지 측정했고, 몇몇 연구는 사람들이 왜 음성 메모를 보내는지, 받는 사람은 왜 그걸 미루는지 물었어요. 후반부는 사람들이 이미 가진 받아쓰기 도구가 하는 일, 다시 쓰기 단계가 더하는 것, 그리고 Subtext가 음성 메모로 하는 일이에요.
저는 Subtext의 공동 창업자예요. 이 앱에서 음성은 직접 쓴 초안, 대화 스크린샷과 함께 들어오는 세 가지 방법 중 하나라서, 이 질문의 답에는 제 이해관계가 걸려 있어요. 아래 출처는 모두 제가 직접 열어본 거예요. 초록밖에 볼 수 없었던 경우에는 그렇다고 밝히고, 거기서 가져온 수치는 인용하지 않아요.
말은 글과 다르게 만들어져요
자발적인 말에는 글이 빼는 것들이 가득해요. Elizabeth Shriberg는 미국 영어 자발 발화 코퍼스 여러 개를 가로질러 비유창성을 조사했는데, 비유창성은 단어의 최대 10%, 발화의 3분의 1 이상에서 나타났어요1. 유형은 채움말(“uh”, “um”), 반복(“I I think”), 문장 중간에 단어를 바꿔 말하는 고쳐 말하기, 그리고 절을 버리고 처음부터 다시 시작하는 말 다시 시작하기예요. Shriberg는 마지막 것을 삭제로 분류해요. 그가 살펴본 사람 대 사람 코퍼스 두 개, 곧 격식 없는 전화 대화와 여행 계획 통화에서는 단어당 비율이 약 6%였고1, 이는 같은 코퍼스를 다룬 SRI 논문에서 사람이 직접 표시한 40,515단어와 12,762단어의 표본에 해당해요2. 컴퓨터에 대고 버튼을 누른 채 말하는 코퍼스에서는 비율이 1% 아래로 떨어졌고, Shriberg는 그 하락의 일부를 버튼 덕으로 봐요. 화자가 먼저 발화를 계획한 다음 녹음할 수 있었기 때문이에요1. 음성 메모는 한 번 누르고 바로 말하니까, 계획이 소리 내어 이루어져요.
음성 속 군말과 화자마다 다른 정도
군말은 잡음이 아니고, 그래서 걷어내기 어려운 면도 있어요. Herbert Clark와 Jean Fox Tree는 여러 대규모 코퍼스를 근거로 “uh”와 “um”이 그 자체로 하나의 단어라고 주장했어요. 다른 단어와 똑같이 계획하고 발음하며, 화자가 다음 단어를 찾거나 무슨 말을 할지 정하는 동안 짧은 지연인지 긴 지연인지를 알리는 데 쓰인다는 거예요3. 화자마다 편차도 엄청나요. London-Lund 코퍼스는 1961년부터 1976년 사이에 녹음한 영국인의 대면 대화 50건, 약 170,000단어로 이루어져 있고 대부분 학자들의 대화예요. 여기서 각자 1,000단어를 넘게 말한 화자 65명은 1,000단어당 군말이 1.2개에서 88.5개까지 퍼져 있었고 중앙값은 17.3개였어요3. 받아쓴 글이 거의 깨끗하게 나오는 사람도 있고, 열두 단어쯤마다 군말이 하나씩 붙는 사람도 있어요.
비유창성은 계획이 가장 무거운 곳에 몰리기도 해요. Shriberg는 앞선 연구를 인용하며 구절의 앞부분에서 더 일어나기 쉽다고 짚어요1. 음성 메모에서 그 앞부분은 도입부이고, 아직 이 메시지가 무엇을 위한 것인지 정하는 중이에요. 글에서는 그 도입부를 아무도 보기 전에 지울 수 있어요. 음성 메모에서는 메시지 전체를 다시 녹음하지 않는 한 대개 그대로 나가요.
음성 인식 오류는 화자마다 달라요
받아쓰기는 당신이 말한 오류 위에 자기만의 오류를 더해요. 제가 찾은 가장 분명한 측정은 2020년 PNAS 연구예요. Amazon, Apple, Google, IBM, Microsoft의 상용 음성 인식기 다섯 개에 미국인 백인 화자 42명과 흑인 화자 73명의 인터뷰 오디오 19.8시간을 돌렸어요4. 평균 단어 오류율은 백인 화자가 0.19, 흑인 화자가 0.35였고, 어느 시스템에서나 이 격차가 나타났어요. 가장 잘한 Microsoft는 0.15와 0.27이었고, 가장 못한 Apple은 0.23과 0.45였어요. 흑인 화자의 클립 중 20% 넘게가 단어의 절반 이상이 틀린 채로 돌아왔고, 백인 화자의 클립에서는 2% 미만이었어요4. 저자들은 이 격차의 원인을 소리를 단어로 대응시키는 부분인 음향 모델에서 찾고, 학습 데이터에 흑인 화자의 오디오가 너무 적었다고 짚어요.
같은 논문의 두 번째 패턴은 음성 메모와 관련이 있어요. 시스템은 남성 화자에게서 다소 더 나빴는데, 저자들은 이를 더 격식 없는 말투, 곧 더 짧고 더 많이 줄여 발음하며 비유창성이 더 많은 말투 탓으로 봐요4. 친구에게 보내는 음성 메모의 말투죠.
억양, 제2언어, 아무도 말하지 않은 단어
음성 인식은 억양이 다르거나 제2언어로 말할 때도 성능이 떨어져요. 2024년 JASA Express Letters 논문은 OpenAI의 Whisper 모델을 여러 영어 억양에 걸쳐 시험했고, 영어가 제2언어인 화자보다 원어민에게서, 영국이나 호주 영어보다 미국 영어에서, 대화보다 낭독 음성에서 정확도가 더 높았다고 보고했어요5. 초록밖에 볼 수 없어서 방향만 인용하고 수치는 인용하지 않아요. Whisper는 680,000시간의 오디오로 학습했고, 만든 이들은 이 모델이 사람의 “accuracy and robustness”에 가까워지고 있다고 설명해요6. Whisper 자체 문서는 “performance varies widely depending on the language”라고 덧붙여요7. 화자 전체의 평균은 지친 상태로 제2언어로 남긴 음성 메모에 대해 거의 말해주지 않아요. 그 언어가 영어라면 문법이 맞는 메시지도 원어민에게는 퉁명스럽게 읽힐 수 있는데, 받아쓴 글은 그걸 알려주지 않아요.
Whisper는 아무도 말하지 않은 단어를 더하기도 해요. 2024년 연구는 미국 기관에서 녹음한 실어증이 있는 참가자와 없는 참가자 437명의 짧은 영어 클립 13,140개를 2023년 4월과 5월에 OpenAI가 제공하는 Whisper API에 돌렸어요. 받아쓴 글의 약 1%에 오디오에 없던 구절이나 문장이 통째로 들어 있었고, 그중 38%는 폭력이나 권위가 있다는 거짓 주장 같은 명백한 해악을 적어도 하나 담고 있었어요. 긴 침묵이 있는 클립이 더 위험했어요. Whisper가 텍스트를 지어낸 클립 187개에서 Google, Amazon, Microsoft, AssemblyAI, RevAI는 비슷한 지어내기를 하지 않았어요. 클립은 음성 메모가 아니라 인터뷰였고, 이 연구가 시험한 것은 2023년 당시의 API예요8.
사람들이 음성 메모를 보내는 이유
사람들이 음성 메모를 보내는 건 보내는 쪽에게 빠르기 때문이에요. 제가 찾은 가장 큰 연구는 Ulm University의 것으로, Amazon Mechanical Turk로 모집한 대부분 미국 거주자 1,003명에 대한 2020년 설문과, 음성 메시지를 자주 쓰는 6명에 대한 두 주간의 현장 연구예요9. 설문에서 83%가 음성 메시지를 받아본 적이 있었고 73%가 보내본 적이 있었어요. 음성 메시지를 녹음해본 사람들의 주관식 답변 735건에서 뽑은 보내는 이유는 네 가지 주제로 나뉘었어요. 주제별 횟수를 더하면 735건보다 많은데, 답변 일부가 둘 이상에 걸쳤기 때문이에요. 휴대폰에서 말하는 게 타이핑보다 낫다는 편의성이 359번 꼽혔어요. 목소리에는 담기고 글에서는 사라지는 어조와 감정이 229번이었고요. 운전처럼 타이핑이 불편하거나 위험한 상황이 203번이었어요. 마지막으로 상대가 음성을 요청했거나 그쪽이 더 편하다고 한 경우가 34번이었어요.
실험실 연구는 속도를 측정했어요. 대학생 48명, 그중 24명은 영어 원어민이었는데, 이들이 iPhone에서 짧은 문구를 따라 입력했더니 영어 음성 입력은 분당 153단어, 키보드는 52단어로 2.93배 빨랐어요. 다만 음성 입력은 최종 텍스트에 고치지 못한 오류를 조금 더 남겼어요. 0.55%와 0.35%였어요. 과제가 정해진 문구를 따라 치는 일이라서, 메시지를 직접 쓰는 일에 대해서는 알려주는 게 별로 없어요. 저자 중 두 명은 Baidu 소속이었고, Baidu의 서버 쪽 인식기 Deep Speech 2를 iPhone 6 Plus 앱으로 시험했어요. 2017년에 발표된 논문이에요10.
음성 메모는 수고를 보내는 사람에게서 받는 사람에게로 옮겨요
Ulm 현장 연구에서 두 주 동안 기록된 음성 메시지 438건은 1.5초에서 7분 조금 넘는 길이까지 다양했고 중앙값은 17.5초였어요9. 저자들은 받는 사람이 듣기도 전에 치르는 비용도 짚어요. 소리는 금방 사라지는 것이라 녹음을 다시 검토하고 고치기가 번거롭고, 말실수가 나면 메시지 전체를 다시 녹음해야 해요9. 현장 연구에서 중단된 녹음 12건 중 5건이 바로 그런 경우였어요.
저자들은 음성 메시지가 “shift the effort necessary for communication towards the receiver”라고 써요9. 쓰는 건 빠르지만, 같은 내용의 글을 읽는 것보다 다시 찾아 듣는 데 시간과 수고가 더 들고, 현장 참가자 대부분이 직장에서 음성 메시지를 미뤘어요. 글은 한눈에 들어오는데 녹음은 그럴 수 없기 때문이에요. 2020년에 저자들이 내놓은 해법은 자동 받아쓰기였어요. 녹음 속에 묻힌 약속의 날짜와 장소를 훑어보면서 찾을 수 있게 하자는 거예요.
받는 사람이 미루는 이유
받는 사람은 훑어볼 수 없으니, 들은 내용을 다시 돌려봐요. 같은 현장 연구에서 사람들은 받은 음성 메시지를 평균 1.37번 재생했고, 한 메시지는 13번 재생됐어요9. 읽을 때는 다시 재생할 필요가 없어요. 190개 연구와 참가자 18,573명을 다룬 2019년 메타분석은 영어 비문학을 조용히 읽는 평균 속도를 분당 238단어로 봐요11. 대화에서 말은 큰 전화 코퍼스 기준으로 통화 전체를 세면 분당 약 196단어, 한 화자의 발언 차례 안에서는 약 164단어예요12. 읽는 사람은 속도도 직접 조절하고 질문 부분으로 건너뛸 수도 있어요. 듣는 사람은 말하는 사람의 속도로, 말하는 사람의 순서대로 단어를 받아요.
사람들은 음성 메모를 그다지 좋아하지 않고, 보내는 것보다 받는 것을 조금 더 좋아해요. YouGov가 영국 성인 2,149명을 대상으로 2022년 5월 5일과 6일에 조사해 그해 6월에 발표한 설문은, 그중 스마트폰 사용자 1,956명에게 음성 메모에 대해 물었어요. 이들 중 16%는 보내는 것을 좋아했고 36%는 싫어했어요. 받는 것은 22%가 좋아했고 25%가 싫어했으며 29%는 양가적이었어요13. 받는 것을 싫어하는 사람보다 좋아하는 사람이 더 많은 건 18세에서 24세뿐이었고 43% 대 28%였어요. 그 집단에서도 보내는 것은 절반이 싫어했고 좋아한 사람은 30%였어요. 스마트폰 사용자 전체에서는 63%가 음성 메모를 한 번도 보내본 적이 없었어요.
음성 메모는 얼마나 길면 너무 긴가요?
2022년 5월 영국 스마트폰 사용자 YouGov 설문에서, 답을 한 사람의 65%가 1분짜리 음성 메모도 너무 길다고 했고, 받는 것을 싫어하면서 답을 한 사람 중 57%는 30초에도 답답했다고 했어요. 스마트폰 사용자 전체에서는 27%가 한계가 어디인지 몰랐어요. 긴 메시지를 어떻게 받고 싶은지 묻자 78%가 글을, 14%가 음성 메모를 골랐는데, 이건 밝힌 선호일 뿐이에요13. 녹음이 상대에게 부담이라는 걸 아는 듯한 보내는 사람들도 있어요. 독일과 스페인의 WhatsApp 대화를 분석한 2024년 연구는 사람들이 메시지 앞, 안, 뒤에서 오디오를 고른 이유를 설명하는 걸 발견했고, 저자들은 이런 설명이 음성 메모를 사과할 만한 일로 틀 짓는 것까지 포함해 사회적 일을 한다고 봐요14. 이 세 출처를 종합하면 보내는 사람은 수고를 덜고 받는 사람이 그 값을 치르며, 일부 보내는 사람은 그 점을 사과해요.
Apple의 받아쓰기가 음성 메모로 하는 일
받아쓰기는 말한 순서대로 단어를 주고, Apple의 받아쓰기는 그게 일의 전부예요. iOS 27용 Apple의 iPhone 사용 설명서는 받아쓰기가 인터넷 연결 없이 휴대폰에서 많은 언어로 처리되고, 언어가 지원되면 쉼표, 마침표, 물음표를 자동으로 넣는다고 설명해요15. 최신 휴대폰에서는 기기 안의 모델이 영어에 한해 철자, 문장 부호, 대문자 표기를 개선해요. 나머지는 전부 말로 하는 명령이에요. “새로운 줄”이라고 말하고, 구절 뒤에 “삭제”라고 말하면 돼요. 기기 안에서 처리된다는 말에는 조건이 있어요. Apple의 개인정보 페이지는 키보드 설정에 받아쓰기가 기기에서 처리된다고 표시되지 않으면 받아쓴 내용이 Apple 서버로 전송되고, ‘Siri 및 받아쓰기 기능 향상’에 참여하지 않는 한 저장되지 않는다고 밝혀요. 또 요청 기록과 받아쓴 글을 Apple 계정이 아니라 임의의 기기 식별자에 연결해 최대 2년 동안 보관할 수 있다고도 해요16. 이 두 가지가 어떻게 맞물리는지는 페이지에 나와 있지 않아요. 고쳐 쓰기는 Apple의 별도 기능인 글쓰기 도구의 일인데, 글쓰기 도구는 글이 어떻게 닿는지에 대한 판독을 주지 않아요.
Google과 Microsoft의 음성 입력이 하는 일
Google의 기본 Gboard 음성 입력도 Apple의 받아쓰기처럼 말한 그대로 단어를 줘요. 마이크를 탭하고, 쓰고 싶은 내용을 말하고, 문장 부호도 말로 하면 돼요. 다만 음성 입력과 문장 부호는 모든 언어에서 쓸 수 있는 건 아니에요17. Pixel 6 이상의 고급 음성 입력은 말하는 동안 문장 부호를 넣어주고, Pixel 9 이상(9a 제외)에서는 말로 내린 명령으로 받아쓴 내용을 교정하거나 표현을 바꾸거나 줄이거나 늘릴 수 있어요. Google은 이 기능이 기기에서 영어, 프랑스어, 이탈리아어, 일본어, 스페인어로 실행되고 독일어는 곧 지원된다고 밝혀요18. Windows에서는 Microsoft 도움말 페이지가 Copilot+ PC 기능인 Fluid 받아쓰기가 말하는 동안 문법, 문장 부호, 군말을 바로잡는다고 설명해요19. 고급 음성 입력은 말로 명령을 줄 때만 고쳐 써요. Fluid 받아쓰기는 명령 없이도 실행되지만 Copilot+ PC에서만 쓸 수 있고, 도움말 페이지에는 메시지의 순서를 바꾼다는 말이 없어요. 여기 인용한 Apple, Google, Microsoft 도움말 페이지에서, 횡설수설한 음성 메모 전체를 기본적으로 보낼 수 있는 메시지로 바꿔주는 기능은 찾지 못했어요.
음성을 글로 옮기는 앱과 메신저가 하는 일
받아쓰기 앱인 Otter는 휴대폰 키보드보다 한 걸음 더 나가요. 음성 텍스트 변환 페이지는 화자 표시와 타임스탬프가 붙은 받아쓴 글, 하이라이트가 달린 자동 요약, 추출된 핵심과 할 일을 설명해요20. Otter 고객센터는 지원 언어로 영어, 스페인어, 프랑스어, 독일어, 일본어, 중국어(간체)를 꼽는데21, 음성 텍스트 변환 페이지에 적힌 것보다 많아요. 회의용으로 만들어져서 말한 내용을 압축해줄 뿐이고, 그 두 페이지에서 당신이 보내려던 말을 초안으로 써주는 기능은 찾지 못했어요. 오픈 음성 모델이 밑바탕에 깔린 앱도 있어요. Whisper 자체는 받아쓴 글과 언어 라벨을 내놓아요7. 이걸 기반으로 한 앱은 제각각이에요. MacWhisper는 받아쓴 글 위에 군말 제거, 요약, 직접 쓰는 프롬프트를 내세우고, 그 단계에 로컬 모델과 클라우드 모델을 둘 다 제공해요22.
메신저는 받은 음성 메모를 글로 옮기기 시작했어요. WhatsApp는 2024년 11월에 음성 메시지 텍스트 변환을 추가했어요. 기기에서 생성되어 WhatsApp 자체도 읽을 수 없고, 설정의 채팅 메뉴에서 켜고 메시지를 길게 눌러 실행해요23. 게시물은 텍스트 변환이 소수의 선택된 언어로 시작했다고 하는데, 현재 목록은 확인하지 못했어요. 언어가 지원되는 곳에서는 Ulm 저자들이 짚은 훑어보기 문제에 대한 답이 되는 셈이에요. 다만 손에 들어오는 건 다른 사람이 소리 내어 한 생각의 받아쓴 글이에요. 회의 중에 읽을 수는 있어도, 답장은 여전히 직접 써야 해요.
다시 쓰기 단계가 더하는 것
다시 쓰기 단계는 받아쓴 글을, 타이핑이 공짜였다면 당신이 쳤을 메시지로 바꿔줘요. Clark와 Fox Tree가 설명한 군말을 걷어내고, Shriberg의 분류에 나오는 반복과 말 다시 시작하기를 합치고, 말하다 중간에 한 정정은 정정 대상이던 말을 대체해서 있어야 할 자리에 놓아요. 순서도 다시 짜요. 말로 하는 설명은 대개 떠오른 순서대로 오니까요. 맥락이 먼저 나오고 부탁이 마지막에 오거나, 부탁이 먼저 나오고 이유가 뒤에 줄줄이 따라와요. 쓴 메시지는 요점으로 시작할 수 있어요.
이 단계가 건드리지 말아야 할 게 둘 있어요. 첫째는 뜻이에요. 음성 메모를 매끈하게 다듬다가 다른 부탁으로 바꿔버리면 받아쓴 글보다 나빠요. 받아쓴 글은 적어도 당신이 한 말을 그대로 담고 있으니까요. 둘째는 어조예요. 따뜻했든, 직설적이었든, 농담을 했든, 쓴 글도 같은 사람이어야 해요. 여기서의 실패는 AI를 쓰면 내 문자가 로봇처럼 들릴까요?에서 다룬 것과 같아요. 다시 쓴 글이 공손하지만 평범하게 돌아오는 거예요.
받아쓴 글에는 필요 없지만 다시 쓰기 단계에는 꼭 필요한 판단이 하나 더 있어요. 음성 메모에서 한 말 중 일부는 받는 사람이 아니라 당신 자신을 위한 말이었어요. 어떤 이야기를 꺼내야 할지 소리 내어 고민했다고 해서 꺼내려던 건 아니에요. 다시 쓰기 단계는 어디까지가 메시지이고 어디까지가 초안 작업이었는지 가려야 하고, 이 판단은 양쪽으로 틀릴 수 있어요. 스스로 말려보던 문장을 남겨두거나, 하려던 말을 빼버리는 식으로요. 어떤 도구로든, Subtext를 포함해서, 이런 일이 얼마나 자주 일어나는지 측정한 연구는 찾지 못했어요.
Subtext가 음성 메모로 하는 일
Subtext는 앱에서 녹음한 음성 메모를 받아쓴 다음, 당신이 하려던 말을 바탕으로 메시지를 써서 최대 세 가지 버전으로 돌려줘요. 버전마다 의도한 대로 닿을 가능성을 보여주는 보내기 안전 점수가 붙어요. 버전은 당신의 뜻과 당신다운 말투를 지키도록 만들어졌어요. 첫 초안이라면 하나는 문제를 고치면서 당신의 말에 가깝게 유지하고, 하나는 더 따뜻하게 다듬거나 다르게 접근하고, 하나는 더 본격적으로 다시 써요. 표현이 의도보다 차갑거나 날카롭게 읽히면 앱이 그 문제에 이름을 붙이고 원인이 된 단어를 표시해요. 대신 보내주는 건 없어요.
모델에 주는 지시문에는 받아쓰기 과정에서 생기는 오류 처리도 들어 있고, 저는 이 글을 쓰기 전에 백엔드 프롬프트를 읽었어요. 메시지가 음성으로 받아쓴 것으로 표시되면 모델은 잘못 들은 단어나 붙어버린 단어, 이상한 문장 부호, 남은 군말이 있을 수 있다고 전제하고, 그걸 헤치고 의도한 표현을 읽어내며, 당신이 잘못한 것처럼 짚지 않고 조용히 고치라는 지시를 받아요. 프롬프트는 모델이 무엇을 하라고 지시받았는지를 보여줄 뿐이에요. Subtext의 음성 받아쓰기나 다시 쓰기를 독립적으로 평가한 연구는 찾지 못해서, 이 모든 내용은 앱이 보여주는 것과 앱의 프롬프트와 개인정보처리방침이 말하는 것에 기대고 있어요. 위의 연구 중 어느 것도 Subtext의 오디오를 받아쓰는 음성 모델 Deepgram을 시험하지 않았기 때문에, 억양, 제2언어 발화, 격식 없는 말투에 대한 오류 패턴이 Deepgram에 얼마나 그대로 적용되는지는 말씀드릴 수 없어요. 그러니 보내기 전에 메시지를 다시 읽어보세요.
Subtext에서 음성 녹음은 어떻게 되나요?
Subtext는 받아쓰기를 위해 음성 녹음을 Deepgram에 보내고, 그래서 오디오는 휴대폰 밖으로 나가요. 2026년 7월 26일에 업데이트된 개인정보처리방침은 여러 제공업체의 이름을 밝히는데, 음성 녹음은 Deepgram, 텍스트와 이미지와 음성 받아쓴 글은 Anthropic, 계정과 대화는 Google Firebase, 그리고 읽어주기를 켰을 때만 OpenAI예요. 방침은 웹 검색이 켜져 있으면 요청에서 뽑은 검색어가 Anthropic을 거쳐 제3자 검색 제공업체로 간다는 점과, 앱 설정에서 웹 검색을 끌 수 있다는 점도 덧붙여요24. 제출한 어떤 내용도 AI 모델 학습에 쓰이지 않고 어떤 AI 제공업체도 그걸로 학습해서는 안 되며, Subtext는 음성에 대해 Deepgram의 모델 개선 옵트아웃도 설정해뒀다고 해요. Subtext가 가진 대화 사본은 마지막으로 사용한 지 5일 뒤에, 고정해두면 90일 뒤에 서버에서 삭제한다고 해요. 그 옵트아웃을 설정한 Deepgram은 받아쓰는 데 걸리는 시간 동안만 오디오를 보관하고, Anthropic은 입력과 출력을 30일 안에 삭제하며, 표시된 요청은 최대 2년, 관련 안전 점수는 최대 7년까지 보관할 수 있다고 해요. Subtext는 이들 중 어느 곳과도 데이터 무보관 약정을 맺고 있지 않다고 밝혀요24. 다른 어시스턴트가 당신의 텍스트를 어떻게 다루는지는 어떤 AI 글쓰기 도구가 당신의 메시지로 학습하는지에서 비교했어요.
Subtext는 어떤 언어를 지원하나요?
Subtext는 당신이 말한 언어로 메시지를 써주고, 17개 이상의 언어를 지원하며, 언어가 격식 수준을 구분하는 경우에는 당신이 쓴 격식 수준을 그대로 유지해요. 독일어 음성 메모는 독일어 메시지로 돌아와요. 받은 음성 메모의 요약은 그 메모가 도착한 언어로 쓰여요. Google Play 에디터는 이 흐름을 “Hot Tip” 기사로 소개했어요. 마이크 아이콘을 탭하고, 말하고, 다시 탭하면 원래 말이 어떻게 전달됐는지에 대한 태그와 복사 버튼이 붙은 다듬어진 메시지가 나온다는 내용이에요25. 제가 2026년 10월 4일에 페이지를 열었을 때 독일 스토어의 앱 소개에는 별점 4.3에 리뷰 295개, 다운로드 50,000회 이상이 표시돼 있었어요. Google Play 집계일 뿐이고, 별점은 나라마다 달라요. Subtext는 유료이고, 시작할 때 몇 번의 무료 분석이 있어요. 녹음한 음성 메모는 보낼 수 있는 메시지로 돌아와요.
누군가 보낸 긴 음성 메시지에는 어떻게 답장하나요?
Subtext는 다른 사람이 당신에게 보낸 음성 메시지도 읽어요. 이쪽은 받아쓴 글만으로 가장 충분해지는 경우예요. WhatsApp의 기기 안 텍스트 변환을 쓰면 당신의 언어가 지원되는 곳에서 2분짜리 녹음을 읽을 수 있어요23. 하지만 그 사람이 당신에게 무엇을 원하는지는 알려주지 않아요. Ulm 연구가 든 예도 오디오에 묻힌 날짜와 장소였어요9. 친구나 상사가 보낸 긴 음성 메모도 같은 모양이에요. 질문은 중간 어딘가에 있고 이유가 그 주위를 둘러싸고 있어요. 답장을 자꾸 미루는 사람에게 읽는 단계는 답장이 막히는 다섯 군데 중 하나이고, Ulm 현장 참가자 대부분은 녹음을 한눈에 파악할 수 없다는 이유로 직장에서 음성 메시지를 미뤘어요9.
받은 음성 메시지를 Subtext에 넣으면 받아쓴 다음, 그 사람이 당신에게 원하는 걸 한 줄로 요약하고 행동 포인트를 두 개에서 다섯 개 붙여줘요. 이어서 흐름을 이어받는 답장 초안을 쓸 수도 있고, 보낸 사람의 어조에는 라벨을 붙이지 않아요. 백엔드 프롬프트는 첨부한 음성 파일을 상대방이 당신에게 보낸 것일 가능성이 높다고 보고, 모델이 누가 누구인지 확신하지 못하면 물어보라고 지시해요. 요약은 그 밑에 깔린 받아쓰기만큼만 좋고, 한 줄은 맥락 없이 읽기 어려워요. 이 문자, 무슨 뜻일까요?가 그걸 보여줘요. 억양이 강하거나 소음이 많은 녹음은 스튜디오에서 녹음한 영어보다 받아쓰기에 오류가 더 많이 들어가니, 중요한 내용이라면 답장하기 전에 원본을 재생해보세요. 텍스트와 스크린샷도 같은 요약 단계를 거치니까, 받은 메시지도 같은 한 줄 요약을 받아요.
가장 가까운 실험은 오래됐고 규모도 작아요
다시 쓰기 단계나 요약에 가장 가까운 실험 두 개는 2003년과 2005년의 것이고, 둘 다 규모가 작아요. 2003년에 DARPA 지원 실험은 영어 원어민 28명에게 전화와 방송 음성의 150에서 250단어 분량 글을 읽게 했어요. 한쪽은 그대로 옮긴 받아쓴 글이고, 다른 쪽은 사람이 손으로 다듬은 글이었어요. 읽은 사람들은 다듬은 글이 이해하기 더 쉽다고 평가했지만, 그 글에 대한 질문에 더 정확하게 또는 더 빠르게 답하지는 못했어요. 저자들은 읽은 사람들이 이미 최고점에 가까웠기 때문이라고 봐요. 불완전한 인식기 출력을 자동으로 다듬은 글은 다듬지 않은 것보다 더 어렵다고 평가받는 경향이 있었지만, 차이는 아주 작았어요26. 다듬기는 비유창성을 지우고 문장 부호를 고쳤을 뿐, 글을 메시지로 다시 쓰지는 않았어요.
2005년에는 16명이 자동으로 추출한 요약을 보고 음성 메일 15건에 대한 질문에 답했어요. 인식된 음성으로 만든 요약은 발신자 이름을 57% 맞혔고 사람이 받아쓴 글로 만든 요약은 94%였어요. 전화한 이유는 두 경우 모두 78%로 똑같이 전달됐어요. 요약이 인식된 음성에서 나왔을 때 사람들은 원본 오디오를 더 자주 요청했어요. 53% 대 30%였어요27. 2005년 음성 인식으로 만든 음성 메일의 추출 요약이었으니, 이 연구는 기대치를 정해줄 뿐이에요. 두 연구 모두 누군가 실제로 보낼 메시지를 측정하지는 않았어요.
근거가 멈추는 곳
강한 근거는 양 끝에 있어요. 말에는 글에 없는 비유창성이 측정된 비율로 들어 있고, 음성 인식은 어떤 화자에게서 다른 화자보다 더 많이 틀려요. 위의 수치가 그걸 보여줘요. 가운데는 더 얇아요. 다시 쓴 음성 메모가 날것의 받아쓴 글보다 얼마나 더 잘 닿는지, 다시 쓰다가 뜻이 얼마나 자주 바뀌는지를 측정한 연구는 찾지 못했어요. 음성 메시지에 대한 연구는 몇 편뿐이고, 가장 큰 연구도 미국 크라우드워크 플랫폼에서 뽑은 설문 표본과 6명의 현장 연구예요. YouGov 설문은 한 나라, 한 해의 결과고요. 그리고 음성 메모 연구들은 기기 안 텍스트 변환이 나오기 전의 것이라서, 그 연구들이 설명하는 수고의 이동은 이제 메신저들이 일부 직접 메우고 있어요.
실제로는 당신이 어떻게 말하느냐에 달려 있어요. 깔끔한 문장으로 말한다면 받아쓰기로 충분하고, 그건 이미 휴대폰에 있어요. 그 코퍼스의 화자들처럼 말한다면, 곧 Clark와 Fox Tree가 센 군말과 Shriberg가 분류한 다시 시작한 말이 섞인 채로 말한다면, 받아쓴 글은 받는 사람에게 당신의 초안 작업 과정을 넘겨주고, 그걸 메시지로 바꿔주는 게 다시 쓰기 단계예요. Subtext는 그 단계를 해주는 앱 중 하나이고, 녹음한 음성 메모와 받은 음성 메모 모두에 해줘요. 그리고 계속 고치는 답장이 문제라면, 왜 두 줄짜리 답장에 한 시간이나 걸릴까요?가 그 반복을 다뤄요. 브라우저에서 Subtext 써보기휴대폰 카메라로 스캔하면 설치돼요.브라우저에서 Subtext 써보기
출처
등장한 순서대로 번호를 매겼어요. 페이지는 2026년 10월 4일과 5일에 확인했고, Subtext 개인정보처리방침은 2026년 10월 10일에 다시 열어봤어요.
- Shriberg, E. (2001). To ‘errrr’ is human: ecology and acoustics of speech disfluencies. Journal of the International Phonetic Association, 31(1), 153에서 169쪽. 미국 영어 대화 코퍼스 연구이고, 비유창성의 비율과 유형을 다뤄요.
- Shriberg, E. Disfluencies in Switchboard. SRI International Speech Technology and Research Laboratory. 학회 발표 논문이고, PDF에 연도가 없으며 인용한 참고문헌은 1996년까지예요. 사람이 직접 표시한 코퍼스로, 화자 30명의 40,515단어(Switchboard)와 화자 523명의 12,762단어(AMEX, SRI 직원과 여행사 직원 사이의 통화)예요. DARPA와 NSF의 지원을 받았어요. . 2026년 10월 5일에 확인했어요.
- Clark, H. H., and Fox Tree, J. E. (2002). Using uh and um in spontaneous speaking. Cognition, 84(1), 73에서 111쪽. London-Lund 코퍼스의 화자별 군말 비율이에요.
- Koenecke, A., Nam, A., Lake, E., Nudell, J., Quartey, M., Mengesha, Z., Toups, C., Rickford, J. R., Jurafsky, D., and Goel, S. (2020). Racial disparities in automated speech recognition. Proceedings of the National Academy of Sciences, 117(14), 7684에서 7689쪽. 상용 시스템 다섯 개, 백인 화자 42명과 흑인 화자 73명, 오디오 19.8시간이에요.
- Graham, C., and Roll, N. (2024). Evaluating OpenAI’s Whisper ASR: Performance analysis across diverse accents and speaker traits. JASA Express Letters, 4(2), 025206. 초록만 읽었어요. 확인했을 때 전문은 열리지 않았어요.
- Radford, A., Kim, J. W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I. (2022). Robust Speech Recognition via Large-Scale Weak Supervision. arXiv 프리프린트예요.
- OpenAI. Whisper README. GitHub. . 2026년 10월 4일에 확인했어요.
- Koenecke, A., Choi, A. S. G., Mei, K. X., Schellmann, H., and Sloane, M. (2024). Careless Whisper: Speech-to-Text Hallucination Harms. ACM Conference on Fairness, Accountability, and Transparency (FAccT ’24). 미국 기관에서 녹음한 실어증이 있는 참가자와 없는 참가자 437명의 오디오 구간 13,140개를 2023년 4월과 5월에 Whisper API에 돌렸어요. Pulitzer Center와 Cornell’s Center for Social Sciences의 지원을 받았어요.
- Haas, G., Gugenheimer, J., Rixen, J. O., Schaub, F., and Rukzio, E. (2020). “They Like to Hear My Voice”: Exploring Usage Behavior in Speech-Based Mobile Instant Messaging. MobileHCI 2020. 1,003명 설문과 6명의 두 주간 현장 연구예요.
- Ruan, S., Wobbrock, J. O., Liou, K., Ng, A., and Landay, J. A. (2017). Comparing Speech and Keyboard Text Entry for Short Messages in Two Languages on Touchscreen Phones. Proceedings of the ACM on Interactive, Mobile, Wearable and Ubiquitous Technologies, 1(4), 159. 2017년 12월에 발표됐어요. 대학생 48명, 언어당 24명이 iPhone에서 문구를 따라 입력한 실험실 연구예요. 저자 중 두 명은 Baidu USA 소속이었고, Baidu 서버에서 돌아가는 서버 쪽 음성 시스템 Deep Speech 2를 iPhone 6 Plus 앱으로 시험했어요.
- Brysbaert, M. (2019). How many words do we read per minute? A review and meta-analysis of reading rate. Journal of Memory and Language, 109, 104047. 연구 190개, 참가자 18,573명이에요.
- Yuan, J., Liberman, M., and Cieri, C. (2006). Towards an integrated understanding of speaking rate in conversation. Interspeech 2006. Switchboard 전화 대화예요.
- YouGov. How many Britons like voice notes? 2022년 6월 14일. 영국 성인 2,149명 설문이고 조사 기간은 2022년 5월 5일과 6일이며, 그중 1,956명이 스마트폰 사용자예요. 길이에 관한 수치는 답을 한 응답자의 비율이에요. 결과 표는 에 있어요. https://yougov.com/en-gb/articles/42817-how-many-britons-voice-notes. 2026년 10월 4일과 5일에 확인했어요. 백분율은 YouGov의 기사 본문을 따랐고, 결과 표는 반올림 때문에 싫어하는 비율의 합계가 조금 달라요.
- Sampietro, A., and König, K. (2024). The medium is accountable: Metacommunication and media ideologies about voice messages in WhatsApp chats. Discourse & Communication, 18(1), 51에서 71쪽. 독일어와 스페인어 WhatsApp 대화예요. 초록은 출판사의 Crossref 기록으로 읽었고 전문은 유료예요.
- Apple. Dictate text on iPhone. iPhone User Guide, iOS 27. . 2026년 10월 4일에 확인했어요.
- Apple. Siri, Dictation & Privacy. Legal, 최종 업데이트 2026년 9월 14일. . 2026년 10월 5일에 확인했어요.
- Google. Type with your voice. Gboard Help. . 2026년 10월 4일에 확인했어요.
- Google. Use advanced voice typing features. Gboard Help. . 2026년 10월 5일에 확인했어요.
- Microsoft. Use voice typing to talk instead of type on your PC. Microsoft Support. . 2026년 10월 5일에 확인했어요.
- Otter.ai. Convert Speech to Text. . 2026년 10월 4일에 확인했어요.
- Otter.ai. Supported languages. Otter Help Center, 2026년 5월 6일 수정된 글이에요. . 2026년 10월 5일에 확인했어요.
- MacWhisper. Homepage. 날짜가 없는 마케팅 페이지라서, 제품이 어떻게 작동하는지가 아니라 무엇을 내세우는지를 보여줘요. . 2026년 10월 5일에 확인했어요.
- WhatsApp. Introducing Voice Message Transcripts. 2024년 11월 21일. . 2026년 10월 4일에 확인했어요.
- Subtext, Terms, privacy and your account. 개인정보처리방침 최종 업데이트 2026년 7월 26일. 2026년 10월 10일에 확인했어요.
- Google Play. Hot Tip: Speak your mind with Subtext. . 2026년 10월 4일에 확인했어요. 제가 연 모든 스토어에서 리뷰 295개와 다운로드 50K+가 표시됐고, 별점 4.3은 독일 스토어에서 표시됐어요.
- Jones, D. A., and six co-authors (2003). Measuring the Readability of Automatic Speech-to-Text Transcripts. Eurospeech 2003, 1585에서 1588쪽. 영어 원어민 32명을 모집해 28명을 분석했어요. 공군 계약 F19628-00-C-0002에 따라 DARPA의 후원을 받았어요.
- Koumpis, K., and Renals, S. (2005). Automatic summarization of voicemail messages using lexical and prosodic features. ACM Transactions on Speech and Language Processing, 2(1). 참가자 16명과 음성 메일 15건의 이해도 테스트예요. 수치는 저자가 올린 PDF에서 읽었어요. EPSRC ROPA 상, GR/R23954의 지원을 받았어요.