받아쓰기 소프트웨어를 비교해 보셨다면 99%, 97%, 95%와 같은 몇 가지 수치를 모으셨겠지만, 그 수치들이 선택에 별로 도움이 되지 않는다는 것을 느끼셨을 것입니다. 이는 그 숫자가 부정직해서가 아닙니다. 하나의 정확도 수치는 실제로 묻고 있는 질문과는 다른 질문에 답하고 있기 때문입니다.
알고 싶은 것은 다음과 같습니다: 제 책상에서, 제 마이크로, 이 소프트웨어가 저를 얼마나 잘 이해할까요? 공개된 정확도 수치가 답하는 질문은 다음과 같습니다: 이 엔진이 우리 둘 다 들어본 적 없는 특정 녹음 세트를 얼마나 잘 받아쓰기했는가? 이 두 질문은 전혀 다른 답을 가질 수 있습니다.
이 페이지에서는 측정 방식을 설명해 드립니다. 이를 통해 어떤 업체의 수치든 — 저희에 대한 수치를 포함해서 — 그 값이 실제로 무엇을 의미하는지 이해하실 수 있습니다.
단어 오류율(WER), 쉽게 풀어보기
음성 인식 정확도는 보통 단어 오류율(보통 WER로 표기)로 보고되며, 잘못 나온 단어의 비율을 뜻합니다. 수치는 낮을수록 좋으며, "95% 정확"이라는 표현은 "WER 5%"를 다르게 쓴 것일 뿐입니다.
무엇이 '틀린 것'으로 간주되는지는 대부분의 사람이 생각하는 것보다 더 구체적으로 정해져 있습니다. 오류는 세 가지 종류가 있으며, 이를 모두 더해서 계산합니다:
- 대체(Substitution) — 한 단어가 다른 단어로 잘못 인식된 경우입니다. "their"이라고 말했는데 "there"로 입력된 경우입니다.
- 누락(Deletion) — 말한 단어가 텍스트에서 빠진 경우입니다.
- 삽입(Insertion) — 말하지 않은 단어가 나타난 경우입니다. 배경 소리나 숨소리가 이런 오류를 일으킵니다.
이 세 가지를 모두 더한 후 실제로 말한 단어 수로 나눕니다. 예를 들어 100단어 분량의 문단을 받아쓰기했는데 잘못된 단어가 4개, 누락된 단어가 1개, 추가된 단어가 1개라면, 100단어 중 6개의 오류이므로 WER은 6%, 즉 "94% 정확"이 됩니다.
한 가지 알아두면 좋은 결과가 있는데, 이는 헷갈리는 마케팅 문구들을 이해하는 데 도움이 됩니다: WER은 100%를 넘을 수 있습니다. 소프트웨어가 실제로 말한 단어보다 더 많은 단어를 삽입하는 경우 — 시끄러운 방에서 흔히 일어나는 일입니다 — 오류 수가 단어 수보다 많아질 수 있습니다. 100을 넘을 수 없는 수치라면 그것은 단어 오류율이 아닙니다.
같은 소프트웨어가 두 사람에게 다른 결과를 주는 이유
엔진은 정확도를 결정하는 여러 요소 중 하나일 뿐이며, 흔히 가장 중요한 요소도 아닙니다. 나머지는 사용자의 상황입니다:
- 마이크와 그 위치. 대개 가장 큰 영향을 미치는 요소이면서 가장 저렴하게 개선할 수 있는 부분이기도 합니다. 입에서 몇 센티미터 떨어진 헤드셋 마이크가 듣는 소리는 책상 건너편에 있는 노트북 마이크가 듣는 소리와 상당히 다릅니다.
- 방(공간) 환경. 배경의 텔레비전 소리, 선풍기, 열린 창문, 울림이 있는 딱딱한 표면의 방. 이 모든 소리가 목소리와 함께 인식기에 전달됩니다.
- 받아쓰기하는 내용. 일상적인 문장은 비교적 쉬운 경우입니다. 이름, 의학 또는 법률 용어, 부품 번호, 주소, 약어는 훨씬 어렵습니다. 소프트웨어가 발음이 비슷한 단어들 중에서 선택해야 하기 때문입니다.
- 말하는 방식. 억양, 말하는 속도, 목소리 크기, 문장을 이어서 말하는지, 말끝을 흐리는지 등입니다. 이는 결코 잘못이 아니며, 단지 엔진이 잘 처리하거나 처리하지 못하는 다양성일 뿐입니다.
- 사용하는 모델. 대부분의 온디바이스 소프트웨어는 크기가 다른 여러 모델을 제공합니다. 오래된 노트북에서도 무리 없이 실행되는 작은 모델은 대체로 빠른 컴퓨터에서 실행되는 큰 모델보다 실수가 더 많습니다.
동일한 소프트웨어를 동일한 설정으로 사용하는 두 사람도 이런 요인들만으로 몇 퍼센트포인트씩 차이가 날 수 있습니다. 그리고 이 격차는 어떤 공개된 수치로도 메워줄 수 없습니다.
벤치마크 수치가 실제로 측정하는 것
공개된 단어 오류율은 표준 연구용 데이터셋에서 나옵니다 — 검증된 텍스트가 함께 제공되는 고정된 녹음 모음으로, 서로 다른 시스템을 동일한 자료로 평가할 수 있게 해줍니다. 이는 소프트웨어를 개발하는 사람들에게는 실제로 유용합니다. 이번 달 모델이 지난달보다 나아졌는지를 판단하는 방법이 되기 때문입니다.
하지만 구매 안내로서는 그다지 유용하지 않은데, 여기에는 세 가지 이유가 있습니다:
- 녹음은 사용자 본인이 아닙니다. 벤치마크 음성에는 그 나름의 억양, 마이크, 주제가 있으며, 그 어느 것도 사용자분의 것이 아닙니다.
- 업체마다 서로 다른 테스트 결과를 보고합니다. 서로 다른 데이터셋에서 측정된 두 수치는 둘 다 정직하게 보고되었더라도 서로 비교할 수 없습니다. 오디오북을 낭독하는 음성과 즉흥적인 대화는 같은 엔진으로도 매우 다른 점수를 만들어 냅니다.
- 측정 조건이 생략되는 경우가 많습니다. 데이터셋, 마이크, 말하기 방식이 명시되지 않은 수치는 검증할 수 없는 주장입니다.
수치를 보게 되었을 때 유용한 질문은 "높은가?"가 아니라 "무엇을 측정한 것인가?"입니다. 이것이 명시되어 있지 않다면, 그 수치는 장식에 불과합니다.
두 가지 서로 다른 설계 철학
기존 방식과 최신 방식의 음성 인식 사이에는 실제로 기술적인 차이가 있으며, 이는 알아둘 가치가 있습니다. 왜냐하면 이 차이가 특정 제품에서 "정확도"가 의미하는 바 자체를 바꾸기 때문입니다.
학습형 프로필 방식. 전통적인 데스크톱 방식은 개인의 목소리와 어휘에 대한 프로필을 구축합니다. 처음에 시간이 필요하지만, 이후에도 계속 학습시킬 수 있습니다 — 자신만의 전문 용어, 동료의 이름, 직업에서 쓰는 단어를 추가할 수 있습니다. Dragon이 이 방식으로 만들어진 가장 잘 알려진 제품이며, Nuance 자체 자료에서는 최대 99%의 인식 정확도를 주장합니다. 그 대가로 설정에 시간이 걸리고, 프로필을 직접 관리해야 합니다.
범용 모델 방식. 최신 방식은 매우 폭넓은 범위의 음성으로 하나의 대형 모델을 한 번 학습시킨 뒤, 동일한 모델을 모든 사용자에게 제공합니다. OpenAI의 Whisper 모델이 가장 잘 알려진 공개 사례이며, 원 Whisper 논문에는 약 68만 시간 분량의 오디오로 학습했다고 나와 있습니다. 등록 단계가 없어서 설치 후 바로 말하기 시작할 수 있지만, 마찬가지로 목소리를 학습시킬 방법도 없습니다. 개인 단어 목록처럼 소프트웨어가 모델 주변에 추가하는 기능을 제외하면, 처음 사용하는 날 얻는 결과는 이후에도 대체로 비슷합니다.
어느 한 방식이 무조건 더 나은 것은 아닙니다. 하루 종일 전문 용어를 받아쓰기한다면, 소프트웨어를 학습시킬 수 있는 것이 실제로 돈값을 합니다. 오늘 오후에 바로 설치해서 쓰고 싶다면, 등록 과정은 이점 없는 비용일 뿐입니다. 어느 쪽이 자신에게 맞는지는 어떤 백분율도 알려줄 수 없습니다.
10분 만에 자신의 목소리로 직접 테스트하기
이것이 질문에 답할 수 있는 유일한 벤치마크이며, 체험판을 제공하는 어떤 받아쓰기 도구에서도 쉽게 실행할 수 있습니다 — 이미 컴퓨터에 있는 무료 도구도 포함해서요.
- 먼저 짧은 글을 작성해 두세요 — 150~200단어 분량으로요. 예시 문단이 아니라 자신이 실제로 쓰는 글, 즉 평소 이메일 문체와 주제, 실제로 입력하는 이름들을 사용하세요.
- 이를 소리 내어 소프트웨어에 읽어주세요 평소 말하는 방식 그대로, 평소 앉는 자리에서요.
- 두 글을 나란히 비교하고 대체, 누락, 삽입 오류의 개수를 세어보세요. 그런 다음 전체 단어 수로 나누세요.
- 헤드셋 마이크로 한 번 더 반복해 보세요 처음에 내장 마이크로 테스트했다면요. 이 한 가지 변화만으로도 제품을 바꾸는 것보다 더 큰 차이가 나는 경우가 많습니다.
- 그런 다음 실제 상황에 가까운 테스트를 해보세요. 미리 준비된 글이 아니라 실제 이메일처럼 즉흥적으로 받아쓰기해 보세요. 글을 보고 읽는 것은 머릿속에서 바로 말하는 것보다 쉽기 때문이며, 실제로 함께 살아가게 될 수치는 바로 이 두 번째 결과입니다.
같은 글을 두세 가지 도구로 테스트해 보면, 어떤 리뷰도 줄 수 없는 것을 얻게 됩니다. 바로 목소리, 마이크, 공간을 기준으로 한 직접 비교입니다. 결제 전에 미리 사용해 볼 수 없는 도구라면, 그 점도 신중히 고려할 가치가 있습니다.
결과를 읽는 법
WER의 몇 퍼센트포인트 차이보다 오류가 어디에서 발생하는지가 더 중요합니다. 가끔 짧은 단어를 놓치더라도 이름은 항상 정확하게 인식하는 소프트웨어가, 점수는 더 높지만 동료의 이름을 자꾸 틀리는 소프트웨어보다 사용하기 편합니다. 잘못된 단어를 고치는 데는 잠깐이면 되지만, 그것을 알아차리는 데는 주의력이 필요합니다.
그러므로 수치가 아니라 받아쓰기 결과 자체로 판단하세요. 결과물을 읽어보고, 얼마나 다듬어야 하는지 확인하고, 그것이 직접 타이핑하는 것보다 수고가 덜한지 물어보세요. 그것이 바로 진짜 질문입니다.
CaringDictate는 어디에 해당하는가
저희는 정확도 백분율을 공개하지 않습니다. 만들 수는 있습니다 — 누구나 만들 수 있으니까요 — 하지만 그것은 목소리가 아닌 녹음으로 측정한 수치일 것이며, 이를 경험을 예측하는 값처럼 제시하는 것은 오해의 소지가 있습니다.
CaringDictate는 사용자의 컴퓨터에서 실행되는 공개 음성 인식 모델을 사용하며, 사용 중인 기기에 맞게 여러 크기의 모델을 제공합니다. 무료 7일 체험판이 있으며, 이는 바로 이 질문을 저희 마케팅이 아니라 목소리로 직접 확인할 수 있도록 하기 위한 것입니다. 위의 테스트를 해보셨을 때 Windows에 이미 내장된 무료 음성 입력 기능만으로도 충분한 결과가 나온다면, 그것도 좋은 결과입니다 — 그것을 사용하시고 비용은 아끼세요.
이제 어디로 가면 될까요
피드 맨 위에 있는 음성 입력 용어집 구매 과정에서 마주치게 될 나머지 용어들을 설명합니다. Dragon 비교 는 제품 수준의 차이를 다루며, 개인정보 보호 안내서 는 로컬 도구와 클라우드 도구에서 음성 데이터가 어디로 전송되는지를 다룹니다.