여러분의 말을 텍스트로 바꾸는 것이 주된 기능인 도구를 구매하기 위해 번역기가 필요해서는 안 됩니다. 이 페이지는 받아쓰기 소프트웨어를 비교하는 동안 만나게 될 모든 용어 — 저희 설정 화면에 있는 용어까지 포함하여 — 를 정의합니다. 각 정의는 한 문장이며, 그 뒤의 세부 내용은 선택 사항입니다.
기본 사항
받아쓰기
받아쓰기는 소프트웨어가 여러분의 말을 글로 된 텍스트로 바꾸는 동안 소리 내어 말하는 것입니다. 사람들은 이를 음성 입력 또는 음성-텍스트 변환이라고도 부릅니다. 이 세 가지 이름은 모두 같은 의미입니다: 여러분이 말하면, 컴퓨터가 입력합니다.
음성 입력
음성 입력은 받아쓰기의 또 다른 이름입니다 — 타이핑 대신 말하면, 그 말이 텍스트 커서가 있는 곳 어디에든 나타납니다. Windows는 자사의 내장 도구를 '음성 입력'(Win+H 기능)이라고 부릅니다. CaringDictate는 대부분의 프로그램에서 같은 일을 하되, 내장 도구의 시간 제한 없이 합니다.
음성-텍스트 변환
음성-텍스트 변환은 음성 오디오를 글로 된 단어로 변환하는 기술입니다. 기술 문서에서는 STT로 약칭되는 것을 볼 수 있습니다. 제품이 "음성-텍스트 변환 기술 기반"이라고 말하면, 이는 받아쓰기를 의미합니다.
음성 인식
음성 인식은 컴퓨터가 사람의 음성을 이해하는 더 넓은 분야입니다 — 여러분이 말한 내용(받아쓰기)과 의도한 내용(명령) 모두를 포함합니다. 받아쓰기 앱은 음성 인식을 사용하여 여러분의 말을 기록합니다. 음성 비서는 이를 사용하여 명령을 실행합니다.
전사
전사는 음성 녹음 — 회의, 인터뷰, 음성 메시지 — 을 나중에 글로 된 문서로 바꾸는 것입니다. 받아쓰기는 실시간으로 이루어지며(말하는 동안 단어가 나타나는 것을 볼 수 있습니다), 전사는 일반적으로 나중에 파일에서 이루어집니다. Otter.ai와 같은 도구는 받아쓰기 도구가 아닌 전사 도구입니다.
인식 작동 방식
음성 모델 (인식 모델)
음성 모델은 받아쓰기 프로그램의 훈련된 두뇌입니다 — 실제로 말을 이해하는 파일이죠. 더 큰 모델은 보통 더 정확하지만 더 강력한 컴퓨터가 필요합니다. CaringDictate는 당신의 기기에 맞는 모델 크기를 고릅니다. 약 190 MB부터 약 3.1 GB까지요.
Whisper
Whisper는 2022년 OpenAI가 출시한 오픈 소스 음성 모델 제품군으로, 다양한 언어에서 거의 사람과 같은 정확도를 자랑합니다. CaringDictate를 포함한 많은 최신 받아쓰기 및 전사 제품의 핵심 엔진입니다. 오픈 소스이기 때문에 사용자 자신의 컴퓨터에서 완전히 실행될 수 있습니다.
기기 내 (오프라인) 인식
기기 내 인식은 사용자의 음성이 사용자 자신의 컴퓨터에서 처리된다는 것을 의미합니다. 오디오는 회사 서버로 전송되지 않습니다. 이는 인터넷 없이 작동하며, 개인적인 생각을 비공개로 유지하고, 서비스 중단으로 인해 작동이 멈추는 일이 없습니다. CaringDictate가 작동하는 방식입니다.
클라우드 인식
클라우드 인식이란 사용자의 음성이 인터넷을 통해 회사의 서버로 전송되고, 그곳에서 텍스트로 변환된 뒤 다시 전송되는 방식을 뜻합니다. 인식은 사용자의 기기가 아니라 서버에서 이루어집니다. 특정 도구가 인식을 어디에서 처리하는지는 해당 도구의 문서에 나와 있으며, 두 가지 방식을 모두 제공하는 제품도 있으므로 짐작하지 말고 직접 확인하는 것이 좋습니다.
정확도 (단어 오류율)
정확도는 받아쓰기 프로그램이 맞게 옮긴 단어의 비율입니다; 단어 오류율(WER)은 같은 개념을 거꾸로 측정한 것으로 — 틀리게 옮긴 비율입니다. 최신 Whisper 기반 받아쓰기는 또렷한 영어 발음에서 매우 정확합니다. 결과는 마이크 품질, 배경 소음, 그리고 당신이 얼마나 또렷하게 말하는지에 따라 달라집니다.
지연 시간
지연 시간은 문장을 마친 후 텍스트가 나타나는 데 걸리는 시간입니다. 약 0.3초 미만은 즉각적으로 느껴지지만, 그 이상은 지연이 있는 것처럼 느껴집니다. 기기 내 인식은 서버로의 왕복을 피하여 도움이 됩니다.
자동 언어 감지
자동 언어 감지는 소프트웨어가 사용자에게 지시받지 않고도 사용자가 어떤 언어를 말하는지 파악하는 것을 의미합니다. 하루 중 여러 언어를 전환할 때 유용합니다. CaringDictate의 '자동' 설정은 지원하는 20개 언어에서 이 기능을 수행합니다.
일상적인 받아쓰기 앱 사용
말하기 버튼 (단축키)
말하기 버튼은 받아쓰기를 시작하고 멈추는 단일 키 또는 마우스 버튼입니다. CaringDictate의 기본 설정은 오른쪽 Ctrl 키이며, 사용자의 손에 편안한 어떤 키나 마우스 버튼으로든 변경할 수 있습니다.
눌러서 말하기 (누르고 말하기)
눌러서 말하기는 마치 무전기처럼 말하는 동안 말하기 버튼을 누르고 있다가 말을 마치면 놓는 것을 의미합니다. 검색창이나 빠른 답장과 같은 짧은 입력에 좋습니다. 대안은 탭하여 전환하는 방식으로, 긴 글쓰기에 더 적합합니다.
전환 (탭하여 말하기)
전환 모드는 말하기 버튼을 한 번 탭하여 듣기를 시작하고 다시 탭하여 멈추는 것을 의미합니다. 그 사이에는 손이 완전히 자유롭습니다. 키를 누르고 있는 것이 불편하거나 긴 문장을 받아쓰기할 때 유용합니다.
호출어 (음성 활성화)
호출어는 키보드나 마우스를 전혀 건드리지 않고 받아쓰기를 시작하는 '받아쓰기 시작'과 같은 소리 내어 말하는 구문입니다. 키보드에 손을 뻗는 것이 어려운 경우에 가장 중요합니다. CaringDictate는 버전 3.5에서 사용자가 설정할 수 있는 음성 활성화 기능을 추가했습니다.
듣기 표시기
듣기 표시기는 마이크가 활성화되어 있고 사용자의 말이 들리고 있음을 보여주는 작은 화면 신호입니다. 신뢰할 수 있는 표시기는 중요합니다. 컴퓨터가 듣고 있는지 궁금해할 필요가 없어야 합니다.
음성 명령
음성 명령은 단어를 쓰는 대신 서식을 제어하는 '새 줄' 또는 '그것 삭제'와 같은 음성 지시입니다. 받아쓰기 앱마다 이 부분이 많이 다릅니다. 간단한 명령은 대부분의 일상적인 글쓰기를 처리하며, 고도의 핸즈프리 컴퓨터 제어는 별도의 범주입니다 (Voice Access 참조).
구두점 명령
구두점 명령은 구두점을 삽입하기 위해 '마침표', '쉼표', '물음표'를 소리 내어 말하는 것입니다. Whisper와 같은 최신 엔진은 사용자의 구문과 멈춤에서 자동으로 구두점을 찍어주므로, 종종 자연스럽게 말하기만 해도 됩니다.
사용자 지정 사전 (단어 목록)
사용자 지정 사전은 인식기가 신뢰해야 하는 이름과 특별한 단어(가족 이름, 약물 이름, 업계 용어)의 개인 목록입니다. 'Zofran' 또는 'Oaxaca'를 한 번 추가하는 것이 영원히 수정하는 것보다 낫습니다. CaringDictate는 '글쓰기 및 단어' 섹션에 이 기능을 포함하고 있습니다.
텍스트 삽입
텍스트 삽입은 받아쓰기된 단어가 문서에 물리적으로 나타나는 방식입니다. 앱이 키 입력 하나하나를 입력하거나 한 번에 붙여넣습니다. 전체 구문을 붙여넣는 것이 더 빠르고 다양한 프로그램에서 훨씬 더 신뢰할 수 있습니다. 이것이 CaringDictate가 텍스트를 그렇게 전달하는 이유입니다.
Windows 관련 용어
Win+H (Windows 음성 입력)
Win+H는 Windows 10 및 11에서 내장 음성 입력 표시줄을 여는 키보드 단축키입니다. 무료이며 Windows에 기본 내장되어 있어 일상적인 받아쓰기에 가장 먼저 시도해 볼 만한 합리적인 선택입니다. Windows 11에는 Voice Access도 포함되어 있어 사용자 지정 어휘와 텍스트 교정 기능은 물론 PC 전체의 음성 제어 기능까지 추가됩니다.
Windows Voice Access
Voice Access는 Windows 11의 핸즈프리 컴퓨터 제어 기능으로, 음성으로 클릭, 스크롤, 창 전환을 할 수 있으며 받아쓰기 기능도 포함되어 있습니다. 음성으로 컴퓨터를 완전히 제어하기 위해 만들어졌습니다. 주로 편안한 글쓰기를 원하신다면, 전용 받아쓰기 도구가 일반적으로 더 적합합니다.
Windows 음성 인식 (WSR)
Windows 음성 인식은 Microsoft가 Voice Access를 선호하여 더 이상 사용하지 않는(deprecated) 오래된 내장 받아쓰기 도구입니다. 구형 PC에서 WSR에 의존하셨다면, WSR의 단종은 Windows가 다음에 제공하는 도구를 그대로 사용하는 대신 의도적으로 대체 도구를 선택해야 할 시점입니다.
마이크 개인 정보 설정
마이크 개인 정보 설정은 어떤 프로그램이 마이크를 사용할 수 있는지 결정하는 Windows 스위치입니다. 받아쓰기 앱이 아무것도 듣지 못한다면, 가장 먼저 확인해야 할 곳은 '설정 → 개인 정보 및 보안 → 마이크'입니다.
기본 마이크
기본 마이크는 프로그램이 다르게 선택하지 않는 한 Windows가 프로그램에 할당하는 마이크입니다. 노트북에는 종종 여러 개(내장, 헤드셋, 웹캠)가 있습니다. 올바른 마이크(입 가까이, 팬에서 멀리 떨어진)를 선택하는 것이 어떤 설정보다 정확도를 향상시킵니다.
구매 조건
일회성 구매 (영구 라이선스)
일회성 구매는 한 번 결제하고 소프트웨어를 소유하는 것을 의미합니다. 계속 사용하기 위한 월별 또는 연간 요금이 없습니다. CaringDictate는 업데이트를 포함하여 $49에 한 번 구매합니다. 대안 모델인 구독은 타이핑을 계속하는 한 계속 요금을 청구합니다.
구독
구독은 소프트웨어에 계속 액세스하기 위해 매월 또는 매년 비용을 지불하는 것입니다. 지불을 중단하면 작동이 멈춥니다. 지속적인 서버 비용이 발생하는 서비스에는 합리적이지만, 전적으로 사용자 컴퓨터에서 실행되는 도구에는 정당화하기 어렵습니다. 선택하기 전에 5년 총액을 비교해 보세요.
시트 (장치 라이선스)
시트는 프로그램의 설치된 사본 하나를 의미합니다. 3시트 라이선스는 컴퓨터 세 대를 커버합니다. CaringDictate의 $49 라이선스에는 데스크톱, 노트북 및 추가 한 대를 포함하여 3시트가 포함됩니다.
무료 체험
무료 체험은 결제 전에 모든 기능을 사용해 볼 수 있는 기간입니다. CaringDictate는 카드 정보 없이 7일 동안 지속됩니다. 자신의 컴퓨터에서 자신의 마이크와 자신의 목소리로 체험하는 것이 어떤 리뷰나 정확도 차트보다 낫습니다.
무료 업데이트
무료 업데이트란 소프트웨어의 새 버전이 당신이 이미 낸 가격에 별도의 업그레이드 요금 없이 포함된다는 뜻입니다. 한 번 결제하는 소프트웨어를 사기 전에 확인할 가치가 있습니다: 어떤 '영구' 라이선스는 당신이 산 버전에 묶어 두고 업그레이드에 다시 요금을 부과합니다.
단어 제한 (사용량 제한)
단어 제한은 받아쓰기할 수 있는 양에 대한 제한으로, 구독형 받아쓰기 서비스의 무료 등급에서 흔히 볼 수 있습니다. 장치 내 도구는 사용자에게 사용량을 측정할 이유가 없습니다. 서버 요금이 없기 때문입니다. CaringDictate에는 제한이 없습니다.
GPU 가속
GPU 가속은 컴퓨터의 그래픽 칩을 사용하여 음성 모델을 메인 프로세서보다 빠르게 실행하는 것을 의미합니다. 게이밍 노트북이 훨씬 더 빠르게 받아쓰는 이유입니다. 필수는 아닙니다. CaringDictate는 더 작은 모델로 일반 컴퓨터에서도 실행됩니다.
시스템 요구 사항
시스템 요구 사항은 프로그램이 잘 실행되기 위해 필요한 최소 컴퓨터 사양입니다. CaringDictate의 경우: Windows 10(64비트, 버전 1903) 또는 Windows 11, 4 GB RAM, 그리고 몇 GB의 여유 디스크 공간.
짧게 요약하면
받아쓰기, 음성 입력, 음성-텍스트 변환은 모두 같은 의미입니다. 즉, 사용자가 말하면 컴퓨터가 입력합니다. 구매 시 실제로 중요한 선택은 음성이 처리되는 위치(사용자 컴퓨터 또는 다른 사람의 서버), 시작 및 중지 방법(편안한 말하기 버튼 또는 깨우기 단어), 그리고 결제 방법 (한 번 또는 영원히)입니다. CaringDictate의 답변은 다음과 같습니다. 사용자 컴퓨터에서, 원하는 버튼으로 — $49 한 번, 7일간의 무료 체험 먼저 음성에 맞는지 확인하기 위해.