あなたの言葉をテキストに変えることが唯一の仕事であるツールを購入するのに、翻訳者が必要であるべきではありません。このページでは、ディクテーションソフトウェアを比較する際に出会うすべての用語(当社の設定画面にあるものも含む)を定義しています。各定義は1文で、その後の詳細は任意で読んでいただけます。
基本
ディクテーション
ディクテーションとは、ソフトウェアがあなたの言葉を書き言葉に変換する間、声に出して話すことです。人々はこれを音声入力(ボイスタイピング)や音声認識(スピーチ・トゥ・テキスト)とも呼びます。これら3つの名前はすべて同じことを意味します:あなたが話し、コンピューターが入力します。
音声入力
音声入力(ボイスタイピング)は、ディクテーションの別名です——入力する代わりに話し、テキストカーソルのあるところに言葉が現れます。Windows は、組み込みのツールを「音声入力」(Win+H 機能)と呼んでいます。CaringDictate は、組み込みツールのようなタイムアウトなしに、ほとんどのプログラムで同じ仕事をします。
音声認識(スピーチ・トゥ・テキスト)
音声認識(スピーチ・トゥ・テキスト)は、話された音声を書き言葉に変換する技術です。技術記事ではSTTと略されることがあります。製品が「powered by speech-to-text」と謳っている場合、それはディクテーションを意味します。
音声認識
音声認識は、コンピューターが人間の音声を理解するより広範な分野です — あなたが言ったこと(ディクテーション)と、あなたが意図したこと(コマンド)の両方です。ディクテーションアプリは音声認識を使ってあなたの言葉を書き留めます。音声アシスタントはそれを使って行動します。
文字起こし
文字起こしとは、会議、インタビュー、ボイスメールなどの音声録音を、後から書かれた文書にすることです。ディクテーションはライブ(話すと同時に言葉が表示されるのを見る)ですが、文字起こしは通常、後からファイルから行われます。Otter.aiのようなツールは文字起こしツールであり、ディクテーションツールではありません。
認識の仕組み
音声モデル(認識モデル)
音声モデルとは、ディクテーションプログラムの訓練された頭脳です——実際に発話を理解するファイルのことです。大きいモデルはたいてい精度が高いですが、より強力なコンピューターを必要とします。CaringDictate は、約 190 MB から約 3.1 GB まで、あなたのマシンに合うモデルサイズを選びます。
Whisper
Whisperは、2022年にOpenAIがリリースしたオープンソースの音声モデルファミリーで、多くの言語で人間とほぼ同等の精度を誇ります。CaringDictateを含む多くの最新の音声入力および文字起こし製品の基盤となっています。オープンソースであるため、完全にあなたのコンピューター上で実行できます。
デバイス上(オフライン)認識
デバイス上認識とは、あなたの音声があなた自身のコンピューター上で処理されることを意味します。音声が企業のサーバーに送信されることはありません。これはインターネットなしで動作し、個人的な思考をプライベートに保ち、サービスが停止しても機能が停止することはありません。CaringDictateはこの方法で動作します。
クラウド認識
クラウド認識とは、あなたの音声がインターネット経由で企業のサーバーへ送信され、そこでテキストに変換されて送り返される仕組みを指します。認識処理はご自身の端末ではなく、サーバー上で行われます。個々のツールがどこで認識処理を行うかは、それぞれのドキュメントに記載されており、両方に対応している製品もあります――思い込まずに確認しておく価値があります。
精度(単語誤り率)
精度とは、ディクテーションプログラムが正しく認識する単語の割合です。単語誤り率(WER)は、同じ考え方を逆から測ったもの——誤って認識する割合です。現代的な Whisper ベースのディクテーションは、クリアな英語の発話で非常に高い精度を持ちます。結果は、マイクの品質、背景雑音、そしてどれだけ明瞭に話すかによって変わります。
遅延
遅延とは、文を話し終えてからテキストが表示されるまでの時間差です。約0.3秒未満であれば瞬時に感じられ、それ以上になると遅く感じられます。デバイス上認識はサーバーへの往復を避けるため、この点で有利です。
自動言語検出
自動言語検出とは、ソフトウェアが指示されなくてもあなたが話している言語を判別することを意味します。日中に言語を切り替える場合に便利です。CaringDictateの「自動」設定は、サポートされている20言語すべてでこれを実行します。
日常的な音声入力アプリの使用
トークボタン(ホットキー)
トークボタンは、音声入力を開始および停止する単一のキーまたはマウスボタンです。CaringDictateでは、デフォルトは右Ctrlキーですが、手の快適さに合わせて任意のキーまたはマウスボタンに変更できます。
プッシュトゥトーク(押しながら話す)
プッシュトゥトークとは、話している間トークボタンを押し続け、話し終えたら離すことを意味します。トランシーバーのようなものです。検索ボックスや簡単な返信など、短い発話に適しています。もう一つの方法はタップトゥトグルで、長い文章の入力に適しています。
トグル(タップして話す)
トグルモードとは、トークボタンを1回タップして聞き取りを開始し、もう一度タップして停止することを意味します。その間、手は完全に自由になります。キーを押し続けるのが不快な場合や、長い文章を音声入力する場合に役立ちます。
ウェイクワード(音声起動)
ウェイクワードとは、「音声入力を開始」のように声に出して言うフレーズで、キーボードやマウスに一切触れることなく音声入力を開始します。これは、キーボードに手を伸ばすのが困難な場合に最も重要です。CaringDictateはバージョン3.5でユーザー設定可能な音声起動機能を追加しました。
聞き取りインジケーター
聞き取りインジケーターは、マイクがアクティブであなたの言葉が認識されていることを示す画面上の小さな信号です。信頼できるインジケーターは重要です。コンピューターが聞き取っているかどうかを疑問に思う必要はありません。
音声コマンド
音声コマンドは、「改行」や「それを削除」のように、単語を書く代わりに書式設定を制御する音声指示です。音声入力アプリによってこの点は大きく異なります。簡単なコマンドはほとんどの日常的な文章作成をカバーしますが、高度なハンズフリーコンピューター制御は別のカテゴリです(Voice Accessを参照)。
句読点コマンド
句読点コマンドとは、「句点」、「読点」、「疑問符」と声に出して言うことで句読点を挿入することです。Whisperのような最新のエンジンは、あなたのフレーズや間から自動的に句読点を付けるため、多くの場合、自然に話すだけで済みます。
カスタム辞書(単語リスト)
カスタム辞書とは、認識エンジンが信頼すべきあなたの個人的な名前や特殊な単語のリストです。家族の名前、薬の名前、業界用語などです。「ゾフラン」や「オアハカ」を一度追加すれば、永遠に修正し続ける手間が省けます。CaringDictateには、「文章と単語」の下にこれらが含まれています。
テキスト挿入
テキスト挿入とは、音声入力された単語が物理的にドキュメントにどのように到達するかを指します。アプリは、キー入力ごとに単語を入力するか、まとめて貼り付けます。フレーズ全体を貼り付ける方が、さまざまなプログラムでより高速で信頼性が高いため、CaringDictateはこの方法でテキストを配信します。
Windows固有の用語
Win+H (Windows音声入力)
Win+Hは、Windows 10および11でWindows標準搭載の音声入力バーを開くキーボードショートカットです。無料でWindowsに標準搭載されており、日常的な音声入力としてまず試すのに適しています。Windows 11にはVoice Accessも搭載されており、カスタム語彙とテキスト修正機能に加えて、パソコンの完全な音声操作が可能になります。
Windows Voice Access
Voice Accessは、Windows 11のハンズフリーコンピューター制御機能で、音声でクリック、スクロール、ウィンドウ切り替えができ、音声入力も含まれています。これは音声による完全なコンピューター制御のために作られています。もし主に快適な文章作成を望むのであれば、専用の音声入力ツールの方が通常は適しています。
Windows 音声認識 (WSR)
Windows 音声認識は、MicrosoftがVoice Accessを優先して非推奨にした古い組み込みの音声入力ツールです。もし古いPCでWSRに頼っていたのであれば、その廃止は、Windowsが次に提供するツールをそのまま使うのではなく、意図的に代替品を選ぶべき時です。
マイクのプライバシー設定
マイクのプライバシー設定は、どのプログラムがマイクを使用できるかを決定するWindowsの設定です。音声入力アプリが何も聞き取れない場合、最初に確認すべき場所はここです: 設定 → プライバシーとセキュリティ → マイク。
既定のマイク
既定のマイクは、プログラムが別のマイクを選択しない限り、Windowsがプログラムに割り当てるマイクです。ノートパソコンには複数のマイク(内蔵、ヘッドセット、ウェブカメラ)があることがよくあります。口に近く、ファンから離れた適切なマイクを選ぶことは、どの設定よりも精度を向上させます。
購入に関する用語
一括購入(永続ライセンス)
一括購入とは、一度支払えばソフトウェアを所有できることを意味します。継続して使用するための月額または年額料金はかかりません。CaringDictateは$49の一括払いで、アップデートも含まれています。代替モデルであるサブスクリプションは、入力し続ける限り料金が発生し続けます。
サブスクリプション
サブスクリプションとは、ソフトウェアへの継続的なアクセスに対して月ごとまたは年ごとに支払うことです。支払いを停止すると、動作しなくなります。継続的なサーバー費用がかかるサービスには妥当ですが、完全に自分のコンピューターで動作するツールには正当化しにくい場合があります。選択する前に5年間の総費用を比較してください。
シート(デバイスライセンス)
シートとは、プログラムのインストールされたコピー1つを指します。3シートライセンスは、3台のコンピューターをカバーします。CaringDictateの$49ライセンスには、デスクトップ、ノートパソコン、もう1台の合計3シートが含まれています。
無料トライアル
無料トライアルとは、支払い前に全機能をお試しいただける期間です。CaringDictateのトライアルは7日間で、カード情報は不要です。ご自身のコンピューターで、ご自身のマイクと声を使って試すことは、どんなレビューや精度チャートよりも優れています。
無料アップデート
無料アップデートとは、ソフトウェアの新しいバージョンが、すでにお支払いいただいた価格に含まれ、別途アップグレード料金がかからないということです。買い切りソフトを購入する前に確認する価値があります。一部の「永久」ライセンスは、購入したバージョンに固定したうえで、アップグレードに再び課金します。
単語数制限(使用制限)
単語数制限とは、音声入力できる量に設けられた制限で、サブスクリプション型音声入力サービスの無料プランでよく見られます。デバイス上で動作するツールには、使用量を制限する理由はありません。サーバー費用が発生しないからです。CaringDictateには制限がありません。
GPUアクセラレーション
GPUアクセラレーションとは、コンピューターのグラフィックチップを使用して、メインプロセッサーよりも高速に音声モデルを実行することです。ゲーミングノートパソコンが著しく速く文字起こしできるのはこのためです。必須ではありません。CaringDictateは、より小さなモデルで通常のコンピューターでも動作します。
動作環境
システム要件とは、プログラムがうまく動作するために必要な、コンピューターの最低限のスペックのことです。CaringDictate の場合:Windows 10(64ビット、バージョン1903)または Windows 11、4 GB の RAM、そして数 GB の空きディスク容量です。
要点
音声入力、ボイスタイピング、音声認識はすべて同じ意味です。あなたが話し、コンピューターが入力します。購入時に実際に重要な選択肢は、音声がどこで処理されるか(あなたのコンピューター上か、誰かのサーバー上か)、どのように開始および停止するか(快適なトークボタン、またはウェイクワード)、そして どのように支払うか (一度だけか、永続的にか)です。CaringDictateの答えは、あなたのコンピューター上で、お好きなボタンで — $49 を一度だけ, とともに 7日間の 無料トライアル まずあなたの声に合うか確認するために。