Anda seharusnya tidak memerlukan penerjemah untuk membeli alat yang seluruh pekerjaannya adalah mengubah kata-kata Anda menjadi teks. Halaman ini mendefinisikan setiap istilah yang akan Anda temui saat membandingkan perangkat lunak dikte — termasuk yang ada di layar pengaturan kami sendiri. Setiap definisi adalah satu kalimat; detail setelahnya adalah bacaan opsional.

Dasar-dasar

Dikte

Dikte adalah berbicara dengan lantang sementara perangkat lunak mengubah kata-kata Anda menjadi teks tertulis. Orang juga menyebutnya pengetikan suara atau speech-to-text. Ketiga nama ini memiliki arti yang sama: Anda berbicara, komputer mengetik.

Pengetikan suara

Pengetikan suara adalah nama lain untuk dikte — berbicara alih-alih mengetik, dengan kata-katanya muncul di mana pun kursor teks Anda berada. Windows menyebut alat bawaannya "voice typing" (fitur Win+H). CaringDictate melakukan pekerjaan yang sama di sebagian besar program, tanpa batas waktu alat bawaan itu.

Speech-to-text

Speech-to-text adalah teknologi yang mengubah audio lisan menjadi kata-kata tertulis. Anda akan melihatnya disingkat sebagai STT dalam artikel teknis. Ketika suatu produk mengatakan "didukung oleh speech-to-text," itu berarti dikte.

Pengenalan suara

Pengenalan suara adalah bidang yang lebih luas tentang komputer yang memahami ucapan manusia — baik apa yang Anda katakan (dikte) maupun apa yang Anda maksud (perintah). Aplikasi dikte menggunakan pengenalan suara untuk menuliskan kata-kata Anda. Asisten suara menggunakannya untuk bertindak berdasarkan kata-kata tersebut.

Transkripsi

Transkripsi adalah mengubah rekaman ucapan — rapat, wawancara, pesan suara — menjadi dokumen tertulis setelah kejadian. Dikte bersifat langsung (Anda melihat kata-kata muncul saat Anda berbicara); transkripsi biasanya terjadi kemudian, dari sebuah file. Alat seperti Otter.ai adalah alat transkripsi, bukan alat dikte.

Bagaimana pengenalan bekerja

Model suara (model pengenalan)

Model suara adalah otak terlatih dari sebuah program dikte — file yang benar-benar memahami ucapan. Model yang lebih besar biasanya lebih akurat tetapi membutuhkan komputer yang lebih bertenaga. CaringDictate memilih ukuran model yang cocok dengan mesin Anda, dari sekitar 190 MB hingga sekitar 3.1 GB.

Whisper

Whisper adalah keluarga model suara sumber terbuka yang dirilis oleh OpenAI pada tahun 2022, dikenal karena akurasi mendekati manusia di banyak bahasa. Ini adalah mesin di balik banyak produk diktasi dan transkripsi modern, termasuk CaringDictate. Karena bersifat sumber terbuka, ia dapat berjalan sepenuhnya di komputer Anda sendiri.

Pengenalan di perangkat (offline)

Pengenalan di perangkat berarti ucapan Anda diproses di komputer Anda sendiri — audio tidak pernah dikirim ke server perusahaan. Ini berfungsi tanpa internet, menjaga pikiran pribadi tetap privat, dan tidak pernah berhenti berfungsi karena layanan mati. Ini adalah cara CaringDictate beroperasi.

Pengenalan cloud

Pengenalan berbasis cloud berarti suara Anda dikirimkan melalui internet ke server sebuah perusahaan, diubah menjadi teks di sana, lalu dikirim kembali. Pengenalan terjadi di server, bukan di komputer Anda. Di mana suatu alat tertentu melakukan pengenalan suaranya dijelaskan dalam dokumentasinya sendiri, dan beberapa produk menawarkan keduanya — ini layak diperiksa, bukan diasumsikan.

Akurasi (tingkat kesalahan kata)

Akurasi adalah persentase kata yang benar oleh program dikte; word error rate (WER) adalah gagasan yang sama diukur secara terbalik — persentase yang salah. Dikte modern berbasis Whisper sangat akurat pada bahasa Inggris yang jelas. Hasilnya bervariasi dengan kualitas mikrofon, kebisingan latar, dan seberapa jelas Anda berbicara.

Latensi

Latensi adalah penundaan antara menyelesaikan kalimat dan melihat teks muncul. Di bawah sekitar sepertiga detik terasa instan; jauh lebih dari itu terasa lambat. Pengenalan di perangkat menghindari perjalanan bolak-balik ke server, yang membantu.

Deteksi bahasa otomatis

Deteksi bahasa otomatis berarti perangkat lunak mengetahui bahasa apa yang Anda gunakan tanpa diberitahu. Berguna jika Anda beralih antar bahasa di tengah hari. Pengaturan "Otomatis" CaringDictate melakukan ini di 20 bahasa yang didukungnya.

Menggunakan aplikasi diktasi sehari-hari

Tombol bicara (hotkey)

Tombol bicara adalah satu tombol keyboard atau mouse yang memulai dan menghentikan diktasi. Di CaringDictate, defaultnya adalah tombol Ctrl Kanan, dan Anda dapat mengubahnya ke tombol keyboard atau mouse apa pun yang nyaman untuk tangan Anda.

Tekan-untuk-bicara (tahan untuk bicara)

Tekan-untuk-bicara berarti menahan tombol bicara saat Anda berbicara dan melepaskannya saat Anda selesai — seperti walkie-talkie. Baik untuk ucapan singkat: kotak pencarian, balasan cepat. Alternatifnya adalah ketuk-untuk-alih, lebih baik untuk penulisan yang lebih panjang.

Alih (ketuk untuk bicara)

Mode alih berarti mengetuk tombol bicara sekali untuk mulai mendengarkan dan mengetuk lagi untuk berhenti. Tangan Anda sepenuhnya bebas di antaranya — membantu saat menahan tombol tidak nyaman, atau saat Anda mendikte bagian yang panjang.

Kata bangun (aktivasi suara)

Kata bangun adalah frasa yang Anda ucapkan dengan lantang — seperti "mulai diktasi" — yang memulai diktasi tanpa menyentuh keyboard atau mouse sama sekali. Ini paling penting ketika menjangkau keyboard adalah bagian yang sulit. CaringDictate menambahkan aktivasi suara yang dapat diatur pengguna di versi 3.5.

Indikator mendengarkan

Indikator mendengarkan adalah sinyal kecil di layar yang menunjukkan mikrofon aktif dan kata-kata Anda sedang didengar. Indikator yang dapat dipercaya itu penting: Anda tidak perlu bertanya-tanya apakah komputer sedang mendengarkan.

Perintah suara

Perintah suara adalah instruksi lisan — seperti "baris baru" atau "hapus itu" — yang mengontrol pemformatan alih-alih menulis kata-kata. Aplikasi diktasi sangat berbeda di sini. Perintah sederhana mencakup sebagian besar penulisan sehari-hari; kontrol komputer bebas tangan yang berat adalah kategori terpisah (lihat Voice Access).

Perintah tanda baca

Perintah tanda baca adalah mengucapkan "titik," "koma," atau "tanda tanya" dengan lantang untuk menyisipkan tanda baca. Mesin modern seperti Whisper juga memberi tanda baca secara otomatis dari frasa dan jeda Anda, sehingga Anda seringkali bisa berbicara secara alami.

Kamus kustom (daftar kata)

Kamus kustom adalah daftar pribadi Anda berisi nama dan kata-kata khusus yang harus dipercaya oleh pengenal — nama keluarga, nama obat, jargon industri. Menambahkan "Zofran" atau "Oaxaca" sekali lebih baik daripada mengoreksinya selamanya. CaringDictate menyertakan satu di bawah Menulis & kata-kata.

Penyisipan teks

Penyisipan teks adalah bagaimana kata-kata yang didiktekan secara fisik tiba di dokumen Anda — aplikasi mengetiknya ketukan demi ketukan atau menempelkannya dalam satu bagian. Menempelkan seluruh frasa lebih cepat dan jauh lebih andal di berbagai program, itulah sebabnya CaringDictate mengirimkan teks dengan cara itu.

Istilah khusus Windows

Win+H (pengetikan suara Windows)

Win+H adalah pintasan keyboard yang membuka bilah pengetikan suara bawaan Windows di Windows 10 dan 11. Gratis, sudah bawaan di Windows, dan hal pertama yang masuk akal untuk dicoba dalam dikte sehari-hari. Windows 11 juga menyertakan Voice Access, yang menambahkan kontrol suara penuh atas PC bersama dengan kosakata khusus dan koreksi teks.

Windows Voice Access

Voice Access adalah fitur kontrol komputer bebas tangan Windows 11 — mengklik, menggulir, dan beralih jendela dengan suara, termasuk dikte. Ini dibangun untuk kontrol komputer penuh dengan suara. Jika yang Anda inginkan terutama adalah menulis dengan nyaman, alat dikte khusus biasanya lebih cocok.

Windows Speech Recognition (WSR)

Windows Speech Recognition adalah alat dikte bawaan yang lebih lama yang telah dihentikan oleh Microsoft demi Voice Access. Jika Anda mengandalkan WSR di PC lama, penghentiannya biasanya adalah saat untuk memilih pengganti secara sengaja daripada mewarisi alat apa pun yang ditawarkan Windows selanjutnya.

Pengaturan privasi mikrofon

Pengaturan privasi mikrofon adalah sakelar Windows yang menentukan program mana yang boleh menggunakan mikrofon Anda. Jika aplikasi dikte tidak mendengar apa-apa, ini adalah tempat pertama untuk mencari: Pengaturan → Privasi & keamanan → Mikrofon.

Mikrofon default

Mikrofon default adalah mikrofon yang diberikan Windows kepada program kecuali jika mereka memilih yang berbeda. Laptop sering memiliki beberapa (bawaan, headset, webcam). Memilih yang tepat — dekat dengan mulut Anda, jauh dari kipas — meningkatkan akurasi lebih dari pengaturan apa pun.

Istilah pembelian

Pembelian satu kali (lisensi abadi)

Pembelian satu kali berarti membayar sekali dan memiliki perangkat lunak — tidak ada biaya bulanan atau tahunan untuk terus menggunakannya. CaringDictate seharga $49 sekali, dengan pembaruan disertakan. Model alternatif, langganan, terus mengenakan biaya selama Anda terus mengetik.

Langganan

Langganan adalah membayar bulanan atau tahunan untuk akses berkelanjutan ke perangkat lunak — berhenti membayar dan itu berhenti berfungsi. Masuk akal untuk layanan dengan biaya server yang berkelanjutan; lebih sulit untuk dibenarkan untuk alat yang berjalan sepenuhnya di komputer Anda sendiri. Bandingkan total lima tahun sebelum memilih.

Kursi (lisensi perangkat)

Satu kursi adalah satu salinan program yang terinstal; lisensi 3 kursi mencakup tiga komputer Anda. Lisensi CaringDictate seharga $49 mencakup 3 kursi — desktop, laptop, dan satu lagi.

Uji coba gratis

Uji coba gratis adalah periode percobaan berfitur lengkap sebelum membayar — CaringDictate berlangsung 7 hari tanpa kartu diperlukan. Uji coba di komputer Anda sendiri, dengan mikrofon Anda sendiri dan suara Anda sendiri, mengalahkan ulasan atau bagan akurasi apa pun.

Pembaruan gratis

Pembaruan gratis berarti versi baru dari perangkat lunak disertakan dalam harga yang sudah Anda bayar, tanpa biaya peningkatan terpisah. Layak diperiksa sebelum membeli perangkat lunak sekali bayar apa pun: beberapa lisensi "abadi" mengunci Anda pada versi yang Anda beli dan menagih lagi untuk peningkatan.

Batas kata (batas penggunaan)

Batas kata adalah batasan seberapa banyak Anda dapat mendikte — umum pada tingkatan gratis layanan dikte berlangganan. Alat di perangkat tidak memiliki alasan untuk membatasi Anda; tidak ada tagihan server. CaringDictate tidak memiliki batas.

Akselerasi GPU

Akselerasi GPU berarti menggunakan chip grafis komputer Anda untuk menjalankan model suara lebih cepat daripada yang bisa dilakukan prosesor utama. Inilah mengapa laptop gaming mentranskripsi jauh lebih cepat. Tidak wajib — CaringDictate juga berjalan di mesin biasa dengan model yang lebih kecil.

Persyaratan sistem

Persyaratan sistem adalah spesifikasi komputer minimum yang dibutuhkan sebuah program untuk berjalan dengan baik. Untuk CaringDictate: Windows 10 (64-bit, versi 1903) atau Windows 11, 4 GB RAM, dan beberapa GB ruang disk kosong.

Versi singkatnya

Dikte, pengetikan suara, dan speech-to-text semuanya berarti hal yang sama: Anda berbicara, komputer mengetik. Pilihan yang benar-benar penting saat membeli adalah di mana suara Anda diproses (di komputer Anda atau di server seseorang), bagaimana Anda memulai dan menghentikannya (tombol bicara yang nyaman, atau kata bangun), dan bagaimana Anda membayar (sekali, atau selamanya). Jawaban CaringDictate adalah: di komputer Anda, tombol apa pun yang Anda suka — $49 sekali saja, dengan uji coba 7 hari uji coba gratis untuk memastikan sesuai dengan suara Anda terlebih dahulu.