Jika Anda pernah membandingkan perangkat lunak dikte, Anda mungkin sudah mengumpulkan beberapa persentase — 99%, 97%, 95% — dan mendapati bahwa angka itu tidak membantu Anda memilih. Itu bukan karena angkanya tidak jujur. Itu karena satu angka akurasi menjawab pertanyaan yang berbeda dari pertanyaan yang Anda ajukan.

Anda ingin tahu: seberapa baik alat ini akan memahami saya, di meja saya, dengan mikrofon saya? Angka akurasi yang dipublikasikan menjawab: seberapa baik mesin ini menranskripsi satu set rekaman tertentu yang belum pernah kita berdua dengar? Kedua pertanyaan itu bisa memiliki jawaban yang sangat berbeda.

Halaman ini menjelaskan bagaimana pengukurannya bekerja, sehingga Anda bisa membaca angka dari vendor mana pun — termasuk yang Anda lihat tentang kami — dan mengetahui seberapa berarti angka itu.

Word error rate, dijelaskan dengan sederhana

Akurasi pengenalan ucapan biasanya dilaporkan sebagai word error rate, biasanya ditulis WER. Ini adalah persentase kata yang keluar salah. Semakin rendah semakin baik, dan "akurat 95%" hanyalah cara lain untuk menulis "WER 5%".

Apa yang dianggap salah lebih spesifik daripada yang diperkirakan kebanyakan orang. Ada tiga jenis kesalahan, dan ketiganya dijumlahkan:

  • Substitusi — sebuah kata keluar sebagai kata yang berbeda. Anda mengatakan "their", tapi yang tertulis "there".
  • Penghapusan — sebuah kata yang Anda ucapkan hilang dari transkrip.
  • Penyisipan — sebuah kata muncul padahal Anda tidak pernah mengucapkannya. Suara latar belakang dan bunyi napas menyebabkan hal ini.

Jumlahkan ketiganya dan bagi dengan jumlah kata yang benar-benar Anda ucapkan. Misalnya Anda mendiktekan paragraf 100 kata dan transkripnya memiliki empat kata yang salah, satu kata yang hilang, dan satu kata tambahan: itu berarti enam kesalahan dalam 100 kata, WER sebesar 6%, atau "akurat 94%".

Ada satu konsekuensi yang layak diketahui, karena ini menjelaskan banyak pemasaran yang membingungkan: WER bisa melebihi 100%. Jika perangkat lunak menyisipkan lebih banyak kata daripada yang Anda ucapkan — yang terjadi di ruangan yang bising — jumlah kesalahannya bisa lebih besar daripada jumlah katanya. Angka yang tidak bisa melebihi 100 bukanlah word error rate.

Mengapa perangkat lunak yang sama memberikan hasil yang berbeda untuk dua orang

Mesinnya hanyalah salah satu hal yang menentukan akurasi Anda, dan sering kali bukan yang paling penting. Selebihnya adalah situasi Anda:

  • Mikrofon Anda, dan di mana posisinya. Ini biasanya menjadi faktor tunggal yang paling besar, dan yang termurah untuk diperbaiki. Mikrofon headset yang berjarak beberapa sentimeter dari mulut Anda mendengar sesuatu yang cukup berbeda dari mikrofon laptop di seberang meja.
  • Ruangannya. Televisi di latar belakang, kipas angin, jendela terbuka, ruangan berpermukaan keras dengan gema. Semuanya sampai ke pengenal suara bersama dengan suara Anda.
  • Apa yang Anda diktekan. Prosa sehari-hari adalah kasus yang mudah. Nama, istilah medis atau hukum, nomor komponen, alamat, dan akronim jauh lebih sulit, karena perangkat lunak harus memilih di antara kata-kata yang terdengar mirip.
  • Bagaimana Anda berbicara. Aksen, kecepatan, volume, apakah Anda menyambung kalimat, apakah suara Anda melemah di akhir. Tidak ada satu pun dari ini yang merupakan kesalahan — ini hanyalah variasi yang bisa ditangani mesinnya atau tidak.
  • Model mana yang Anda jalankan. Sebagian besar perangkat lunak on-device menyertakan beberapa model dengan ukuran berbeda. Model kecil yang berjalan lancar di laptop lama umumnya akan membuat lebih banyak kesalahan dibanding model besar di perangkat yang cepat.

Dua orang yang menjalankan perangkat lunak yang identik, dengan pengaturan yang identik, bisa berbeda beberapa poin persentase hanya karena hal-hal ini saja. Itulah kesenjangan yang tidak bisa ditutup oleh angka yang dipublikasikan mana pun untuk Anda.

Apa sebenarnya yang diukur oleh angka benchmark

Word error rate yang dipublikasikan berasal dari dataset riset standar — kumpulan rekaman tetap dengan transkrip yang telah diverifikasi, sehingga sistem yang berbeda bisa dinilai terhadap materi yang sama. Itu benar-benar berguna bagi orang-orang yang membangun perangkat lunaknya: itulah cara mengetahui apakah model bulan ini lebih baik dari model bulan lalu.

Itu jauh kurang berguna sebagai panduan belanja, karena tiga alasan:

  • Rekamannya bukan Anda. Audio benchmark memiliki aksennya sendiri, mikrofonnya sendiri, dan materinya sendiri, yang semuanya bukan milik Anda.
  • Vendor yang berbeda melaporkan pengujian yang berbeda. Dua angka yang diukur pada dua dataset tidak bisa dibandingkan, bahkan ketika keduanya dilaporkan dengan jujur. Ucapan buku audio yang dibacakan dan percakapan spontan menghasilkan skor yang sangat berbeda dari mesin yang sama.
  • Kondisinya sering kali tidak dicantumkan. Angka yang dicantumkan tanpa dataset, mikrofon, dan gaya bicaranya bukanlah klaim yang bisa Anda periksa.

Ketika Anda melihat sebuah angka, pertanyaan yang berguna bukanlah "apakah tinggi?" melainkan "diukur pada apa?" Jika itu tidak dicantumkan, angka itu hanyalah hiasan.

Dua filosofi desain yang berbeda

Ada perbedaan teknis yang nyata antara pendekatan lama dan baru terhadap pengenalan suara, dan penting untuk dipahami karena hal ini mengubah apa arti "akurasi" itu sendiri untuk suatu produk.

Profil terlatih. Pendekatan desktop tradisional membangun profil suara dan kosakata individual Anda. Anda menghabiskan waktu di awal, dan Anda bisa terus mengajarinya — menambahkan istilah Anda sendiri, nama rekan kerja Anda, kata-kata yang digunakan dalam profesi Anda. Dragon adalah produk paling dikenal yang dibangun dengan cara ini, dan materi Nuance sendiri mengklaim akurasi pengenalan hingga 99%. Konsekuensinya adalah waktu pengaturan, dan fakta bahwa profil itu harus Anda pelihara sendiri.

Model umum. Pendekatan yang lebih baru melatih satu model besar pada rentang ucapan yang sangat luas, satu kali saja, lalu mengirim model yang sama ke semua orang. Model Whisper dari OpenAI adalah contoh terbuka yang paling dikenal; makalah Whisper asli menjelaskan pelatihan pada sekitar 680.000 jam audio. Tidak ada langkah pendaftaran — Anda memasangnya dan langsung mulai berbicara — dan sama sekali tidak ada cara untuk mengajarinya suara Anda. Apa yang Anda dapatkan di hari pertama secara garis besar sama dengan apa yang Anda dapatkan setelahnya, terlepas dari apa pun yang ditambahkan perangkat lunaknya di sekitar model itu, seperti daftar kata pribadi.

Tidak ada satu pendekatan yang begitu saja lebih baik. Jika Anda mendiktekan kosakata khusus sepanjang hari, kemampuan melatih perangkat lunaknya bernilai uang sungguhan. Jika Anda ingin memasang sesuatu dan menggunakannya sore ini juga, sesi pendaftaran hanyalah biaya tanpa keuntungan. Mana yang menggambarkan Anda bukanlah sesuatu yang bisa diberi tahu oleh sebuah persentase.

Ujilah dengan suara Anda sendiri dalam sepuluh menit

Ini adalah satu-satunya benchmark yang menjawab pertanyaan Anda, dan mudah dijalankan pada alat dikte apa pun yang menyediakan uji coba — termasuk yang gratis dan sudah ada di komputer Anda.

  • Tulis dulu sebuah bagian singkat — 150 hingga 200 kata. Gunakan tulisan Anda sendiri, bukan paragraf contoh: gaya email Anda, topik Anda, nama-nama yang benar-benar Anda ketik.
  • Bacakan dengan suara keras ke dalam perangkat lunaknya dengan cara Anda biasa berbicara, duduk di tempat Anda biasa duduk.
  • Bandingkan keduanya berdampingan dan hitung substitusi, penghapusan, dan penyisipannya. Bagi dengan jumlah kata Anda.
  • Ulangi sekali lagi dengan mikrofon headset jika percobaan pertama Anda menggunakan mikrofon bawaan. Satu perubahan ini saja sering kali lebih berarti daripada mengganti produk.
  • Lalu lakukan percobaan yang realistis. Diktekan sesuatu yang tidak dituliskan lebih dulu — sebuah email sungguhan — karena berbicara dari sebuah halaman lebih mudah daripada berbicara dari kepala Anda, dan angka kedua itulah yang akan Anda hadapi sehari-hari.

Jalankan bagian yang sama pada dua atau tiga alat dan Anda akan memiliki sesuatu yang tidak bisa diberikan oleh ulasan mana pun: perbandingan pada suara, mikrofon, dan ruangan Anda. Jika sebuah alat tidak bisa dicoba sebelum Anda membayar, itu juga layak dipertimbangkan.

Membaca hasilnya

Beberapa poin persentase WER kurang penting dibanding di mana letak kesalahannya. Perangkat lunak yang sesekali melewatkan kata pendek tetapi selalu benar dalam mengenali nama lebih menyenangkan digunakan daripada perangkat lunak dengan skor lebih baik yang mengacaukan nama rekan kerja Anda. Memperbaiki kata yang salah hanya butuh sesaat; menyadarinya butuh perhatian.

Jadi nilailah transkripnya, bukan angkanya. Baca apa yang keluar, tanyakan seberapa banyak perapian yang dibutuhkannya, dan tanyakan apakah itu lebih sedikit usaha daripada jika Anda mengetiknya sendiri. Itulah keseluruhan pertanyaannya.

Di mana posisi CaringDictate

Kami tidak mempublikasikan angka persentase akurasi. Kami bisa saja membuat satu — siapa pun bisa — tetapi angka itu akan diukur pada rekaman yang bukan suara Anda, dan menyajikannya sebagai prediksi pengalaman Anda akan menyesatkan.

CaringDictate menggunakan model pengenalan ucapan terbuka yang berjalan di komputer Anda sendiri, dan menyertakan beberapa ukuran model agar bisa sesuai dengan perangkat yang Anda miliki. Ada uji coba gratis tujuh hari, yang ada justru agar pertanyaan ini dijawab oleh suara Anda sendiri, bukan oleh pemasaran kami. Jika pengetikan suara gratis yang sudah terpasang di Windows sudah cukup baik untuk Anda ketika Anda menjalankan uji di atas, itu adalah hasil yang baik — gunakan itu dan simpan uang Anda.

Ke mana melangkah dari sini

Kotak glosarium pengetikan suara menjelaskan sisa istilah yang akan Anda temui saat mencari-cari. Perbandingan Dragon membahas perbedaan pada tingkat produk, dan panduan privasi membahas ke mana audio Anda pergi pada alat lokal dibanding alat berbasis cloud.