Selama dua dekade, Dragon NaturallySpeaking adalah standar emas untuk akurasi diktasi. Posisi itu sedang berubah. Mesin Whisper milik OpenAI, khususnya varian Large v3 Turbo yang dirilis pada tahun 2024, telah mencapai kesetaraan dengan Dragon untuk diktasi umum dan melampauinya untuk banyak kasus spesifik. Artikel ini menelusuri apa yang sebenarnya kita ketahui tentang perbandingan tersebut, dengan sumber.

Apa arti "akurasi" dalam diktasi

Akurasi diktasi biasanya diukur sebagai Word Error Rate (WER), yaitu persentase kata yang keluar salah dalam transkrip. Lebih rendah lebih baik. WER 5% berarti 95 dari 100 kata benar.

WER bervariasi secara luar biasa berdasarkan kondisi: suara pembicara, kualitas mikrofon, kebisingan latar belakang, domain kosakata, gaya diktasi. Sebuah angka tolok ukur hanya bermakna ketika Anda tahu kondisi pengukurannya.

Whisper Large v3 Turbo: angka yang dipublikasikan

OpenAI menerbitkan Whisper Large v3 Turbo pada tahun 2024 sebagai varian Whisper Large v3 yang lebih cepat dengan akurasi yang sebanding. Tingkat kesalahan kata yang dilaporkan pada tolok ukur standar:

  • Whisper Large v3 (asli): WER 13,20% dirata-ratakan di seluruh kumpulan data multibahasa
  • Whisper Large v3 Turbo: WER 13,40% — dalam rentang 0,2% dari versi aslinya
  • Kondisi bersih khusus bahasa Inggris: WER 3-5% (akurasi 97-95%)

Varian Turbo berjalan sekitar 4× lebih cepat daripada v3 dengan akurasi yang pada dasarnya sama. Inilah mesin yang digunakan CaringDictate.

Untuk kasus penggunaan CaringDictate yang umum (bahasa Inggris, ruangan jernih, mikrofon yang layak), akurasi dunia nyata rata-rata 96-97% pada diktasi berkelanjutan. Ini sesuai dengan angka yang dipublikasikan OpenAI untuk kondisi bersih bahasa Inggris dan inilah yang kami laporkan di halaman pemasaran kami.

Klaim akurasi Dragon

Dragon secara historis mengiklankan akurasi 99%. Cetakan kecilnya: angka ini dicapai pada pengguna terlatih dengan mikrofon headset berkualitas tinggi di lingkungan yang tenang, setelah pelatihan suara yang ekstensif. Pengguna Dragon yang belum terlatih di hari pertama biasanya melihat akurasi lebih sekitar 92-94%.

Untuk pengguna Dragon Professional Individual yang terlatih dengan pengaturan yang tepat, akurasi dunia nyata biasanya berada di rentang 95-98% pada diktasi umum. Untuk domain khusus (medis, hukum), Dragon yang terlatih dapat mencapai 98-99% pada kosakata yang telah disesuaikan untuknya.

Perbandingan langsung yang jujur

Untuk pengguna yang belum terlatih, dengan headset USB generik, mendiktekan bahasa Inggris percakapan: mesin berbasis Whisper (CaringDictate) biasanya menang. Whisper tidak memerlukan pelatihan suara dan bekerja dengan baik langsung dari awal pada rentang suara luas tempat ia dilatih (lebih dari 680.000 jam audio multibahasa).

Untuk pengguna yang terlatih, dengan mikrofon berkualitas terbaik (Plantronics, Andrea USB), mendiktekan kosakata khusus: Dragon Professional yang terlatih masih dapat sedikit unggul pada kosakata spesifik yang telah dilatih untuknya. Keunggulan itu menyempit secara signifikan untuk penulisan umum.

Untuk penutur bahasa Inggris non-natif, penutur dengan aksen, atau penutur dengan disartria ringan akibat kondisi medis: Whisper memiliki keunggulan yang jelas. Korpus pelatihannya jauh lebih beragam daripada Dragon, dan pengenalannya menangani variasi ucapan dengan jauh lebih baik.

Untuk penutur dengan disartria signifikan (Parkinson berat, ALS yang memengaruhi ucapan, CP yang memengaruhi ucapan): baik Whisper maupun Dragon bukanlah alat yang tepat. Voiceitt dibangun khusus untuk kasus ini dan secara signifikan lebih baik daripada keduanya, meskipun jauh lebih mahal.

Kecepatan

Keunggulan nyata Whisper Turbo dibandingkan Dragon adalah kecepatan. Whisper Large v3 Turbo pada perangkat keras modern (Intel i5 dari 5 tahun terakhir, atau Apple Silicon, atau CPU AMD modern mana pun) menghasilkan transkripsi lebih cepat daripada waktu nyata — artinya Anda dapat mendiktekan sebuah kalimat dan kata-katanya muncul sebelum Anda selesai berbicara. Dragon juga memproses dalam waktu nyata tetapi memiliki latensi yang lebih terasa pada kata pertama setiap ucapan.

Untuk diktasi bentuk panjang, perbedaan kecepatan ini sebagian besar bersifat psikologis. Untuk diktasi pesan singkat (komentar Facebook, email cepat), responsivitas Whisper Turbo terasa jauh lebih baik.

Pertanyaan data pelatihan

Keunggulan akurasi tradisional Dragon berasal dari pelatihan suara yang diawasi: Anda akan membacakan sebuah bagian panjang kepada Dragon, dan ia akan membangun model pribadi yang mengenali suara Anda lebih baik daripada model defaultnya. Ini berhasil tetapi memerlukan waktu di awal yang signifikan.

Whisper tidak bekerja dengan cara ini. Ia dilatih pada korpus multibahasa yang luas sekali saja, oleh OpenAI, dan model yang dihasilkan itulah yang dijalankan setiap pengguna Whisper. Anda tidak melatihnya pada suara Anda. Ia entah bekerja pada suara Anda atau tidak — dan data pelatihan yang luas berarti ia bekerja dengan cukup baik pada sebagian besar suara.

Implikasinya bagi pengguna: dengan Dragon, Anda dapat menghabiskan waktu pelatihan untuk meningkatkan akurasi. Dengan Whisper, apa yang Anda dapatkan di hari pertama adalah apa yang Anda dapatkan di hari ke-365. Bagi sebagian besar pengguna, ini adalah fitur, bukan kekurangan — mereka memang tidak ingin menghabiskan satu jam untuk melatih Dragon. Bagi pengguna tingkat lanjut dengan kosakata teknis, ketidakmampuan untuk melatih-suara Whisper adalah keterbatasan yang nyata.

Pertanyaan pemeliharaan

Dragon Professional Individual telah dibekukan di versi 16 sejak 2023. Mesin pengenalannya tidak diperbarui. Microsoft telah mengalihkan Dragon ke medis perusahaan dan membiarkan Dragon konsumen menua.

Whisper, sebaliknya, dikembangkan secara aktif oleh OpenAI dan komunitas sumber terbuka. Whisper v3 dirilis pada 2023, Whisper v3 Turbo pada 2024, dan model penerusnya sedang dalam pengembangan aktif. CaringDictate dikirimkan dengan v3 Turbo hari ini dan akan diperbarui ke model yang lebih baru sebagai pembaruan gratis ketika model tersebut terbukti lebih baik.

Dalam cakupan lima tahun ke depan, inilah perbedaan yang paling penting. Mesin pengenalan yang dibekukan akan terus bekerja, tetapi tidak akan memperoleh manfaat dari perbaikan substansial yang terjadi di tempat lain dalam bidang ini.

Untuk kelompok pengguna tertentu

Pengguna lanjut usia dengan kosakata bahasa Inggris umum: Whisper (melalui CaringDictate) adalah pilihan yang lebih baik. Tanpa pelatihan, tanpa kerumitan pengaturan, bekerja dengan baik langsung dari awal.

Profesional medis yang mendiktekan catatan klinis: Dragon Medical One yang terlatih masih menjadi standar industri. Kosakata medis Whisper bagus tetapi tidak sekhusus itu.

Pengacara yang mendiktekan dokumen hukum: Dragon Professional yang terlatih dengan kosakata khusus sulit dikalahkan. Whisper menangani sebagian besar bahasa Inggris hukum dengan baik tetapi kurang dapat disesuaikan.

Orang dewasa dengan kondisi medis yang memengaruhi tangan tetapi tidak ucapan: Whisper melalui CaringDictate adalah yang akan kami rekomendasikan. Tanpa beban pelatihan, akurasi lebih baik pada variasi ucapan, dan jauh lebih murah.

Penutur bahasa Inggris non-natif: Whisper memiliki keunggulan yang jelas. Korpus pelatihan multibahasa berarti ia menangani aksen jauh lebih baik daripada model Dragon yang dilatih dengan bahasa Inggris.

Kesimpulan akhir

Whisper Large v3 Turbo dan Dragon Professional yang terlatih kini berada dalam rentang beberapa poin persentase satu sama lain pada akurasi diktasi umum. Bagi sebagian besar pengguna, terutama lanjut usia dan pengguna dengan kondisi medis, keunggulan praktis Whisper (tanpa pelatihan, penanganan aksen lebih baik, pengembangan aktif, biaya jauh lebih rendah) melampaui keunggulan sisa Dragon pada kosakata khusus.

CaringDictate dibangun di atas Whisper Large v3 Turbo karena kami yakin inilah mesin yang tepat untuk audiens kami. Pengembalian dana 30 hari berarti Anda dapat membandingkan sendiri tanpa risiko.

Ke mana melangkah dari sini

Baca selengkapnya perbandingan CaringDictate vs Dragon untuk perbedaan tingkat produk (harga, UX, pembaruan, pengembalian dana), dan panduan privasi kami jika pemrosesan lokal vs cloud penting untuk situasi Anda.