หากคุณกำลังเปรียบเทียบซอฟต์แวร์พูดสั่งงาน คุณอาจรวบรวมตัวเลขเปอร์เซ็นต์มาหลายค่า — 99%, 97%, 95% — และพบว่าตัวเลขเหล่านั้นไม่ได้ช่วยให้คุณตัดสินใจได้เลย นั่นไม่ใช่เพราะตัวเลขไม่ซื่อสัตย์ แต่เพราะตัวเลขความแม่นยำเพียงค่าเดียวตอบคำถามคนละข้อกับที่คุณกำลังถาม
สิ่งที่คุณอยากรู้คือ: มันจะเข้าใจฉันได้ดีแค่ไหน ที่โต๊ะของฉัน ด้วยไมโครโฟนของฉัน ตัวเลขความแม่นยำที่เผยแพร่ตอบคำถามว่า: เอนจินนี้ถอดเสียงชุดการบันทึกเสียงชุดหนึ่งซึ่งทั้งคุณและเราต่างก็ไม่เคยได้ยินมาก่อนได้ดีแค่ไหน คำถามสองข้อนี้อาจมีคำตอบที่แตกต่างกันมาก
หน้านี้อธิบายวิธีการวัดผล เพื่อให้คุณอ่านตัวเลขของผู้จำหน่ายรายใดก็ได้ — รวมถึงตัวเลขที่คุณเห็นเกี่ยวกับเรา — แล้วรู้ว่ามันมีความหมายมากน้อยเพียงใด
อัตราความผิดพลาดของคำ ฉบับเข้าใจง่าย
ความแม่นยำของการจดจำเสียงพูดมักถูกรายงานในรูปของ อัตราความผิดพลาดของคำมักเขียนย่อว่า WER คือสัดส่วนของคำที่ออกมาผิด ยิ่งค่าน้อยยิ่งดี และคำว่า "แม่นยำ 95%" ก็เป็นเพียงอีกวิธีหนึ่งในการเขียนคำว่า "WER 5%"
สิ่งที่นับว่า "ผิด" นั้นเจาะจงกว่าที่คนส่วนใหญ่คิด มีข้อผิดพลาดสามประเภท และนำมารวมกัน:
- การแทนที่คำ — คำที่พูดออกมากลายเป็นอีกคำหนึ่ง เช่น คุณพูดว่า "their" แต่กลับพิมพ์เป็น "there"
- การหายไปของคำ — คำที่คุณพูดหายไปจากข้อความที่ถอดออกมา
- การเพิ่มคำเกิน — มีคำปรากฏขึ้นทั้งที่คุณไม่ได้พูด มักเกิดจากเสียงพูดพื้นหลังและเสียงลมหายใจ
นำทั้งสามค่ามารวมกันแล้วหารด้วยจำนวนคำที่คุณพูดออกมาจริง สมมติว่าคุณพูดสั่งงานหนึ่งย่อหน้าที่มี 100 คำ และข้อความที่ได้มีคำผิดสี่คำ คำหายไปหนึ่งคำ และคำเกินมาหนึ่งคำ นั่นคือข้อผิดพลาดหกครั้งใน 100 คำ ซึ่งคือ WER 6% หรือ "แม่นยำ 94%"
มีข้อสรุปหนึ่งที่ควรรู้ไว้ เพราะช่วยอธิบายการตลาดที่สร้างความสับสนได้หลายอย่าง: WER สามารถเกิน 100% ได้หากซอฟต์แวร์เพิ่มคำเข้ามามากกว่าที่คุณพูด — ซึ่งเกิดขึ้นได้ในห้องที่มีเสียงดัง — จำนวนข้อผิดพลาดก็อาจมากกว่าจำนวนคำทั้งหมด ตัวเลขที่ไม่มีทางเกิน 100 ได้จึงไม่ใช่อัตราความผิดพลาดของคำที่แท้จริง
เหตุใดซอฟต์แวร์ตัวเดียวกันจึงให้ผลลัพธ์ต่างกันสำหรับคนสองคน
เอนจินเป็นเพียงหนึ่งในหลายปัจจัยที่กำหนดความแม่นยำของคุณ และมักไม่ใช่ปัจจัยที่สำคัญที่สุดด้วยซ้ำ ส่วนที่เหลือคือสถานการณ์ของคุณเอง:
- ไมโครโฟนของคุณ และตำแหน่งที่วางไว้ นี่มักเป็นปัจจัยเดียวที่ส่งผลมากที่สุด และแก้ไขได้ง่ายที่สุดด้วย ไมโครโฟนหูฟังที่อยู่ห่างจากปากเพียงไม่กี่เซนติเมตรจะได้ยินเสียงต่างจากไมโครโฟนในโน้ตบุ๊กที่วางอยู่อีกฟากของโต๊ะอย่างมาก
- ห้องที่คุณอยู่ เสียงโทรทัศน์เบื้องหลัง เสียงพัดลม หน้าต่างที่เปิดอยู่ ห้องที่มีพื้นผิวแข็งจนเกิดเสียงสะท้อน ทั้งหมดนี้จะเข้าไปถึงระบบจดจำเสียงพร้อมกับเสียงของคุณ
- สิ่งที่คุณกำลังพูดสั่งงาน ข้อความในชีวิตประจำวันทั่วไปเป็นกรณีที่ง่าย ส่วนชื่อเฉพาะ ศัพท์ทางการแพทย์หรือกฎหมาย หมายเลขชิ้นส่วน ที่อยู่ และคำย่อ ล้วนยากกว่ามาก เพราะซอฟต์แวร์ต้องเลือกระหว่างคำที่ออกเสียงคล้ายกัน
- วิธีที่คุณพูด สำเนียง ความเร็วในการพูด ระดับเสียง การพูดประโยคต่อเนื่องกันหรือไม่ การพูดเสียงเบาลงท้ายประโยคหรือไม่ ทั้งหมดนี้ไม่ใช่ข้อผิดพลาดของคุณ — เป็นเพียงความหลากหลายที่เอนจินอาจรับมือได้หรือไม่ได้เท่านั้น
- โมเดลที่คุณใช้งาน ซอฟต์แวร์ที่ประมวลผลบนเครื่องส่วนใหญ่มีโมเดลหลายขนาดให้เลือก โมเดลขนาดเล็กที่ทำงานได้ลื่นไหลบนโน้ตบุ๊กรุ่นเก่ามักมีข้อผิดพลาดมากกว่าโมเดลขนาดใหญ่บนเครื่องที่แรงกว่า
คนสองคนที่ใช้ซอฟต์แวร์เดียวกันและตั้งค่าเหมือนกันทุกอย่าง อาจได้ผลลัพธ์ที่ต่างกันหลายเปอร์เซ็นต์จากปัจจัยเหล่านี้เพียงอย่างเดียว นั่นคือช่องว่างที่ตัวเลขที่เผยแพร่ไว้ไม่มีทางปิดให้คุณได้
ตัวเลขมาตรฐานเปรียบเทียบวัดอะไรกันแน่
อัตราความผิดพลาดของคำที่เผยแพร่นั้นมาจากชุดข้อมูลวิจัยมาตรฐาน — คือชุดการบันทึกเสียงที่ตายตัวพร้อมข้อความถอดเสียงที่ตรวจสอบแล้ว เพื่อให้ระบบต่างๆ ถูกให้คะแนนจากเนื้อหาชุดเดียวกัน สิ่งนี้มีประโยชน์จริงสำหรับผู้พัฒนาซอฟต์แวร์ เพราะช่วยบอกได้ว่าโมเดลเดือนนี้ดีกว่าเดือนที่แล้วหรือไม่
แต่มีประโยชน์น้อยกว่ามากในฐานะคู่มือเลือกซื้อ ด้วยเหตุผลสามประการ:
- การบันทึกเสียงเหล่านั้นไม่ใช่เสียงของคุณ เสียงในชุดทดสอบมาตรฐานมีสำเนียง ไมโครโฟน และเนื้อหาของตัวเอง ซึ่งไม่มีอย่างใดตรงกับของคุณเลย
- ผู้จำหน่ายแต่ละรายรายงานผลจากการทดสอบที่ต่างกัน ตัวเลขสองค่าที่วัดจากชุดข้อมูลสองชุดที่ต่างกันนำมาเทียบกันไม่ได้ แม้ทั้งสองจะรายงานอย่างซื่อสัตย์ก็ตาม เสียงอ่านออกเสียงจากหนังสือเสียงกับบทสนทนาที่เกิดขึ้นตามธรรมชาติให้คะแนนที่ต่างกันมากจากเอนจินตัวเดียวกัน
- เงื่อนไขการทดสอบมักไม่ถูกระบุไว้ ตัวเลขที่ยกมาโดยไม่ระบุชุดข้อมูล ไมโครโฟน และรูปแบบการพูด ไม่ใช่คำกล่าวอ้างที่คุณจะตรวจสอบได้
เมื่อคุณเห็นตัวเลขใดตัวหนึ่ง คำถามที่มีประโยชน์ไม่ใช่ "สูงหรือไม่" แต่คือ "วัดจากอะไร" หากไม่มีการระบุไว้ ตัวเลขนั้นก็เป็นเพียงเครื่องประดับเท่านั้น
แนวคิดการออกแบบสองแบบที่แตกต่างกัน
มีความแตกต่างทางเทคนิคที่แท้จริงระหว่างแนวทางการจดจำเสียงแบบเก่าและแบบใหม่ และควรเข้าใจไว้ เพราะมันเปลี่ยนความหมายของคำว่า "ความแม่นยำ" สำหรับแต่ละผลิตภัณฑ์ไปเลย
โปรไฟล์ที่ผ่านการฝึก แนวทางแบบดั้งเดิมบนคอมพิวเตอร์เดสก์ท็อปจะสร้างโปรไฟล์เฉพาะสำหรับเสียงและคำศัพท์ของคุณ คุณต้องใช้เวลาในช่วงแรก และสามารถสอนมันต่อไปได้เรื่อยๆ — เพิ่มศัพท์เฉพาะของคุณ ชื่อเพื่อนร่วมงาน คำที่ใช้ในสายอาชีพของคุณ Dragon เป็นผลิตภัณฑ์ที่รู้จักกันดีที่สุดในแนวทางนี้ และเอกสารของ Nuance เองก็อ้างว่ามีความแม่นยำในการจดจำสูงถึง 99% ข้อแลกเปลี่ยนคือเวลาในการตั้งค่า และความจริงที่ว่าโปรไฟล์นี้เป็นสิ่งที่คุณต้องดูแลรักษาเอง
โมเดลแบบทั่วไป แนวทางแบบใหม่จะฝึกโมเดลขนาดใหญ่หนึ่งตัวด้วยข้อมูลเสียงพูดที่หลากหลายมาก เพียงครั้งเดียว แล้วส่งมอบโมเดลเดียวกันนั้นให้ทุกคน โมเดล Whisper ของ OpenAI เป็นตัวอย่างแบบเปิดที่รู้จักกันดีที่สุด งานวิจัยต้นฉบับของ Whisper ระบุว่าฝึกด้วยข้อมูลเสียงประมาณ 680,000 ชั่วโมง ไม่มีขั้นตอนการฝึกเสียง — คุณติดตั้งแล้วเริ่มพูดได้เลย — และในทางกลับกันก็ไม่มีวิธีสอนให้เข้าใจเสียงของคุณโดยเฉพาะเช่นกัน สิ่งที่คุณได้รับในวันแรกก็โดยรวมแล้วเหมือนกับสิ่งที่ได้รับในภายหลัง นอกเหนือจากสิ่งที่ซอฟต์แวร์เพิ่มเติมเข้ามารอบๆ โมเดล เช่น รายการคำศัพท์ส่วนตัว
ไม่มีแนวทางใดดีกว่ากันอย่างเบ็ดเสร็จ หากคุณพูดสั่งงานด้วยคำศัพท์เฉพาะทางตลอดทั้งวัน การฝึกซอฟต์แวร์ให้เข้าใจก็คุ้มค่าเงินจริงๆ แต่หากคุณต้องการติดตั้งแล้วใช้งานได้เลยในบ่ายนี้ ขั้นตอนการฝึกเสียงก็เป็นเพียงต้นทุนที่ไม่มีข้อดีตอบแทน ส่วนว่าคุณเป็นแบบไหนนั้น ไม่มีเปอร์เซ็นต์ใดบอกคุณได้
ทดสอบด้วยเสียงของคุณเองภายในสิบนาที
นี่คือมาตรฐานเปรียบเทียบเพียงอย่างเดียวที่ตอบคำถามของคุณได้จริง และทำได้ง่ายกับเครื่องมือพูดสั่งงานตัวใดก็ได้ที่มีให้ทดลองใช้ — รวมถึงตัวฟรีที่มีอยู่แล้วในคอมพิวเตอร์ของคุณ
- เขียนข้อความสั้นๆ ไว้ก่อน — ประมาณ 150 ถึง 200 คำ ใช้ข้อความที่คุณเขียนเอง ไม่ใช่ย่อหน้าตัวอย่าง ให้เป็นสไตล์อีเมลของคุณ เนื้อหาที่คุณเขียนจริง และชื่อที่คุณพิมพ์เป็นประจำ
- อ่านออกเสียงใส่ซอฟต์แวร์ ด้วยวิธีการพูดตามปกติของคุณ นั่งในตำแหน่งที่คุณนั่งเป็นประจำ
- เปรียบเทียบข้อความทั้งสองแบบเคียงข้างกัน และนับจำนวนการแทนที่คำ การหายไปของคำ และการเพิ่มคำเกิน แล้วหารด้วยจำนวนคำทั้งหมดของคุณ
- ลองทำซ้ำอีกครั้งด้วยไมโครโฟนหูฟัง หากรอบแรกคุณใช้ไมโครโฟนในตัวเครื่อง การเปลี่ยนแปลงเพียงจุดเดียวนี้มักคุ้มค่ากว่าการเปลี่ยนผลิตภัณฑ์เสียอีก
- จากนั้นลองทดสอบในสถานการณ์จริง พูดสั่งงานสิ่งที่ไม่ได้เตรียมสคริปต์ไว้ล่วงหน้า — เช่น อีเมลจริง — เพราะการพูดตามข้อความที่เขียนไว้ง่ายกว่าการพูดจากความคิดของตัวเอง และตัวเลขในรอบที่สองนี้คือตัวเลขที่คุณจะต้องใช้ชีวิตอยู่กับมันจริงๆ
ลองใช้ข้อความเดียวกันกับเครื่องมือสองหรือสามตัว แล้วคุณจะได้สิ่งที่ไม่มีรีวิวใดให้คุณได้: การเปรียบเทียบด้วยเสียงของคุณเอง ไมโครโฟนของคุณเอง และห้องของคุณเอง หากเครื่องมือใดไม่มีให้ทดลองใช้ก่อนจ่ายเงิน นั่นก็เป็นสิ่งที่ควรนำมาพิจารณาด้วยเช่นกัน
การอ่านผลลัพธ์
ค่า WER ที่ต่างกันไม่กี่เปอร์เซ็นต์นั้นสำคัญน้อยกว่าตำแหน่งที่ข้อผิดพลาดเกิดขึ้น ซอฟต์แวร์ที่พลาดคำสั้นๆ เป็นครั้งคราวแต่พิมพ์ชื่อทุกคนถูกต้อง ใช้งานได้น่าพอใจกว่าซอฟต์แวร์ที่มีคะแนนดีกว่าแต่พิมพ์ชื่อเพื่อนร่วมงานของคุณผิดเพี้ยน การแก้คำผิดใช้เวลาเพียงชั่วครู่ แต่การสังเกตเห็นมันต้องใช้ความใส่ใจ
ดังนั้นจงตัดสินจากข้อความที่ถอดออกมา ไม่ใช่จากตัวเลข อ่านสิ่งที่ได้ ถามตัวเองว่าต้องแก้ไขมากแค่ไหน และถามว่านั่นน้อยกว่าการพิมพ์เองหรือไม่ นั่นคือคำถามทั้งหมด
CaringDictate อยู่ตรงไหนในเรื่องนี้
เราไม่เผยแพร่เปอร์เซ็นต์ความแม่นยำ เราสามารถสร้างตัวเลขนั้นขึ้นมาได้ — ใครก็ทำได้ — แต่มันจะวัดจากการบันทึกเสียงที่ไม่ใช่เสียงของคุณ และการนำเสนอตัวเลขนั้นราวกับเป็นการทำนายประสบการณ์ของคุณก็จะทำให้เข้าใจผิดได้
CaringDictate ใช้โมเดลจดจำเสียงพูดแบบเปิดที่ทำงานบนคอมพิวเตอร์ของคุณเอง และมีให้เลือกหลายขนาดโมเดลเพื่อให้เหมาะกับเครื่องที่คุณมี มีการทดลองใช้ฟรี 7 วัน ซึ่งมีไว้เพื่อให้คำถามนี้ถูกตัดสินด้วยเสียงของคุณเอง ไม่ใช่ด้วยการตลาดของเรา หากการพิมพ์ด้วยเสียงแบบฟรีที่มีอยู่แล้วใน Windows ให้ผลลัพธ์ที่ดีพอสำหรับคุณเมื่อลองทดสอบตามวิธีข้างต้น นั่นก็เป็นผลลัพธ์ที่ดี — ใช้มันต่อไปและเก็บเงินของคุณไว้
จะไปต่อจากตรงนี้ที่ไหน
ช่อง อภิธานศัพท์การพิมพ์ด้วยเสียง อธิบายคำศัพท์ที่เหลือที่คุณจะพบระหว่างเลือกซื้อ ส่วน การเปรียบเทียบกับ Dragon ครอบคลุมความแตกต่างในระดับผลิตภัณฑ์ และ คู่มือความเป็นส่วนตัว ครอบคลุมเรื่องที่ว่าข้อมูลเสียงของคุณไปอยู่ที่ไหนในเครื่องมือแบบประมวลผลบนเครื่องเทียบกับแบบคลาวด์