Nếu quý vị đã và đang so sánh các phần mềm đọc chính tả, có lẽ quý vị đã thu thập được một vài con số phần trăm — 99%, 97%, 95% — và nhận ra rằng chúng không giúp ích gì cho việc lựa chọn. Không phải vì những con số đó không trung thực. Mà vì một con số độ chính xác duy nhất trả lời một câu hỏi khác với câu hỏi mà quý vị đang đặt ra.
Điều quý vị muốn biết là: phần mềm này sẽ hiểu tôi tốt đến đâu, tại bàn làm việc của tôi, với micro của tôi? Một con số độ chính xác được công bố trả lời câu hỏi: công cụ này đã ghi lại tốt đến đâu một tập bản ghi âm cụ thể mà cả tôi và quý vị đều chưa từng nghe qua? Hai câu hỏi này có thể có câu trả lời rất khác nhau.
Trang này giải thích cách đo lường hoạt động, để quý vị có thể đọc bất kỳ con số nào của nhà cung cấp — kể cả con số quý vị thấy về chúng tôi — và biết được giá trị thực sự của nó.
Tỷ lệ lỗi từ, giải thích bằng ngôn ngữ dễ hiểu
Độ chính xác của việc nhận diện giọng nói thường được báo cáo dưới dạng tỷ lệ lỗi từ, thường viết tắt là WER. Đó là tỷ lệ số từ bị sai. Con số càng thấp càng tốt, và "chính xác 95%" chỉ là một cách viết khác của "WER 5%".
Điều được tính là sai cụ thể hơn nhiều so với những gì hầu hết mọi người nghĩ. Có ba loại lỗi, và chúng được cộng lại với nhau:
- Thay thế — một từ được ghi ra thành một từ khác. Quý vị nói "their", phần mềm gõ ra "there".
- Bỏ sót — một từ quý vị đã nói bị thiếu trong bản ghi.
- Thêm thừa — một từ xuất hiện mà quý vị chưa bao giờ nói. Tiếng nói xung quanh và tiếng thở là nguyên nhân gây ra lỗi này.
Cộng cả ba loại lại rồi chia cho số từ quý vị thực sự đã nói. Giả sử quý vị đọc một đoạn văn 100 từ và bản ghi có bốn từ sai, một từ bị thiếu và một từ thừa: đó là sáu lỗi trong 100 từ, tức WER 6%, hay "chính xác 94%".
Có một hệ quả đáng để biết, vì nó giải thích rất nhiều nội dung tiếp thị gây khó hiểu: WER có thể vượt quá 100%. Nếu phần mềm thêm vào nhiều từ hơn số từ quý vị đã nói — điều này xảy ra trong phòng ồn ào — số lỗi có thể lớn hơn cả số từ. Một con số không thể vượt quá 100 thì không phải là tỷ lệ lỗi từ.
Vì sao cùng một phần mềm lại cho hai người kết quả khác nhau
Công cụ nhận diện chỉ là một trong những yếu tố quyết định độ chính xác của quý vị, và thường không phải là yếu tố quan trọng nhất. Phần còn lại nằm ở hoàn cảnh của quý vị:
- Micro của quý vị, và vị trí đặt micro. Đây thường là yếu tố lớn nhất, và cũng là yếu tố rẻ nhất để khắc phục. Một micro tai nghe đặt cách miệng vài centimet sẽ nghe được điều khác hẳn so với micro trên laptop đặt cách xa bên kia bàn.
- Căn phòng. Tiếng ti vi phía sau, quạt máy, cửa sổ mở, căn phòng bề mặt cứng gây vang. Tất cả những âm thanh đó đều lọt vào bộ nhận diện cùng với giọng nói của quý vị.
- Nội dung quý vị đang đọc. Văn bản đời thường là trường hợp dễ nhất. Tên riêng, thuật ngữ y tế hoặc pháp lý, mã số linh kiện, địa chỉ và từ viết tắt khó hơn nhiều, vì phần mềm phải chọn giữa những từ nghe giống nhau.
- Cách quý vị nói. Giọng địa phương, tốc độ, âm lượng, việc quý vị có nói dồn các câu vào nhau hay không, có nói nhỏ dần cuối câu hay không. Không điều nào trong số này là lỗi của quý vị — đó đơn giản chỉ là những khác biệt mà công cụ hoặc xử lý được hoặc không.
- Mô hình quý vị đang chạy. Hầu hết phần mềm xử lý trên máy đều đi kèm nhiều mô hình với kích thước khác nhau. Một mô hình nhỏ chạy mượt trên laptop cũ thường sẽ mắc nhiều lỗi hơn một mô hình lớn chạy trên máy nhanh.
Hai người chạy cùng một phần mềm, với cùng cài đặt, vẫn có thể chênh nhau vài điểm phần trăm chỉ vì những yếu tố này. Đó là khoảng cách mà không con số công bố nào có thể lấp đầy giúp quý vị.
Con số kiểm định thực sự đang đo lường điều gì
Các tỷ lệ lỗi từ được công bố đến từ những bộ dữ liệu nghiên cứu tiêu chuẩn — các tập bản ghi âm cố định kèm bản ghi văn bản đã xác minh, để các hệ thống khác nhau có thể được chấm điểm trên cùng một tài liệu. Điều này thực sự hữu ích cho những người xây dựng phần mềm: đó là cách để biết mô hình của tháng này có tốt hơn tháng trước hay không.
Nhưng nó ít hữu ích hơn nhiều khi dùng làm căn cứ để chọn mua, vì ba lý do sau:
- Bản ghi âm đó không phải là quý vị. Âm thanh dùng để kiểm định có giọng riêng, micro riêng và chủ đề riêng, không có yếu tố nào trong số đó là của quý vị.
- Mỗi nhà cung cấp báo cáo một bài kiểm tra khác nhau. Hai con số được đo trên hai bộ dữ liệu khác nhau không thể so sánh với nhau, kể cả khi cả hai đều được báo cáo trung thực. Giọng đọc sách nói và cuộc trò chuyện tự nhiên cho ra điểm số rất khác nhau dù cùng một công cụ.
- Điều kiện đo lường thường bị bỏ qua không nhắc đến. Một con số được nêu ra mà không kèm bộ dữ liệu, loại micro và phong cách nói thì không phải là một tuyên bố quý vị có thể kiểm chứng.
Khi quý vị thấy một con số, câu hỏi hữu ích không phải là "con số này có cao không?" mà là "được đo trên cái gì?" Nếu điều đó không được nêu rõ, con số đó chỉ mang tính trang trí.
Hai triết lý thiết kế khác nhau
Có một khác biệt kỹ thuật thực sự giữa cách tiếp cận nhận diện cũ và mới, và điều này đáng để hiểu vì nó làm thay đổi ý nghĩa của "độ chính xác" đối với từng sản phẩm cụ thể.
Hồ sơ được huấn luyện. Cách tiếp cận truyền thống trên máy tính để bàn xây dựng một hồ sơ riêng cho giọng nói và từ vựng của quý vị. Quý vị bỏ thời gian ban đầu, và có thể tiếp tục dạy cho phần mềm — thêm thuật ngữ riêng, tên đồng nghiệp, các từ chuyên ngành của mình. Dragon là sản phẩm nổi tiếng nhất được xây dựng theo cách này, và tài liệu của chính Nuance tuyên bố độ chính xác nhận diện lên đến 99%. Điểm đánh đổi là thời gian thiết lập, và việc hồ sơ đó là của quý vị nên quý vị phải tự duy trì nó.
Mô hình tổng quát. Cách tiếp cận mới hơn huấn luyện một mô hình lớn duy nhất trên phạm vi giọng nói rất rộng, chỉ một lần, rồi phân phối cùng một mô hình đó cho tất cả mọi người. Các mô hình Whisper của OpenAI là ví dụ mã nguồn mở nổi tiếng nhất; bài báo gốc về Whisper mô tả việc huấn luyện trên khoảng 680.000 giờ âm thanh. Không có bước đăng ký huấn luyện nào — quý vị cài đặt và bắt đầu nói ngay — và cũng không có cách nào để dạy phần mềm giọng nói của quý vị. Những gì quý vị nhận được vào ngày đầu tiên nhìn chung cũng giống như những gì quý vị nhận được sau này, ngoại trừ những gì phần mềm bổ sung xung quanh mô hình, chẳng hạn như danh sách từ cá nhân.
Không cách tiếp cận nào đơn giản là tốt hơn cách kia. Nếu quý vị đọc chính tả từ vựng chuyên ngành suốt cả ngày, khả năng huấn luyện phần mềm thực sự đáng giá. Nếu quý vị chỉ muốn cài đặt và sử dụng ngay chiều nay, một buổi đăng ký huấn luyện chỉ là chi phí mà không đem lại lợi ích gì thêm. Trường hợp nào đúng với quý vị thì không một con số phần trăm nào có thể cho quý vị biết.
Tự kiểm tra bằng giọng nói của quý vị chỉ trong mười phút
Đây là phép kiểm định duy nhất trả lời được câu hỏi của quý vị, và rất dễ thực hiện với bất kỳ công cụ đọc chính tả nào có bản dùng thử — kể cả những công cụ miễn phí đã có sẵn trên máy tính của quý vị.
- Trước tiên hãy viết ra một đoạn văn ngắn — khoảng 150 đến 200 từ. Hãy dùng văn bản của chính quý vị, không phải một đoạn mẫu: phong cách viết email của quý vị, chủ đề của quý vị, những tên riêng quý vị thực sự hay gõ.
- Đọc to đoạn văn đó vào phần mềm theo cách quý vị vẫn thường nói, ngồi ở nơi quý vị vẫn thường ngồi.
- So sánh hai bản với nhau và đếm số lỗi thay thế, bỏ sót và thêm thừa. Chia cho tổng số từ quý vị đã nói.
- Lặp lại một lần nữa với micro tai nghe nếu lần đầu quý vị dùng micro tích hợp sẵn. Chỉ riêng thay đổi này thường đáng giá hơn cả việc đổi sang sản phẩm khác.
- Sau đó hãy thử một lần trong tình huống thực tế. Đọc chính tả điều gì đó không chuẩn bị trước — một email thật — vì đọc từ một trang viết sẵn dễ hơn là nói từ trong đầu, và con số thứ hai này mới là con số quý vị sẽ thực sự sống cùng.
Chạy cùng một đoạn văn qua hai hoặc ba công cụ và quý vị sẽ có được điều mà không bài đánh giá nào có thể mang lại: một sự so sánh trên chính giọng nói, micro và căn phòng của quý vị. Nếu một công cụ không cho phép dùng thử trước khi trả tiền, đó cũng là điều đáng cân nhắc.
Đọc hiểu kết quả
Vài điểm phần trăm chênh lệch trong WER không quan trọng bằng việc lỗi rơi vào đâu. Một phần mềm thỉnh thoảng bỏ sót vài từ ngắn nhưng luôn đúng mọi tên riêng sẽ dễ chịu hơn khi dùng so với một phần mềm có điểm số cao hơn nhưng lại làm sai tên đồng nghiệp của quý vị. Sửa một từ sai chỉ tốn một chút thời gian; nhận ra nó mới là điều tốn sự chú ý.
Vì vậy, hãy đánh giá bản ghi văn bản, không phải con số. Đọc lại những gì hiện ra, tự hỏi cần chỉnh sửa bao nhiêu, và tự hỏi liệu điều đó có ít công sức hơn so với việc tự gõ hay không. Đó chính là toàn bộ câu hỏi cần trả lời.
Vị trí của CaringDictate
Chúng tôi không công bố một con số phần trăm độ chính xác. Chúng tôi có thể tạo ra một con số như vậy — ai cũng có thể làm được — nhưng nó sẽ được đo trên những bản ghi âm không phải là giọng nói của quý vị, và việc trình bày nó như một dự đoán về trải nghiệm của quý vị sẽ gây hiểu lầm.
CaringDictate sử dụng các mô hình nhận diện giọng nói mã nguồn mở chạy ngay trên máy tính của quý vị, và đi kèm nhiều kích thước mô hình khác nhau để phù hợp với máy quý vị đang dùng. Có bản dùng thử miễn phí bảy ngày, tồn tại chính là để câu hỏi này được trả lời bằng giọng nói thật của quý vị chứ không phải bằng lời quảng cáo của chúng tôi. Nếu tính năng gõ chữ bằng giọng nói miễn phí đã tích hợp sẵn trong Windows đạt kết quả đủ tốt khi quý vị chạy bài kiểm tra ở trên, đó là một kết quả tốt — hãy dùng nó và giữ lại tiền của mình.
Đi tiếp từ đây như thế nào
Ô bảng thuật ngữ gõ chữ bằng giọng nói giải thích phần từ vựng còn lại quý vị sẽ gặp khi tìm mua sản phẩm. Còn bài so sánh với Dragon đề cập đến những khác biệt ở cấp độ sản phẩm, và hướng dẫn về bảo mật đề cập đến việc âm thanh của quý vị đi đâu khi so sánh giữa công cụ xử lý cục bộ và công cụ đám mây.