Hầu hết những người dùng đọc chính tả bằng giọng nói không bao giờ nghĩ về việc giọng nói của họ thực sự đi đâu. Quảng cáo nói với bạn rằng phần mềm là "riêng tư" hoặc "an toàn" và bạn phần lớn tin vào điều đó. Đối với các cuộc trò chuyện về y tế, việc viết liên quan đến tài chính và thư từ cá nhân, niềm tin này đáng được xem xét kỹ hơn. Đây là những gì thực sự xảy ra khi bạn đọc chính tả vào các sản phẩm khác nhau.
Sự phân biệt giữa đám mây và cục bộ
Khả năng nhận dạng giọng nói có thể chạy ở hai nơi hoàn toàn khác nhau: trên một máy chủ nào đó trên internet (đám mây), hoặc trên chính bộ xử lý của máy tính bạn (cục bộ, trên thiết bị). Trải nghiệm người dùng tương tự nhau — bạn nói, các từ hiện ra — nhưng các tác động đối với quyền riêng tư rất khác nhau.
Đọc chính tả dựa trên đám mây gửi âm thanh giọng nói của bạn đến một máy chủ, nơi quá trình nhận dạng diễn ra, rồi gửi văn bản kết quả về lại. Giọng nói của bạn đã được tải lên hạ tầng của bên thứ ba. Việc âm thanh đó có được lưu trữ, ghi lại, dùng để huấn luyện, chia sẻ với đối tác hay xóa đi hay không hoàn toàn phụ thuộc vào chính sách của nhà cung cấp — thứ mà thường bạn đã không đọc.
Đọc chính tả cục bộ/trên thiết bị chạy quá trình nhận dạng trên chính bộ xử lý (CPU) của máy tính bạn bằng một mô hình đã tải về. Âm thanh giọng nói của bạn không bao giờ rời khỏi thiết bị. Không có gì để bất kỳ ai ghi lại, lưu trữ hay huấn luyện trên đó, vì không có gì được tải lên ngay từ đầu.
Công cụ nào thuộc loại nào, trong năm 2026
Cục bộ (giọng nói của bạn ở lại trên máy tính):
- CaringDictate — hoàn toàn cục bộ. Whisper Large v3 Turbo chạy trên CPU của bạn. Không có gì được tải lên, không bao giờ. Chính sách bảo mật tại đây.
- Dragon Professional Individual v16 — cục bộ. Công nghệ nhận dạng cũ hơn, nhưng chạy trên máy tính của bạn.
- Apple Dictation trên các máy Mac và iPhone mới hơn — cục bộ trên các thiết bị có Apple Neural Engine (máy Mac từ 2020, iPhone XS trở lên). Các thiết bị Apple cũ hơn gửi âm thanh đến máy chủ của Apple.
- Microsoft Voice Access trên Windows 11 — cục bộ.
- VoiceInk (Mac) — cục bộ.
Đám mây (giọng nói của bạn đi đến một máy chủ):
- Dragon Anywhere — chỉ chạy trên đám mây.
- Dragon Medical One — chỉ chạy trên đám mây.
- Otter.ai — chỉ chạy trên đám mây.
- Wispr Flow — dựa trên đám mây (dù quảng cáo ngụ ý ngược lại; khả năng nhận dạng của họ chạy trên máy chủ của họ).
- Google Docs Voice Typing — chỉ chạy trên đám mây. Âm thanh được gửi đến Google.
- Voiceitt — chỉ chạy trên đám mây.
- Các thiết bị Apple cũ hơn — đám mây, âm thanh được gửi đến máy chủ của Apple.
Đối với những người dùng có các cuộc trò chuyện liên quan đến HIPAA, các cuộc thảo luận tài chính nhạy cảm, lo ngại về đặc quyền pháp lý, hay đơn giản là thích không để bên thứ ba nghe được — nhóm đám mây là điều dứt khoát không chấp nhận.
Cụm từ "tuân thủ HIPAA" thường có nghĩa là gì (và không phải là gì)
Nhiều dịch vụ đọc chính tả trên đám mây quảng cáo là "tuân thủ HIPAA." Điều này nghe như một sự bảo đảm về quyền riêng tư. Phần lớn thì không phải vậy.
Việc tuân thủ HIPAA đối với một nhà cung cấp đám mây thường có nghĩa là nhà cung cấp đã ký Thỏa thuận Đối tác Kinh doanh (Business Associate Agreement) với các đơn vị được bảo hộ (bệnh viện, phòng khám), triển khai một số biện pháp kiểm soát truy cập, và tuân theo một số yêu cầu kiểm toán. Nó không có nghĩa là giọng nói của bạn không bị tải lên máy chủ của họ. Nó có nghĩa là họ xử lý việc tải lên đó theo các quy tắc HIPAA — điều vẫn bao gồm việc lưu trữ dữ liệu, có nhân viên truy cập được vào đó, và (trong nhiều trường hợp) dùng nó cho việc cải thiện dịch vụ.
Đối với một bệnh nhân hay thành viên gia đình muốn giọng nói của mình không bao giờ rời khỏi máy tính, phép thử đúng đắn không phải là "nó có tuân thủ HIPAA không?" Phép thử đúng đắn là "nó có chạy cục bộ không?" Nếu câu trả lời là có, thì quyền riêng tư được bảo đảm về mặt kỹ thuật bởi kiến trúc, chứ không phải bởi chính sách. Nếu câu trả lời là không — ngay cả khi dịch vụ đám mây tuân thủ HIPAA — thì giọng nói của bạn đã bị tải lên.
Những gì thực sự được lưu trữ, ngay cả trên các dịch vụ đám mây
Đối với các dịch vụ đọc chính tả trên đám mây, những gì được lưu trữ khác nhau. Các kiểu phổ biến bao gồm:
- Bản ghi âm — được giữ lại để cải thiện dịch vụ, gỡ lỗi, hoặc huấn luyện mô hình. Một số dịch vụ cho phép bạn từ chối tham gia; nhiều dịch vụ thì không.
- Bản chép lời — các văn bản đầu ra thường được lưu trữ vô thời hạn. Hầu hết người dùng không nhận ra rằng bản chép lời của mọi thứ họ đọc chính tả vẫn tồn tại trên đám mây.
- Siêu dữ liệu (Metadata) — thời gian, thông tin thiết bị, địa chỉ IP. Hữu ích cho phân tích, nhưng nó vẫn là dữ liệu về việc sử dụng của bạn.
- Hồ sơ giọng nói — một số dịch vụ xây dựng hồ sơ về giọng nói của bạn theo thời gian để nhận dạng tốt hơn. Đây đúng nghĩa là một dấu vân giọng, vốn có những tác động về mặt sinh trắc học.
Không có thứ nào trong số này tồn tại đối với các công cụ đọc chính tả cục bộ, vì không có gì được tải lên.
Câu hỏi về "huấn luyện AI"
Nhiều người giờ đây hoàn toàn có lý khi cảnh giác với việc để giọng nói hay bài viết của mình bị dùng để huấn luyện các mô hình AI. Các dịch vụ đọc chính tả trên đám mây thường (không phải lúc nào cũng) có các điều khoản dữ liệu huấn luyện trong điều khoản dịch vụ của họ. Những điều khoản này cấp cho nhà cung cấp một giấy phép để dùng âm thanh và bản chép lời của bạn nhằm cải thiện các mô hình nhận dạng của họ.
Với một số người, điều này không sao. Với những người khác — đặc biệt là những người viết về bệnh lý y khoa, chuyện gia đình, hay công việc được bảo vệ trí tuệ — điều này không thể chấp nhận được. Cách phòng vệ là dùng đọc chính tả cục bộ. Với CaringDictate (và bất kỳ công cụ hoàn toàn cục bộ nào khác), không có gì được tải lên, nên không có gì để huấn luyện.
Câu hỏi về việc bắt buộc phải có internet
Một vấn đề liên quan nhưng riêng biệt: đọc chính tả trên đám mây cần internet. Nếu internet ở nhà bạn bị ngắt, đọc chính tả trên đám mây của bạn không hoạt động. Nếu bạn đang đi đến nơi nào đó có kết nối kém, chất lượng đọc chính tả của bạn có thể giảm sút hoặc hỏng hoàn toàn. Đối với những người phụ thuộc vào đọc chính tả vì lý do hỗ trợ tiếp cận, sự phụ thuộc vào một kết nối internet ổn định này là một điểm yếu.
Đọc chính tả cục bộ hoạt động mà không cần internet. CaringDictate tải mô hình nhận dạng về một lần trong quá trình cài đặt ban đầu, và từ thời điểm đó trở đi, nó hoạt động hoàn toàn ngoại tuyến. Điều này quan trọng cho việc đi lại, cho các kết nối chập chờn, và cho những trường hợp (ngày càng hiếm) khi bạn đơn giản là không muốn máy tính của mình liên tục gửi dữ liệu về cho mọi thứ.
Cách CaringDictate xử lý quyền riêng tư cụ thể
Kiến trúc của chúng tôi được thiết kế đơn giản một cách có chủ đích để dễ kiểm chứng:
- Whisper Large v3 Turbo (động cơ nhận dạng) được tải về một lần trong quá trình cài đặt và lưu trên máy tính của bạn.
- Khi bạn đọc chính tả, âm thanh được micro thu lại, được Whisper xử lý trên CPU của bạn, và chuyển thành văn bản. Bộ đệm âm thanh sau đó bị loại bỏ.
- Văn bản được chèn vào bất kỳ trường văn bản nào đang có con trỏ.
- Không có gì được gửi qua internet. Không có gì được ghi lại. Không có gì được lưu trữ.
- Bạn có thể kiểm chứng điều này bằng bất kỳ công cụ giám sát mạng nào — CaringDictate không tạo ra kết nối đi ra nào trong quá trình đọc chính tả.
Lưu lượng mạng duy nhất mà CaringDictate từng tạo ra là trong quá trình cài đặt ban đầu (tải mô hình nhận dạng và bất kỳ lần kiểm tra cập nhật nào). Một khi đã cài đặt, nó hoàn toàn ngoại tuyến.
Khuyến nghị thực tế theo từng trường hợp sử dụng
Cho việc đọc chính tả thông thường (email, tài liệu, biểu mẫu web): Bất kỳ công cụ đọc chính tả cục bộ nào cũng được — CaringDictate, Dragon, hoặc Apple Dictation trên một máy Mac mới hơn.
Cho các cuộc trò chuyện về y tế hoặc công việc liên quan đến HIPAA: Chỉ chạy cục bộ là câu trả lời đúng. CaringDictate được xây dựng riêng cho việc này; Dragon Professional đời cũ cũng hoạt động (dù nó thiếu cập nhật).
Cho các cuộc họp bạn muốn được phiên âm: Otter.ai là lựa chọn tiêu chuẩn nhưng dựa trên đám mây — hãy chắc chắn mọi người trong cuộc họp đồng ý với điều đó.
Cho việc viết cá nhân nhạy cảm về quyền riêng tư (nhật ký, hồi ký): Chắc chắn nên dùng cục bộ. CaringDictate hoặc Apple Dictation đời cũ. Tránh hoàn toàn các dịch vụ đám mây.
Đi tiếp từ đây như thế nào
Để biết toàn bộ chi tiết kỹ thuật về cách CaringDictate xử lý dữ liệu của bạn, hãy xem chính sách bảo mật của chúng tôi. Để so sánh với các lựa chọn thay thế dựa trên đám mây, hãy xem so với Dragon Anywhere, so với Wispr Flow, so với Otter.ai.