No deberías necesitar un traductor para comprar una herramienta cuyo único trabajo es convertir tus palabras en texto. Esta página define cada término que encontrarás al comparar software de dictado — incluyendo los de nuestras propias pantallas de configuración. Cada definición es una oración; los detalles posteriores son lectura opcional.
Lo básico
Dictado
El dictado es hablar en voz alta mientras el software convierte tus palabras en texto escrito. La gente también lo llama escritura por voz o voz a texto. Los tres nombres significan lo mismo: tú hablas, el ordenador escribe.
Escritura por voz
La escritura por voz es otro nombre para el dictado: hablar en lugar de teclear, con las palabras apareciendo allá donde esté tu cursor de texto. Windows llama a su herramienta integrada "escritura por voz" (la función Win+H). CaringDictate hace el mismo trabajo en la mayoría de los programas, sin los tiempos de espera de la herramienta integrada.
Voz a texto
Voz a texto es la tecnología que convierte el audio hablado en palabras escritas. Lo verás abreviado como STT en artículos técnicos. Cuando un producto dice "impulsado por voz a texto", significa dictado.
Reconocimiento de voz
El reconocimiento de voz es el campo más amplio de las computadoras que entienden el habla humana — tanto lo que dijiste (dictado) como lo que quisiste decir (comandos). Una aplicación de dictado utiliza el reconocimiento de voz para escribir tus palabras. Un asistente de voz lo utiliza para actuar sobre ellas.
Transcripción
La transcripción es convertir una grabación de voz — una reunión, una entrevista, un mensaje de voz — en un documento escrito después del hecho. El dictado es en vivo (ves las palabras aparecer mientras hablas); la transcripción suele ocurrir más tarde, a partir de un archivo. Herramientas como Otter.ai son herramientas de transcripción, no herramientas de dictado.
Cómo funciona el reconocimiento
Modelo de voz (modelo de reconocimiento)
Un modelo de voz es el cerebro entrenado de un programa de dictado: el archivo que de verdad entiende el habla. Los modelos más grandes suelen ser más precisos, pero necesitan un ordenador más potente. CaringDictate elige el tamaño de modelo que se adapta a tu máquina, desde unos 190 MB hasta unos 3.1 GB.
Whisper
Whisper es una familia de modelos de voz de código abierto lanzada por OpenAI en 2022, conocida por su precisión casi humana en muchos idiomas. Es el motor detrás de muchos productos modernos de dictado y transcripción, incluido CaringDictate. Debido a que es de código abierto, puede ejecutarse completamente en tu propio ordenador.
Reconocimiento en el dispositivo (sin conexión)
El reconocimiento en el dispositivo significa que tu voz se procesa en tu propio ordenador; el audio nunca viaja al servidor de una empresa. Esto funciona sin internet, mantiene tus pensamientos privados y nunca deja de funcionar porque un servicio esté caído. Así es como funciona CaringDictate.
Reconocimiento en la nube
El reconocimiento en la nube significa que su voz se transmite por internet a los servidores de una empresa, se convierte en texto allí y se envía de vuelta. El reconocimiento ocurre en un servidor y no en su equipo. Dónde realiza el reconocimiento cada herramienta se indica en su propia documentación, y algunos productos ofrecen ambas opciones; vale la pena comprobarlo en lugar de suponerlo.
Precisión (tasa de error de palabras)
La precisión es el porcentaje de palabras que un programa de dictado acierta; la tasa de error por palabra (WER) es la misma idea medida al revés: el porcentaje que falla. El dictado moderno basado en Whisper es muy preciso con habla clara en inglés. Los resultados varían según la calidad del micrófono, el ruido de fondo y lo claro que hables.
Latencia
La latencia es el retraso entre terminar una frase y ver aparecer el texto. Menos de un tercio de segundo se siente instantáneo; mucho más allá de eso se siente lento. El reconocimiento en el dispositivo evita el viaje de ida y vuelta a un servidor, lo que ayuda.
Detección automática de idioma
La detección automática de idioma significa que el software averigua qué idioma estás hablando sin que se lo digas. Útil si cambias de idioma a mitad del día. La configuración "Automática" de CaringDictate hace esto en sus 20 idiomas compatibles.
Uso diario de una aplicación de dictado
Botón de hablar (tecla de acceso rápido)
El botón de hablar es la única tecla o botón del ratón que inicia y detiene el dictado. En CaringDictate, el valor predeterminado es la tecla Ctrl derecha, y puedes cambiarlo a cualquier tecla o botón del ratón que sea cómodo para tus manos.
Pulsar para hablar (mantener pulsado para hablar)
Pulsar para hablar significa mantener pulsado el botón de hablar mientras hablas y soltarlo cuando terminas, como un walkie-talkie. Bueno para ráfagas cortas: un cuadro de búsqueda, una respuesta rápida. La alternativa es tocar para alternar, mejor para escribir textos más largos.
Alternar (tocar para hablar)
El modo de alternancia significa tocar el botón de hablar una vez para empezar a escuchar y tocar de nuevo para detenerse. Tus manos quedan completamente libres entretanto, lo que es útil cuando mantener una tecla pulsada es incómodo o cuando dictas pasajes largos.
Palabra de activación (activación por voz)
Una palabra de activación es una frase que dices en voz alta —como "empezar a dictar"— que inicia el dictado sin tocar el teclado ni el ratón en absoluto. Esto es más importante cuando llegar al teclado es la parte difícil. CaringDictate añadió la activación por voz configurable por el usuario en la versión 3.5.
Indicador de escucha
El indicador de escucha es la pequeña señal en pantalla que muestra que el micrófono está activo y que tus palabras están siendo escuchadas. Un indicador fiable es importante: nunca deberías tener que preguntarte si el ordenador está escuchando.
Comandos de voz
Los comandos de voz son instrucciones habladas —como "nueva línea" o "borrar eso"— que controlan el formato en lugar de escribir palabras. Las aplicaciones de dictado difieren mucho aquí. Los comandos simples cubren la mayoría de la escritura diaria; el control informático manos libres intensivo es una categoría separada (ver Voice Access).
Comandos de puntuación
Los comandos de puntuación consisten en decir "punto", "coma" o "signo de interrogación" en voz alta para insertar puntuación. Los motores modernos como Whisper también puntúan automáticamente a partir de tu fraseo y pausas, por lo que a menudo puedes hablar con naturalidad.
Diccionario personalizado (lista de palabras)
Un diccionario personalizado es tu lista personal de nombres y palabras especiales en las que el reconocedor debe confiar: nombres de familiares, nombres de medicamentos, jerga de la industria. Añadir "Zofran" u "Oaxaca" una vez es mejor que corregirlo para siempre. CaringDictate incluye uno en Escritura y palabras.
Inserción de texto
La inserción de texto es cómo las palabras dictadas llegan físicamente a tu documento: la aplicación las escribe pulsación por pulsación o las pega de una sola vez. Pegar frases completas es más rápido y mucho más fiable en diferentes programas, por lo que CaringDictate entrega el texto de esa manera.
Términos específicos de Windows
Win+H (escritura por voz de Windows)
Win+H es el atajo de teclado que abre la barra de escritura por voz integrada de Windows en Windows 10 y 11. Es gratuita, viene integrada en Windows y es una opción sensata para probar primero en el dictado diario. Windows 11 también incluye Voice Access, que añade control total del PC por voz junto con vocabulario personalizado y corrección de texto.
Windows Voice Access
Voice Access es la función de control de computadora manos libres de Windows 11 — hacer clic, desplazarse y cambiar ventanas por voz, con dictado incluido. Está diseñado para el control completo de la computadora por voz. Si lo que principalmente quieres es escribir cómodamente, una herramienta de dictado dedicada suele ser la mejor opción.
Reconocimiento de voz de Windows (WSR)
El Reconocimiento de voz de Windows es la herramienta de dictado integrada más antigua que Microsoft ha dejado de usar en favor de Voice Access. Si dependías de WSR en una PC antigua, su retirada suele ser el momento de elegir un reemplazo deliberadamente en lugar de heredar la herramienta que Windows ofrezca a continuación.
Configuración de privacidad del micrófono
La configuración de privacidad del micrófono son los interruptores de Windows que deciden qué programas pueden usar tu micrófono. Si una aplicación de dictado no escucha nada, este es el primer lugar donde buscar: Configuración → Privacidad y seguridad → Micrófono.
Micrófono predeterminado
El micrófono predeterminado es el que Windows asigna a los programas a menos que elijan uno diferente. Las laptops a menudo tienen varios (integrado, auriculares, cámara web). Elegir el correcto — cerca de tu boca, lejos de los ventiladores — mejora la precisión más que cualquier configuración.
Términos de compra
Compra única (licencia perpetua)
Una compra única significa pagar una vez y ser dueño del software — sin cuota mensual o anual para seguir usándolo. CaringDictate cuesta $49 una vez, con actualizaciones incluidas. El modelo alternativo, las suscripciones, sigue cobrando mientras sigas escribiendo.
Suscripción
Una suscripción es pagar mensual o anualmente por el acceso continuo al software — si dejas de pagar, deja de funcionar. Razonable para servicios con costos de servidor continuos; más difícil de justificar para una herramienta que se ejecuta completamente en tu propia computadora. Compara los totales de cinco años antes de elegir.
Puesto (licencia por dispositivo)
Un puesto es una copia instalada de un programa; una licencia de 3 puestos cubre tres de tus computadoras. La licencia de $49 de CaringDictate incluye 3 puestos — escritorio, laptop y uno más.
Prueba gratuita
Una prueba gratuita es un período de prueba con todas las funciones antes de pagar — la de CaringDictate dura 7 días sin necesidad de tarjeta. Una prueba en tu propia computadora, con tu propio micrófono y tu propia voz, supera cualquier reseña o tabla de precisión.
Actualizaciones gratuitas
Actualizaciones gratuitas significa que las versiones nuevas del software están incluidas en el precio que ya pagaste, sin una tarifa de mejora aparte. Vale la pena comprobarlo antes de comprar cualquier software de pago único: algunas licencias "perpetuas" te congelan en la versión que compraste y vuelven a cobrarte por las mejoras.
Límite de palabras (límite de uso)
Un límite de palabras es una restricción sobre cuánto puedes dictar — común en los niveles gratuitos de los servicios de dictado por suscripción. Las herramientas en el dispositivo no tienen razón para medirte; no hay factura de servidor. CaringDictate no tiene límite.
Aceleración por GPU
La aceleración por GPU significa usar el chip gráfico de tu computadora para ejecutar el modelo de voz más rápido de lo que podría el procesador principal. Es por eso que una laptop para juegos transcribe notablemente más rápido. No es un requisito — CaringDictate también funciona en máquinas ordinarias con modelos más pequeños.
Requisitos del sistema
Los requisitos del sistema son las especificaciones mínimas de ordenador que un programa necesita para funcionar bien. Para CaringDictate: Windows 10 (64 bits, versión 1903) o Windows 11, 4 GB de RAM y unos pocos GB de espacio libre en disco.
La versión corta
Dictado, escritura por voz y voz a texto significan lo mismo: tú hablas, la computadora escribe. Las elecciones que realmente importan al comprar son dónde se procesa tu voz (en tu computadora o en el servidor de alguien), cómo lo inicias y detienes (un cómodo botón para hablar, o una palabra de activación), y cómo pagas (una vez, o para siempre). Las respuestas de CaringDictate son: en tu computadora, cualquier botón que te guste — $49 una sola vez, con una prueba de 7 días prueba gratuita para comprobar primero si se adapta a tu voz.