Nie powinieneś potrzebować tłumacza, aby kupić narzędzie, którego całe zadanie polega na zamianie Twoich słów w tekst. Ta strona definiuje każdy termin, który napotkasz podczas porównywania oprogramowania do dyktowania — w tym te z naszych własnych ekranów ustawień. Każda definicja to jedno zdanie; szczegóły po niej są opcjonalną lekturą.
Podstawy
Dyktowanie
Dyktowanie to mówienie na głos, podczas gdy oprogramowanie zamienia Twoje słowa w tekst pisany. Ludzie nazywają to również pisaniem głosowym lub mową na tekst. Wszystkie trzy nazwy oznaczają to samo: Ty mówisz, komputer pisze.
Pisanie głosowe
Pisanie głosem to inna nazwa dyktowania — mówienie zamiast pisania, przy czym słowa pojawiają się tam, gdzie znajduje się kursor tekstowy. Windows nazywa swoje wbudowane narzędzie „pisaniem głosowym” (funkcja Win+H). CaringDictate wykonuje to samo zadanie w większości programów, bez limitów czasu wbudowanego narzędzia.
Mowa na tekst
Mowa na tekst to technologia, która konwertuje mówiony dźwięk na słowa pisane. W artykułach technicznych zobaczysz ją skróconą jako STT. Kiedy produkt mówi „zasilany przez mowę na tekst”, oznacza to dyktowanie.
Rozpoznawanie mowy
Rozpoznawanie mowy to szersza dziedzina, w której komputery rozumieją ludzką mowę — zarówno to, co powiedziałeś (dyktowanie), jak i to, co miałeś na myśli (polecenia). Aplikacja do dyktowania używa rozpoznawania mowy do zapisywania Twoich słów. Asystent głosowy używa jej do działania na ich podstawie.
Transkrypcja
Transkrypcja to zamiana nagrania mowy — spotkania, wywiadu, poczty głosowej — w dokument pisany po fakcie. Dyktowanie jest na żywo (obserwujesz, jak słowa pojawiają się, gdy mówisz); transkrypcja zazwyczaj odbywa się później, z pliku. Narzędzia takie jak Otter.ai to narzędzia do transkrypcji, a nie do dyktowania.
Jak działa rozpoznawanie
Model głosowy (model rozpoznawania)
Model głosowy to wytrenowany mózg programu do dyktowania — plik, który faktycznie rozumie mowę. Większe modele są zwykle dokładniejsze, ale wymagają mocniejszego komputera. CaringDictate wybiera rozmiar modelu, który pasuje do Twojej maszyny, od około 190 MB do około 3.1 GB.
Whisper
Whisper to otwartoźródłowa rodzina modeli głosowych wydana przez OpenAI w 2022 roku, znana z niemal ludzkiej dokładności w wielu językach. Jest to silnik stojący za wieloma nowoczesnymi produktami do dyktowania i transkrypcji, w tym CaringDictate. Ponieważ jest to oprogramowanie open source, może działać w całości na Twoim własnym komputerze.
Rozpoznawanie na urządzeniu (offline)
Rozpoznawanie na urządzeniu oznacza, że Twoja mowa jest przetwarzana na Twoim własnym komputerze — dźwięk nigdy nie trafia na serwer firmy. Działa to bez internetu, zachowuje prywatność myśli i nigdy nie przestaje działać z powodu awarii usługi. Tak właśnie działa CaringDictate.
Rozpoznawanie w chmurze
Rozpoznawanie w chmurze oznacza, że głos jest przesyłany przez internet na serwery firmy, tam zamieniany na tekst i odsyłany z powrotem. Rozpoznawanie odbywa się na serwerze, a nie na własnym komputerze. To, gdzie dane narzędzie przeprowadza rozpoznawanie mowy, określa jego własna dokumentacja, a niektóre produkty oferują obie opcje — warto to sprawdzić, zamiast zakładać.
Dokładność (wskaźnik błędów słownych)
Dokładność to procent słów, które program do dyktowania rozpoznaje poprawnie; współczynnik błędów słów (WER) to ta sama idea mierzona odwrotnie — procent słów, które rozpoznaje błędnie. Nowoczesne dyktowanie oparte na Whisper jest bardzo dokładne przy wyraźnej mowie angielskiej. Wyniki zależą od jakości mikrofonu, hałasu w tle i tego, jak wyraźnie mówisz.
Opóźnienie
Opóźnienie to czas między zakończeniem zdania a pojawieniem się tekstu. Poniżej około jednej trzeciej sekundy wydaje się natychmiastowe; znacznie dłużej sprawia wrażenie opóźnienia. Rozpoznawanie na urządzeniu pozwala uniknąć podróży w obie strony do serwera, co pomaga.
Automatyczne wykrywanie języka
Automatyczne wykrywanie języka oznacza, że oprogramowanie samo rozpoznaje, w jakim języku mówisz, bez konieczności informowania go. Przydatne, jeśli przełączasz się między językami w ciągu dnia. Ustawienie „Automatyczne” w CaringDictate robi to we wszystkich 20 obsługiwanych językach.
Codzienne korzystanie z aplikacji do dyktowania
Przycisk mówienia (skrót klawiszowy)
Przycisk mówienia to pojedynczy klawisz lub przycisk myszy, który rozpoczyna i zatrzymuje dyktowanie. W CaringDictate domyślnie jest to prawy klawisz Ctrl, a możesz zmienić go na dowolny klawisz lub przycisk myszy, który jest wygodny dla Twoich rąk.
Naciśnij i mów (przytrzymaj, aby mówić)
Naciśnij i mów oznacza przytrzymywanie przycisku mówienia podczas mówienia i zwalnianie go po zakończeniu — jak w krótkofalówce. Dobre do krótkich wypowiedzi: pola wyszukiwania, szybkiej odpowiedzi. Alternatywą jest tryb przełączania (tap-to-toggle), lepszy do dłuższego pisania.
Przełączanie (dotknij, aby mówić)
Tryb przełączania oznacza jednokrotne dotknięcie przycisku mówienia, aby rozpocząć słuchanie, i ponowne dotknięcie, aby zatrzymać. Twoje ręce są całkowicie wolne w międzyczasie — pomocne, gdy trzymanie klawisza jest niewygodne lub gdy dyktujesz długie fragmenty.
Słowo wybudzające (aktywacja głosowa)
Słowo wybudzające to fraza, którą wypowiadasz na głos — na przykład „rozpocznij dyktowanie” — która rozpoczyna dyktowanie bez dotykania klawiatury ani myszy. Jest to najważniejsze, gdy dotarcie do klawiatury jest trudne. CaringDictate dodało aktywację głosową ustawianą przez użytkownika w wersji 3.5.
Wskaźnik słuchania
Wskaźnik słuchania to mały sygnał na ekranie, który pokazuje, że mikrofon jest aktywny i Twoje słowa są słyszane. Wiarygodny wskaźnik jest ważny: nigdy nie powinieneś się zastanawiać, czy komputer słucha.
Polecenia głosowe
Polecenia głosowe to wypowiadane instrukcje — takie jak „nowa linia” lub „usuń to” — które kontrolują formatowanie zamiast pisać słowa. Aplikacje do dyktowania bardzo się tutaj różnią. Proste polecenia obejmują większość codziennego pisania; zaawansowane sterowanie komputerem bez użycia rąk to osobna kategoria (patrz Voice Access).
Polecenia interpunkcyjne
Polecenia interpunkcyjne to wypowiadanie na głos „kropka”, „przecinek” lub „znak zapytania” w celu wstawienia interpunkcji. Nowoczesne silniki, takie jak Whisper, automatycznie interpunkcjonują również na podstawie Twojego sformułowania i pauz, więc często możesz po prostu mówić naturalnie.
Słownik niestandardowy (lista słów)
Słownik niestandardowy to Twoja osobista lista nazw i specjalnych słów, którym rozpoznawacz powinien ufać — nazwiska rodzinne, nazwy leków, żargon branżowy. Dodanie „Zofran” lub „Oaxaca” raz jest lepsze niż poprawianie tego w nieskończoność. CaringDictate zawiera taki słownik w sekcji Pisanie i słowa.
Wstawianie tekstu
Wstawianie tekstu to sposób, w jaki podyktowane słowa fizycznie trafiają do Twojego dokumentu — aplikacja albo wpisuje je klawisz po klawiszu, albo wkleja je w całości. Wklejanie całych fraz jest szybsze i znacznie bardziej niezawodne w różnych programach, dlatego CaringDictate dostarcza tekst w ten sposób.
Terminy specyficzne dla systemu Windows
Win+H (pisanie głosowe w systemie Windows)
Win+H to skrót klawiszowy, który otwiera wbudowany pasek pisania głosowego w Windows 10 i 11. Jest darmowy, wbudowany w Windows i rozsądną pierwszą opcją do wypróbowania przy codziennym dyktowaniu. Windows 11 zawiera również Voice Access, które dodaje pełną kontrolę głosową nad komputerem wraz z niestandardowym słownictwem i korektą tekstu.
Windows Voice Access
Voice Access to funkcja sterowania komputerem bez użycia rąk w systemie Windows 11 — klikanie, przewijanie i przełączanie okien za pomocą głosu, z włączonym dyktowaniem. Jest stworzona do pełnego sterowania komputerem za pomocą głosu. Jeśli głównym celem jest wygodne pisanie, dedykowane narzędzie do dyktowania jest zazwyczaj lepszym rozwiązaniem.
Rozpoznawanie mowy systemu Windows (WSR)
Rozpoznawanie mowy systemu Windows to starsze, wbudowane narzędzie do dyktowania, które Microsoft wycofał na rzecz Voice Access. Jeśli polegałeś na WSR na starszym komputerze, jego wycofanie jest zazwyczaj momentem, aby świadomie wybrać zamiennik, zamiast dziedziczyć kolejne narzędzie oferowane przez system Windows.
Ustawienia prywatności mikrofonu
Ustawienia prywatności mikrofonu to przełączniki w systemie Windows, które decydują, które programy mogą używać Twojego mikrofonu. Jeśli aplikacja do dyktowania nic nie słyszy, to jest to pierwsze miejsce, w którym należy szukać rozwiązania: Ustawienia → Prywatność i zabezpieczenia → Mikrofon.
Domyślny mikrofon
Domyślny mikrofon to ten, który system Windows udostępnia programom, chyba że wybiorą one inny. Laptopy często mają kilka (wbudowany, zestaw słuchawkowy, kamera internetowa). Wybór właściwego — blisko ust, z dala od wentylatorów — poprawia dokładność bardziej niż jakiekolwiek ustawienie.
Warunki zakupu
Zakup jednorazowy (licencja wieczysta)
Zakup jednorazowy oznacza zapłacenie raz i posiadanie oprogramowania — bez miesięcznych ani rocznych opłat za dalsze korzystanie. CaringDictate kosztuje $49 jednorazowo, z wliczonymi aktualizacjami. Alternatywny model, subskrypcje, pobiera opłaty tak długo, jak długo piszesz.
Subskrypcja
Subskrypcja to płacenie co miesiąc lub co rok za ciągły dostęp do oprogramowania — przestajesz płacić, a ono przestaje działać. Rozsądne dla usług z bieżącymi kosztami serwerów; trudniejsze do uzasadnienia dla narzędzia działającego w całości na Twoim własnym komputerze. Porównaj sumy pięcioletnie przed wyborem.
Stanowisko (licencja na urządzenie)
Stanowisko to jedna zainstalowana kopia programu; licencja na 3 stanowiska obejmuje trzy Twoje komputery. Licencja CaringDictate za $49 obejmuje 3 stanowiska — komputer stacjonarny, laptop i jeszcze jedno.
Darmowy okres próbny
Darmowy okres próbny to pełnofunkcyjny okres testowy przed zapłatą — CaringDictate trwa 7 dni i nie wymaga podawania karty. Testowanie na własnym komputerze, z własnym mikrofonem i własnym głosem, jest lepsze niż jakakolwiek recenzja czy wykres dokładności.
Darmowe aktualizacje
Darmowe aktualizacje oznaczają, że nowe wersje oprogramowania są wliczone w cenę, którą już zapłaciłeś, bez osobnej opłaty za ulepszenie. Warto sprawdzić przed zakupem dowolnego oprogramowania jednorazowego: niektóre licencje „wieczyste” zamrażają Cię na kupionej wersji i naliczają opłatę ponownie za ulepszenia.
Limit słów (limit użycia)
Limit słów to ograniczenie ilości tekstu, który możesz podyktować — często spotykane w darmowych wersjach subskrypcyjnych usług dyktowania. Narzędzia działające na urządzeniu nie mają powodu, aby Cię mierzyć; nie ma rachunku za serwer. CaringDictate nie ma limitu.
Akceleracja GPU
Akceleracja GPU oznacza wykorzystanie układu graficznego komputera do szybszego uruchamiania modelu głosowego niż mógłby to zrobić główny procesor. Dlatego laptop gamingowy transkrybuje zauważalnie szybciej. Nie jest wymagana — CaringDictate działa również na zwykłych maszynach z mniejszymi modelami.
Wymagania systemowe
Wymagania systemowe to minimalne parametry komputera, jakich program potrzebuje, aby działać dobrze. Dla CaringDictate: Windows 10 (64-bitowy, wersja 1903) lub Windows 11, 4 GB pamięci RAM i kilka GB wolnego miejsca na dysku.
Wersja w skrócie
Dyktowanie, pisanie głosowe i zamiana mowy na tekst oznaczają to samo: Ty mówisz, komputer pisze. Wybory, które naprawdę mają znaczenie przy zakupie, to miejsce przetwarzania Twojego głosu (na Twoim komputerze lub na czyimś serwerze), jak go uruchamiasz i zatrzymujesz (wygodny przycisk mówienia lub słowo-klucz), oraz jak płacisz (raz, czy na zawsze). Odpowiedzi CaringDictate to: na Twoim komputerze, dowolny przycisk, który lubisz — $49 jednorazowo, z 7-dniowym bezpłatnym okresem próbnym aby najpierw sprawdzić, czy pasuje do Twojego głosu.