Du ska inte behöva en översättare för att köpa ett verktyg vars hela uppgift är att förvandla dina ord till text. Den här sidan definierar varje term du kommer att stöta på när du jämför dikteringsprogramvara — inklusive de som finns i våra egna inställningsskärmar. Varje definition är en mening; detaljerna efter den är valfri läsning.

Grunderna

Diktering

Diktering är att tala högt medan programvara förvandlar dina ord till skriven text. Människor kallar det också röstskrivning eller tal-till-text. Alla tre namnen betyder samma sak: du pratar, datorn skriver.

Röstskrivning

Rösttypning är ett annat namn för diktering – att tala istället för att skriva, där orden dyker upp där din textmarkör står. Windows kallar sitt inbyggda verktyg för "röstinmatning" (Win+H-funktionen). CaringDictate gör samma jobb i de flesta program, utan det inbyggda verktygets tidsgränser.

Tal-till-text

Tal-till-text är tekniken som omvandlar talat ljud till skrivna ord. Du kommer att se det förkortas som STT i tekniska artiklar. När en produkt säger "drivs av tal-till-text" betyder det diktering.

Taligenkänning

Taligenkänning är det bredare fältet där datorer förstår mänskligt tal — både vad du sa (diktering) och vad du menade (kommandon). En dikteringsapp använder taligenkänning för att skriva ner dina ord. En röstassistent använder det för att agera på dem.

Transkription

Transkription är att förvandla en inspelning av tal — ett möte, en intervju, ett röstmeddelande — till ett skrivet dokument i efterhand. Diktering är live (du ser orden dyka upp medan du talar); transkription sker vanligtvis senare, från en fil. Verktyg som Otter.ai är transkriptionsverktyg, inte dikteringsverktyg.

Hur igenkänning fungerar

Röstmodell (igenkänningsmodell)

En röstmodell är den tränade hjärnan i ett dikteringsprogram – filen som faktiskt förstår tal. Större modeller är oftast mer noggranna men behöver en kraftfullare dator. CaringDictate väljer den modellstorlek som passar din maskin, från omkring 190 MB till omkring 3,1 GB.

Whisper

Whisper är en öppen källkods-familj av röstmodeller som släpptes av OpenAI 2022, känd för nästan mänsklig noggrannhet över många språk. Det är motorn bakom många moderna dikterings- och transkriptionsprodukter, inklusive CaringDictate. Eftersom det är öppen källkod kan det köras helt på din egen dator.

Lokal (offline) igenkänning

Lokal igenkänning innebär att ditt tal bearbetas på din egen dator – ljudet skickas aldrig till ett företags server. Detta fungerar utan internet, håller privata tankar privata och slutar aldrig fungera för att en tjänst är nere. Det är så CaringDictate fungerar.

Molnbaserad igenkänning

Molnbaserad igenkänning innebär att din röst strömmas över internet till ett företags servrar, omvandlas till text där och skickas tillbaka. Igenkänningen sker på en server snarare än på din egen dator. Var ett visst verktyg utför sin igenkänning framgår av dess egen dokumentation, och vissa produkter erbjuder båda — det är värt att kontrollera snarare än att anta.

Noggrannhet (ordfelfrekvens)

Noggrannhet är andelen ord som ett dikteringsprogram får rätt; ordfelfrekvens (WER) är samma idé mätt baklänges – andelen det får fel. Modern Whisper-baserad diktering är mycket noggrann på tydligt engelskt tal. Resultaten varierar med mikrofonkvalitet, bakgrundsljud och hur tydligt du talar.

Latens

Latens är fördröjningen mellan att avsluta en mening och att se texten visas. Under ungefär en tredjedels sekund känns det omedelbart; mycket mer än så känns segt. Lokal igenkänning undviker rundresan till en server, vilket hjälper.

Automatisk språkidentifiering

Automatisk språkidentifiering innebär att programvaran själv listar ut vilket språk du talar utan att du behöver berätta det. Användbart om du växlar mellan språk mitt på dagen. CaringDictate's inställning "Automatisk" gör detta över dess 20 språk som stöds.

Att använda en dikteringsapp dagligen

Talknapp (snabbkommando)

Talknappen är den enda tangenten eller musknappen som startar och stoppar diktering. I CaringDictate är standardinställningen höger Ctrl-tangent, och du kan ändra den till vilken tangent eller musknapp som helst som är bekväm för dina händer.

Tryck-för-att-tala (håll inne för att tala)

Tryck-för-att-tala innebär att du håller talknappen intryckt medan du talar och släpper den när du är klar – som en walkie-talkie. Bra för korta utbrott: ett sökfält, ett snabbt svar. Alternativet är tryck-för-att-växla, bättre för längre skrivande.

Växla (tryck för att tala)

Växlingsläge innebär att du trycker på talknappen en gång för att börja lyssna och trycker igen för att stoppa. Dina händer är helt fria däremellan – hjälpsamt när det är obekvämt att hålla en tangent intryckt, eller när du dikterar långa stycken.

Väckningsord (röstaktivering)

Ett väckningsord är en fras du säger högt – som "börja diktera" – som startar diktering utan att alls röra tangentbordet eller musen. Detta är viktigast när det är svårt att nå tangentbordet. CaringDictate lade till användarinställbar röstaktivering i version 3.5.

Lyssningsindikator

Lyssningsindikatorn är den lilla signalen på skärmen som visar att mikrofonen är aktiv och att dina ord hörs. En pålitlig indikator är viktig: du ska aldrig behöva undra om datorn lyssnar.

Röstkommandon

Röstkommandon är talade instruktioner – som "ny rad" eller "radera det" – som styr formatering istället för att skriva ord. Dikteringsappar skiljer sig mycket här. Enkla kommandon täcker det mesta av vardagligt skrivande; avancerad handsfree-datorstyrning är en separat kategori (se Voice Access).

Interpunktionskommandon

Interpunktionskommandon innebär att säga "punkt", "komma" eller "frågetecken" högt för att infoga interpunktion. Moderna motorer som Whisper interpunkterar också automatiskt utifrån din frasering och dina pauser, så du kan ofta bara tala naturligt.

Anpassad ordlista (ordlista)

En anpassad ordlista är din personliga lista över namn och speciella ord som igenkänningsmotorn ska lita på – familjenamn, medicinnamn, branschjargong. Att lägga till "Zofran" eller "Oaxaca" en gång är bättre än att korrigera det för alltid. CaringDictate inkluderar en under Skrivande & ord.

Textinfogning

Textinfogning är hur dikterade ord fysiskt hamnar i ditt dokument – appen skriver antingen in dem tangenttryckning för tangenttryckning eller klistrar in dem i ett stycke. Att klistra in hela fraser är snabbare och mycket mer tillförlitligt över olika program, vilket är anledningen till att CaringDictate levererar text på det sättet.

Windows-specifika termer

Win+H (Windows röstinmatning)

Win+H är kortkommandot som öppnar Windows inbyggda röstinmatningsfält i Windows 10 och 11. Gratis, inbyggt i Windows och ett förnuftigt förstahandsval för vardaglig diktering. Windows 11 innehåller också Voice Access, som lägger till fullständig röststyrning av datorn tillsammans med anpassat ordförråd och textkorrigering.

Windows Voice Access

Voice Access är Windows 11:s handsfree-funktion för datorstyrning – klicka, scrolla och växla fönster med rösten, med diktering inkluderad. Den är byggd för fullständig datorstyrning med rösten. Om det du främst vill ha är bekväm skrivning, är ett dedikerat dikteringsverktyg oftast ett bättre val.

Windows Taligenkänning (WSR)

Windows Taligenkänning är det äldre inbyggda dikteringsverktyget som Microsoft har avvecklat till förmån för Voice Access. Om du förlitade dig på WSR på en äldre PC, är dess avveckling oftast tillfället att medvetet välja en ersättare snarare än att ärva vilket verktyg Windows än erbjuder härnäst.

Sekretessinställningar för mikrofon

Sekretessinställningar för mikrofon är de Windows-inställningar som bestämmer vilka program som får använda din mikrofon. Om en dikteringsapp inte hör något, är detta det första stället att titta: Inställningar → Sekretess och säkerhet → Mikrofon.

Standardmikrofon

Standardmikrofonen är den som Windows tilldelar program om de inte väljer en annan. Bärbara datorer har ofta flera (inbyggd, headset, webbkamera). Att välja rätt – nära munnen, bort från fläktar – förbättrar noggrannheten mer än någon annan inställning.

Köpvillkor

Engångsköp (evig licens)

Ett engångsköp innebär att du betalar en gång och äger programvaran – ingen månads- eller årsavgift för att fortsätta använda den. CaringDictate kostar $49 en gång, med uppdateringar inkluderade. Den alternativa modellen, prenumerationer, fortsätter att debitera så länge du fortsätter att skriva.

Prenumeration

En prenumeration innebär att du betalar månadsvis eller årligen för fortsatt tillgång till programvara – slutar du betala slutar den att fungera. Rimligt för tjänster med löpande serverkostnader; svårare att motivera för ett verktyg som körs helt på din egen dator. Jämför femårskostnader innan du väljer.

Plats (enhetslicens)

En plats är en installerad kopia av ett program; en 3-platsers licens täcker tre av dina datorer. CaringDictate's $49 licens inkluderar 3 platser – stationär, bärbar och en till.

Gratis provperiod

En gratis provperiod är en fullfjädrad testperiod innan du betalar – CaringDictate's varar i 7 dagar utan att något kort krävs. En provperiod på din egen dator, med din egen mikrofon och din egen röst, slår vilken recension eller noggrannhetstabell som helst.

Kostnadsfria uppdateringar

Kostnadsfria uppdateringar innebär att nya versioner av programvaran ingår i priset du redan betalat, utan någon separat uppgraderingsavgift. Värt att kontrollera innan du köper någon engångsprogramvara: vissa "eviga" licenser fryser dig på versionen du köpte och tar betalt igen för uppgraderingar.

Ordgräns (användningsbegränsning)

En ordgräns är en begränsning för hur mycket du får diktera – vanligt på gratisnivåer av prenumerationsbaserade dikteringstjänster. Verktyg som körs på enheten har ingen anledning att mäta din användning; det finns ingen serverräkning. CaringDictate har ingen gräns.

GPU-acceleration

GPU-acceleration innebär att du använder datorns grafikchip för att köra röstmodellen snabbare än vad huvudprocessorn skulle kunna. Det är därför en gaminglaptop transkriberar märkbart snabbare. Inte ett krav – CaringDictate körs även på vanliga maskiner med mindre modeller.

Systemkrav

Systemkrav är de minimala datorspecifikationer ett program behöver för att köra bra. För CaringDictate: Windows 10 (64-bitars, version 1903) eller Windows 11, 4 GB RAM, och några GB ledigt diskutrymme.

Den korta versionen

Diktering, röstinmatning och tal-till-text betyder alla samma sak: du pratar, datorn skriver. De val som verkligen spelar roll när du köper är var din röst bearbetas (på din dator eller på någons server), hur du startar och stoppar det (en bekväm talknapp, eller ett väckningsord), och hur du betalar (en gång, eller för alltid). CaringDictate's svar är: på din dator, vilken knapp du vill — $49 en gång, med en 7-dagars gratis provperiod för att kontrollera att det passar din röst först.