Sie sollten keinen Übersetzer benötigen, um ein Tool zu kaufen, dessen einzige Aufgabe es ist, Ihre Worte in Text umzuwandeln. Diese Seite definiert jeden Begriff, dem Sie beim Vergleich von Diktatsoftware begegnen werden – einschließlich derer in unseren eigenen Einstellungsbildschirmen. Jede Definition ist ein Satz; die Details danach sind optional zu lesen.

Die Grundlagen

Diktat

Diktat ist das laute Sprechen, während Software Ihre Worte in geschriebenen Text umwandelt. Man nennt es auch Spracheingabe oder Spracherkennung (Speech-to-Text). Alle drei Namen bedeuten dasselbe: Sie sprechen, der Computer tippt.

Spracheingabe

Sprachtippen ist ein anderer Name für Diktieren — sprechen statt tippen, wobei die Wörter dort erscheinen, wo Ihr Textcursor steht. Windows nennt sein integriertes Werkzeug „Spracheingabe“ (die Win+H-Funktion). CaringDictate erledigt dieselbe Aufgabe in den meisten Programmen, ohne die Zeitüberschreitungen des integrierten Werkzeugs.

Spracherkennung (Speech-to-Text)

Speech-to-Text ist die Technologie, die gesprochene Audioinhalte in geschriebene Worte umwandelt. In technischen Artikeln wird es als STT abgekürzt. Wenn ein Produkt angibt, „powered by Speech-to-Text“ zu sein, bedeutet dies Diktat.

Spracherkennung

Spracherkennung ist das umfassendere Feld, in dem Computer menschliche Sprache verstehen – sowohl das, was Sie gesagt haben (Diktat), als auch das, was Sie gemeint haben (Befehle). Eine Diktat-App verwendet Spracherkennung, um Ihre Worte aufzuschreiben. Ein Sprachassistent verwendet sie, um darauf zu reagieren.

Transkription

Transkription ist die Umwandlung einer Sprachaufnahme – eines Meetings, eines Interviews, einer Voicemail – in ein schriftliches Dokument im Nachhinein. Diktat ist live (Sie sehen, wie Worte erscheinen, während Sie sprechen); Transkription erfolgt normalerweise später, aus einer Datei. Tools wie Otter.ai sind Transkriptionstools, keine Diktat-Tools.

Wie die Erkennung funktioniert

Sprachmodell (Erkennungsmodell)

Ein Sprachmodell ist das trainierte Gehirn eines Diktierprogramms — die Datei, die die Sprache tatsächlich versteht. Größere Modelle sind in der Regel genauer, benötigen aber einen leistungsstärkeren Computer. CaringDictate wählt die Modellgröße, die zu Ihrem Gerät passt, von etwa 190 MB bis etwa 3,1 GB.

Whisper

Whisper ist eine Open-Source-Familie von Sprachmodellen, die 2022 von OpenAI veröffentlicht wurde und für ihre nahezu menschliche Genauigkeit in vielen Sprachen bekannt ist. Es ist die Engine hinter vielen modernen Diktier- und Transkriptionsprodukten, einschließlich CaringDictate. Da es Open Source ist, kann es vollständig auf Ihrem eigenen Computer ausgeführt werden.

Erkennung auf dem Gerät (offline)

Erkennung auf dem Gerät bedeutet, dass Ihre Sprache auf Ihrem eigenen Computer verarbeitet wird – die Audiodaten gelangen niemals auf den Server eines Unternehmens. Dies funktioniert ohne Internet, hält private Gedanken privat und funktioniert immer, da kein Dienst ausfallen kann. So funktioniert CaringDictate.

Cloud-Erkennung

Cloud-Erkennung bedeutet, dass Ihre Stimme über das Internet an die Server eines Unternehmens gestreamt, dort in Text umgewandelt und zurückgesendet wird. Die Erkennung findet auf einem Server statt und nicht auf Ihrem Gerät. Wo ein bestimmtes Tool seine Erkennung durchführt, steht in dessen eigener Dokumentation, und manche Produkte bieten beides an — es lohnt sich, das zu prüfen, statt es anzunehmen.

Genauigkeit (Wortfehlerrate)

Genauigkeit ist der Prozentsatz der Wörter, die ein Diktierprogramm richtig erkennt; die Wortfehlerrate (WER) ist dieselbe Idee andersherum gemessen — der Prozentsatz, den es falsch erkennt. Modernes Whisper-basiertes Diktieren ist bei klarer englischer Sprache hochgenau. Die Ergebnisse variieren mit der Mikrofonqualität, Hintergrundgeräuschen und wie deutlich Sie sprechen.

Latenz

Latenz ist die Verzögerung zwischen dem Beenden eines Satzes und dem Erscheinen des Textes. Weniger als etwa eine Drittel Sekunde fühlt sich sofort an; viel mehr als das fühlt sich träge an. Die Erkennung auf dem Gerät vermeidet den Hin- und Rückweg zu einem Server, was hilfreich ist.

Automatische Spracherkennung

Automatische Spracherkennung bedeutet, dass die Software herausfindet, welche Sprache Sie sprechen, ohne dass Sie es ihr mitteilen müssen. Nützlich, wenn Sie tagsüber zwischen Sprachen wechseln. Die Einstellung „Automatisch“ von CaringDictate tut dies für ihre 20 unterstützten Sprachen.

Eine Diktier-App im Alltag verwenden

Sprechtaste (Hotkey)

Die Sprechtaste ist die einzelne Taste oder Maustaste, die das Diktieren startet und stoppt. In CaringDictate ist die Standardeinstellung die rechte Strg-Taste, und Sie können sie auf jede Taste oder Maustaste ändern, die für Ihre Hände bequem ist.

Push-to-talk (Halten zum Sprechen)

Push-to-talk bedeutet, die Sprechtaste gedrückt zu halten, während Sie sprechen, und sie loszulassen, wenn Sie fertig sind – wie bei einem Walkie-Talkie. Gut für kurze Eingaben: ein Suchfeld, eine schnelle Antwort. Die Alternative ist Tap-to-toggle, besser für längere Texte.

Umschalten (Tippen zum Sprechen)

Der Umschaltmodus bedeutet, die Sprechtaste einmal zu tippen, um mit dem Zuhören zu beginnen, und erneut zu tippen, um zu stoppen. Ihre Hände sind dazwischen völlig frei – hilfreich, wenn das Halten einer Taste unangenehm ist oder wenn Sie lange Passagen diktieren.

Aktivierungswort (Sprachaktivierung)

Ein Aktivierungswort ist eine Phrase, die Sie laut aussprechen – wie „Diktat starten“ – die das Diktieren beginnt, ohne Tastatur oder Maus zu berühren. Dies ist am wichtigsten, wenn das Erreichen der Tastatur der schwierigste Teil ist. CaringDictate hat in Version 3.5 eine vom Benutzer einstellbare Sprachaktivierung hinzugefügt.

Hörindikator

Der Hörindikator ist das kleine Bildschirmsignal, das anzeigt, dass das Mikrofon aktiv ist und Ihre Worte gehört werden. Ein vertrauenswürdiger Indikator ist wichtig: Sie sollten sich niemals fragen müssen, ob der Computer zuhört.

Sprachbefehle

Sprachbefehle sind gesprochene Anweisungen – wie „neue Zeile“ oder „das löschen“ – die die Formatierung steuern, anstatt Wörter zu schreiben. Diktier-Apps unterscheiden sich hier stark. Einfache Befehle decken die meisten alltäglichen Schreibarbeiten ab; eine umfassende freihändige Computersteuerung ist eine separate Kategorie (siehe Voice Access).

Interpunktionsbefehle

Interpunktionsbefehle bedeuten, „Punkt“, „Komma“ oder „Fragezeichen“ laut auszusprechen, um Satzzeichen einzufügen. Moderne Engines wie Whisper setzen Satzzeichen auch automatisch anhand Ihrer Formulierung und Pausen, sodass Sie oft einfach natürlich sprechen können.

Benutzerdefiniertes Wörterbuch (Wortliste)

Ein benutzerdefiniertes Wörterbuch ist Ihre persönliche Liste von Namen und speziellen Wörtern, denen der Erkennungsdienst vertrauen sollte – Familiennamen, Medikamentennamen, Fachjargon. „Zofran“ oder „Oaxaca“ einmal hinzuzufügen, ist besser, als es für immer zu korrigieren. CaringDictate enthält eines unter „Schreiben & Wörter“.

Texteinfügung

Texteinfügung ist die Art und Weise, wie diktierte Wörter physisch in Ihrem Dokument ankommen – die App tippt sie entweder Tastaturanschlag für Tastaturanschlag ein oder fügt sie in einem Stück ein. Das Einfügen ganzer Phrasen ist schneller und weitaus zuverlässiger in verschiedenen Programmen, weshalb CaringDictate Text auf diese Weise liefert.

Windows-spezifische Begriffe

Win+H (Windows Spracheingabe)

Win+H ist die Tastenkombination, die unter Windows 10 und 11 die integrierte Spracheingabeleiste öffnet. Kostenlos, in Windows integriert und ein sinnvoller erster Versuch für alltägliches Diktieren. Windows 11 enthält außerdem Voice Access, das volle Sprachsteuerung des PCs sowie individuelles Vokabular und Textkorrektur hinzufügt.

Windows Voice Access

Voice Access ist die Freisprech-Computersteuerungsfunktion von Windows 11 – Klicken, Scrollen und Wechseln von Fenstern per Sprache, inklusive Diktat. Es ist für die vollständige Computersteuerung per Sprache konzipiert. Wenn Sie hauptsächlich bequem schreiben möchten, ist ein spezielles Diktierwerkzeug in der Regel die bessere Wahl.

Windows Spracherkennung (WSR)

Windows Spracherkennung ist das ältere, integrierte Diktierwerkzeug, das Microsoft zugunsten von Voice Access eingestellt hat. Wenn Sie sich auf WSR auf einem älteren PC verlassen haben, ist dessen Einstellung in der Regel der Zeitpunkt, bewusst einen Ersatz zu wählen, anstatt das nächste von Windows angebotene Werkzeug zu übernehmen.

Mikrofon-Datenschutzeinstellungen

Mikrofon-Datenschutzeinstellungen sind die Windows-Schalter, die entscheiden, welche Programme Ihr Mikrofon verwenden dürfen. Wenn eine Diktier-App nichts hört, ist dies der erste Ort, an dem Sie nachsehen sollten: Einstellungen → Datenschutz & Sicherheit → Mikrofon.

Standardmikrofon

Das Standardmikrofon ist dasjenige, das Windows Programmen zur Verfügung stellt, es sei denn, diese wählen ein anderes. Laptops haben oft mehrere (eingebaut, Headset, Webcam). Die Wahl des richtigen Mikrofons – nah am Mund, fern von Lüftern – verbessert die Genauigkeit mehr als jede Einstellung.

Kaufbedingungen

Einmaliger Kauf (dauerhafte Lizenz)

Ein einmaliger Kauf bedeutet, einmal zu bezahlen und die Software zu besitzen – keine monatliche oder jährliche Gebühr, um sie weiterhin zu nutzen. CaringDictate kostet einmalig $49, inklusive Updates. Das alternative Modell, Abonnements, berechnet Ihnen Gebühren, solange Sie tippen.

Abonnement

Ein Abonnement bedeutet, monatlich oder jährlich für den fortgesetzten Zugriff auf Software zu bezahlen – hören Sie auf zu zahlen, und es funktioniert nicht mehr. Angemessen für Dienste mit laufenden Serverkosten; schwerer zu rechtfertigen für ein Werkzeug, das vollständig auf Ihrem eigenen Computer läuft. Vergleichen Sie die Fünfjahresgesamtkosten, bevor Sie sich entscheiden.

Platz (Gerätelizenz)

Ein Platz ist eine installierte Kopie eines Programms; eine 3-Platz-Lizenz deckt drei Ihrer Computer ab. Die $49-Lizenz von CaringDictate umfasst 3 Plätze – Desktop, Laptop und einen weiteren.

Kostenlose Testversion

Eine kostenlose Testversion ist eine voll funktionsfähige Testphase vor dem Bezahlen – die von CaringDictate dauert 7 Tage, ohne dass eine Karte erforderlich ist. Ein Test auf Ihrem eigenen Computer, mit Ihrem eigenen Mikrofon und Ihrer eigenen Stimme, schlägt jede Bewertung oder Genauigkeitstabelle.

Kostenlose Updates

Kostenlose Updates bedeutet, dass neue Versionen der Software im bereits gezahlten Preis enthalten sind, ohne separate Upgrade-Gebühr. Vor dem Kauf jeder Einmal-Software lohnt sich ein Blick darauf: Manche „unbefristeten“ Lizenzen frieren Sie auf der gekauften Version ein und berechnen erneut für Upgrades.

Wortlimit (Nutzungsbegrenzung)

Ein Wortlimit ist eine Begrenzung, wie viel Sie diktieren dürfen – üblich bei kostenlosen Stufen von Abonnement-Diktierdiensten. Tools, die auf dem Gerät laufen, haben keinen Grund, Sie zu messen; es gibt keine Serverrechnung. CaringDictate hat kein Limit.

GPU-Beschleunigung

GPU-Beschleunigung bedeutet, den Grafikchip Ihres Computers zu verwenden, um das Sprachmodell schneller auszuführen, als es der Hauptprozessor könnte. Deshalb transkribiert ein Gaming-Laptop merklich schneller. Nicht erforderlich – CaringDictate läuft auch auf gewöhnlichen Maschinen mit kleineren Modellen.

Systemanforderungen

Systemanforderungen sind die minimalen Computer-Spezifikationen, die ein Programm benötigt, um gut zu laufen. Für CaringDictate: Windows 10 (64-Bit, Version 1903) oder Windows 11, 4 GB RAM und ein paar GB freier Speicherplatz.

Die Kurzfassung

Diktat, Spracheingabe und Spracherkennung bedeuten alle dasselbe: Sie sprechen, der Computer tippt. Die Entscheidungen, die beim Kauf wirklich wichtig sind, betreffen, wo Ihre Stimme verarbeitet wird (auf Ihrem Computer oder auf dem Server eines anderen), wie Sie es starten und stoppen (eine bequeme Sprechtaste oder ein Aktivierungswort), und wie Sie bezahlen (einmal oder für immer). Die Antworten von CaringDictate sind: auf Ihrem Computer, jede Taste, die Sie mögen — einmalig $49, mit einer 7-tägigen kostenlosen Testversion Testphase, um zu prüfen, ob es zu Ihrer Stimme passt.