आपको एक ऐसे टूल को खरीदने के लिए अनुवादक की आवश्यकता नहीं होनी चाहिए जिसका पूरा काम आपके शब्दों को टेक्स्ट में बदलना है। यह पृष्ठ उन सभी शब्दों को परिभाषित करता है जिनसे आप डिक्टेशन सॉफ्टवेयर की तुलना करते समय मिलेंगे — जिसमें हमारी अपनी सेटिंग्स स्क्रीन में दिए गए शब्द भी शामिल हैं। प्रत्येक परिभाषा एक वाक्य की है; इसके बाद के विवरण वैकल्पिक पठन हैं।

मूल बातें

डिक्टेशन

डिक्टेशन ज़ोर से बोलना है जबकि सॉफ्टवेयर आपके शब्दों को लिखित टेक्स्ट में बदल देता है। लोग इसे वॉयस टाइपिंग या स्पीच-टू-टेक्स्ट भी कहते हैं। तीनों नामों का एक ही अर्थ है: आप बोलते हैं, कंप्यूटर टाइप करता है।

वॉयस टाइपिंग

वॉइस टाइपिंग डिक्टेशन का ही दूसरा नाम है — टाइप करने के बजाय बोलना, जिसमें शब्द वहीं प्रकट होते हैं जहाँ आपका टेक्स्ट कर्सर होता है। Windows अपने बिल्ट-इन टूल को voice typing कहता है (Win+H फ़ीचर)। CaringDictate वही काम अधिकांश प्रोग्राम में करता है, बिल्ट-इन टूल के टाइम-आउट के बिना।

स्पीच-टू-टेक्स्ट

स्पीच-टू-टेक्स्ट वह तकनीक है जो बोले गए ऑडियो को लिखित शब्दों में परिवर्तित करती है। तकनीकी लेखों में आप इसे STT के रूप में संक्षिप्त देखेंगे। जब कोई उत्पाद कहता है कि "स्पीच-टू-टेक्स्ट द्वारा संचालित," तो इसका मतलब डिक्टेशन है।

स्पीच रिकॉग्निशन

स्पीच रिकॉग्निशन कंप्यूटरों द्वारा मानव भाषण को समझने का व्यापक क्षेत्र है — आपने क्या कहा (डिक्टेशन) और आपका क्या मतलब था (कमांड)। एक डिक्टेशन ऐप आपके शब्दों को लिखने के लिए स्पीच रिकॉग्निशन का उपयोग करता है। एक वॉयस असिस्टेंट उनका उपयोग उन पर कार्य करने के लिए करता है।

ट्रांसक्रिप्शन

ट्रांसक्रिप्शन भाषण की रिकॉर्डिंग — एक मीटिंग, एक साक्षात्कार, एक वॉइसमेल — को बाद में एक लिखित दस्तावेज़ में बदलना है। डिक्टेशन लाइव होता है (आप बोलते समय शब्दों को प्रकट होते देखते हैं); ट्रांसक्रिप्शन आमतौर पर बाद में, एक फ़ाइल से होता है। Otter.ai जैसे उपकरण ट्रांसक्रिप्शन उपकरण हैं, डिक्टेशन उपकरण नहीं।

पहचान कैसे काम करती है

वॉयस मॉडल (पहचान मॉडल)

एक वॉइस मॉडल एक डिक्टेशन प्रोग्राम का प्रशिक्षित दिमाग है — वह फ़ाइल जो असल में भाषण समझती है। बड़े मॉडल आमतौर पर अधिक सटीक होते हैं लेकिन उन्हें एक अधिक शक्तिशाली कंप्यूटर चाहिए। CaringDictate वह मॉडल आकार चुनता है जो आपकी मशीन के अनुकूल हो, लगभग 190 MB से लगभग 3.1 GB तक।

Whisper

Whisper OpenAI द्वारा 2022 में जारी किए गए वॉयस मॉडल का एक ओपन-सोर्स परिवार है, जो कई भाषाओं में लगभग मानवीय सटीकता के लिए जाना जाता है। यह CaringDictate सहित कई आधुनिक डिक्टेशन और ट्रांसक्रिप्शन उत्पादों का इंजन है। क्योंकि यह ओपन सोर्स है, यह पूरी तरह से आपके अपने कंप्यूटर पर चल सकता है।

डिवाइस पर (ऑफ़लाइन) पहचान

डिवाइस पर पहचान का मतलब है कि आपकी बात आपके अपने कंप्यूटर पर प्रोसेस होती है — ऑडियो कभी किसी कंपनी के सर्वर पर नहीं जाता। यह बिना इंटरनेट के काम करता है, निजी विचारों को निजी रखता है, और कोई सेवा बंद होने के कारण कभी काम करना बंद नहीं करता। CaringDictate इसी तरह चलता है।

क्लाउड पहचान

क्लाउड पहचान का मतलब है कि आपकी आवाज़ इंटरनेट पर किसी कंपनी के सर्वर तक भेजी जाती है, वहां टेक्स्ट में बदली जाती है, और वापस भेजी जाती है। पहचान आपके डिवाइस के बजाय एक सर्वर पर होती है। कोई खास टूल अपनी पहचान कहां करता है, यह उसके अपने दस्तावेज़ में बताया जाता है, और कुछ उत्पाद दोनों विकल्प देते हैं — मान लेने के बजाय जांच लेना उचित है।

सटीकता (शब्द त्रुटि दर)

सटीकता वह प्रतिशत है जितने शब्द एक डिक्टेशन प्रोग्राम सही पकड़ता है; वर्ड एरर रेट (WER) वही विचार उल्टे तरीके से मापा गया है — जितना प्रतिशत यह गलत पकड़ता है। आधुनिक Whisper-आधारित डिक्टेशन स्पष्ट अंग्रेज़ी भाषण पर अत्यधिक सटीक है। परिणाम माइक्रोफ़ोन की गुणवत्ता, पृष्ठभूमि के शोर, और आप कितनी स्पष्टता से बोलते हैं, इसके साथ बदलते हैं।

विलंबता

विलंबता एक वाक्य समाप्त करने और टेक्स्ट दिखाई देने के बीच की देरी है। लगभग एक तिहाई सेकंड से कम तुरंत महसूस होता है; उससे बहुत अधिक देरी महसूस होती है। डिवाइस पर पहचान सर्वर तक की राउंड-ट्रिप से बचती है, जिससे मदद मिलती है।

स्वचालित भाषा पहचान

स्वचालित भाषा पहचान का मतलब है कि सॉफ़्टवेयर बिना बताए यह पता लगा लेता है कि आप कौन सी भाषा बोल रहे हैं। यदि आप दिन के बीच में भाषाओं के बीच स्विच करते हैं तो यह उपयोगी है। CaringDictate की "स्वचालित" सेटिंग इसकी 20 समर्थित भाषाओं में ऐसा करती है।

रोजमर्रा में डिक्टेशन ऐप का उपयोग करना

बात करने का बटन (हॉटकी)

बात करने का बटन वह एकल कुंजी या माउस बटन है जो डिक्टेशन शुरू और बंद करता है। CaringDictate में डिफ़ॉल्ट रूप से राइट Ctrl कुंजी होती है, और आप इसे किसी भी कुंजी या माउस बटन में बदल सकते हैं जो आपके हाथों के लिए आरामदायक हो।

पुश-टू-टॉक (बात करने के लिए दबाए रखें)

पुश-टू-टॉक का मतलब है कि जब आप बोलते हैं तो बात करने वाले बटन को दबाए रखना और जब आप समाप्त कर लें तो उसे छोड़ देना — जैसे एक वॉकी-टॉकी। छोटे वाक्यों के लिए अच्छा है: एक खोज बॉक्स, एक त्वरित उत्तर। इसका विकल्प टैप-टू-टॉगल है, जो लंबे लेखन के लिए बेहतर है।

टॉगल (बात करने के लिए टैप करें)

टॉगल मोड का मतलब है कि सुनने के लिए बात करने वाले बटन को एक बार टैप करना और रोकने के लिए फिर से टैप करना। इस बीच आपके हाथ पूरी तरह से स्वतंत्र होते हैं — यह तब मददगार होता है जब किसी कुंजी को पकड़े रहना असहज हो, या जब आप लंबे अंशों को डिक्टेट करते हैं।

वेक वर्ड (वॉयस एक्टिवेशन)

एक वेक वर्ड एक वाक्यांश है जिसे आप ज़ोर से कहते हैं — जैसे "डिक्टेट करना शुरू करें" — जो कीबोर्ड या माउस को बिल्कुल भी छुए बिना डिक्टेशन शुरू करता है। यह तब सबसे महत्वपूर्ण होता है जब कीबोर्ड तक पहुँचना मुश्किल होता है। CaringDictate ने संस्करण 3.5 में उपयोगकर्ता-निर्धारित वॉयस एक्टिवेशन जोड़ा।

सुनने का संकेतक

सुनने का संकेतक स्क्रीन पर एक छोटा संकेत है जो दिखाता है कि माइक्रोफ़ोन चालू है और आपके शब्द सुने जा रहे हैं। एक विश्वसनीय संकेतक महत्वपूर्ण है: आपको कभी यह सोचने की ज़रूरत नहीं होनी चाहिए कि कंप्यूटर सुन रहा है या नहीं।

वॉयस कमांड

वॉयस कमांड बोले गए निर्देश हैं — जैसे "नई लाइन" या "उसे हटा दें" — जो शब्दों को लिखने के बजाय फ़ॉर्मेटिंग को नियंत्रित करते हैं। डिक्टेशन ऐप्स यहाँ बहुत भिन्न होते हैं। सरल कमांड अधिकांश रोजमर्रा के लेखन को कवर करते हैं; भारी हैंड्स-फ़्री कंप्यूटर नियंत्रण एक अलग श्रेणी है (Voice Access देखें)।

विराम चिह्न कमांड

विराम चिह्न कमांड का मतलब है विराम चिह्न डालने के लिए ज़ोर से "पूर्ण विराम," "अल्पविराम," या "प्रश्न चिह्न" कहना। Whisper जैसे आधुनिक इंजन आपके वाक्यांशों और विरामों से स्वचालित रूप से विराम चिह्न भी लगाते हैं, इसलिए आप अक्सर स्वाभाविक रूप से बात कर सकते हैं।

कस्टम डिक्शनरी (शब्द सूची)

एक कस्टम डिक्शनरी नामों और विशेष शब्दों की आपकी व्यक्तिगत सूची है जिन पर पहचानकर्ता को भरोसा करना चाहिए — पारिवारिक नाम, दवा के नाम, उद्योग की शब्दावली। "Zofran" या "Oaxaca" को एक बार जोड़ना उसे हमेशा के लिए सही करने से बेहतर है। CaringDictate में लेखन और शब्दों के तहत एक शामिल है।

टेक्स्ट इंसर्शन

टेक्स्ट इन्सर्शन वह तरीका है जिससे बोले गए शब्द आपके दस्तावेज़ में आते हैं — ऐप या तो उन्हें एक-एक कीस्ट्रोक करके टाइप करता है या उन्हें एक साथ पेस्ट करता है। पूरे वाक्यांशों को पेस्ट करना विभिन्न प्रोग्रामों में तेज़ और कहीं अधिक विश्वसनीय होता है, यही कारण है कि CaringDictate टेक्स्ट को इसी तरह डिलीवर करता है।

विंडोज-विशिष्ट शब्द

Win+H (विंडोज वॉयस टाइपिंग)

Win+H वह कीबोर्ड शॉर्टकट है जो Windows 10 और 11 पर Windows की बिल्ट-इन वॉइस टाइपिंग बार खोलता है। मुफ़्त, Windows में पहले से बिल्ट-इन, और रोज़मर्रा के डिक्टेशन के लिए आज़माने वाली एक समझदारी भरी पहली चीज़। Windows 11 में Voice Access भी शामिल है, जो कस्टम शब्दावली और टेक्स्ट सुधार के साथ-साथ पीसी का पूरा वॉइस नियंत्रण जोड़ता है।

Windows Voice Access

Voice Access विंडोज 11 की हैंड्स-फ्री कंप्यूटर कंट्रोल सुविधा है — जिसमें वॉयस द्वारा क्लिक करना, स्क्रॉल करना और विंडोज स्विच करना शामिल है, साथ ही डिक्टेशन भी शामिल है। यह वॉयस द्वारा पूर्ण कंप्यूटर नियंत्रण के लिए बनाया गया है। यदि आप मुख्य रूप से आरामदायक लेखन चाहते हैं, तो एक समर्पित डिक्टेशन टूल आमतौर पर बेहतर विकल्प होता है।

विंडोज स्पीच रिकॉग्निशन (WSR)

विंडोज स्पीच रिकॉग्निशन एक पुराना बिल्ट-इन डिक्टेशन टूल है जिसे Microsoft ने Voice Access के पक्ष में बंद कर दिया है। यदि आप पुराने पीसी पर WSR पर निर्भर थे, तो इसका बंद होना आमतौर पर वह क्षण होता है जब आप जानबूझकर एक प्रतिस्थापन चुनते हैं, बजाय इसके कि विंडोज अगला जो भी टूल प्रदान करे उसे अपना लें।

माइक्रोफोन गोपनीयता सेटिंग्स

माइक्रोफोन गोपनीयता सेटिंग्स वे विंडोज स्विच हैं जो तय करते हैं कि कौन से प्रोग्राम आपके माइक्रोफोन का उपयोग कर सकते हैं। यदि कोई डिक्टेशन ऐप कुछ भी नहीं सुनता है, तो यह देखने के लिए पहली जगह है: सेटिंग्स → गोपनीयता और सुरक्षा → माइक्रोफोन।

डिफ़ॉल्ट माइक्रोफोन

डिफ़ॉल्ट माइक्रोफोन वह है जिसे विंडोज प्रोग्राम्स को देता है जब तक कि वे अलग विकल्प न चुनें। लैपटॉप में अक्सर कई होते हैं (बिल्ट-इन, हेडसेट, वेबकैम)। सही माइक्रोफोन चुनना — आपके मुंह के करीब, पंखों से दूर — किसी भी सेटिंग से अधिक सटीकता में सुधार करता है।

खरीदने की शर्तें

एक बार की खरीद (स्थायी लाइसेंस)

एक बार की खरीद का मतलब है एक बार भुगतान करना और सॉफ्टवेयर का मालिक होना — इसे इस्तेमाल करते रहने के लिए कोई मासिक या वार्षिक शुल्क नहीं। CaringDictate $49 का एक बार का भुगतान है, जिसमें अपडेट शामिल हैं। वैकल्पिक मॉडल, सब्सक्रिप्शन, जब तक आप टाइप करते रहते हैं तब तक शुल्क लेता रहता है।

सब्सक्रिप्शन

सब्सक्रिप्शन सॉफ्टवेयर तक निरंतर पहुंच के लिए मासिक या वार्षिक भुगतान करना है — भुगतान करना बंद करें और यह काम करना बंद कर देता है। चल रहे सर्वर लागत वाली सेवाओं के लिए उचित; पूरी तरह से आपके अपने कंप्यूटर पर चलने वाले टूल के लिए इसे सही ठहराना कठिन है। चुनने से पहले पांच साल के कुल योग की तुलना करें।

सीट (डिवाइस लाइसेंस)

एक सीट एक प्रोग्राम की एक स्थापित कॉपी है; एक 3-सीट लाइसेंस आपके तीन कंप्यूटरों को कवर करता है। CaringDictate का $49 लाइसेंस में 3 सीटें शामिल हैं — डेस्कटॉप, लैपटॉप और एक और।

निःशुल्क परीक्षण

एक निःशुल्क परीक्षण भुगतान करने से पहले एक पूर्ण-विशेषताओं वाली परीक्षण अवधि है — CaringDictate का 7 दिनों तक चलता है जिसमें किसी कार्ड की आवश्यकता नहीं होती है। आपके अपने कंप्यूटर पर, आपके अपने माइक्रोफोन और आपकी अपनी आवाज के साथ किया गया परीक्षण किसी भी समीक्षा या सटीकता चार्ट से बेहतर होता है।

मुफ़्त अपडेट

मुफ़्त अपडेट का मतलब है कि सॉफ़्टवेयर के नए संस्करण उस कीमत में शामिल हैं जो आप पहले ही चुका चुके हैं, बिना किसी अलग अपग्रेड शुल्क के। कोई भी एक बार का सॉफ़्टवेयर खरीदने से पहले जाँचने लायक: कुछ 'स्थायी' लाइसेंस आपको उसी संस्करण पर रोक देते हैं जो आपने खरीदा और अपग्रेड के लिए फिर से शुल्क लेते हैं।

वर्ड कैप (उपयोग सीमा)

एक वर्ड कैप इस बात की सीमा है कि आप कितना डिक्टेट कर सकते हैं — यह सब्सक्रिप्शन डिक्टेशन सेवाओं के मुफ्त टियर पर आम है। ऑन-डिवाइस टूल के पास आपको मापने का कोई कारण नहीं है; कोई सर्वर बिल नहीं होता है। CaringDictate में कोई कैप नहीं है।

GPU त्वरण

GPU त्वरण का मतलब है आपके कंप्यूटर की ग्राफिक्स चिप का उपयोग करके वॉयस मॉडल को मुख्य प्रोसेसर की तुलना में तेज़ी से चलाना। यही कारण है कि एक गेमिंग लैपटॉप काफी तेज़ी से ट्रांसक्राइब करता है। इसकी आवश्यकता नहीं है — CaringDictate छोटे मॉडल के साथ सामान्य मशीनों पर भी चलता है।

सिस्टम आवश्यकताएँ

सिस्टम आवश्यकताएँ वे न्यूनतम कंप्यूटर स्पेक्स हैं जो किसी प्रोग्राम को अच्छी तरह चलने के लिए चाहिए। CaringDictate के लिए: Windows 10 (64-बिट, संस्करण 1903) या Windows 11, 4 GB RAM, और कुछ GB खाली डिस्क स्थान।

संक्षिप्त रूप

डिक्टेशन, वॉयस टाइपिंग और स्पीच-टू-टेक्स्ट सभी का एक ही मतलब है: आप बात करते हैं, कंप्यूटर टाइप करता है। खरीदते समय वास्तव में मायने रखने वाले विकल्प यह हैं कि आपकी आवाज कहाँ संसाधित होती है (आपके कंप्यूटर पर या किसी के सर्वर पर), आप इसे कैसे शुरू और बंद करते हैं (एक आरामदायक टॉक बटन, या एक वेक वर्ड), और आप कैसे भुगतान करते हैं (एक बार, या हमेशा के लिए)। CaringDictate के उत्तर हैं: आपके कंप्यूटर पर, कोई भी बटन जो आपको पसंद हो — एक बार $49, के साथ एक 7-दिवसीय मुफ़्त परीक्षण यह जांचने के लिए कि यह पहले आपकी आवाज़ के अनुकूल है या नहीं।