टेक्स्ट टू स्पीच API: वॉइस स्क्रिप्ट और कैप्शन के लिए बिना सेंसर LLM का उपयोग कैसे करें
एक टेक्स्ट टू स्पीच API लिखित स्क्रिप्ट को बोलने वाले ऑडियो में बदलता है, लेकिन उस आवाज़ की गुणवत्ता पूरी तरह से उस टेक्स्ट पर निर्भर करती है जिसे वह प्राप्त करता है। पोस्ट-प्रोसेसिंग के लिए एक बिना सेंसर LLM का उपयोग करके, डेवलपर कच्ची, बिना फ़िल्टर स्क्रिप्ट और कैप्शन जनरेट कर सकते हैं जिन्हें पारंपरिक AI नरम या मना कर सकता है, यह सुनिश्चित करते हुए कि आपकी वॉइस पाइपलाइन एज केस और वयस्क सामग्री को बिना रुकावट संभालती है।
अपडेटेडSpeech To Text API
TTS को बिना सेंसर बैकएंड की आवश्यकता क्यों है
अधिकांश डेवलपर मानते हैं कि उनका टेक्स्ट टू स्पीच API केवल एक रेंडरर है। यह टेक्स्ट लेता है और ऑडियो बनाता है। लेकिन प्राप्त टेक्स्ट अक्सर एक सामान्य-उद्देश्य AI से आता है जिस पर भारी फ़िल्टर लगा है। यदि आप रचनात्मक सामग्री, सुरक्षा अनुसंधान या वयस्क मनोरंजन के लिए स्क्रिप्ट जनरेट कर रहे हैं, तो मानक LLM विशिष्ट वाक्यांशों को जनरेट करने से मना कर सकते हैं, स्लैंग को सैनिटाइज़ कर सकते हैं या टोन को अधिक "कॉर्पोरेट" बनाने के लिए बदल सकते हैं। इससे एक बाधा पैदा होती है जहां आपकी वॉइस पाइपलाइन आपकी रचनात्मक इरादे का सैनिटाइज़्ड संस्करण प्रदान करती है।
अपनी टेक्स्ट जनरेशन के बैकएंड के रूप में एक बिना सेंसर LLM को एकीकृत करके, आप सुनिश्चित करते हैं कि आपकी TTS इंजन तक पहुंचने वाली स्क्रिप्ट बिल्कुल वही है जिसे आपने मांगा था। यह उन उपयोग मामलों के लिए महत्वपूर्ण है जहां भाषा की बारीकियों का महत्व होता है। यदि LLM एक कानूनी लेकिन एज विषय को मना करता है, तो आपकी TTS API के पास बोलने के लिए कुछ नहीं होता। एक बिना सेंसर मॉडल इन मनमाने मना करने को हटा देता है, आपको उस सामग्री पर पूर्ण नियंत्रण देता है जिसे आवाज़ दी जाएगी।
वॉइस पाइपलाइन में LLM की भूमिका
आधुनिक वॉइस पाइपलाइन में, LLM दिमाग के रूप में कार्य करता है। यह आपके प्रॉम्प्ट लेता है और कच्चे विचारों को एक साफ स्क्रिप्ट में संरचित करता है। यह स्क्रिप्ट फिर टेक्स्ट टू स्पीच API में बहती है। LLM फॉर्मेटिंग, टोन और संरचना संभालता है। TTS API ऑडियो सिंथेसिस संभालता है। यदि LLM बहुत प्रतिबंधित है, तो TTS API रूखा लगता है। यदि LLM बहुत रचनात्मक है, तो TTS API जटिल सिंटैक्स के साथ संघर्ष कर सकता है।
हमारा API एक ओपनAI-कम्पेटिबल एंडपॉइंट प्रदान करता है जो एकल, बिना सेंसर मॉडल सर्व करता है। यह मॉडल कानूनी वयस्क उपयोग के लिए बिना सामग्री मना किए उत्तर देने के लिए ट्यून किया गया है। यह GPT, क्लॉड या किसी अन्य विक्रेता का मॉडल नहीं है। यह हमारे अपने GPU सर्वर पर चलता है। इसका मतलब है कि आपको अपने टेक्स्ट आउटपुट में एक भविष्यसूचक, स्थिर आवाज़ मिलती है। मॉडल ID "uncensored" है। आप टेक्स्ट भेजते हैं, आप टेक्स्ट प्राप्त करते हैं। कोई एम्बेडिंग नहीं, कोई इमेज नहीं, कोई वीडियो नहीं। बस आपकी वॉइस पाइपलाइन के लिए शुद्ध, बिना फ़िल्टर भाषा।
सामग्री फ़िल्टर के बिना स्क्रिप्ट जनरेशन
वॉइसओवर्स के लिए स्क्रिप्ट जनरेट करते समय, सामग्री फ़िल्टर परेशान हो सकते हैं। वे शब्दों को ब्लॉक कर सकते हैं जो पूरी तरह से कानूनी हैं लेकिन संवेदनशील माने जाते हैं। वे एक खलनायक पात्र के लिए संवाद जनरेट करने से मना कर सकते हैं क्योंकि टोन बहुत गहरा है। एक बिना सेंसर LLM के साथ, आप ऐसी स्क्रिप्ट जनरेट कर सकते हैं जो आपकी सामग्री की सच्ची प्रकृति को दर्शाती है। यह रचनात्मक लेखन, वयस्क मीडिया या निश शौक समुदायों के लिए विशेष रूप से महत्वपूर्ण है।
मॉडल कानूनी वयस्क, काल्पनिक, सुरक्षा-अनुसंधान या विवादास्पद विषयों को मना नहीं करता है। यह केवल किशोरों से संबंधित यौन सामग्री को ब्लॉक करता है। यह कठोर सीमा सुनिश्चित करती है कि आप किसी भी अन्य कानूनी उद्देश्य के लिए API का उपयोग बिना अचानक मना के भय के कर सकें। आप LLM द्वारा आपकी रचनात्मक चयनों को दोबारा सोचे बिना लंबी स्क्रिप्ट, पात्र संवाद या कथन जनरेट कर सकते हैं। परिणाम एक साफ, अधिक सीधा टेक्स्ट आउटपुट है जिसे आपकी TTS API संशोधन के बिना प्रोसेस कर सकती है।
कैप्शन और सबटाइटल: एज केस हैंडल करना
कैप्शन और सबटाइटल जनरेट करने अक्सर अस्तव्यस्त, वास्तविक-दुनिया के बोलने को संभालने की आवश्यकता होती है। ASR प्रणालियां त्रुटियां उत्पन्न करती हैं। वे शब्द छूट जाती हैं, उच्चारण को गलत समझती हैं, और फिलर ध्वनियां जोड़ती हैं। एक बिना सेंसर LLL इस आउटपुट को नरम किए बिना साफ कर सकता है। यह मूल टोन और शब्दावली को बनाए रखते हुए व्याकरण को ठीक कर सकता है। यह बोलने वाली सामग्री की प्रामाणिकता बनाए रखने के लिए महत्वपूर्ण है।
मानक LLM अत्यधिक सुधार कर सकते हैं, जिससे कैप्शन बहुत औपचारिक लगते हैं। एक बिना सेंसर मॉडल को मूल कच्ची, खुरदुरी प्रकृति को बनाए रखने के लिए प्रॉम्प्ट किया जा सकता है। यह डॉक्यूमेंट्री, इंटरव्यू या कैजुअल व्लॉग के लिए उपयोगी है। LLL टेक्स्ट प्रोसेस करता है, और आउटपुट आपकी TTS API को पुनः आवाज़ देने या आपके सबटाइटल जनरेटर को समय देने के लिए तैयार है। कॉन्टेक्स्ट विंडो आपको पूरी एपिसोड को प्रोसेस करने की अनुमति देता है, पूरे ट्रांसक्रिप्ट में स्थिरता सुनिश्चित करता है।
ASR आउटपुट का पोस्ट-प्रोसेसिंग
ऑटोमैटिक स्पीच रिकग्निशन (ASR) प्रणालियां सुधार रही हैं, लेकिन वे पूर्ण नहीं हैं। वे होमोफोन्स, उपनामों और जटिल वाक्य संरचनाओं के साथ संघर्ष करती हैं। LLL के साथ पोस्ट-प्रोसेसिंग इन त्रुटियों को ठीक कर सकती है। एक बिना सेंसर LLL ट्रांसक्रिप्ट को अधिक पठनीय बनाने के लिए फिर से लिख सकता है जबकि मूल अर्थ को बनाए रखता है। यह विशेष रूप से उपयोगी है जब ASR आउटपुट में स्लैंग या जार्गन होता है जिसे AI गलत समझ सकता है।
हमारे बिना सेंसर मॉडल का उपयोग करके, आप सुनिश्चित कर सकते हैं कि पोस्ट-प्रोसेस्ड टेक्स्ट मूल वक्ता की आवाज़ को बनाए रखता है। मॉडल बिना मना किए उत्तर देने के लिए ट्यून किया गया है, इसलिए यह अजीब लगने के कारण सामग्री नहीं छोड़ेगा। आप कच्चा ASR आउटपुट भेज सकते हैं, एक साफ संस्करण प्राप्त कर सकते हैं, और फिर उसे पुनः सिंथेसिस या आर्काइविंग के लिए अपनी टेक्स्ट टू स्पीच API में फ़ीड कर सकते हैं। यह उच्च-गुणवत्ता वाली वॉइस सामग्री के लिए एक मजबूत पाइपलाइन बनाता है।
TTS प्रदाताओं के साथ एकीकरण
हमारा API किसी भी TTS प्रदाता के साथ काम करने के लिए डिज़ाइन किया गया है। यह एक OpenAI-संगत चैट-समापन API है। आप आधिकारिक OpenAI SDKs या किसी भी क्लाइंट का उपयोग कर सकते हैं जो OpenAI फॉर्मेट का समर्थन करता है। बेस URL https://api.speechtotextapis.com/v1. है। आप बेस URL बदल सकते हैं और अपनी API कुंजी प्रदान कर सकते हैं। मॉडल आईडी "uncensored" है। इससे एकीकरण सरल और लचीला हो जाता है।
चूंकि API टेक्स्ट-इन, टेक्स्ट-आउट है, यह आपके मौजूदा वर्कफ़्लो में सहजता से फिट होता है। आप टेक्स्ट जनरेट करते हैं, फिर इसे अपनी TTS प्रदाता को भेजते हैं। मॉडल की बिना सेंसर प्रकृति सुनिश्चित करती है कि टेक्स्ट छिपे हुए फ़िल्टर के बिना आपकी TTS प्रदाता तक पहुंचता है। इसका मतलब है कि आपकी वॉइस पाइपलाइन केवल आपकी रचनात्मकता द्वारा सीमित है, AI की सामग्री नीति द्वारा नहीं। आप मना करने की चिंता किए बिना अलग-अलग प्रॉम्प्ट और शैलियों का परीक्षण कर सकते हैं।
कॉन्टेक्स्ट विंडो: लंबी स्क्रिप्ट के लिए 100,000 टोकन
वॉइस पाइपलाइन में सबसे बड़ी चुनौतियों में लंबे स्क्रिप्ट को प्रोसेस करना शामिल है। यदि आपकी कॉन्टेक्स्ट विंडो बहुत छोटी है, तो आपको स्क्रिप्ट को चंक में बांटना पड़ता है। इससे कथानक की धारा बिगड़ सकती है या टोन में असंगतता आ सकती है। हमारा API 100,000 टोकन की कॉन्टेक्स्ट विंडो का समर्थन करता है। इससे आपको लंबे स्क्रिप्ट, पूरे एपिसोड या बड़े डेटासेट को एक ही अनुरोध में प्रोसेस करने की अनुमति मिलती है।
यह स्थिर पात्र जनरेट करने, कथानक निरंतरता बनाए रखने या पूरी किताबों को प्रोसेस करने के लिए उपयोगी है। आप टेक्स्ट का एक बड़ा ब्लॉक भेज सकते हैं, एक सहसंबंधी आउटपुट प्राप्त कर सकते हैं, और फिर इसे अपनी TTS API में फ़ीड कर सकते हैं। बड़ी कॉन्टेक्स्ट विंडो आपके कोड में जटिल चंकिंग लॉजिक की आवश्यकता को कम करती है। यह आपकी वॉइस पाइपलाइन की आर्किटेक्चर को सरल बनाती है और सुनिश्चित करती है कि आउटपुट चिकना और स्थिर हो।
रियल-टाइम कैप्शनिंग के लिए स्ट्रीमिंग
रियल-टाइम अनुप्रयोगों के लिए, जैसे लाइव कैप्शनिंग या इंटरैक्टिव वॉइस असिस्टेंट, लेटेंसी कुंजी है। हमारा API सर्वर-सेंट इवेंट्स (SSE) के माध्यम से स्ट्रीमिंग का समर्थन करता है। इससे आपको टेक्स्ट प्राप्त होता है जैसे ही यह जनरेट होता है, पूरे प्रतिक्रिया का इंतजार करने के बजाय। यह एक चिकने उपयोगकर्ता अनुभव को बनाए रखने के लिए महत्वपूर्ण है।
एक तेज TTS प्रदाता के साथ संयुक्त, स्ट्रीमिंग एक लगभग तत्काल वॉइस पाइपलाइन बना सकता है। LLL टेक्स्ट जनरेट करता है, इसे आपके एप्लिकेशन में स्ट्रीम करता है, और TTS API रियल-टाइम में इसे बोलता है। यह चैटबॉट, लाइव ट्रांसक्रिप्शन या इंटरैक्टिव स्टोरीटेलिंग के लिए आदर्श है। बिना सेंसर मॉडल सुनिश्चित करता है कि स्ट्रीम किया गया टेक्स्ट सामग्री मना द्वारा बाधित नहीं होता है, उपयोगकर्ता के लिए एक स्थिर अनुभव प्रदान करता है।
हाई-वॉल्यूम टेक्स्ट प्रोसेसिंग के लिए मूल्य निर्धारण
हमारा मूल्य निर्धारण सरल और पारदर्शी है। आप अपने उपयोग के लिए भुगतान करते हैं। कोई मासिक शुल्क या सदस्यता नहीं है। कीमत 1 मिलियन इनपुट टोकन के लिए $0.25 और 1 मिलियन आउटपुट टोकन के लिए $1.00 है। यह उच्च-वॉल्यूम टेक्स्ट प्रोसेसिंग के लिए प्रतिस्पर्धी है। आप प्रीपेड क्रेडिट के साथ अपने खाता टॉप-अप कर सकते हैं, जो $10 से शुरू होता है। आप क्रिप्टो (USDT या USDC) द्वारा भुगतान कर सकते हैं।
यदि आप $50 या उससे अधिक टॉप-अप करते हैं, तो आपको 5% बोनस मिलता है। यदि आप $100 या उससे अधिक टॉप-अप करते हैं, तो आपको 10% बोनस मिलता है। यह आपके TTS पाइपलाइन के लिए बड़े वॉल्यूम के टेक्स्ट को प्रोसेस करने को लागत-प्रभावी बनाता है। क्रेडिट कभी एक्सपायर नहीं होता है। आप किसी भी समय अपनी API कुंजी रीजेनरेट कर सकते हैं। ट्रायल आपको 7 दिनों के लिए $0.50 का क्रेडिट देता है, कार्ड की आवश्यकता नहीं है। इससे आपको प्रतिबद्ध होने से पहले अपनी Text To Speech API के साथ इंटीग्रेशन टेस्ट करने की अनुमति मिलती है।
प्रश्न और उत्तर
क्या बिना सेंसर मॉडल ऑडियो जनरेट करता है?
नहीं। API केवल टेक्स्ट-आधारित चैट-कम्प्लीशंस API है। यह टेक्स्ट इनपुट लेता है और टेक्स्ट आउटपुट देता है। आपको आउटपुट को ऑडियो में बदलने के लिए एक अलग टेक्स्ट टू स्पीच API की आवश्यकता है। हमारा API आपके TTS इंजन को कच्चा, बिना फ़िल्टर टेक्स्ट प्रदान करने के लिए डिज़ाइन किया गया है।
कॉन्टेक्स्ट विंडो का आकार क्या है?
कॉन्टेक्स्ट विंडो 100,000 टोकन का है। इसमें इनपुट प्रॉम्प्ट और आउटपुट कम्प्लीशन दोनों शामिल हैं। इससे आपको लंबी स्क्रिप्ट या बड़े डेटासेट को छोटे-छोटे हिस्सों में बांटने के बिना एक ही अनुरोध में प्रोसेस करने की अनुमति मिलती है।
क्या मॉडल GPT या क्लॉड है?
नहीं। मॉडल ID "uncensored" है। यह एक ओपन-वेट मॉडल है जो हमारे अपने GPU सर्वर पर चलता है। यह GPT, क्लॉड, जेमिनी, ग्रॉक या किसी अन्य विक्रेता का मॉडल नहीं है। इसे विशेष रूप से बिना मना किए सामग्री जनरेशन के लिए ट्यून किया गया है।
इसकी लागत कितनी है?
मूल्य $0.25 प्रति 1 मिलियन इनपुट टोकन और $1.00 प्रति 1 मिलियन आउटपुट टोकन है। कोई मासिक शुल्क नहीं है। आप प्रीपेड क्रेडिट के साथ उपयोग के लिए भुगतान करते हैं। टॉप-अप $10 से शुरू होता है, बड़ी राशि के लिए बोनस मिलते हैं।
आपकी कुंजी बस एक फ़ॉर्म दूर है
एक खाता बनाएं, कुंजी कॉपी करें, बेस URL बदलें। सेटअप यही तक सीमित है।