Text-to-speech API: Een ongecensureerde LLM gebruiken voor voice-scripts en ondertiteling
Een Text-to-speech API zet geschreven scripts om in gesproken audio, maar de kwaliteit van die stem hangt volledig af van de tekst die het ontvangt. Door een ongecensureerde LLM te gebruiken voor nabewerking, kunnen ontwikkelaars ruwe, ongefilterde scripts en ondertiteling genereren die traditionele AI zou kunnen verzachten of weigeren, zodat je voice-pipeline edge cases en volwassen content zonder onderbreking aankan.
BijgewerktSpeech To Text API
Waarom TTS een ongecensureerde backend nodig heeft
De meeste ontwikkelaars nemen aan dat hun Text-to-speech API slechts een renderer is. Het neemt tekst aan en produceert audio. Maar de tekst die het ontvangt komt vaak van een algemene AI die sterk gefilterd is. Als je scripts genereert voor creatieve content, security research of volwassen entertainment, kunnen standaard LLMs weigeren specifieke zinnen te genereren, slang te zuiveren of de toon meer "corporate" maken. Dit creëert een knelpunt waar je voice-pipeline een gezuiverde versie van je creatieve intentie levert.
Door een ongecensureerde LLM te integreren als backend voor je tekstgeneratie, zorg je ervoor dat het script dat je TTS-engine bereikt precies is wat je hebt gevraagd. Dit is cruciaal voor use cases waarbij de nuance van de taal belangrijk is. Als de LLM een wettelijk maar edgy onderwerp weigert, heeft je TTS API niets om uit te spreken. Een ongecensureerd model verwijdert deze willekeurige weigeringen en geeft je volledige controle over de content die wordt uitgesproken.
De rol van de LLM in voice-pipelines
In een moderne voice-pipeline fungeert de LLM als het brein. Het neemt je prompt aan en structureert de ruwe ideeën tot een schoon script. Dit script stroomt vervolgens naar de Text-to-speech API. De LLM verwerkt de opmaak, toon en structuur. De TTS API verzorgt de audio-synthese. Als de LLM te restrictief is, klinkt de TTS API saai. Als de LLM te creatief is, kan de TTS API moeite hebben met complexe syntaxis.
Onze API biedt een OpenAI-compatible endpoint dat een enkel, ongecensureerd model serveert. Dit model is afgestemd om te antwoorden zonder contentweigeringen voor wettelijk volwassen gebruik. Het is geen GPT, Claude of een model van een andere leverancier. Het draait op onze eigen GPU-servers. Dit betekent dat je een voorspelbare, consistente voice krijgt in je tekstuitvoer. De model-id is "uncensored". Je stuurt tekst in, je krijgt tekst uit. Geen embeddings, geen afbeeldingen, geen video. Puur, ongefilterde taal voor je voice-pipeline.
Scriptgeneratie zonder contentfilters
Bij het genereren van scripts voor voice-overs kunnen contentfilters een last zijn. Ze kunnen woorden blokkeren die volledig legaal zijn maar als gevoelig worden beschouwd. Ze kunnen weigeren dialoog te genereren voor een boosaardig personage omdat de toon te donker is. Met een ongecensureerde LLM kun je scripts genereren die de ware aard van je content weerspiegelen. Dit is vooral belangrijk voor creatief schrijven, volwassen media of niche hobby-gemeenschappen.
Het model weigert geen wettelijke volwassen, fictieve, security-research of controversiële onderwerpen. Het blokkeert alleen seksuele content met minderjarigen. Deze harde limiet zorgt ervoor dat je de API voor elk ander wettelijk doel kunt gebruiken zonder angst voor plotselinge weigeringen. Je kunt langlopende scripts, personagedialoog of narraties genereren zonder dat de LLM je creatieve keuzes ter discussie stelt. Het resultaat is een schonere, directere tekstuitvoer die je TTS API zonder aanpassing kan verwerken.
Ondertiteling en bijschriften: omgaan met edge cases
Het genereren van ondertiteling en bijschriften vereist vaak het verwerken van rommelige, echte spraak. ASR-systemen produceren fouten. Ze missen woorden, interpreteren accenten verkeerd en voegen vulgeluiden toe. Een ongecensureerde LLM kan deze uitvoer opschonen zonder de betekenis te verzachten. Het kan grammatica corrigeren terwijl het de oorspronkelijke toon en het vocabulaire behoudt. Dit is cruciaal voor het behoud van de authenticiteit van de gesproken content.
Standaard LLM's corrigeren soms te veel, waardoor de ondertiteling te formeel klinkt. Een ongecensureerd model kan de prompt krijgen om de ruwe, rauwe aard van de originele spraak te behouden. Dit is nuttig voor documentaires, interviews of informele vlogs. De LLM verwerkt de tekst en de uitvoer is klaar om door je TTS API opnieuw te laten spreken of door je ondertitelgenerator te timen. Het contextvenster stelt je in staat om hele afleveringen te verwerken, wat consistentie over het hele transcript waarborgt.
Nabewerken van ASR-uitvoer
Automatic Speech Recognition (ASR)-systemen worden steeds beter, maar ze zijn niet perfect. Ze hebben moeite met homofonen, eigennamen en complexe zinsstructuren. Nabewerken met een LLM kan deze fouten herstellen. Een ongecensureerde LLM kan het transcript herschrijven om leesbaarder te maken terwijl de oorspronkelijke betekenis behouden blijft. Dit is vooral nuttig wanneer de ASR-uitvoer slang of jargon bevat die de AI verkeerd kan interpreteren.
Door ons ongecensureerde model te gebruiken, kun je ervoor zorgen dat de nabewerkte tekst de stem van de oorspronkelijke spreker behoudt. Het model is afgestemd om zonder weigeringen te antwoorden, dus het zal geen inhoud weggooien alleen omdat het ongebruikelijk klinkt. Je kunt de ruwe ASR-uitvoer sturen, een opgeschoonde versie ontvangen en die vervolgens naar je Text To Speech API sturen voor hersynthese of archivering. Dit creëert een robuuste pipeline voor hoogwaardige spraakinhoud.
Integratie met TTS-aanbieders
Onze API is ontworpen om te werken met elke TTS-provider. Het is een OpenAI-compatible chat-completions-API. Je kunt de officiële OpenAI SDK's gebruiken of elke client die het OpenAI-formaat ondersteunt. De basis-URL is https://api.speechtotextapis.com/v1. Je wijzigt de basis-URL en levert je API-sleutel. De model-id is "uncensored". Dit maakt integratie eenvoudig en flexibel.
Omdat de API tekst-in, tekst-uit is, past het naadloos in je bestaande workflow. Je genereert de tekst en stuurt deze vervolgens naar je TTS-aanbieder. De ongecensureerde aard van het model zorgt ervoor dat de tekst zonder verborgen filters je TTS-aanbieder bereikt. Dit betekent dat je voice-pipeline alleen wordt beperkt door je creativiteit, niet door het contentbeleid van de AI. Je kunt verschillende prompts en stijlen testen zonder je zorgen te maken over weigeringen.
Contextvenster: 100.000 tokens voor lange scripts
Een van de grootste uitdagingen in voice-pipelines is het verwerken van lange scripts. Als je contextvenster te klein is, moet je het script in brokken splitsen. Dit kan de flow van het verhaal verstoren of inconsistenties in toon veroorzaken. Onze API ondersteunt een contextvenster van 100.000 tokens. Hiermee kun je lange scripts, hele afleveringen of grote datasets in één verzoek verwerken.
Dit is nuttig voor het genereren van consistente personages, het behouden van narratieve continuïteit of het verwerken van hele boeken. Je kunt een groot tekstblok sturen, een coherente uitvoer krijgen en deze vervolgens naar je TTS API sturen. Het grotere contextvenster vermindert de behoefte aan complexe chunking-logica in je code. Het vereenvoudigt de architectuur van je voice-pipeline en zorgt ervoor dat de uitvoer soepel en consistent is.
Streaming voor real-time ondertiteling
Voor real-time toepassingen, zoals live ondertiteling of interactieve voice-assistenten, is latentie cruciaal. Onze API ondersteunt streaming via Server-Sent Events (SSE). Hiermee kun je de tekst ontvangen terwijl deze wordt gegenereerd, in plaats van te wachten op de volledige respons. Dit is cruciaal voor het behouden van een soepele gebruikerservaring.
In combinatie met een snelle TTS-aanbieder kan streaming een bijna directe voice-pipeline creëren. De LLM genereert de tekst, streamt deze naar je applicatie en de TTS API spreekt het in real-time uit. Dit is ideaal voor chatbots, live transcripties of interactief storytelling. Het ongecensureerde model zorgt ervoor dat de gestreamde tekst niet wordt onderbroken door contentweigeringen, wat een consistente ervaring voor de gebruiker biedt.
Prijzen voor tekstverwerking met hoog volume
Onze prijzen zijn eenvoudig en transparant. Je betaalt voor wat je gebruikt. Er zijn geen maandelijkse kosten of abonnementen. De prijs is $0,25 per 1 miljoen input-tokens en $1,00 per 1 miljoen output-tokens. Dit is concurrerend voor tekstverwerking met hoog volume. Je kunt je account opwaarderen met prepaid tegoed, beginnend vanaf $10. Je kunt betalen met crypto (USDT of USDC).
Als je $50 of meer opwaardeert, krijg je een bonus van 5%. Als je $100 of meer opwaardeert, krijg je een bonus van 10%. Dit maakt het kostenefficiënt om grote volumes tekst te verwerken voor je TTS-pijplijn. Het tegoed vervalt nooit. Je kunt je API-sleutel op elk moment regenereren. De trial geeft je $0.50 tegoed voor 7 dagen, geen kaart nodig. Dit stelt je in staat de integratie met je Text To Speech API te testen voordat je je verbindt.
Vragen en antwoorden
Genereert het ongecensureerde model audio?
Nee. De API is een tekstgebaseerde chat-completions-API. Hij neemt tekst als invoer en retourneert tekst. Je hebt een aparte Text To Speech API nodig om de uitvoer om te zetten naar audio. Onze API is ontworpen om de ruwe, ongefilterde tekst te leveren die je TTS-engine nodig heeft.
Wat is de grootte van het contextvenster?
Het contextvenster is 100.000 tokens. Dit omvat zowel de invoerprompt als de response. Hiermee kun je lange scripts of grote datasets in één verzoek verwerken zonder ze in kleinere brokken te splitsen.
Is het model GPT of Claude?
Nee. De model-id is "uncensored". Het is een open-weight model dat draait op onze eigen GPU-servers. Het is geen GPT, Claude, Gemini, Grok of een model van een andere leverancier. Het is specifiek afgestemd op contentgeneratie zonder weigeringen.
Hoeveel kost het?
De prijs is $0,25 per 1 miljoen input-tokens en $1,00 per 1 miljoen output-tokens. Er zijn geen maandelijkse kosten. Je betaalt voor wat je gebruikt met prepaid tegoed. Opwaarderingen beginnen vanaf $10, met bonussen voor hogere bedragen.
Je sleutel is nog maar één formulier verwijderd
Maak een account aan, kopieer de sleutel, pas de base URL aan. Dat is de hele configuratie.