FR ▾

speechtotextapis.comLLM sans censure pour le post-traitement des pipelines textuels

Speech To Text API
Obtenir une clé API

API Text-to-Speech : Comment utiliser un LLM sans censure pour les scripts vocaux et les sous-titres

Une API Text To Speech convertit des scripts écrits en audio parlé, mais la qualité de cette voix dépend entièrement du texte qu'elle reçoit. En utilisant un LLM sans censure pour le post-traitement, les développeurs peuvent générer des scripts et des sous-titres bruts et non filtrés que l'IA traditionnelle pourrait adoucir ou refuser, garantissant ainsi que votre pipeline vocal gère les cas limites et le contenu pour adultes sans interruption.

Mis à jourSpeech To Text API

Pourquoi le TTS a besoin d'un backend sans censure

La plupart des développeurs supposent que leur API Text To Speech n'est qu'un moteur de rendu. Elle prend du texte et produit de l'audio. Mais le texte qu'elle reçoit provient souvent d'une IA à usage général qui a été fortement filtrée. Si vous générez des scripts pour du contenu créatif, de la recherche en sécurité ou du divertissement pour adultes, les LLM standard peuvent refuser de générer des phrases spécifiques, assainir le langage familier ou modifier le ton pour le rendre plus « corporatif ». Cela crée un goulot d'étranglement où votre pipeline vocal délivre une version assainie de votre intention créative.

En intégrant un LLM sans censure comme backend pour votre génération de texte, vous vous assurez que le script qui atteint votre moteur TTS est exactement ce que vous avez demandé. Cela est critique pour les cas d'utilisation où la nuance du langage est importante. Si le LLM refuse un sujet légal mais audacieux, votre API TTS n'a rien à dire. Un modèle sans censure supprime ces refus arbitraires, vous donnant un contrôle total sur le contenu qui sera prononcé.

Le rôle du LLM dans les pipelines vocaux

Dans un pipeline vocal moderne, le LLM agit comme le cerveau. Il prend votre prompt et structure les idées brutes en un script propre. Ce script est ensuite envoyé à l'API Text To Speech. Le LLM gère le formatage, le ton et la structure. L'API TTS gère la synthèse audio. Si le LLM est trop restrictif, l'API TTS semble fade. Si le LLM est trop créatif, l'API TTS peut avoir du mal avec une syntaxe complexe.

Notre API fournit un endpoint compatible OpenAI qui sert un seul modèle sans censure. Ce modèle est ajusté pour répondre sans refus de contenu pour un usage adulte légal. Ce n'est pas GPT, Claude ou le modèle d'un autre fournisseur. Il s'exécute sur nos propres serveurs GPU. Cela signifie que vous obtenez une voix prévisible et cohérente dans votre sortie textuelle. L'identifiant du modèle est « uncensored ». Vous envoyez du texte, vous recevez du texte. Pas d'embeddings, pas d'images, pas de vidéo. Juste du langage pur et non filtré pour votre pipeline vocal.

Génération de scripts sans filtres de contenu

Lors de la génération de scripts pour des voix off, les filtres de contenu peuvent être gênants. Ils peuvent bloquer des mots qui sont parfaitement légaux mais considérés comme sensibles. Ils peuvent refuser de générer des dialogues pour un personnage méchant parce que le ton est trop sombre. Avec un LLM sans censure, vous pouvez générer des scripts qui reflètent la véritable nature de votre contenu. Cela est particulièrement important pour l'écriture créative, les médias pour adultes ou les communautés de passionnés de niche.

Le modèle ne refuse pas les sujets adultes légaux, fictifs, de recherche en sécurité ou controversés. Il bloque uniquement le contenu sexuel impliquant des mineurs. Cette limite stricte garantit que vous pouvez utiliser l'API pour tout autre usage légal sans craindre des refus soudains. Vous pouvez générer des scripts de longue durée, des dialogues de personnages ou des narrations sans que le LLM ne remette en question vos choix créatifs. Le résultat est une sortie textuelle plus propre et plus directe que votre API TTS peut traiter sans modification.

Sous-titres et légendes : gestion des cas limites

La génération de sous-titres et de légendes nécessite souvent de gérer des discours réels et désordonnés. Les systèmes ASR produisent des erreurs. Ils manquent des mots, interprètent mal les accents et ajoutent des sons de remplissage. Un LLM sans censure peut nettoyer cette sortie sans en atténuer le sens. Il peut corriger la grammaire tout en préservant le ton et le vocabulaire d'origine. Cela est crucial pour maintenir l'authenticité du contenu parlé.

Les LLM standard peuvent trop corriger, rendant les sous-titres trop formels. Un modèle sans censure peut être incité à conserver la nature brute et rugueuse du discours original. Cela est utile pour les documentaires, les interviews ou les vlogs décontractés. Le LLM traite le texte, et la sortie est prête pour que votre API TTS la reformule ou pour que votre générateur de sous-titres la synchronise. La fenêtre de contexte vous permet de traiter des épisodes entiers, garantissant la cohérence dans toute la transcription.

Post-traitement de la sortie ASR

Les systèmes de reconnaissance automatique de la parole (ASR) s'améliorent, mais ils ne sont pas parfaits. Ils ont du mal avec les homophones, les noms propres et les structures de phrases complexes. Le post-traitement avec un LLM peut corriger ces erreurs. Un LLM sans censure peut réécrire la transcription pour la rendre plus lisible tout en conservant le sens original. Cela est particulièrement utile lorsque la sortie ASR contient du langage familier ou du jargon que l'IA pourrait mal interpréter.

En utilisant notre modèle sans censure, vous pouvez vous assurer que le texte post-traité conserve la voix du locuteur original. Le modèle est ajusté pour répondre sans refus, il ne supprimera donc pas de contenu simplement parce qu'il semble inhabituel. Vous pouvez envoyer la sortie ASR brute, obtenir une version nettoyée, puis l'alimenter dans votre API Text To Speech pour une nouvelle synthèse ou l'archivage. Cela crée un pipeline robuste pour du contenu vocal de haute qualité.

Intégration avec les fournisseurs TTS

Notre API est conçue pour fonctionner avec n'importe quel fournisseur TTS. C'est une API de chat-completions compatible OpenAI. Vous pouvez utiliser les SDK officiels OpenAI ou n'importe quel client qui prend en charge le format OpenAI. L'URL de base est https://api.speechtotextapis.com/v1. Vous modifiez l'URL de base et fournissez votre clé API. L'identifiant du modèle est « uncensored ». Cela rend l'intégration simple et flexible.

Puisque l'API est texte en entrée, texte en sortie, elle s'intègre parfaitement à votre flux de travail existant. Vous générez le texte, puis vous l'envoyez à votre fournisseur TTS. La nature sans censure du modèle garantit que le texte atteint votre fournisseur TTS sans filtres cachés. Cela signifie que votre pipeline vocal est limité uniquement par votre créativité, et non par la politique de contenu de l'IA. Vous pouvez tester différents prompts et styles sans vous soucier des refus.

Fenêtre de contexte : 100 000 tokens pour les longs scripts

L'un des plus grands défis dans les pipelines vocaux est le traitement de longs scripts. Si votre fenêtre de contexte est trop petite, vous devez diviser le script en morceaux. Cela peut rompre le flux du récit ou causer des incohérences dans le ton. Notre API prend en charge une fenêtre de contexte de 100 000 tokens. Cela vous permet de traiter de longs scripts, des épisodes entiers ou de grands ensembles de données en une seule requête.

Cela est utile pour générer des personnages cohérents, maintenir la continuité narrative ou traiter des livres entiers. Vous pouvez envoyer un grand bloc de texte, obtenir une sortie cohérente, puis l'alimenter dans votre API TTS. La fenêtre de contexte plus grande réduit le besoin d'une logique de découpage complexe dans votre code. Elle simplifie l'architecture de votre pipeline vocal et garantit que la sortie est fluide et cohérente.

Streaming pour le sous-titrage en temps réel

Pour les applications en temps réel, telles que le sous-titrage en direct ou les assistants vocaux interactifs, la latence est essentielle. Notre API prend en charge le streaming via Server-Sent Events (SSE). Cela vous permet de recevoir le texte au fur et à mesure de sa génération, plutôt que d'attendre la réponse entière. Cela est crucial pour maintenir une expérience utilisateur fluide.

Combiné avec un fournisseur TTS rapide, le streaming peut créer un pipeline vocal quasi instantané. Le LLM génère le texte, le diffuse vers votre application, et l'API TTS le prononce en temps réel. C'est idéal pour les chatbots, les transcriptions en direct ou le récit interactif. Le modèle sans censure garantit que le texte diffusé n'est pas interrompu par des refus de contenu, offrant une expérience cohérente à l'utilisateur.

Tarification pour le traitement de texte à haut volume

Notre tarification est simple et transparente. Vous payez ce que vous utilisez. Il n'y a pas de frais mensuels ni d'abonnements. Le prix est de 0,25 $ par 1 million de tokens d'entrée et de 1,00 $ par 1 million de tokens de sortie. C'est compétitif pour le traitement de texte à haut volume. Vous pouvez recharger votre compte avec un crédit prépayé, à partir de 10 $. Vous pouvez payer par crypto (USDT ou USDC).

Si vous rechargez 50 $ ou plus, vous obtenez un bonus de 5 %. Si vous rechargez 100 $ ou plus, vous obtenez un bonus de 10 %. Cela rend rentable le traitement de grands volumes de texte pour votre pipeline TTS. Le crédit n'expire jamais. Vous pouvez régénérer votre clé API à tout moment. L'essai vous donne 0,50 $ de crédit pendant 7 jours, sans carte requise. Cela vous permet de tester l'intégration avec votre API Text To Speech avant de vous engager.

Questions et réponses

Le modèle sans censure génère-t-il de l'audio ?

Non. L'API est une API de chat-completions textuelle uniquement. Elle prend du texte en entrée et renvoie du texte en sortie. Vous avez besoin d'une API Text To Speech distincte pour convertir la sortie en audio. Notre API est conçue pour fournir le texte brut et non filtré dont votre moteur TTS a besoin.

Quelle est la taille de la fenêtre de contexte ?

La fenêtre de contexte est de 100 000 tokens. Cela inclut à la fois le prompt d'entrée et la complétion de sortie. Cela vous permet de traiter de longs scripts ou de grands ensembles de données en une seule requête sans les diviser en morceaux plus petits.

Le modèle est-il GPT ou Claude ?

Non. L'identifiant du modèle est « uncensored ». Il s'agit d'un modèle à poids ouverts exécuté sur nos propres serveurs GPU. Ce n'est pas GPT, Claude, Gemini, Grok ou le modèle d'un autre fournisseur. Il est spécifiquement ajusté pour la génération de contenu sans refus.

Combien cela coûte-t-il ?

Le prix est de 0,25 $ par 1 million de tokens d'entrée et de 1,00 $ par 1 million de tokens de sortie. Il n'y a pas de frais mensuels. Vous payez ce que vous utilisez avec un crédit prépayé. Les recharges commencent à 10 $, avec des bonus pour les montants plus élevés.

Votre clé est à un formulaire de vous

Créez un compte, copiez la clé, modifiez l’URL de base. C’est toute la configuration.

Obtenir la clé APILire la documentation