ES ▾

speechtotextapis.comLLM sin censura para postprocesamiento de pipelines de texto

Speech To Text API
Obtener clave de API

API de Text To Speech: Cómo usar un LLM sin censura para guiones y subtítulos de voz

Una API de Text To Speech convierte guiones escritos en audio hablado, pero la calidad de esa voz depende enteramente del texto que recibe. Al usar un LLM sin censura para el postprocesamiento, los desarrolladores pueden generar guiones y subtítulos crudos y sin filtros que la IA tradicional podría suavizar o rechazar, asegurando que tu pipeline de voz maneje casos extremos y contenido para adultos sin interrupciones.

ActualizadoSpeech To Text API

Por qué TTS necesita un backend sin censura

La mayoría de los desarrolladores asumen que su API de Text To Speech es solo un renderizador. Toma texto y produce audio. Pero el texto que recibe a menudo proviene de una IA de propósito general que ha sido fuertemente filtrada. Si estás generando guiones para contenido creativo, investigación de seguridad o entretenimiento para adultos, los LLM estándar pueden negarse a generar frases específicas, sanitizar jerga o alterar el tono para hacerlo más "corporativo". Esto crea un cuello de botella donde tu pipeline de voz entrega una versión sanitizada de tu intención creativa.

Al integrar un LLM sin censura como backend para tu generación de texto, te aseguras de que el guion que llega a tu motor TTS sea exactamente lo que pediste. Esto es crítico para casos de uso donde la sutileza del lenguaje importa. Si el LLM rechaza un tema legal pero atrevido, tu API TTS no tiene nada que hablar. Un modelo sin censura elimina estos rechazos arbitrarios, dándote control total sobre el contenido que se va a voicear.

El rol del LLM en pipelines de voz

En un pipeline de voz moderno, el LLM actúa como el cerebro. Toma tu prompt y estructura las ideas crudas en un guion limpio. Este guion luego fluye hacia la API de Text To Speech. El LLM maneja el formato, el tono y la estructura. La API TTS maneja la síntesis de audio. Si el LLM es demasiado restrictivo, la API TTS suena monótona. Si el LLM es demasiado creativo, la API TTS podría tener dificultades con la sintaxis compleja.

Nuestra API proporciona un endpoint compatible con OpenAI que sirve un único modelo sin censura. Este modelo está ajustado para responder sin rechazos de contenido para uso adulto legal. No es GPT, Claude ni ningún otro modelo de proveedor. Se ejecuta en nuestros propios servidores GPU. Esto significa que obtienes una voz predecible y consistente en tu salida de texto. El id del modelo es "uncensored". Envías texto y recibes texto. Sin embeddings, sin imágenes, sin video. Solo lenguaje puro y sin filtros para tu pipeline de voz.

Generación de guiones sin filtros de contenido

Al generar guiones para doblaje, los filtros de contenido pueden ser una molestia. Pueden bloquear palabras que son perfectamente legales pero se consideran sensibles. Pueden negarse a generar diálogos para un personaje villano porque el tono es demasiado oscuro. Con un LLM sin censura, puedes generar guiones que reflejen la verdadera naturaleza de tu contenido. Esto es especialmente importante para escritura creativa, medios para adultos o comunidades de nicho.

El modelo no rechaza contenido adulto legal, ficción, investigación de seguridad o temas controversiales. Solo bloquea contenido sexual que involucre menores. Este límite estricto asegura que puedas usar la API para cualquier otro propósito legal sin miedo a rechazos repentinos. Puedes generar guiones de formato largo, diálogos de personajes o narraciones sin que el LLM cueste tus decisiones creativas. El resultado es una salida de texto más limpia y directa que tu API TTS puede procesar sin modificaciones.

Subtítulos: manejo de casos extremos

Generar subtítulos y leyendas a menudo requiere manejar el habla real y desordenada. Los sistemas ASR producen errores. Pierden palabras, malinterpretan acentos y añaden sonidos de relleno. Un LLM sin censura puede limpiar esta salida sin suavizar el significado. Puede corregir la gramática preservando el tono y el vocabulario originales. Esto es crucial para mantener la autenticidad del contenido hablado.

Los LLM estándar pueden corregir en exceso, haciendo que los subtítulos suenen demasiado formales. Un modelo sin censura puede tener instrucciones para retener la naturaleza cruda y áspera del habla original. Esto es útil para documentales, entrevistas o vlogs casuales. El LLM procesa el texto y la salida está lista para que tu API TTS la voicee nuevamente o para que tu generador de subtítulos la sincronice. La ventana de contexto te permite procesar episodios completos, asegurando la consistencia en toda la transcripción.

Postprocesamiento de salida ASR

Los sistemas de Reconocimiento Automático del Habla (ASR) están mejorando, pero no son perfectos. Tienen dificultades con homófonos, nombres propios y estructuras de oraciones complejas. El postprocesamiento con un LLM puede corregir estos errores. Un LLM sin censura puede reescribir la transcripción para que sea más legible manteniendo el significado original. Esto es especialmente útil cuando la salida ASR contiene jerga o jerga técnica que la IA podría malinterpretar.

Al usar nuestro modelo sin censura, puedes asegurar que el texto postprocesado conserve la voz del hablante original. El modelo está ajustado para responder sin rechazos, por lo que no eliminará contenido solo porque suene inusual. Puedes enviar la salida ASR cruda, obtener una versión limpiada y luego alimentarla a tu API de Text To Speech para resíntesis o archivo. Esto crea un pipeline robusto para contenido de voz de alta calidad.

Integración con proveedores TTS

Nuestra API está diseñada para funcionar con cualquier proveedor TTS. Es una API de chat-completions compatible con OpenAI. Puedes usar los SDK oficiales de OpenAI o cualquier cliente que soporte el formato OpenAI. La Base URL es https://api.speechtotextapis.com/v1. Cambias la Base URL y proporcionas tu clave de API. El id del modelo es "uncensored". Esto hace que la integración sea simple y flexible.

Dado que la API es texto de entrada, texto de salida, se integra perfectamente en tu flujo de trabajo existente. Generas el texto y luego lo envías a tu proveedor TTS. La naturaleza sin censura del modelo asegura que el texto llegue a tu proveedor TTS sin filtros ocultos. Esto significa que tu pipeline de voz está limitado solo por tu creatividad, no por la política de contenido de la IA. Puedes probar diferentes prompts y estilos sin preocuparte por los rechazos.

Ventana de contexto: 100,000 tokens para guiones largos

Uno de los mayores desafíos en los pipelines de voz es procesar guiones largos. Si tu ventana de contexto es demasiado pequeña, tienes que dividir el guion en fragmentos. Esto puede romper el flujo de la narrativa o causar inconsistencias en el tono. Nuestra API admite una ventana de contexto de 100,000 tokens. Esto te permite procesar guiones largos, episodios completos o conjuntos de datos grandes en una sola petición.

Esto es útil para generar personajes consistentes, mantener la continuidad narrativa o procesar libros completos. Puedes enviar un bloque grande de texto, obtener una salida coherente y luego alimentarlo a tu API TTS. La ventana de contexto más grande reduce la necesidad de lógica compleja de fragmentación en tu código. Simplifica la arquitectura de tu pipeline de voz y asegura que la salida sea fluida y consistente.

Streaming para subtítulos en tiempo real

Para aplicaciones en tiempo real, como subtítulos en vivo o asistentes de voz interactivos, la latencia es clave. Nuestra API admite streaming mediante Server-Sent Events (SSE). Esto te permite recibir el texto a medida que se genera, en lugar de esperar a toda la respuesta. Esto es crucial para mantener una experiencia de usuario fluida.

Combinado con un proveedor TTS rápido, el streaming puede crear un pipeline de voz casi instantáneo. El LLM genera el texto, lo transmite a tu aplicación y la API TTS lo habla en tiempo real. Esto es ideal para chatbots, transcripciones en vivo o narración interactiva. El modelo sin censura asegura que el texto transmitido no sea interrumpido por rechazos de contenido, proporcionando una experiencia consistente para el usuario.

Precios para procesamiento de texto a gran escala

Nuestros precios son simples y transparentes. Pagas por lo que usas. No hay tarifas mensuales ni suscripciones. El precio es $0,25 por 1 millón de tokens de entrada y $1,00 por 1 millón de tokens de salida. Esto es competitivo para el procesamiento de texto a gran escala. Puedes recargar tu cuenta con crédito prepago, comenzando desde $10. Puedes pagar con criptomonedas (USDT o USDC).

Si recargas $50 o más, obtienes un bono del 5%. Si recargas $100 o más, obtienes un bono del 10%. Esto hace que sea rentable procesar grandes volúmenes de texto para tu pipeline TTS. El crédito no caduca. Puedes regenerar tu clave de API en cualquier momento. La prueba te da $0,50 de crédito durante 7 días, sin necesidad de tarjeta. Esto te permite probar la integración con tu API de Text To Speech antes de comprometerte.

Preguntas y respuestas

¿El modelo sin censura genera audio?

No. La API es de texto únicamente. Recibe texto y devuelve texto. Necesitas una API de Text To Speech separada para convertir la salida en audio. Nuestra API está diseñada para proporcionar el texto crudo y sin filtros que necesita tu motor TTS.

¿Cuál es el tamaño de la ventana de contexto?

La ventana de contexto es de 100,000 tokens. Esto incluye tanto el prompt de entrada como la finalización de salida. Esto te permite procesar guiones largos o conjuntos de datos grandes en una sola petición sin dividirlos en fragmentos más pequeños.

¿Es el modelo GPT o Claude?

No. El id del modelo es "uncensored". Es un modelo de pesos abiertos ejecutado en nuestros propios servidores. No es GPT, Claude, Gemini, Grok ni ningún otro modelo de proveedor. Está ajustado específicamente para generación de contenido sin rechazos.

¿Cuánto cuesta?

El precio es $0,25 por 1 millón de tokens de entrada y $1,00 por 1 millón de tokens de salida. No hay tarifas mensuales. Pagas por lo que usas con crédito prepago. Las recargas comienzan en $10, con bonificaciones para montos mayores.

Tu clave está a un formulario de distancia

Crea una cuenta, copia la clave y cambia la URL base. Eso es todo el proceso de configuración.

Obtener clave de APILeer la documentación