文本转语音 API:如何使用无审查 LLM 处理语音脚本和字幕
文本转语音 API 将书面脚本转换为语音,但语音质量完全取决于接收到的文本。通过使用无审查 LLM 进行后处理,开发人员可以生成传统 AI 可能会软化或拒绝的原始、无过滤脚本和字幕,确保你的语音管道在不中断的情况下处理边缘情况和成人内容。
已更新Speech To Text API
为什么 TTS 需要无审查后端
大多数开发人员认为他们的文本转语音 API 只是一个渲染器。它接收文本并生成音频。但它接收到的文本通常来自经过重度过滤的通用 AI。如果你为创意内容、安全研究或成人娱乐生成脚本,标准 LLM 可能会拒绝生成特定短语、清理俚语或改变语气以使其更“企业化”。这会造成瓶颈,使你的语音管道交付经过清理的创意意图版本。
通过将无审查 LLM 集成到文本生成的后端,你可以确保到达 TTS 引擎的脚本正是你所要求的。这对于语言细微差别很重要的用例至关重要。如果 LLM 拒绝合法但边缘的话题,你的 TTS API 就没有内容可说。无审查模型消除了这些任意拒绝,让你完全控制要配音的内容。
LLM 在语音管道中的作用
在现代语音管道中,LLM 充当大脑。它接收你的提示词并将原始想法结构化为一个清晰的脚本。该脚本随后流入文本转语音 API。LLM 处理格式、语气和结构。TTS API 处理音频合成。如果 LLM 限制过多,TTS API 听起来会很平淡。如果 LLM 过于富有创意,TTS API 可能会难以处理复杂的语法。
我们的 API 提供一个 OpenAI 兼容的接口,服务于单一的无审查模型。该模型经过调整,可在合法成人用途中无内容拒绝地回答。它不是 GPT、Claude 或其他供应商的模型。它在我们的自有 GPU 服务器上运行。这意味着你在文本输出中获得可预测、一致的语音。模型 ID 为 "uncensored"。你输入文本,得到文本输出。没有嵌入、没有图像、没有视频。只有纯粹的、无过滤的语言用于你的语音管道。
无内容过滤的脚本生成
在为旁白生成脚本时,内容过滤器可能很烦人。它们可能会阻止完全合法但被认为敏感的词汇。它们可能会拒绝生成反派角色的对话,因为语气太黑暗。使用无审查 LLM,你可以生成反映你内容真实本质的脚本。这对于创意写作、成人媒体或利基爱好者社区尤为重要。
该模型不会拒绝合法的成人、虚构、安全研究或争议性话题。它仅阻止涉及未成年人的性内容。这一硬性限制确保你可以将 API 用于任何其他合法用途,而无需担心突然的拒绝。你可以生成长篇脚本、角色对话或旁白,而无需 LLM 对你的创意选择进行二次猜测。结果是更干净、更直接的文本输出,你的 TTS API 可以在不修改的情况下处理。
字幕与字幕:处理边缘情况
生成字幕和字幕通常需要处理混乱的真实世界语音。ASR 系统会产生错误。它们会漏掉单词、误解口音并添加填充音。无审查 LLM 可以在不软化含义的情况下清理此输出。它可以纠正语法,同时保留原始语气和词汇。这对于保持口语内容的真实性至关重要。
标准 LLM 可能会过度纠正,使字幕听起来过于正式。你可以提示无审查模型保留原始对话的粗犷风格。这适用于纪录片、采访或随意拍摄的 vlog。LLM 处理文本,输出结果准备好供你的 TTS API 重新配音,或由字幕生成器进行时间轴同步。上下文窗口允许你处理整集内容,确保整个转录的一致性。
ASR 输出后处理
自动语音识别 (ASR) 系统正在改进,但并非完美。它们在同音异义词、专有名词和复杂句子结构方面存在困难。使用 LLM 进行后处理可以修复这些错误。无审查 LLM 可以重写转录内容以提高可读性,同时保留原始含义。当 ASR 输出包含 AI 可能会误解的俚语或行话时,这特别有用。
通过使用我们的无审查模型,你可以确保后处理文本保留原始说话者的声音。该模型经过调整,可以无拒绝地回答,因此它不会因为声音不寻常而丢弃内容。你可以发送原始 ASR 输出,获得清理后的版本,然后将其输入到你的文本转语音 API 进行重新合成或归档。这为高质量语音内容创建了一个强大的管道。
与 TTS 提供商集成
我们的 API 旨在与任何 TTS 提供商配合使用。它是一个 OpenAI 兼容的 chat-completions API。你可以使用官方的 OpenAI SDK 或任何支持 OpenAI 格式的客户端。Base URL 是 https://api.speechtotextapis.com/v1.。你只需更改 Base URL 并提供 API 密钥即可。模型 ID 为 "uncensored"。这使得集成变得简单且灵活。
由于 API 是文本输入、文本输出,它可以无缝集成到你现有的工作流程中。你生成文本,然后将其发送给你的 TTS 提供商。模型的无审查性质确保文本在没有隐藏过滤器的情况下到达你的 TTS 提供商。这意味着你的语音管道仅受你的创造力限制,而不受 AI 内容政策的限制。你可以测试不同的提示词和风格,而无需担心拒绝。
上下文窗口:100,000 token 用于长脚本
语音管道中最大的挑战之一是处理长脚本。如果你的上下文窗口太小,你就必须将脚本拆分为块。这可能会破坏叙事流程或导致语气不一致。我们的 API 支持 100,000 token 的上下文窗口。这允许你在单次请求中处理长脚本、整集节目或大型数据集。
这对于生成一致的角色、保持叙事连续性或处理整本书很有用。你可以发送大块文本,获得连贯的输出,然后将其输入到你的 TTS API。较大的上下文窗口减少了代码中复杂分块逻辑的需求。它简化了你的语音管道架构,并确保输出平滑且一致。
流式输出用于实时字幕
对于实时应用程序,如实时字幕或交互式语音助手,延迟是关键。我们的 API 支持通过服务器发送事件 (SSE) 进行流式输出。这允许你接收生成的文本,而不是等待整个响应。这对于保持流畅的用户体验至关重要。
与快速的 TTS 提供商结合使用时,流式输出可以创建近乎即时的语音管道。LLM 生成文本,将其流式传输到你的应用程序,TTS API 实时朗读。这非常适合聊天机器人、实时转录或交互式故事讲述。无审查模型确保流式传输的文本不会因内容拒绝而中断,为用户提供一致的体验。
大规模文本处理的定价
我们的定价简单透明。你按使用量付费。没有月费或订阅。价格为每 100 万输入 token $0.25,每 100 万输出 token $1.00。这对于大规模文本处理具有竞争力。你可以使用预付额度充值你的账户,从 $10 起。你可以通过加密货币 (USDT 或 USDC) 支付。
如果你充值 $50 或更多,你将获得 5% 的奖励。如果你充值 $100 或更多,你将获得 10% 的奖励。这使得为你的 TTS 管道处理大量文本具有成本效益。额度永不过期。你可以随时重新生成你的 API 密钥。试用版提供 $0.50 的额度,有效期 7 天,无需信用卡。这允许你在承诺之前测试与你的文本转语音 API 的集成。
问答
无审查模型会生成音频吗?
不是。该 API 是一个纯文本聊天补全 API。它接收文本输入并返回文本输出。你需要一个单独的 Text To Speech API 将输出转换为音频。我们的 API 旨在提供你的 TTS 引擎所需的原始、无过滤文本。
上下文窗口大小是多少?
上下文窗口为 100,000 token。这包括输入提示词和输出补全。这允许你在单次请求中处理长脚本或大型数据集,而无需将其拆分为较小的块。
该模型是 GPT 还是 Claude?
不是。模型 ID 为 "uncensored"。这是一个在自有 GPU 服务器上运行的开放权重模型。它不是 GPT、Claude、Gemini、Grok 或其他供应商的模型。它专为无拒绝的内容生成而调整。
费用是多少?
价格为每 100 万输入 token $0.25,每 100 万输出 token $1.00。没有月费。你使用预付额度按量付费。充值从 $10 起,大额充值有额外奖励。