語音合成 API:如何使用無審查 LLM 製作語音腳本與字幕
語音合成 API 將書面腳本轉換為語音,但該語音的品質完全取決於它接收的文字。透過使用無審查 LLM 進行後處理,開發人員可以生成原始、無過濾的腳本和字幕,傳統 AI 可能會柔化或拒絕這些內容,確保你的語音管道能無縫處理邊緣案例與成人內容。
更新Speech To Text API
為什麼語音管道需要無審查後端
大多數開發者認為他們的語音合成 API 僅是一個渲染器。它接收文字並產生音訊。但它接收的文字通常來自經過嚴格過濾的通用 AI。如果你為創意內容、安全研究或成人娛樂生成腳本,標準 LLM 可能會拒絕生成特定短語、修飾俚語,或將語調調整得更「企業化」。這會造成瓶頸,使你的語音管道交付柔化後的創意意圖。
透過將無審查 LLM 整合為文字生成的後端,你確保傳送至語音引擎的腳本完全符合你的要求。這對於語言細微差別至關重要的用例非常關鍵。如果 LLM 拒絕合法但具爭議性的主題,你的語音 API 就沒有內容可讀。無審查模型消除了這些任意拒絕,讓你完全掌控要配音的內容。
LLM 在語音管道中的角色
在現代語音管道中,LLM 扮演大腦的角色。它接收你的提示詞並將原始想法結構化為清晰的腳本。此腳本隨後流入語音合成 API。LLM 處理格式、語調和結構。TTS API 處理音訊合成。如果 LLM 限制過多,TTS API 聽起來會單調乏味;如果 LLM 過於創意,TTS API 可能會難以處理複雜語法。
我們的 API 提供 OpenAI 相容的端點,服務單一無審查模型。該模型經過調整,可針對合法成人用途無拒絕地回答。它不是 GPT、Claude 或任何其他廠商的模型。它在我們自己的 GPU 伺服器上運行。這意味著你在文字輸出中獲得可預測、一致的語音。模型 ID 為「uncensored」。輸入文字,輸出文字。沒有嵌入、沒有圖片、沒有影片。只有純粹、無過濾的文字供你的語音管道使用。
無內容過濾的腳本生成
為語音旁白生成腳本時,內容過濾可能會造成干擾。它們可能會阻止完全合法但被視為敏感的詞彙。它們可能會拒絕生成反派角色的對話,因為語調過於陰暗。使用無審查 LLM,你可以生成反映內容真實性質的腳本。這對於創意寫作、成人媒體或利基愛好者社群尤為重要。
該模型不會拒絕合法的成人、虛構、安全研究或爭議性主題。它僅阻止涉及未成年人的性內容。此硬性限制確保你可以將 API 用於任何其他合法用途,而不必擔心突然的拒絕。你可以生成長篇腳本、角色對話或旁白,無需 LLM 對你的創意選擇猶豫不決。結果是更乾淨、更直接的文字輸出,你的語音 API 可以直接處理而無需修改。
字幕與副標題:處理邊緣案例
生成字幕與副標題通常需要處理雜亂的真實世界語音。語音辨識系統會產生錯誤。它們會遺漏詞彙、誤解口音並添加填充音。無審查 LLM 可以清理此輸出而不弱化含義。它可以修正語法,同時保留原始語調與詞彙。這對於維持口語內容的真實性至關重要。
標準 LLM 可能會過度修正,使字幕聽起來過於正式。無審查模型可以提示保留原始語音的原始、粗獷性質。這對於紀錄片、訪談或隨性部落格很有用。LLM 處理文字,輸出結果準備好供你的語音 API 重新配音或供你的字幕生成器進行時間對齊。上下文視窗允許你處理整集節目,確保整個轉錄的一致性。
ASR 輸出後處理
語音辨識 (ASR) 系統正在改進,但並不完美。它們難以處理同音異義字、專有名詞和複雜的句法結構。使用 LLM 進行後處理可以修正這些錯誤。無審查 LLM 可以重寫轉錄內容以提高可讀性,同時保留原始含義。當 ASR 輸出包含 AI 可能會誤解的俚語或術語時,這特別有用。
透過使用我們的無審查模型,你可以確保後處理文字保留原始說話者的語氣。該模型經過調校以無拒絕地回答,因此不會因為內容聽起來不尋常就刪除內容。你可以發送原始 ASR 輸出,取得清理後的版本,然後將其饋入語音合成 API 進行重新合成或存檔。這為高品質語音內容建立了穩健的管道。
與語音供應商整合
我們的 API 設計用於與任何 TTS 供應商搭配運作。它是 OpenAI 相容的聊天補全 API。你可以使用官方的 OpenAI SDK 或任何支援 OpenAI 格式的客戶端。Base URL 為 https://api.speechtotextapis.com/v1.。你只需更改 Base URL 並提供 API 金鑰即可。模型 ID 為「uncensored」。這使得整合既簡單又具彈性。
由於 API 是文字輸入、文字輸出,它可以無縫整合到你現有的工作流程中。你生成文字,然後將其發送給語音供應商。模型的無審查性質確保文字在沒有隱藏過濾的情況下到達語音供應商。這意味著你的語音管道僅受限於你的創意,而非 AI 的內容政策。你可以測試不同的提示詞與風格,無需擔心拒絕。
上下文視窗:100,000 token 處理長腳本
語音管道中最大的挑戰之一是處理長腳本。如果你的上下文視窗太小,你必須將腳本分割成區塊。這可能會破壞敘事流程或導致語調不一致。我們的 API 支援 100,000 token 上下文視窗。這允許你在單一請求中處理長腳本、整集節目或大型資料集。
這對於生成一致的角色、維持敘事連續性或處理整本書很有用。你可以發送大量文字,獲得一致的輸出,然後將其輸入語音 API。較大的上下文視窗減少了程式碼中複雜區塊邏輯的需求。它簡化了語音管道的架構,並確保輸出平滑且一致。
串流輸出用於即時字幕
對於即時應用程式,如即時字幕或互動式語音助手,延遲至關重要。我們的 API 支援透過伺服器發送事件 (SSE) 進行串流輸出。這允許你在文字生成時接收文字,而不是等待整個回應。這對於維持流暢的使用者體驗至關重要。
與快速的語音供應商結合時,串流輸出可以創建近乎即時的語音管道。LLM 生成文字,將其串流輸出到你的應用程式,語音 API 即時朗讀。這非常適合聊天機器人、即時轉錄或互動式故事講述。無審查模型確保串流文字不會因內容拒絕而中斷,為使用者提供一致的體驗。
大量文字處理的定價
我們的定價簡單透明。你為所用付費。沒有月費或訂閱費。價格為每 100 萬輸入 token $0.25,每 100 萬輸出 token $1.00。對於大量文字處理來說,這具有競爭力。你可以使用預付額度儲值帳戶,最低 $10。你可以透過加密貨幣(USDT 或 USDC)付款。
若儲值 $50 或以上,你可獲得 5% 獎勵。若儲值 $100 或以上,你可獲得 10% 獎勵。這使得為你的 TTS 管道處理大量文字更具成本效益。額度永不過期。你可以隨時重新生成 API 金鑰。試用版提供 $0.50 額度,有效期 7 天,無需信用卡。這允許你在承諾之前測試與語音合成 API 的整合。
問答
無審查模型會生成音訊嗎?
不是。此 API 為純文字聊天補全 API。它接收文字輸入並回傳文字輸出。你需要額外的語音合成 API 將輸出轉換為音訊。我們的 API 旨在提供你的 TTS 引擎所需的原始、無過濾文字。
上下文視窗大小是多少?
上下文視窗為 100,000 token。這包含輸入提示詞與輸出補全。這允許你在單一請求中處理長腳本或大型資料集,無需將其分割成較小的區塊。
該模型是 GPT 或 Claude 嗎?
不是。模型 ID 為「uncensored」。這是一個在我們自有 GPU 伺服器上運行的開放權重模型。它不是 GPT、Claude、Gemini、Grok 或任何其他廠商的模型。它經過特別調整,專門用於無拒絕的內容生成。
費用是多少?
價格為每 100 萬輸入 token $0.25,每 100 萬輸出 token $1.00。沒有月費。你使用預付額度按用量付費。儲值最低 $10,金額越大贈送越多。