音声用スクリプト&字幕に無検閲LLMを使う方法
Text To Speech APIはテキスト形式のスクリプトを音声に変換しますが、その音声の品質は受け取るテキストに完全に依存します。後処理に無検閲LLMを使用することで、開発者は従来のAIが弱めたり拒否したりする可能性のある生でフィルタリングされていないスクリプトやキャプションを生成でき、エッジケースや成人向けコンテンツでも音声パイプラインを途切れることなく処理できます。
更新済みSpeech To Text API
TTSに無検閲バックエンドが必要な理由
ほとんどの開発者は、音声合成APIが単なるレンダラーであると想定しています。テキストを入力して音声を生成します。しかし、受け取るテキストはしばしば強力なフィルタリングが施された汎用AIから来ます。クリエイティブなコンテンツ、セキュリティ研究、またはアダルトエンターテインメント用のスクリプトを生成する場合、標準的なLLMは特定のフレーズの生成を拒否したり、スラングをサニタイズしたり、トーンをより「コーポレート」なものに変更したりする可能性があります。これにより、音声パイプラインがクリエイティブな意図のサニタイズされたバージョンのみを配信するというボトルネックが生じます。
テキスト生成のバックエンドとして無検閲LLMを統合することで、TTSエンジンに届くスクリプトがまさにあなたが求めたものであることを保証します。これは言語のニュアンスが重要なユースケースで重要です。LLMが法的だがエッジなトピックを拒否した場合、TTS APIは話すものがなくなります。無検閲モデルはこれらの任意の拒否を除去し、音声化されるコンテンツに対する完全な制御権をあなたに与えます。
音声パイプラインにおけるLLMの役割
現代の音声パイプラインでは、LLMは脳として機能します。プロンプトを入力として受け取り、生アイデアをクリーンなスクリプトに構造化します。このスクリプトは次に音声合成APIに流れます。LLMはフォーマット、トーン、構造を処理します。TTS APIは音声合成を処理します。LLMが制限が強すぎると、TTS APIは単調に聞こえます。LLMが創造的すぎると、TTS APIは複雑な構文で苦労する可能性があります。
当APIは、単一の無検閲モデルを提供するOpenAI互換エンドポイントです。このモデルは、法的な成人向け用途に対してコンテンツ拒否なしで回答するようにチューニングされています。これはGPT、Claude、またはその他のベンダーのモデルではありません。当社のGPUサーバー上で動作します。つまり、テキスト出力に一貫したトーンが得られます。モデルIDは「uncensored」です。テキストを入力すると、テキストが返されます。埋め込み、画像、動画はありません。あなたの音声パイプラインのための純粋でフィルタリングされていない言語のみです。
コンテンツフィルタなしのスクリプト生成
ボイスオーバー用のスクリプトを生成する際、コンテンツフィルタは邪魔になることがあります。完全に合法な単語でもセンシティブと見なされてブロックされることがあります。トーンが暗すぎるとして、悪役のセリフ生成を拒否することもあります。無検閲LLMを使用すれば、コンテンツの真の性質を反映したスクリプトを生成できます。これはクリエイティブライティング、成人向けメディア、またはニッチなホビーコミュニティにとって特に重要です。
モデルは、法的な大人向け、フィクション、セキュリティ研究、または論争的なトピックを拒否しません。未成年者との性的コンテンツのみをブロックします。このハードリミットにより、突然の拒否の恐れなく他のあらゆる法的な目的でAPIを使用できます。LLMがクリエイティブな選択を二の次にすることなく、長編スクリプト、キャラクターのダイアログ、またはナレーションを生成できます。結果として、TTS APIが修正なしで処理できる、よりクリーンで直接的なテキスト出力が得られます。
字幕&字幕:境界ケースの処理
キャプションや字幕の生成では、現実世界の雑多な音声の処理が必要になることがよくあります。ASRシステムはエラーを生成します。単語の聞き逃し、アクセントの誤解、フィラー音の付加などがあります。無検閲LLMは意味を弱めずにこの出力をクリーンアップできます。元のトーンと語彙を保持しつつ、文法を修正できます。これは音声コンテンツの真正性を維持するために不可欠です。
標準的なLLMは過剰に補正し、字幕があまりにフォーマルに聞こえることがあります。無検閲モデルは、元のスピーチの生で荒々しい性質を保持するようにプロンプトすることができます。これはドキュメンタリー、インタビュー、またはカジュアルなブログに役立ちます。LLMはテキストを処理し、出力はTTS APIが再音声化するか、字幕ジェネレーターがタイミングを設定する準備ができています。コンテキストウィンドウにより、エピソード全体を処理でき、トランスクリプト全体で一貫性を保証します。
ASR出力の後処理
自動音声認識(ASR)システムは改善されていますが、完璧ではありません。同音異義語、固有名詞、複雑な文構造で苦労します。LLMによる後処理でこれらのエラーを修正できます。無検閲LLMは、元の意味を保持しながらトランスクリプトを読みやすく書き直すことができます。これは、ASR出力にAIが誤解する可能性のあるスラングや専門用語が含まれている場合に特に役立ちます。
当社の無検閲モデルを使用することで、後処理されたテキストが元の話者の声を保持することを保証できます。モデルは拒否なしで回答するようにチューニングされているため、不自然に聞こえてもコンテンツをドロップしません。生のASR出力を送信し、クリーンアップされたバージョンを取得し、それを音声合成またはアーカイブ用に音声合成APIにフィードバックできます。これにより、高品質な音声コンテンツのための堅牢なパイプラインが作成されます。
TTSプロバイダーとの統合
当APIは任意のTTSプロバイダーと連携するように設計されています。OpenAI互換のチャット完了APIです。公式のOpenAI SDKまたはOpenAI形式をサポートする任意のクライアントを使用できます。ベースURLはhttps://api.speechtotextapis.com/v1.です。ベースURLを変更し、APIキーを提供します。モデルIDは「uncensored」です。これにより、統合はシンプルで柔軟になります。
APIがテキスト入力・テキスト出力であるため、既存のワークフローにシームレスに適合します。テキストを生成し、次にTTSプロバイダーに送信します。モデルの無検閲な性質により、テキストは隠れたフィルタなしでTTSプロバイダーに到達します。これは、音声パイプラインがAIのコンテンツポリシーではなく、あなたのクリエイティビティによってのみ制限されることを意味します。拒否を気にせずに異なるプロンプトとスタイルをテストできます。
コンテキストウィンドウ:長いスクリプト用100,000トークン
音声パイプラインにおける最大の課題の一つは、長いスクリプトの処理です。コンテキストウィンドウが小さすぎると、スクリプトをチャンクに分割する必要があります。これにより、ナラティブの流れが断ち切られたり、トーンの一貫性が損なわれたりする可能性があります。当APIは100,000トークンのコンテキストウィンドウをサポートしています。これにより、長いスクリプト、エピソード全体、または大規模なデータセットを単一のリクエストで処理できます。
これは、一貫性のあるキャラクターの生成、ナラティブの継続性の維持、または書籍全体の処理に役立ちます。大きなテキストブロックを送信し、一貫性のある出力を取得し、それをTTS APIにフィードバックできます。大きなコンテキストウィンドウは、コード内の複雑なチャンキングロジックの必要性を減らします。音声パイプラインのアーキテクチャを簡素化し、出力が滑らかで一貫していることを保証します。
リアルタイム字幕用のストリーミング
ライブ字幕やインタラクティブな音声アシスタントなどのリアルタイムアプリケーションでは、レイテンシが鍵です。当APIはサーバー送信イベント(SSE)を介したストリーミングをサポートしています。これにより、応答全体を待つのではなく、生成されるテキストを受信できます。これは、スムーズなユーザーエクスペリエンスを維持するために不可欠です。
高速なTTSプロバイダーと組み合わせることで、ストリーミングはほぼ即時の音声パイプラインを作成できます。LLMはテキストを生成し、アプリケーションにストリーミングし、TTS APIはリアルタイムでそれを音声化します。これはチャットボット、ライブ文字起こし、またはインタラクティブなストーリーテリングに最適です。無検閲モデルにより、ストリーミングテキストはコンテンツ拒否によって中断されず、ユーザーに一貫したエクスペリエンスを提供します。
大量テキスト処理の価格表
当社の料金体系はシンプルで透明性があります。利用分のみお支払いください。月額料金やサブスクリプションはありません。料金は、入力トークン100万トークンあたり$0.25、出力トークン100万トークンあたり$1.00です。これは大量のテキスト処理にとって競争力があります。前払いクレジットでアカウントにチャージでき、$10から開始できます。暗号通貨(USDTまたはUSDC)でお支払いいただけます。
$50以上チャージすると、5%のボーナスが付与されます。$100以上チャージすると、10%のボーナスが付与されます。これにより、TTSパイプラインのための大量のテキスト処理がコスト効果的になります。クレジットは期限切れになりません。APIキーはいつでも再生成できます。トライアルでは、カード不要で7日間の$0.50クレジットが提供されます。これにより、コミットする前にText To Speech APIとの統合をテストすることができます。
質問と回答
無検閲モデルは音声を生成しますか?
いいえ。APIはテキストのみのチャット完了APIです。テキストを入力してテキストを返します。出力を音声に変換するには別の音声合成APIが必要です。当APIはTTSエンジンに必要な生でフィルタリングされていないテキストを提供するために設計されています。
コンテキストウィンドウのサイズは?
コンテキストウィンドウは100,000トークンです。入力プロンプトと出力完了の両方を含みます。これにより、分割せずに単一のリクエストで長いスクリプトや大規模なデータセットを処理できます。
モデルはGPTやClaudeですか?
いいえ。モデルIDは「uncensored」です。これは当社のGPUサーバーで実行されるオープンウェイトモデルです。GPT、Claude、Gemini、Grok、または他のベンダーのモデルではありません。拒否なしのコンテンツ生成用に特別にチューニングされています。
コストはいくらですか?
価格は入力トークン100万あたり$0.25、出力トークン100万あたり$1.00です。月額料金はありません。前払いクレジットで使った分だけ支払います。チャージは$10から開始でき、大口チャージにはボーナスがあります。