KO ▾

speechtotextapis.com텍스트 파이프라인 사후 처리용 무검열 LLM

Speech To Text API
API 키 받기

TTS API: 음성 대본 및 자막용 무검열 LLM 사용 방법

TTS API는 작성된 대본을 음성 오디오로 변환하지만, 해당 음성의 품질은 수신되는 텍스트에 전적으로 달려 있습니다. 사후 처리에 무검열 LLM을 사용하면 개발자는 전통적인 AI가 약화하거나 거부할 수 있는 원본 필터링되지 않은 대본과 자막을 생성하여 음성 파이프라인이 중단 없이 경계 사례와 성인 콘텐츠를 처리할 수 있도록 할 수 있습니다.

업데이트됨Speech To Text API

TTS가 무검열 백엔드가 필요한 이유

대부분의 개발자는 TTS API가 단순한 렌더러라고 가정합니다. 텍스트를 받아 오디오를 생성합니다. 그러나 수신되는 텍스트는 종종 강력하게 필터링된 범용 AI에서 비롯됩니다. 창의적 콘텐츠, 보안 연구 또는 성인 엔터테인먼트를 위한 대본을 생성하는 경우 표준 LLM은 특정 구문을 생성하지 않거나, 은어를 정제하거나, 어조를 더 "기업적"으로 변경할 수 있습니다. 이는 음성 파이프라인이 창의적 의도의 정제된 버전을 전달하게 만드는 병목 현상을 만듭니다.

텍스트 생성의 백엔드로 무검열 LLM을 통합하면 TTS 엔진에 도달하는 대본이 요청한 그대로임을 보장합니다. 이는 언어의 뉘앙스가 중요한 사용 사례에 중요합니다. LLM이 합법적이지만 날카로운 주제를 거부하면 TTS API는 말할 내용이 없습니다. 무검열 모델은 이러한 임의적인 거부를 제거하여 음성으로 변환될 콘텐츠에 대한 완전한 제어권을 제공합니다.

음성 파이프라인에서 LLM의 역할

현대적인 음성 파이프라인에서 LLM은 두뇌 역할을 합니다. 프롬프트를 받아 원본 아이디어를 깔끔한 대본으로 구조화합니다. 이 대본은 TTS API로 흐릅니다. LLM은 포맷, 어조 및 구조를 처리합니다. TTS API는 오디오 합성을 처리합니다. LLM이 너무 제한적이면 TTS API가 단조롭게 들립니다. LLM이 너무 창의적이면 TTS API가 복잡한 구문에 어려움을 겪을 수 있습니다.

본 API는 단일 무검열 모델을 제공하는 OpenAI 호환 엔드포인트를 제공합니다. 이 모델은 합법적인 성인 사용에 대한 콘텐츠 거부 없이 답변하도록 튜닝되었습니다. GPT, Claude 또는 기타 벤더의 모델이 아닙니다. 자체 GPU 서버에서 실행됩니다. 이는 텍스트 출력에서 예측 가능하고 일관된 음성을 얻는다는 의미입니다. 모델 ID는 "uncensored"입니다. 텍스트를 입력하면 텍스트가 출력됩니다. 임베딩, 이미지, 비디오 없음. 음성 파이프라인을 위한 순수하고 필터링되지 않은 언어만 제공합니다.

콘텐츠 필터 없이 대본 생성

성우 더빙을 위한 대본을 생성할 때 콘텐츠 필터는 성가신 요소가 될 수 있습니다. 합법적이지만 민감하다고 간주되는 단어를 차단할 수 있습니다. 어조가 너무 어두워 악역 캐릭터의 대본 생성을 거부할 수도 있습니다. 무검열 LLM을 사용하면 콘텐츠의 실제 특성을 반영하는 대본을 생성할 수 있습니다. 이는 창작 글쓰기, 성인 미디어, 또는 틈새 취미 커뮤니티에 특히 중요합니다.

이 모델은 합법적인 성인, 픽션, 보안 연구 또는 논쟁적인 주제를 거부하지 않습니다. 미성년자가 관련된 성적 콘텐츠만 차단합니다. 이 하드 제한은 갑작스러운 거부 없이 합법적인 목적으로 API를 사용할 수 있도록 보장합니다. LLM이 창의적 선택을 다시 생각하지 않도록 긴 형식의 대본, 캐릭터 대화 또는 내레이션을 생성할 수 있습니다. 결과는 수정 없이 TTS API가 처리할 수 있는 더 깔끔하고 직접적인 텍스트 출력입니다.

자막 및 자막: 경계 사례 처리

자막과 자막을 생성하려면 종종 지저분하고 실제 세계의 음성을 처리해야 합니다. ASR 시스템은 오류를 생성합니다. 단어를 놓치거나 억양을 오해하거나 채워진 소리를 추가합니다. 무검열 LLM은 의미를 약화시키지 않고 이 출력을 정리할 수 있습니다. 원래 어조와 어휘를 보존하면서 문법을 수정할 수 있습니다. 이는 구두 콘텐츠의 진정성을 유지하는 데 중요합니다.

표준 LLM은 과잉 보정하여 자막이 너무 격식 있게 들리게 할 수 있습니다. 무검열 모델은 프롬프트를 통해 원본 음성의 원시적이고 거친 특성을 유지하도록 지시할 수 있습니다. 이는 다큐멘터리, 인터뷰, 또는 캐주얼한 브이로그에 유용합니다. LLM은 텍스트를 처리하며, 출력물은 TTS API로 다시 음성으로 변환하거나 자막 생성기로 타이밍을 맞추기 위해 준비됩니다. 컨텍스트 창을 통해 전체 에피소드를 처리하여 전체 대본의 일관성을 보장할 수 있습니다.

ASR 출력 사후 처리

자동 음성 인식(ASR) 시스템은 개선되고 있지만 완벽하지는 않습니다. 동음이의어, 고유명사 및 복잡한 문장 구조에 어려움을 겪습니다. LLM로 사후 처리하면 이러한 오류를 수정할 수 있습니다. 무검열 LLM은 원래 의미를 유지하면서 대본을 더 읽기 쉽게 다시 쓸 수 있습니다. 이는 ASR 출력에 AI가 오해할 수 있는 은어나 전문 용어가 포함될 때 특히 유용합니다.

무검열 모델을 사용하면 사후 처리된 텍스트가 원본 화자의 음성을 유지함을 보장할 수 있습니다. 모델은 거부 없이 답변하도록 튜닝되었으므로 이상하게 들린다고 콘텐츠를 삭제하지 않습니다. 원본 ASR 출력을 보내고 정리된 버전을 받은 다음 이를 TTS API에 피드하여 다시 합성하거나 아카이빙할 수 있습니다. 이는 고품질 음성 콘텐츠를 위한 견고한 파이프라인을 만듭니다.

TTS 제공업체와의 통합

본 API는 모든 TTS 제공업체와 작동하도록 설계되었습니다. OpenAI 호환 채팅 API입니다. 공식 OpenAI SDK 또는 OpenAI 형식을 지원하는 모든 클라이언트를 사용할 수 있습니다. 기본 URL은 https://api.speechtotextapis.com/v1.입니다. 기본 URL을 변경하고 API 키를 제공하면 됩니다. 모델 ID는 "uncensored"입니다. 이는 통합을 간단하고 유연하게 만듭니다.

API가 텍스트 입력, 텍스트 출력이기 때문에 기존 워크플로우에 매끄럽게 통합됩니다. 텍스트를 생성한 다음 TTS 제공업체로 보냅니다. 모델의 무검열 특성은 텍스트가 숨겨진 필터 없이 TTS 제공업체에 도달함을 보장합니다. 이는 음성 파이프라인이 AI의 콘텐츠 정책이 아닌 창의성에 의해만 제한됨을 의미합니다. 거부 없이 다양한 프롬프트와 스타일을 테스트할 수 있습니다.

컨텍스트 창: 긴 대본용 100,000 토큰

음성 파이프라인에서 가장 큰 과제 중 하나는 긴 대본을 처리하는 것입니다. 컨텍스트 창이 너무 작으면 대본을 청크로 나누어야 합니다. 이는 내러티브의 흐름을 끊거나 어조의 불일치를 초래할 수 있습니다. 본 API는 100,000 토큰 컨텍스트 창을 지원합니다. 이를 통해 긴 대본, 전체 에피소드 또는 대규모 데이터셋을 단일 요청으로 처리할 수 있습니다.

이는 일관된 캐릭터 생성, 내러티브 연속성 유지 또는 전체 책 처리에 유용합니다. 큰 텍스트 블록을 보내고 일관된 출력을 받은 다음 이를 TTS API에 피드할 수 있습니다. 더 큰 컨텍스트 창은 코드에서 복잡한 청킹 로직의 필요성을 줄입니다. 이는 음성 파이프라인의 아키텍처를 단순화하고 출력이 매끄럽고 일관되도록 보장합니다.

실시간 자막 제공을 위한 스트리밍

라이브 자막 제공 또는 대화형 음성 비서와 같은 실시간 애플리케이션의 경우 지연 시간이 핵심입니다. 본 API는 서버 전송 이벤트(SSE)를 통한 스트리밍을 지원합니다. 이를 통해 전체 응답을 기다리는 대신 생성되는 텍스트를 받을 수 있습니다. 이는 원활한 사용자 경험을 유지하는 데 중요합니다.

빠른 TTS 제공업체와 결합하면 스트리밍은 거의 즉각적인 음성 파이프라인을 만들 수 있습니다. LLM이 텍스트를 생성하고 애플리케이션에 스트리밍하며 TTS API가 실시간으로 음성으로 변환합니다. 이는 챗봇, 라이브 자막 제공 또는 대화형 스토텔링에 이상적입니다. 무검열 모델은 스트리밍된 텍스트가 콘텐츠 거부로 인해 중단되지 않도록 하여 사용자에게 일관된 경험을 제공합니다.

대규모 텍스트 처리용 가격 정책

본 가격 정책은 간단하고 투명합니다. 사용한 만큼 지불합니다. 월 요금이나 구독이 없습니다. 가격은 입력 토큰 100만 개당 $0.25, 출력 토큰 100만 개당 $1.00입니다. 이는 대규모 텍스트 처리에 대해 경쟁력 있습니다. $10부터 시작하여 선불 크레디로 계정에 충전할 수 있습니다. 암호화폐(USDT 또는 USDC)로 결제할 수 있습니다.

$50 이상을 충전하면 5% 보너스를 받습니다. $100 이상을 충전하면 10% 보너스를 받습니다. 이는 TTS 파이프라인에서 대량의 텍스트를 처리하는 데 비용 효율적입니다. 크레딧은 만료되지 않습니다. API 키는 언제든지 재생성할 수 있습니다. 7일 동안 카드 없이 $0.50의 무료 체험 크레딧을 제공합니다. 이를 통해 계약 전에 Text To Speech API와의 통합을 테스트할 수 있습니다.

질문과 답변

무검열 모델이 오디오를 생성합니까?

아니요. 이 API는 텍스트 전용 채팅-완성 API입니다. 텍스트를 입력으로 받아 텍스트를 출력으로 반환합니다. 출력을 오디오로 변환하려면 별도의 Text To Speech API가 필요합니다. 이 API는 TTS 엔진이 필요한 원시적이고 필터링되지 않은 텍스트를 제공하도록 설계되었습니다.

컨텍스트 창 크기는 얼마입니까?

컨텍스트 창은 100,000 토큰입니다. 여기에는 입력 프롬프트와 생성된 텍스트가 모두 포함됩니다. 이를 통해 작은 청크로 나누지 않고도 단일 요청으로 긴 대본이나 대규모 데이터셋을 처리할 수 있습니다.

모델이 GPT나 Claude입니까?

아니요. 모델 ID는 "uncensored"입니다. 자체 GPU 서버에서 실행되는 오픈 웨이트 모델입니다. GPT, Claude, Gemini, Grok 또는 기타 벤더의 모델이 아닙니다. 거부 없이 콘텐츠 생성을 위해 특별히 튜닝되었습니다.

비용은 얼마입니까?

가격은 입력 토큰 100만 개당 $0.25, 출력 토큰 100만 개당 $1.00입니다. 월 구독료가 없습니다. 선불 크레디로 사용한 만큼 지불합니다. 충전은 $10부터 시작하며, 더 많은 금액에 대해 보너스가 제공됩니다.

키는 양식 하나만 작성하면 받을 수 있습니다

계정을 생성하고 키를 복사한 후, 베이스 URL을 변경하세요. 설정은 이것으로 끝입니다.

API 키 받기문서 읽기