VI ▾

speechtotextapis.comLLM không kiểm duyệt để xử lý hậu kỳ quy trình văn bản

Speech To Text API
Lấy khóa API

API Text To Speech: Cách sử dụng LLM không kiểm duyệt cho kịch bản & phụ đề giọng nói

API Text To Speech chuyển đổi kịch bản viết thành âm thanh nói, nhưng chất lượng giọng nói đó phụ thuộc hoàn toàn vào văn bản mà nó nhận được. Bằng cách sử dụng LLM không kiểm duyệt để xử lý hậu kỳ, các nhà phát triển có thể tạo ra các kịch bản và phụ đề thô, không lọc mà AI truyền thống có thể làm mềm hoặc từ chối, đảm bảo quy trình giọng nói của bạn xử lý các trường hợp đặc biệt và nội dung người lớn mà không bị gián đoạn.

Cập nhậtSpeech To Text API

Tại sao TTS cần Backend không kiểm duyệt

Hầu hết các nhà phát triển đều giả định rằng API Text To Speech của họ chỉ là một bộ hiển thị. Nó nhận văn bản và tạo ra âm thanh. Nhưng văn bản nó nhận thường đến từ một AI đa năng đã được lọc kỹ. Nếu bạn đang tạo kịch bản cho nội dung sáng tạo, nghiên cứu bảo mật hoặc giải trí người lớn, các LLM tiêu chuẩn có thể từ chối tạo các cụm từ cụ thể, làm sạch tiếng lóng hoặc thay đổi giọng điệu để mang tính "doanh nghiệp" hơn. Điều này tạo ra một nút thắt nơi quy trình giọng nói của bạn cung cấp một phiên bản đã được làm sạch của ý định sáng tạo của bạn.

Bằng cách tích hợp LLM không kiểm duyệt làm backend cho việc tạo văn bản của bạn, bạn đảm bảo rằng kịch bản đạt đến công cụ TTS của bạn chính xác những gì bạn yêu cầu. Điều này rất quan trọng đối với các trường hợp sử dụng mà sắc thái ngôn ngữ quan trọng. Nếu LLM từ chối một chủ đề hợp pháp nhưng gây sốc, API TTS của bạn sẽ không có gì để nói. Một mô hình không kiểm duyệt loại bỏ các lệnh từ chối tùy tiện này, mang lại cho bạn quyền kiểm soát hoàn toàn đối với nội dung được đọc.

Vai trò của LLM trong quy trình giọng nói

Trong một quy trình giọng nói hiện đại, LLM đóng vai trò là bộ não. Nó nhận prompt của bạn và cấu trúc các ý tưởng thô thành một kịch bản sạch. Kịch bản này sau đó được chuyển vào API Text To Speech. LLM xử lý định dạng, giọng điệu và cấu trúc. API TTS xử lý tổng hợp âm thanh. Nếu LLM quá hạn chế, API TTS sẽ nghe nhạt nhẽo. Nếu LLM quá sáng tạo, API TTS có thể gặp khó khăn với cú pháp phức tạp.

API của chúng tôi cung cấp một endpoint tương thích OpenAI phục vụ một mô hình không kiểm duyệt duy nhất. Mô hình này được tinh chỉnh để trả lời mà không từ chối nội dung đối với mục đích người lớn hợp pháp. Nó không phải là GPT, Claude hay bất kỳ mô hình của nhà cung cấp nào khác. Nó chạy trên các máy chủ GPU của riêng chúng tôi. Điều này có nghĩa là bạn nhận được một giọng điệu dự đoán được và nhất quán trong đầu ra văn bản của mình. ID mô hình là "uncensored". Bạn gửi văn bản vào, bạn nhận văn bản ra. Không có embedding, không có hình ảnh, không có video. Chỉ có ngôn ngữ thuần túy, không lọc cho quy trình giọng nói của bạn.

Tạo kịch bản không có bộ lọc nội dung

Khi tạo kịch bản cho lồng tiếng, các bộ lọc nội dung có thể gây phiền toái. Chúng có thể chặn các từ hoàn toàn hợp pháp nhưng được coi là nhạy cảm. Chúng có thể từ chối tạo hội thoại cho một nhân vật phản diện vì giọng điệu quá tối tăm. Với một LLM không kiểm duyệt, bạn có thể tạo các kịch bản phản ánh đúng bản chất của nội dung của bạn. Điều này đặc biệt quan trọng đối với văn học sáng tạo, phương tiện người lớn hoặc các cộng đồng sở thích ngách.

Mô hình không từ chối các chủ đề hợp pháp dành cho người lớn, hư cấu, nghiên cứu bảo mật hoặc gây tranh cãi. Mô hình chỉ chặn nội dung tình dục liên quan đến trẻ em dưới 18 tuổi. Giới hạn cứng này đảm bảo bạn có thể sử dụng API cho bất kỳ mục đích hợp pháp nào khác mà không lo sợ các từ chối đột ngột. Bạn có thể tạo kịch bản dài, hội thoại nhân vật hoặc lời dẫn mà không cần LLM do dự về các lựa chọn sáng tạo của bạn. Kết quả là văn bản đầu ra sạch hơn, trực tiếp hơn, giúp API TTS của bạn xử lý mà không cần sửa đổi.

Phụ đề & Phụ đề: Xử lý các trường hợp đặc biệt

Tạo phụ đề và phụ đề thường yêu cầu xử lý giọng nói thực tế, lộn xộn. Các hệ thống ASR tạo ra lỗi. Chúng bỏ sót từ, hiểu sai giọng địa phương và thêm các âm thanh đệm. Một LLM không kiểm duyệt có thể làm sạch đầu ra này mà không làm mềm ý nghĩa. Nó có thể sửa lỗi ngữ pháp trong khi vẫn giữ nguyên giọng điệu và từ vựng ban đầu. Điều này rất quan trọng để duy trì tính xác thực của nội dung nói.

Các LLM tiêu chuẩn có thể sửa quá mức, khiến phụ đề nghe quá trang trọng. Một mô hình không kiểm duyệt có thể được prompt để giữ lại bản chất thô, trần trụi của giọng nói gốc. Điều này hữu ích cho phim tài liệu, phỏng vấn hoặc vlog thông thường. LLM xử lý văn bản và đầu ra sẵn sàng để API TTS của bạn đọc lại hoặc để bộ tạo phụ đề của bạn căn giờ. Cửa sổ ngữ cảnh cho phép bạn xử lý toàn bộ tập phim, đảm bảo tính nhất quán trên toàn bộ bản ghi âm.

Xử lý hậu kỳ đầu ra ASR

Các hệ thống Nhận dạng Giọng nói Tự động (ASR) đang được cải thiện, nhưng chúng không hoàn hảo. Chúng gặp khó khăn với các từ đồng âm, danh từ riêng và cấu trúc câu phức tạp. Xử lý hậu kỳ bằng LLM có thể sửa các lỗi này. Một LLM không kiểm duyệt có thể viết lại bản ghi âm để dễ đọc hơn trong khi vẫn giữ nguyên ý nghĩa ban đầu. Điều này đặc biệt hữu ích khi đầu ra ASR chứa tiếng lóng hoặc thuật ngữ mà AI có thể hiểu sai.

Bằng cách sử dụng mô hình không kiểm duyệt của chúng tôi, bạn có thể đảm bảo rằng văn bản được xử lý hậu kỳ giữ lại giọng nói của người nói gốc. Mô hình được tinh chỉnh để trả lời mà không từ chối, vì vậy nó sẽ không loại bỏ nội dung chỉ vì nó nghe có vẻ lạ. Bạn có thể gửi đầu ra ASR thô, nhận một phiên bản đã được làm sạch và sau đó đưa nó vào API Text To Speech của bạn để tổng hợp lại hoặc lưu trữ. Điều này tạo ra một quy trình mạnh mẽ cho nội dung giọng nói chất lượng cao.

Tích hợp với nhà cung cấp TTS

API của chúng tôi được thiết kế để hoạt động với bất kỳ nhà cung cấp TTS nào. Đây là một API chat-completions tương thích OpenAI. Bạn có thể sử dụng các SDK chính thức của OpenAI hoặc bất kỳ khách hàng nào hỗ trợ định dạng OpenAI. Base URL là https://api.speechtotextapis.com/v1. Bạn thay đổi base URL và cung cấp khóa API của bạn. ID mô hình là "uncensored". Điều này giúp việc tích hợp đơn giản và linh hoạt.

Vì API là văn bản vào, văn bản ra, nó phù hợp liền mạch với quy trình làm việc hiện có của bạn. Bạn tạo văn bản, sau đó gửi nó đến nhà cung cấp TTS của bạn. Bản chất không kiểm duyệt của mô hình đảm bảo rằng văn bản đạt đến nhà cung cấp TTS của bạn mà không có bộ lọc ẩn. Điều này có nghĩa là quy trình giọng nói của bạn chỉ bị giới hạn bởi sự sáng tạo của bạn, không phải bởi chính sách nội dung của AI. Bạn có thể thử các prompt và phong cách khác nhau mà không cần lo lắng về các lệnh từ chối.

Cửa sổ ngữ cảnh: 100,000 token cho kịch bản dài

Một trong những thách thức lớn nhất trong các quy trình giọng nói là xử lý các kịch bản dài. Nếu cửa sổ ngữ cảnh của bạn quá nhỏ, bạn phải chia kịch bản thành các đoạn. Điều này có thể làm gián đoạn dòng chảy của câu chuyện hoặc gây ra sự không nhất quán về giọng điệu. API của chúng tôi hỗ trợ cửa sổ ngữ cảnh 100,000 token. Điều này cho phép bạn xử lý các kịch bản dài, toàn bộ tập phim hoặc bộ dữ liệu lớn trong một yêu cầu duy nhất.

Điều này hữu ích để tạo các nhân vật nhất quán, duy trì tính liên tục của câu chuyện hoặc xử lý toàn bộ sách. Bạn có thể gửi một khối văn bản lớn, nhận một đầu ra mạch lạc và sau đó đưa nó vào API TTS của bạn. Cửa sổ ngữ cảnh lớn hơn giảm nhu cầu về logic chia đoạn phức tạp trong mã của bạn. Nó đơn giản hóa kiến trúc của quy trình giọng nói của bạn và đảm bảo rằng đầu ra mượt mà và nhất quán.

Truyền phát (streaming) cho phụ đề thời gian thực

Đối với các ứng dụng thời gian thực, chẳng hạn như phụ đề trực tiếp hoặc trợ lý giọng nói tương tác, độ trễ là yếu tố then chốt. API của chúng tôi hỗ trợ truyền phát qua Server-Sent Events (SSE). Điều này cho phép bạn nhận văn bản khi nó được tạo, thay vì chờ đợi toàn bộ phản hồi. Điều này rất quan trọng để duy trì trải nghiệm người dùng mượt mà.

Khi kết hợp với một nhà cung cấp TTS nhanh, truyền phát có thể tạo ra một quy trình giọng nói gần như tức thì. LLM tạo văn bản, truyền nó đến ứng dụng của bạn và API TTS đọc nó theo thời gian thực. Điều này rất lý tưởng cho chatbot, bản ghi trực tiếp hoặc kể chuyện tương tác. Mô hình không kiểm duyệt đảm bảo rằng văn bản được truyền phát không bị gián đoạn bởi các lệnh từ chối nội dung, mang lại trải nghiệm nhất quán cho người dùng.

Bảng giá cho xử lý văn bản khối lượng lớn

Bảng giá của chúng tôi đơn giản và minh bạch. Bạn trả tiền cho những gì bạn sử dụng. Không có phí hàng tháng hoặc đăng ký. Giá là $0.25 cho mỗi 1 triệu token đầu vào và $1.00 cho mỗi 1 triệu token đầu ra. Đây là mức giá cạnh tranh cho việc xử lý văn bản khối lượng lớn. Bạn có thể nạp tiền vào tài khoản của mình bằng tín dụng trả trước, bắt đầu từ $10. Bạn có thể thanh toán bằng tiền điện tử (USDT hoặc USDC).

Nếu bạn nạp từ $50 trở lên, bạn nhận được bonus 5%. Nếu bạn nạp từ $100 trở lên, bạn nhận được bonus 10%. Điều này giúp xử lý khối lượng lớn văn bản cho quy trình TTS của bạn hiệu quả về chi phí. Tín dụng không bao giờ hết hạn. Bạn có thể tạo lại khóa API của mình bất cứ lúc nào. Dùng thử cung cấp cho bạn $0.50 tín dụng trong 7 ngày, không cần thẻ. Điều này cho phép bạn kiểm tra tích hợp với API Text To Speech của bạn trước khi cam kết.

Hỏi đáp

Mô hình không kiểm duyệt có tạo ra âm thanh không?

Không. API này chỉ xử lý văn bản (chat-completions). Nó nhận văn bản đầu vào và trả về văn bản đầu ra. Bạn cần một API Text To Speech riêng để chuyển đổi đầu ra thành âm thanh. API của chúng tôi được thiết kế để cung cấp văn bản thô, không lọc mà công cụ TTS của bạn cần.

Kích thước cửa sổ ngữ cảnh là bao nhiêu?

Cửa sổ ngữ cảnh là 100,000 token. Điều này bao gồm cả prompt đầu vào và phần hoàn thành đầu ra. Điều này cho phép bạn xử lý các kịch bản dài hoặc bộ dữ liệu lớn trong một yêu cầu duy nhất mà không cần chia nhỏ chúng.

Mô hình có phải là GPT hay Claude không?

Không. ID mô hình là "uncensored". Đây là một mô hình trọng số mở chạy trên máy chủ GPU của riêng chúng tôi. Nó không phải là GPT, Claude, Gemini, Grok hay bất kỳ mô hình của nhà cung cấp nào khác. Nó được tinh chỉnh đặc biệt cho việc tạo nội dung mà không từ chối.

Chi phí bao nhiêu?

Giá là $0.25 cho mỗi 1 triệu token đầu vào và $1.00 cho mỗi 1 triệu token đầu ra. Không có phí hàng tháng. Bạn trả tiền cho những gì bạn sử dụng bằng tín dụng trả trước. Nạp tiền bắt đầu từ $10, với các khoản bonus cho số tiền lớn hơn.

Khóa của bạn chỉ cách một biểu mẫu

Tạo tài khoản, sao chép khóa, thay đổi base URL. Đó là toàn bộ thiết lập.

Lấy khóa APIĐọc tài liệu