API Text To Speech: วิธีใช้ LLM แบบไม่เซ็นเซอร์สำหรับสคริปต์และคำบรรยายเสียง
API แปลงข้อความเป็นเสียงจะแปลงสคริปต์ที่เขียนไว้ให้เป็นเสียงพูด แต่คุณภาพของเสียงนั้นขึ้นอยู่กับข้อความที่ได้รับอย่างเต็มที่ โดยการใช้โมเดล LLM แบบไม่เซ็นเซอร์สำหรับการประมวลผลขั้นสุดท้าย นักพัฒนาสามารถสร้างสคริปต์และคำบรรยายแบบดิบและไม่มีตัวกรองที่ AI แบบดั้งเดิมอาจทำให้ดูอ่อนลงหรือปฏิเสธ เพื่อให้แน่ใจว่าสายงานเสียงของคุณจัดการกับกรณีขอบเขตและเนื้อหาสำหรับผู้ใหญ่ได้โดยไม่มีการขัดจังหวะ
อัปเดตSpeech To Text API
ทำไม TTS จึงต้องการ Backend แบบไม่เซ็นเซอร์
นักพัฒนาส่วนใหญ่คิดว่าการแปลงข้อความเป็นเสียงเป็นเพียงตัวแสดงผล มันรับข้อความและผลิตเสียง แต่ข้อความที่ได้รับมักมาจาก AI ทั่วไปที่มีการกรองอย่างหนัก หากคุณกำลังสร้างสคริปต์สำหรับเนื้อหาเชิงสร้างสรรค์ การวิจัยด้านความปลอดภัย หรือความบันเทิงสำหรับผู้ใหญ่ โมเดล LLM มาตรฐานอาจปฏิเสธการสร้างวลีเฉพาะ ปรับคำสแลง หรือเปลี่ยนโทนเสียงให้ดู "เป็นทางการ" มากขึ้น สิ่งนี้สร้างจุดคอขวดที่สายงานเสียงของคุณส่งมอบเนื้อหาที่ผ่านการปรับแต่งแล้วของเจตนาเชิงสร้างสรรค์ของคุณ
โดยการรวมโมเดล LLM แบบไม่เซ็นเซอร์เป็นแบ็กเอนด์สำหรับการสร้างข้อความของคุณ คุณจะรับประกันว่าสคริปต์ที่เข้าถึงเครื่องแปลงข้อความเป็นเสียงของคุณคือสิ่งที่คุณต้องการอย่างแท้จริง สิ่งนี้สำคัญมากสำหรับกรณีใช้งานที่ความละเอียดอ่อนของภาษาเป็นเรื่องสำคัญ หากโมเดล LLM ปฏิเสธหัวข้อที่ถูกต้องตามกฎหมายแต่มีความเสี่ยง เครื่องแปลงข้อความเป็นเสียงของคุณจะไม่มีอะไรให้พูด โมเดลแบบไม่เซ็นเซอร์ขจัดการปฏิเสธโดยพลการเหล่านี้ มอบการควบคุมเนื้อหาทั้งหมดให้กับคุณ
บทบาทของ LLM ใน Voice Pipeline
ใน voice pipeline สมัยใหม่ LLM ทำหน้าที่เป็นสมอง มันรับพรอมต์ของคุณและจัดโครงสร้างความคิดดิบให้เป็นสคริปต์ที่สะอาด สคริปต์นี้จะไหลเข้าสู่ API Text To Speech LLM จัดการรูปแบบ น้ำเสียง และโครงสร้าง API TTS จัดการการสังเคราะห์เสียง หาก LLM จำกัดเกินไป API TTS จะฟังดูจืดชืด หาก LLM สร้างสรรค์เกินไป API TTS อาจมีปัญหากับไวยากรณ์ที่ซับซ้อน
API ของเราให้เอนด์พอยต์ที่เข้ากันได้กับ OpenAI ซึ่งให้บริการโมเดลแบบไม่เซ็นเซอร์เพียงโมเดลเดียว โมเดลนี้ได้รับการปรับแต่งให้ตอบคำถามโดยไม่มีการปฏิเสธเนื้อหาสำหรับการใช้งานผู้ใหญ่ที่ถูกต้องตามกฎหมาย โมเดลนี้ไม่ใช่ GPT, Claude หรือโมเดลของผู้จัดจำหน่ายรายอื่น โมเดลนี้ทำงานบนเซิร์ฟเวอร์ GPU ของเราเอง ซึ่งหมายความว่าคุณได้รับเสียงที่คาดเดาได้และสอดคล้องกันในผลลัพธ์ข้อความของคุณ รหัสโมเดลคือ "uncensored" คุณส่งข้อความเข้าไป คุณได้รับข้อความออกมา ไม่มี embeddings ไม่มีภาพ ไม่มีวิดีโอ มีเพียงภาษาที่บริสุทธิ์และไม่มีตัวกรองสำหรับสายงานเสียงของคุณ
การสร้างสคริปต์โดยไม่มีการกรองเนื้อหา
เมื่อสร้างสคริปต์สำหรับเสียงพากย์ การกรองเนื้อหาอาจเป็นปัญหา มันอาจบล็อกคำที่ถูกต้องตามกฎหมายแต่ถือว่ามีความอ่อนไหว มันอาจปฏิเสธที่จะสร้างบทสนทนาสำหรับตัวละครร้ายเพราะน้ำเสียงมืดเกินไป ด้วย LLM แบบไม่เซ็นเซอร์ คุณสามารถสร้างสคริปต์ที่สะท้อนลักษณะที่แท้จริงของเนื้อหาของคุณ สิ่งนี้สำคัญเป็นพิเศษสำหรับการเขียนเชิงสร้างสรรค์ สื่อสำหรับผู้ใหญ่ หรือชุมชนงานอดิเรกเฉพาะทาง
โมเดลไม่ปฏิเสธเนื้อหาผู้ใหญ่ที่ถูกต้องตามกฎหมาย เนื้อหาเชิงจินตนาการ การวิจัยด้านความปลอดภัย หรือหัวข้อที่ถกเถียงได้ มันบล็อกเฉพาะเนื้อหาทางเพศที่เกี่ยวข้องกับเด็กเท่านั้น ขีดจำกัดนี้ช่วยให้คุณสามารถใช้ API สำหรับวัตถุประสงค์ที่ถูกต้องตามกฎหมายอื่น ๆ ได้โดยไม่ต้องกลัวการปฏิเสธกะทันหัน คุณสามารถสร้างสคริปต์แบบยาว บทสนทนาของตัวละคร หรือคำบรรยายได้โดยที่ LLM ไม่ได้คิดซ้ำเกี่ยวกับทางเลือกเชิงสร้างสรรค์ของคุณ ผลลัพธ์คือข้อความที่สะอาดและตรงไปตรงมามากขึ้นที่ API TTS ของคุณสามารถประมวลผลได้โดยไม่ต้องแก้ไข
คำบรรยายและคำบรรยายภาพ: การจัดการกรณีขอบ
การสร้างคำบรรยายและคำบรรยายมักต้องการการจัดการกับคำพูดที่ยุ่งเหยิงและในโลกจริง ระบบ ASR สร้างข้อผิดพลาด มันพลาดคำ เข้าใจผิดสำเนียง และเพิ่มเสียงเติม โมเดล LLM แบบไม่เซ็นเซอร์สามารถทำความสะอาดผลลัพธ์นี้โดยไม่ทำให้ความหมายเบาบางลง มันสามารถแก้ไขไวยากรณ์ในขณะที่รักษาน้ำเสียงและคำศัพท์ต้นฉบับ สิ่งนี้สำคัญมากสำหรับการรักษาความแท้จริงของเนื้อหาที่พูด
LLM มาตรฐานอาจแก้ไขมากเกินไป ทำให้คำบรรยายฟังดูเป็นทางการเกินไป โมเดลแบบไม่เซ็นเซอร์สามารถกำหนดพรอมต์ให้คงลักษณะดิบและหยาบของคำพูดต้นฉบับไว้ได้ สิ่งนี้มีประโยชน์สำหรับสารคดี สัมภาษณ์ หรือ vlog แบบสบายๆ LLM ประมวลผลข้อความ และเอาต์พุตพร้อมสำหรับ API TTS ของคุณเพื่อพูดใหม่หรือสำหรับตัวสร้างคำบรรยายของคุณเพื่อจับเวลา หน้าต่างบริบทช่วยให้คุณประมวลผลทั้งตอนได้ เพื่อให้แน่ใจว่ามีความสอดคล้องตลอดทั้งคำพูด
การประมวลผลหลังเอาต์พุต ASR
ระบบการรู้จำเสียงพูดอัตโนมัติ (ASR) กำลังพัฒนาขึ้น แต่ยังไม่สมบูรณ์แบบ พวกมันมีปัญหากับคำพ้องเสียง ชื่อเฉพาะ และโครงสร้างประโยคที่ซับซ้อน การ post-processing ด้วย LLM สามารถแก้ไขข้อผิดพลาดเหล่านี้ได้ LLM แบบไม่เซ็นเซอร์สามารถเขียนคำบรรยายใหม่ให้อ่านง่ายขึ้นในขณะที่รักษาความหมายต้นฉบับ สิ่งนี้มีประโยชน์เป็นพิเศษเมื่อผลลัพธ์ ASR มีภาษาพูดทั่วไปหรือศัพท์เฉพาะที่ AI อาจเข้าใจผิด
โดยการใช้อโมเดลแบบไม่เซ็นเซอร์ของเรา คุณสามารถรับประกันได้ว่าข้อความที่ผ่านการประมวลผลหลังจะคงน้ำเสียงของผู้พูดต้นฉบับไว้ โมเดลนี้ปรับแต่งเพื่อตอบโดยไม่มีการปฏิเสธ ดังนั้นมันจะไม่ทิ้งเนื้อหาเพียงเพราะมันฟังดูแปลก คุณสามารถส่งเอาต์พุต ASR ดิบ รับเวอร์ชันที่ทำความสะอาดแล้ว แล้วป้อนเข้าไปใน API Text To Speech ของคุณเพื่อการสังเคราะห์ใหม่หรือการจัดเก็บ สิ่งนี้สร้าง pipeline ที่แข็งแกร่งสำหรับเนื้อหาเสียงคุณภาพสูง
การผสานรวมกับผู้ให้บริการ TTS
API ของเราออกแบบมาเพื่อทำงานกับผู้ให้บริการ TTS ใดก็ได้ เป็น API chat-completions ที่เข้ากันได้กับ OpenAI คุณสามารถใช้ SDK ทางการของ OpenAI หรือไคลเอนต์ใด ๆ ที่รองรับรูปแบบ OpenAI Base URL คือ https://api.speechtotextapis.com/v1. คุณเปลี่ยน base URL และให้คีย์ API ของคุณ id ของโมเดลคือ "uncensored" สิ่งนี้ทำให้การผสานรวมง่ายและยืดหยุ่น
เนื่องจาก API เป็นข้อความเข้า ข้อความออก มันจึงผสานรวมเข้ากับ workflow ที่มีอยู่ของคุณได้อย่างลงตัว คุณสร้างข้อความ จากนั้นส่งไปยังผู้ให้บริการ TTS ของคุณ ลักษณะแบบไม่เซ็นเซอร์ของโมเดลช่วยให้มั่นใจได้ว่าข้อความจะส่งถึงผู้ให้บริการ TTS ของคุณโดยไม่มีการกรองที่ซ่อนอยู่ นั่นหมายความว่า voice pipeline ของคุณถูกจำกัดโดยความคิดสร้างสรรค์ของคุณเท่านั้น ไม่ใช่โดยนโยบายเนื้อหาของ AI คุณสามารถทดสอบพรอมต์และสไตล์ต่างๆ ได้โดยไม่กังวลเรื่องการปฏิเสธ
หน้าต่างบริบท: 100,000 โทเคนสำหรับสคริปต์ยาว
ความท้าทายที่ใหญ่ที่สุดอย่างหนึ่งใน voice pipeline คือการประมวลผลสคริปต์ยาว หากหน้าต่างบริบทของคุณเล็กเกินไป คุณต้องแบ่งสคริปต์ออกเป็นชิ้นเล็ก ๆ สิ่งนี้อาจทำลายความต่อเนื่องของเรื่องราวหรือทำให้เกิดความไม่สอดคล้องกันในน้ำเสียง API ของเรารองรับหน้าต่างบริบท 100,000 โทเคน สิ่งนี้ช่วยให้คุณประมวลผลสคริปต์ยาว ทั้งตอน หรือชุดข้อมูลขนาดใหญ่ในคำขอเดียว
สิ่งนี้มีประโยชน์สำหรับการสร้างตัวละครที่สอดคล้องกัน รักษาความต่อเนื่องของเรื่องราว หรือประมวลผลหนังสือทั้งเล่ม คุณสามารถส่งบล็อกข้อความขนาดใหญ่ รับเอาต์พุตที่สอดคล้องกัน แล้วป้อนเข้าไปใน API TTS ของคุณ หน้าต่างบริบทที่ใหญ่ขึ้นลดความจำเป็นสำหรับตรรกะการแบ่งชิ้นที่ซับซ้อนในโค้ดของคุณ มันทำให้สถาปัตยกรรมของ voice pipeline ของคุณง่ายขึ้น และรับประกันว่าเอาต์พุตจะราบรื่นและสอดคล้องกัน
สตรีมมิงสำหรับคำบรรยายแบบเรียลไทม์
สำหรับการใช้งานแบบเรียลไทม์ เช่น คำบรรยายสดหรือผู้ช่วยเสียงแบบโต้ตอบ เวลาแฝงเป็นสิ่งสำคัญ API ของเรารองรับสตรีมมิงผ่าน Server-Sent Events (SSE) สิ่งนี้ช่วยให้คุณรับข้อความในขณะที่มันถูกสร้าง แทนที่จะรอให้คำตอบทั้งหมดเสร็จสิ้น สิ่งนี้สำคัญมากสำหรับการรักษาประสบการณ์ผู้ใช้ที่ราบรื่น
เมื่อรวมกับผู้ให้บริการ TTS ที่รวดเร็ว การสตรีมมิงสามารถสร้าง voice pipeline ที่เกือบจะทันทีได้ LLM สร้างข้อความ สตรีมมิงไปยังแอปพลิเคชันของคุณ และ API TTS พูดมันแบบเรียลไทม์ สิ่งนี้เหมาะสำหรับแชทบอท คำบรรยายสด หรือการเล่าเรื่องแบบโต้ตอบ โมเดลแบบไม่เซ็นเซอร์ช่วยให้มั่นใจได้ว่าข้อความที่สตรีมมิงไม่ถูกขัดจังหวะโดยการปฏิเสธเนื้อหา ให้ประสบการณ์ที่สอดคล้องกันสำหรับผู้ใช้
ราคาสำหรับการประมวลผลข้อความปริมาณสูง
ราคาของเราเรียบง่ายและโปร่งใส คุณจ่ายตามการใช้งาน ไม่มีค่าธรรมเนียมรายเดือนหรือการสมัครสมาชิก ราคาคือ $0.25 ต่อ 1 ล้านโทเคนอินพุตและ $1.00 ต่อ 1 ล้านโทเคนเอาต์พุต สิ่งนี้มีราคาแข่งขันได้สำหรับการประมวลผลข้อความปริมาณสูง คุณสามารถเติมบัญชีของคุณด้วยเครดิตแบบเติมเงินล่วงหน้า เริ่มต้นที่ $10 คุณสามารถจ่ายด้วยคริปโต (USDT หรือ USDC)
หากคุณเติมเงิน $50 ขึ้นไป คุณจะได้รับโบนัส 5% หากคุณเติมเงิน $100 ขึ้นไป คุณจะได้รับโบนัส 10% สิ่งนี้ทำให้มีต้นทุนต่ำในการประมวลผลข้อความปริมาณมากสำหรับ TTS pipeline ของคุณ เครดิตไม่หมดอายุ คุณสามารถสร้างคีย์ API ใหม่ได้ทุกเมื่อ การทดลองให้เครดิต $0.50 เป็นเวลา 7 วัน ไม่ต้องใช้บัตรเครดิต สิ่งนี้ช่วยให้คุณทดสอบการผสานรวมกับ API Text To Speech ของคุณก่อนตัดสินใจ
ถาม-ตอบ
โมเดลแบบไม่เซ็นเซอร์สร้างเสียงได้หรือไม่?
ไม่ API เป็น API chat-completions แบบข้อความเท่านั้น รับข้อความเข้าและส่งข้อความออก คุณต้องใช้อีก API Text To Speech แยกต่างหากเพื่อแปลงผลลัพธ์เป็นเสียง API ของเราออกแบบมาเพื่อส่งข้อความดิบที่ไม่ผ่านการกรองที่ TTS engine ของคุณต้องการ
ขนาดหน้าต่างบริบทคือเท่าใด?
หน้าต่างบริบทคือ 100,000 โทเคน ซึ่งรวมถึงพรอมต์อินพุตและการสร้างเอาต์พุตด้วย สิ่งนี้ช่วยให้คุณประมวลผลสคริปต์ยาวหรือชุดข้อมูลขนาดใหญ่ในคำขอเดียวโดยไม่ต้องแบ่งเป็นชิ้นเล็ก
โมเดลเป็น GPT หรือ Claude หรือไม่?
ไม่ใช่ ID โมเดลคือ "uncensored" เป็นโมเดลแบบเปิดน้ำหนักที่รันบนเซิร์ฟเวอร์ GPU ของเราเอง ไม่ใช่ GPT, Claude, Gemini, Grok หรือโมเดลของผู้จัดจำหน่ายรายอื่น ปรับแต่งเฉพาะสำหรับการสร้างเนื้อหาโดยไม่มีการปฏิเสธ
ราคาเท่าไหร่?
ราคาคือ $0.25 ต่อ 1 ล้านโทเคนอินพุตและ $1.00 ต่อ 1 ล้านโทเคนเอาต์พุต ไม่มีค่าธรรมเนียมรายเดือน คุณจ่ายตามการใช้งานด้วยเครดิตแบบเติมเงินล่วงหน้า การเติมเงินเริ่มต้นที่ $10 พร้อมโบนัสสำหรับยอดที่สูงกว่า
คีย์ของคุณอยู่ห่างแค่แบบฟอร์มเดียว
สร้างบัญชี คัดลอกคีย์ เปลี่ยน base URL แค่นี้ก็พร้อมใช้งานแล้ว