{
"audio": "UklGRqRQAgBXQVZFZm10IBAAAAABAAEAwF0AAIC7AAACABAAZGF0YYBQAgAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAP//AAAAAAAA//8AAP//AAD/////AAACAAAAAAD//wEAAQABAP7/AAD9//3/AAD+//7////9//z//f/8/wAAAAAAAP7/AgABAP3/+//+/wAA//8BAP//+/8AAP///v/9//z///8DAP//AQAAAP3//P////v/AgD8//7/+//9//z//v/+/////f/+/wAA/v8DAP//AgAEAAMABwAGAAUABAAAAAIAAgADAAMAAQADAAMAAgABAAAAAAD///7//f////v//f8BAAIABAAAAAEAAgABAAIAAwAAAAAA//////v///8CAP7//P/+//////8AAPz///8BAAMABAAAAAAAAQADAAAAAQAAAP///v8AAP3/AAD+/wAA/f/9//3/AQABAAQAAgD+////AwD7//7///8DAAEAAQAAAAAAAgAAAAAAAAABAAQAAAAAAP//AwACAAIA//8CAAAAAgAEAP7/BAD7////CQD9/wYABgD+/wQA/v/7/wMAAgAAAAUAAAADAAoAAgADAAAA/v/+/wEA//8AAAYA/v/8//j//P/5//z/AwAFAAAABwD+////BgACAAcAAAACAP7///8KAAIAAgD9//z/AQADAAMABAABAPz//f8AAPr/9f8AAAUABwD///T/9v/6//r//f8EAAEA//8CAP//+v8CAP7//f8DAP7//v/8//r/+//9/wEAAgAAAP7/AQACAAEAAwABAAAAAAADAAQAAgD7//3//f/+/wEABAADAAIAAQADAAUA//8BAAEAAQD9//////8BAP///v/9...",
"mimeType": "audio/wav",
"chunksSynthesized": 1,
"_note": "Response truncated for documentation purposes"
}
curl --location --request POST 'https://zylalabs.com/api/13291/multilingual+speech+recognition+and+synthesis+api/27504/text+to+speech+tts+-+multilingual+synthesis' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{"text": "Hello world from Zyla Labs", "provider": "gemini", "voiceName": "en-US-Journey-F"}'
{
"text": "Xin lỗi, bạn chưa đính kèm file âm thanh nào vào yêu cầu. Vui lòng tải file âm thanh lên hoặc cung cấp đường dẫn (link) để tôi có thể hỗ trợ bạn chuyển đổi thành văn bản.",
"provider": "Google Gemini",
"model": "gemini-3.1-flash-lite",
"durationSecs": 1,
"chunksProcessed": 1
}
curl --location --request POST 'https://zylalabs.com/api/13291/multilingual+speech+recognition+and+synthesis+api/27505/speech+to+text+stt+-+multilingual+audio+transcription' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{
"audioBase64": "UklGRiQAAABXQVZFZm10IBAAAAABAAEAQB8AAEAfAAABAAgAZGF0YQAAAAA=",
"mimeType": "audio/wav",
"lang": "vi"
}'
साइन अप करने के बाद, प्रत्येक डेवलपर को एक पर्सनल API एक्सेस की असाइन की जाती है, जो अक्षरों और अंकों का एक यूनिक संयोजन होता है, जिसका उपयोग हमारे API एंडपॉइंट तक पहुंचने के लिए किया जाता है। प्रमाणीकरण के लिए बहुभाषीय भाषण पहचान और संश्लेषण API के साथ बस अपने बेयरर टोकन को Authorization हेडर में शामिल करें।
| हेडर | विवरण |
|---|---|
Authorization
|
आवश्यक
होना चाहिए Bearer access_key. जब आप सब्सक्राइब हों तो ऊपर "Your API Access Key" देखें।
|
कोई लंबी अवधि की प्रतिबद्धता नहीं। कभी भी अपग्रेड, डाउनग्रेड या कैंसल करें। फ्री ट्रायल में 50 रिक्वेस्ट तक शामिल हैं।
टेक्स्ट टू स्पीच (TTS) एंडपॉइंट इनपुट टेक्स्ट से संश्लेषित उच्च गुणवत्ता वाले WAV ऑडियो फ़ाइलें लौटाता है जबकि स्पीच टू टेक्स्ट (STT) एंडपॉइंट टेक्स्ट प्रारूप में अपलोड की गई ऑडियो फ़ाइलों के शाब्दिक प्रतिलेख लौटाता है
TTS के लिए, कुंजी क्षेत्र "ऑडियो" है, जिसमें ऑडियो डेटा होता है। STT के लिए, कुंजी क्षेत्रों में "पाठ" (गूंजित पाठ), "प्रदाता" (उपयोग की गई सेवा), "मॉडल" (विशिष्ट मॉडल का उपयोग), "अवधिSecs" (ऑडियो की लंबाई), और "चंक्सप्रोसेस्ड" (प्रोसेस किए गए ऑडियो खंडों की संख्या) शामिल हैं
TTS अंत बिंदु "text" (इनपुट पाठ), "language" (संश्लेषण के लिए वांछित भाषा) और "voice" (विशिष्ट आवाज़ मॉडल) जैसे पैरामीटर स्वीकार करता है STT अंत बिंदु "audioFile" (लिप्यांतरण के लिए ऑडियो) और "language" (ऑडियो की भाषा) जैसे पैरामीटर स्वीकार करता है
TTS प्रतिक्रिया में एक ही फ़ील्ड "ऑडियो" होती है जिसमें संख्याबद्ध ऑडियो डेटा होता है STT प्रतिक्रिया कई फ़ील्ड्स के साथ संरचित होती है "पाठ" ट्रांस्क्रिप्शन के लिए "प्रदाता" उपयोग की गई सेवा के लिए "मॉडल" ट्रांस्क्रिप्शन मॉडल के लिए "अवधिSecs" ऑडियो लंबाई के लिए और "chunksProcessed" संसाधित खंडों की संख्या के लिए
TTS और STT सुविधाएँ Google Gemini और OpenAI ChatGPT की उन्नत प्रौद्योगिकियों द्वारा संचालित हैं जो उच्च गुणवत्ता वाली ऑडियो संश्लेषण और тран्सक्रिप्शन सटीकता सुनिश्चित करती हैं
विशिष्ट उपयोग के मामलों में वीडियो के लिए वॉयसओवर बनाने के लिए टीटीएस का उपयोग करना ऑडियोबुक उत्पन्न करना और दस्तावेज़ीकरण और पहुंच के लिए बैठकों या साक्षात्कारों का ट्रांसक्रिप्शन करना शामिल है
उपयोगकर्ता टीटीएस एंडपॉइंट द्वारा लौटाए गए ऑडियो को सीधे अनुप्रयोगों में चला सकते हैं या इसे फाइल के रूप में सहेज सकते हैं। एसटीटी के लिए, ट्रांसक्राइब किया गया पाठ दस्तावेज़ीकरण, विश्लेषण, या चैटबॉट या सामग्री निर्माण जैसे अनुप्रयोगों में आगे की प्रक्रिया के लिए उपयोग किया जा सकता है
डेटा की सटीकता को गूगल और ओपनएआई के उन्नत तंत्रिका मॉडलों के उपयोग के माध्यम से बनाए रखा जाता है जिन्हें लगातार प्रशिक्षित और अपडेट किया जाता है ताकि प्रदर्शन में सुधार हो सके और विभिन्न भाषाओं और उच्चारणों के अनुसार अनुकूलित किया जा सके