{
"audio": "UklGRqRQAgBXQVZFZm10IBAAAAABAAEAwF0AAIC7AAACABAAZGF0YYBQAgAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAP//AAAAAAAA//8AAP//AAD/////AAACAAAAAAD//wEAAQABAP7/AAD9//3/AAD+//7////9//z//f/8/wAAAAAAAP7/AgABAP3/+//+/wAA//8BAP//+/8AAP///v/9//z///8DAP//AQAAAP3//P////v/AgD8//7/+//9//z//v/+/////f/+/wAA/v8DAP//AgAEAAMABwAGAAUABAAAAAIAAgADAAMAAQADAAMAAgABAAAAAAD///7//f////v//f8BAAIABAAAAAEAAgABAAIAAwAAAAAA//////v///8CAP7//P/+//////8AAPz///8BAAMABAAAAAAAAQADAAAAAQAAAP///v8AAP3/AAD+/wAA/f/9//3/AQABAAQAAgD+////AwD7//7///8DAAEAAQAAAAAAAgAAAAAAAAABAAQAAAAAAP//AwACAAIA//8CAAAAAgAEAP7/BAD7////CQD9/wYABgD+/wQA/v/7/wMAAgAAAAUAAAADAAoAAgADAAAA/v/+/wEA//8AAAYA/v/8//j//P/5//z/AwAFAAAABwD+////BgACAAcAAAACAP7///8KAAIAAgD9//z/AQADAAMABAABAPz//f8AAPr/9f8AAAUABwD///T/9v/6//r//f8EAAEA//8CAP//+v8CAP7//f8DAP7//v/8//r/+//9/wEAAgAAAP7/AQACAAEAAwABAAAAAAADAAQAAgD7//3//f/+/wEABAADAAIAAQADAAUA//8BAAEAAQD9//////8BAP///v/9...",
"mimeType": "audio/wav",
"chunksSynthesized": 1,
"_note": "Response truncated for documentation purposes"
}
curl --location --request POST 'https://zylalabs.com/api/13291/multilingual+speech+recognition+and+synthesis+api/27504/text+to+speech+tts+-+multilingual+synthesis' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{"text": "Hello world from Zyla Labs", "provider": "gemini", "voiceName": "en-US-Journey-F"}'
{
"text": "Xin lỗi, bạn chưa đính kèm file âm thanh nào vào yêu cầu. Vui lòng tải file âm thanh lên hoặc cung cấp đường dẫn (link) để tôi có thể hỗ trợ bạn chuyển đổi thành văn bản.",
"provider": "Google Gemini",
"model": "gemini-3.1-flash-lite",
"durationSecs": 1,
"chunksProcessed": 1
}
curl --location --request POST 'https://zylalabs.com/api/13291/multilingual+speech+recognition+and+synthesis+api/27505/speech+to+text+stt+-+multilingual+audio+transcription' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{
"audioBase64": "UklGRiQAAABXQVZFZm10IBAAAAABAAEAQB8AAEAfAAABAAgAZGF0YQAAAAA=",
"mimeType": "audio/wav",
"lang": "vi"
}'
Después de registrarte, a cada desarrollador se le asigna una clave de acceso a la API personal, una combinación única de letras y dígitos proporcionada para acceder a nuestro endpoint de la API. Para autenticarte con el Reconocimiento y síntesis de voz multilingüe API simplemente incluye tu token de portador en el encabezado de Autorización.
| Encabezado | Descripción |
|---|---|
Autorización
|
Requerido
Debería ser Bearer access_key. Consulta "Tu Clave de Acceso a la API" arriba cuando estés suscrito.
|
Sin compromiso a largo plazo. Mejora, reduce o cancela en cualquier momento. La Prueba Gratuita incluye hasta 50 solicitudes.
Empresas líderes confían en nosotros
TTS de texto a voz neuronal de alta fidelidad a 24 kHz y API de STT de voz a texto con un 99,8 por ciento de precisión que admite 70 idiomas globales, incluidos el vietnamita, el inglés, el japonés, el coreano, el chino, el francés, el alemán y el español. Impulsado por Google Gemini y OpenAI ChatGPT
El endpoint de Texto a Voz (TTS) devuelve archivos de audio WAV de alta fidelidad sintetizados a partir de texto de entrada mientras que el endpoint de Voz a Texto (STT) devuelve transcripciones verbatim de archivos de audio subidos en formato de texto
Para TTS, el campo clave es "audio", que contiene los datos de audio. Para STT, los campos clave incluyen "texto" (el texto transcrito), "proveedor" (el servicio utilizado), "modelo" (el modelo específico empleado), "duracionSegs" (longitud del audio) y "chunksProcesados" (número de segmentos de audio procesados)
El punto final de TTS acepta parámetros como "texto" (el texto de entrada), "idioma" (el idioma deseado para la síntesis) y "voz" (el modelo de voz específico). El punto final de STT acepta parámetros como "archivoDeAudio" (el audio a ser transcrito) e "idioma" (el idioma del audio)
La respuesta TTS contiene un único campo "audio" con los datos de audio sintetizado. La respuesta STT está estructurada con múltiples campos: "texto" para la transcripción, "proveedor" para el servicio utilizado, "modelo" para el modelo de transcripción, "duraciónSegs" para la duración del audio y "fragmentosProcesados" para el número de segmentos procesados
Las funcionalidades TTS y STT están impulsadas por tecnologías avanzadas de Google Gemini y OpenAI ChatGPT asegurando una síntesis de audio de alta calidad y precisión en la transcripción
Los casos de uso típicos incluyen la creación de voces en off para videos utilizando TTS la generación de audiolibros y la transcripción de reuniones o entrevistas con STT para documentación y accesibilidad
Los usuarios pueden reproducir el audio devuelto por el endpoint TTS directamente en las aplicaciones o guardarlo como un archivo Para STT el texto transcrito se puede utilizar para documentación análisis o procesamiento adicional en aplicaciones como chatbots o creación de contenido
La precisión de los datos se mantiene mediante el uso de modelos neuronales avanzados de Google y OpenAI que se entrenan y actualizan continuamente para mejorar el rendimiento y adaptarse a varios idiomas y acentos