{
"audio": "UklGRqRQAgBXQVZFZm10IBAAAAABAAEAwF0AAIC7AAACABAAZGF0YYBQAgAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAAP//AAAAAAAA//8AAP//AAD/////AAACAAAAAAD//wEAAQABAP7/AAD9//3/AAD+//7////9//z//f/8/wAAAAAAAP7/AgABAP3/+//+/wAA//8BAP//+/8AAP///v/9//z///8DAP//AQAAAP3//P////v/AgD8//7/+//9//z//v/+/////f/+/wAA/v8DAP//AgAEAAMABwAGAAUABAAAAAIAAgADAAMAAQADAAMAAgABAAAAAAD///7//f////v//f8BAAIABAAAAAEAAgABAAIAAwAAAAAA//////v///8CAP7//P/+//////8AAPz///8BAAMABAAAAAAAAQADAAAAAQAAAP///v8AAP3/AAD+/wAA/f/9//3/AQABAAQAAgD+////AwD7//7///8DAAEAAQAAAAAAAgAAAAAAAAABAAQAAAAAAP//AwACAAIA//8CAAAAAgAEAP7/BAD7////CQD9/wYABgD+/wQA/v/7/wMAAgAAAAUAAAADAAoAAgADAAAA/v/+/wEA//8AAAYA/v/8//j//P/5//z/AwAFAAAABwD+////BgACAAcAAAACAP7///8KAAIAAgD9//z/AQADAAMABAABAPz//f8AAPr/9f8AAAUABwD///T/9v/6//r//f8EAAEA//8CAP//+v8CAP7//f8DAP7//v/8//r/+//9/wEAAgAAAP7/AQACAAEAAwABAAAAAAADAAQAAgD7//3//f/+/wEABAADAAIAAQADAAUA//8BAAEAAQD9//////8BAP///v/9...",
"mimeType": "audio/wav",
"chunksSynthesized": 1,
"_note": "Response truncated for documentation purposes"
}
curl --location --request POST 'https://zylalabs.com/api/13291/multilingual+speech+recognition+and+synthesis+api/27504/text+to+speech+tts+-+multilingual+synthesis' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{"text": "Hello world from Zyla Labs", "provider": "gemini", "voiceName": "en-US-Journey-F"}'
{
"text": "Xin lỗi, bạn chưa đính kèm file âm thanh nào vào yêu cầu. Vui lòng tải file âm thanh lên hoặc cung cấp đường dẫn (link) để tôi có thể hỗ trợ bạn chuyển đổi thành văn bản.",
"provider": "Google Gemini",
"model": "gemini-3.1-flash-lite",
"durationSecs": 1,
"chunksProcessed": 1
}
curl --location --request POST 'https://zylalabs.com/api/13291/multilingual+speech+recognition+and+synthesis+api/27505/speech+to+text+stt+-+multilingual+audio+transcription' --header 'Authorization: Bearer YOUR_API_KEY'
--data-raw '{
"audioBase64": "UklGRiQAAABXQVZFZm10IBAAAAABAAEAQB8AAEAfAAABAAgAZGF0YQAAAAA=",
"mimeType": "audio/wav",
"lang": "vi"
}'
Após se cadastrar, cada desenvolvedor recebe uma chave de acesso à API pessoal, uma combinação única de letras e dígitos para acessar nosso endpoint de API. Para autenticar com a Reconhecimento e Síntese de Fala Multilíngue API basta incluir seu token Bearer no cabeçalho Authorization.
| Cabeçalho | Descrição |
|---|---|
Authorization
|
Obrigatório
Deve ser Bearer access_key. Veja "Sua chave de acesso à API" acima quando você estiver inscrito.
|
Sem compromisso de longo prazo. Faça upgrade, downgrade ou cancele a qualquer momento. O teste gratuito inclui até 50 requisições.
TTS de texto para fala neural de alta fidelidade a 24kHz e API de STT de fala para texto com 99,8 por cento de precisão suportando 70 idiomas globais incluindo vietnamita inglês japonês coreano chinês francês alemão espanhol. Alimentado pelo Google Gemini e OpenAI ChatGPT
O endpoint de Texto para Fala (TTS) retorna arquivos de áudio WAV de alta fidelidade sintetizados a partir de texto de entrada enquanto o endpoint de Fala para Texto (STT) retorna transcrições literais de arquivos de áudio enviados em formato de texto
Para TTS, o campo chave é "áudio", que contém os dados de áudio. Para STT, os campos chave incluem "texto" (o texto transcrito), "fornecedor" (o serviço utilizado), "modelo" (o modelo específico empregado), "duraçãoSegs" (duração do áudio) e "chunksProcessados" (número de segmentos de áudio processados)
O endpoint TTS aceita parâmetros como "texto" (o texto de entrada), "idioma" (o idioma desejado para a síntese) e "voz" (o modelo de voz específico). O endpoint STT aceita parâmetros como "arquivoDeAudio" (o áudio a ser transcrito) e "idioma" (o idioma do áudio)
A resposta TTS contém um único campo "áudio" com os dados de áudio sintetizados. A resposta STT é estruturada com vários campos: "texto" para a transcrição, "prestador" para o serviço utilizado, "modelo" para o modelo de transcrição, "duraçãoSegs" para o comprimento do áudio e "segmentosProcessados" para o número de segmentos processados
As funcionalidades de TTS e STT são alimentadas por tecnologias avançadas do Google Gemini e do OpenAI ChatGPT garantindo síntese de áudio de alta qualidade e precisão na transcrição
Casos de uso típicos incluem criar narrações para vídeos usando TTS gerar audiolivros e transcrever reuniões ou entrevistas com STT para documentação e acessibilidade
Os usuários podem reproduzir o áudio retornado pelo endpoint TTS diretamente em aplicativos ou salvá-lo como um arquivo Para STT o texto transcrito pode ser usado para documentação análise ou processamento adicional em aplicativos como chatbots ou criação de conteúdo
A precisão dos dados é mantida através do uso de modelos neurais avançados do Google e da OpenAI que são continuamente treinados e atualizados para melhorar o desempenho e se adaptar a vários idiomas e sotaques