SDK do Servidor de Conectores de Áudio
Visão geral
O SDK do Servidor do Vonage Audio Connector é uma biblioteca em Python para criar pontos de extremidade WebSocket do lado do servidor que enviam e recebem áudio PCM em tempo real a partir de sessões da Video API da Vonage. Ela foi desenvolvida com base no Conector de áudio, que permite extrair fluxos de áudio brutos de uma sessão ao vivo e encaminhá-los para um servidor WebSocket externo.
O SDK abstraí o protocolo WebSocket de baixo nível, o ciclo de vida da conexão, o armazenamento em buffer de quadros de áudio e o gerenciamento de tempo, para que você possa se concentrar no processamento de áudio e na integração de serviços de IA.
Como funciona
Quando uma sessão do Vonage Video utiliza o Audio Connector, o roteador de mídia da sessão abre uma conexão WebSocket com o seu servidor e inicia a transmissão de áudio PCM. O SDK do servidor do Audio Connector gerencia essa conexão por meio de um modelo orientado a eventos:
- O SDK inicia um servidor WebSocket que fica à escuta em um host e uma porta configuráveis.
- Quando o Audio Connector estabelece uma conexão, o SDK dispara um
on_connectevento e passa um identificador de cliente para o código do seu aplicativo. - Seu aplicativo registra manipuladores no identificador do cliente para receber quadros de áudio
(
on_message), detectar desconexão (on_disconnect), e lidar com erros (on_error). - Seu aplicativo processa o áudio — por exemplo, encaminhando-o para um serviço de conversão de fala em texto — e envia o áudio processado ou mensagens de controle de volta para a sessão por meio do mesmo identificador de cliente.
O SDK gerencia internamente o buffer de áudio e a sincronização dos quadros, garantindo uma reprodução suave e sincronizada quando você reenvia o áudio para a sessão.
Principais recursos
- Arquitetura orientada a eventos: O ciclo de vida do servidor (inicialização, desligamento) e os eventos de conexão (conexão, desconexão, mensagem, erro) são tratados por meio de callbacks assíncronos, mantendo a lógica do seu aplicativo desacoplada do gerenciamento de conexões.
- Áudio bidirecional em tempo real: Recebe áudio PCM bruto da sessão e envia de volta o áudio PCM processado, com taxas de amostragem configuráveis (8 kHz, 16 kHz, 24 kHz).
- Várias conexões simultâneas: Gerencie várias sessões do Audio Connector simultaneamente, tornando-o adequado para fluxos de trabalho de IA multilocatários ou em escala.
- Suporte a SSL/TLS: Proteja as conexões WebSocket com um contexto SSL fornecido para implantações em produção.
- Gerenciamento de quadros de áudio: O buffer integrado e o controle de temporização sincronizam os quadros de áudio de saída, de modo que você não precisa implementar a lógica de sincronização por conta própria.
Quando usar este SDK
Utilize o SDK do Audio Connector Server quando precisar conectar o áudio de uma sessão ao vivo do Vonage Video a um fluxo de processamento no lado do servidor. Os cenários mais comuns incluem:
- Assistentes de IA conversacionais: Crie bots de voz usando um fluxo de trabalho de conversão de fala em texto → LLM → conversão de texto em fala diretamente dentro de uma sessão de vídeo.
- Transcrição e tradução em tempo real: Transmita áudio para um serviço de transcrição e receba legendas ou a tradução do que foi dito em tempo real.
- Análise de sentimento e tom: Detectar sinais de emoção ou de aceitação durante chamadas ao vivo.
- Biometria de voz: Identificar ou autenticar os locutores a partir de seu fluxo de áudio.
- Orientação em tempo real: Fornecer feedback gerado por IA aos atendentes durante as chamadas dos clientes.
- Anotações automatizadas: Gere resumos, transcrições e itens de ação a partir do áudio das sessões.
- Moderação de conteúdo: Sinalize comentários inadequados ou que não estejam em conformidade assim que eles ocorrerem.
Se o seu caso de uso envolver processamento de vídeo ou avatares de vídeo, além de áudio, considere o SDK do Video Connector Server ou o
- Vonage Video Transport para Pipecat em vez disso.
Se você quiser se conectar a um pipeline pré-construído da estrutura de IA Pipecat, em vez de implementar seu próprio processamento de áudio, consulte o Serializador de Áudio da Vonage para o Pipecat.
Veja também
- Configurar o SDK do Audio Connector Server — Passo a passo de instalação e configuração
- Conector de áudio — Como o recurso subjacente “Audio Connector” transmite áudio de uma sessão para um WebSocket
- Serializador de Áudio da Vonage para o Pipecat — Conectando pipelines do Pipecat a sessões do Vonage