SDK do Servidor de Conectores de Áudio

Visão geral

O SDK do Servidor do Vonage Audio Connector é uma biblioteca em Python para criar pontos de extremidade WebSocket do lado do servidor que enviam e recebem áudio PCM em tempo real a partir de sessões da Video API da Vonage. Ela foi desenvolvida com base no Conector de áudio, que permite extrair fluxos de áudio brutos de uma sessão ao vivo e encaminhá-los para um servidor WebSocket externo.

O SDK abstraí o protocolo WebSocket de baixo nível, o ciclo de vida da conexão, o armazenamento em buffer de quadros de áudio e o gerenciamento de tempo, para que você possa se concentrar no processamento de áudio e na integração de serviços de IA.

Como funciona

Quando uma sessão do Vonage Video utiliza o Audio Connector, o roteador de mídia da sessão abre uma conexão WebSocket com o seu servidor e inicia a transmissão de áudio PCM. O SDK do servidor do Audio Connector gerencia essa conexão por meio de um modelo orientado a eventos:

  1. O SDK inicia um servidor WebSocket que fica à escuta em um host e uma porta configuráveis.
  2. Quando o Audio Connector estabelece uma conexão, o SDK dispara um on_connect evento e passa um identificador de cliente para o código do seu aplicativo.
  3. Seu aplicativo registra manipuladores no identificador do cliente para receber quadros de áudio (on_message), detectar desconexão (on_disconnect), e lidar com erros (on_error).
  4. Seu aplicativo processa o áudio — por exemplo, encaminhando-o para um serviço de conversão de fala em texto — e envia o áudio processado ou mensagens de controle de volta para a sessão por meio do mesmo identificador de cliente.

O SDK gerencia internamente o buffer de áudio e a sincronização dos quadros, garantindo uma reprodução suave e sincronizada quando você reenvia o áudio para a sessão.

Principais recursos

  • Arquitetura orientada a eventos: O ciclo de vida do servidor (inicialização, desligamento) e os eventos de conexão (conexão, desconexão, mensagem, erro) são tratados por meio de callbacks assíncronos, mantendo a lógica do seu aplicativo desacoplada do gerenciamento de conexões.
  • Áudio bidirecional em tempo real: Recebe áudio PCM bruto da sessão e envia de volta o áudio PCM processado, com taxas de amostragem configuráveis (8 kHz, 16 kHz, 24 kHz).
  • Várias conexões simultâneas: Gerencie várias sessões do Audio Connector simultaneamente, tornando-o adequado para fluxos de trabalho de IA multilocatários ou em escala.
  • Suporte a SSL/TLS: Proteja as conexões WebSocket com um contexto SSL fornecido para implantações em produção.
  • Gerenciamento de quadros de áudio: O buffer integrado e o controle de temporização sincronizam os quadros de áudio de saída, de modo que você não precisa implementar a lógica de sincronização por conta própria.

Quando usar este SDK

Utilize o SDK do Audio Connector Server quando precisar conectar o áudio de uma sessão ao vivo do Vonage Video a um fluxo de processamento no lado do servidor. Os cenários mais comuns incluem:

  • Assistentes de IA conversacionais: Crie bots de voz usando um fluxo de trabalho de conversão de fala em texto → LLM → conversão de texto em fala diretamente dentro de uma sessão de vídeo.
  • Transcrição e tradução em tempo real: Transmita áudio para um serviço de transcrição e receba legendas ou a tradução do que foi dito em tempo real.
  • Análise de sentimento e tom: Detectar sinais de emoção ou de aceitação durante chamadas ao vivo.
  • Biometria de voz: Identificar ou autenticar os locutores a partir de seu fluxo de áudio.
  • Orientação em tempo real: Fornecer feedback gerado por IA aos atendentes durante as chamadas dos clientes.
  • Anotações automatizadas: Gere resumos, transcrições e itens de ação a partir do áudio das sessões.
  • Moderação de conteúdo: Sinalize comentários inadequados ou que não estejam em conformidade assim que eles ocorrerem.

Se o seu caso de uso envolver processamento de vídeo ou avatares de vídeo, além de áudio, considere o SDK do Video Connector Server ou o

Se você quiser se conectar a um pipeline pré-construído da estrutura de IA Pipecat, em vez de implementar seu próprio processamento de áudio, consulte o Serializador de Áudio da Vonage para o Pipecat.

Veja também