
Apresentando o Audio Connector SDK e o Pipecat Serializer para aplicativos de áudio com IA
Tempo de leitura: 6 minutos
Introdução
As aplicações de IA em tempo real estão transformando a maneira como os desenvolvedores criam experiências de voz e vídeo. Seja para alimentar serviços de transcrição, agentes conversacionais, tradução em tempo real ou análise de sentimentos, as aplicações modernas exigem cada vez mais acesso ao áudio bruto em tempo real — e não apenas ao final de uma gravação ou após o envio de um arquivo.
Pipecat, uma estrutura de código aberto, aprimora a integração das Video API e Voice API da Vonage com conectores de áudio, oferecendo uma plataforma modular e independente de fornecedores para orquestrar fluxos de trabalho de IA. Com recursos como latência ultrabaixa, detecção avançada de atividade de voz e suporte multimodal, o Pipecat permite que os desenvolvedores criem experiências de IA conversacional altamente responsivas e naturais. Sua flexibilidade possibilita uma integração perfeita com uma variedade de modelos e serviços de IA, tornando-o a escolha ideal para a criação de aplicativos ricos de áudio e Video em tempo real.
Para dar suporte a essa próxima geração de applications inteligentes, a Vonage lançou duas ferramentas complementares projetadas especificamente para desenvolvedores: o SDK do Servidor Python do Vonage Audio Connector e o Vonage Serializer para Pipecat. Juntas, elas facilitam significativamente a transmissão de áudio entre sessões de Video e Voice da Vonage, servidores WebSocket e estruturas de IA, como OpenAI, Deepgram ou AWS Nova Sonic.
Este blog apresenta uma visão geral dessas ferramentas, explica como elas se integram entre si e fornece referências para a implantação do seu primeiro agente baseado em IA.
Por que os desenvolvedores precisam de acesso direto ao áudio em tempo real
Muitos fluxos de trabalho de IA — conversão de fala em texto, análise baseada em LLM, síntese de voz e percepção multimodal — dependem de áudio em tempo real. Os desenvolvedores que trabalham com as APIs de voz e Video da Vonage vêm solicitando há muito tempo uma maneira simples e confiável de receber áudio de uma sessão ativa, processá-lo e enviar respostas de volta.
O Vonage Audio Connector para a Video API e a integração da Voice API com WebSocket permite que os desenvolvedores criem servidores WebSocket que conectam as sessões da Vonage aos fluxos de trabalho de IA.
No entanto, criar servidores WebSocket de baixa latência, gerenciar quadros binários de áudio, coordenar taxas de amostragem e manter conexões com estado pode ser complexo e propenso a erros. Essa complexidade costuma retardar a experimentação, o desenvolvimento de provas de conceito e as implantações em produção.
O SDK do Vonage Audio Connector elimina esse obstáculo.
Exemplos de casos de uso
A cadeia de ferramentas oferece suporte a uma ampla variedade de experiências de IA em tempo real, incluindo:
Transcrição de fala para texto
Assistentes de reuniões baseados em LLM
Análise de sentimento ou intenção em chamadas ao vivo
Bots de voz interativos
Tradução de idiomas em tempo real
Anotação ou resumo automatizado
Moderação de áudio e detecção de conformidade
O SDK do Audio Connector
O diagrama a seguir mostra a arquitetura de uma sessão de Video ou conversa de Voice integrada ao SDK do Audio Connector por meio de um WebSocket. O SDK é um pacote em Python (disponível no PyPI) que simplifica a complexidade do gerenciamento de fluxos de áudio via WebSocket das sessões da Vonage.

Principais recursos
Servidor WebSocket orientado a eventos para receber e enviar áudio PCM
Suporte para amostras de 8 kHz, 16 kHz e 24 kHz com processamento automático de quadros
Callbacks assíncronos limpos para eventos de conexão, desconexão, mensagem e erro
Buffer integrado e controle de temporização para uma reprodução suave
Várias conexões simultâneas para fluxos de trabalho com múltiplos agentes ou múltiplos participantes
Suporte a TLS para implantações seguras em ambiente de produção
Isso permite que os desenvolvedores se concentrem inteiramente no que desejam criar — pipelines de transcrição, ferramentas de análise, assistentes de voz — sem precisar desenvolver nenhuma infraestrutura de WebSocket.
Introdução ao SDK do Audio Connector
O SDK pode ser instalado a partir do Python Package Index usando um gerenciador de pacotes Python.
pip install vonage-audio-connector-server Referência
O Guia do desenvolvedor do SDK oferece uma referência básica para configurar/iniciar o servidor WebSocket, definir manipuladores assíncronos para gerenciamento de sessão e áudio e injetar o áudio de volta na sessão de Video por meio do WebSocket.
Informações sobre como estabelecer uma conexão WebSocket a partir de uma sessão de Video para um servidor usando o SDK estão disponíveis na página do desenvolvedor do Audio Connector. Informações sobre como estabelecer uma conexão WebSocket a partir de uma conversa de Voice para um servidor usando o SDK estão disponíveis na página de desenvolvedores do Voice WebSockets.
Código de exemplo
Você pode clonar o código de exemplo para usar o SDK do Audio Connector a partir do repositório do GitHub
Serializador Vonage para Pipecat
Pipecat é uma estrutura de código aberto para orquestrar fluxos de trabalho complexos de IA envolvendo áudio, Video, imagens e texto. Para aplicativos voltados para áudio, o novo Vonage Serializer para Pipecat atua como uma ponte entre as sessões de Voice e Video da Vonage e um pipeline de processamento do Pipecat.
Principais recursos
Converte os quadros de áudio recebidos da Vonage para o formato de quadro interno do Pipecat
Alinha as taxas de amostragem e as codificações de áudio
Suporta DTMF e outros metadados
Converte os quadros de áudio do Pipecat de saída de volta em quadros do WebSocket da Vonage
Isso significa que os desenvolvedores podem usar a lista cada vez maior de nós de IA do Pipecat — OpenAI Realtime, Deepgram, Whisper, ElevenLabs, etc. — sem precisar escrever nenhum código de tradução de mídia.
O serializador oferece uma conexão direta entre o áudio de um participante ao vivo e um fluxo de trabalho de IA totalmente programável.

Referência
O Guia do Serializer oferece uma referência básica para configurar o Vonage Serializer com o Pipecat.
Implemente seu primeiro agente de IA
Utilizando o SDK do Vonage Audio Connector ou o Pipecat Serializer oferece aos desenvolvedores uma maneira simples, moderna e compatível com Python de criar agentes de áudio em tempo real — sem precisar reinventar servidores WebSocket ou pipelines de mídia.
Seja para criar um bot de voz, integrar a conversão de fala em texto a um LLM, gerar respostas sintetizadas em tempo real ou analisar o comportamento das chamadas, essas ferramentas oferecem as bases de que você precisa.
Se você estiver pronto para começar, confira:
O pacote PyPI para o SDK do Audio Connector
Exemplos de applications para o SDK
Exemplos do Vonage no repositório do Pipecat
Conclusão
Com essas ferramentas, você pode implantar seu primeiro agente de IA em questão de minutos — e avançar com confiança na criação de Applications totalmente inteligentes e compatíveis com mídias na plataforma da Vonage.
Tem alguma dúvida ou quer compartilhar o que está criando?
Inscreva-se no Boletim Informativo para Desenvolvedores
Siga-nos no X (antigo Twitter) para ficar por dentro das novidades
Assista aos tutoriais no nosso canal do YouTube
Conecte-se conosco na página de desenvolvedores da Vonage no LinkedIn
Fique conectado e acompanhe as últimas notícias, dicas e eventos para desenvolvedores.