https://a.storyblok.com/f/270183/1368x665/a76a0b7f5b/26may_dev-blog_ai-audio_pipecat.jpg

Apresentando o Audio Connector SDK e o Pipecat Serializer para aplicativos de áudio com IA

Publicado em May 7, 2026

Tempo de leitura: 6 minutos

Introdução

As aplicações de IA em tempo real estão transformando a maneira como os desenvolvedores criam experiências de voz e vídeo. Seja para alimentar serviços de transcrição, agentes conversacionais, tradução em tempo real ou análise de sentimentos, as aplicações modernas exigem cada vez mais acesso ao áudio bruto em tempo real — e não apenas ao final de uma gravação ou após o envio de um arquivo.

Pipecat, uma estrutura de código aberto, aprimora a integração das Video API e Voice API da Vonage com conectores de áudio, oferecendo uma plataforma modular e independente de fornecedores para orquestrar fluxos de trabalho de IA. Com recursos como latência ultrabaixa, detecção avançada de atividade de voz e suporte multimodal, o Pipecat permite que os desenvolvedores criem experiências de IA conversacional altamente responsivas e naturais. Sua flexibilidade possibilita uma integração perfeita com uma variedade de modelos e serviços de IA, tornando-o a escolha ideal para a criação de aplicativos ricos de áudio e Video em tempo real.

Para dar suporte a essa próxima geração de applications inteligentes, a Vonage lançou duas ferramentas complementares projetadas especificamente para desenvolvedores: o SDK do Servidor Python do Vonage Audio Connector e o Vonage Serializer para Pipecat. Juntas, elas facilitam significativamente a transmissão de áudio entre sessões de Video e Voice da Vonage, servidores WebSocket e estruturas de IA, como OpenAI, Deepgram ou AWS Nova Sonic.

Este blog apresenta uma visão geral dessas ferramentas, explica como elas se integram entre si e fornece referências para a implantação do seu primeiro agente baseado em IA.

Por que os desenvolvedores precisam de acesso direto ao áudio em tempo real

Muitos fluxos de trabalho de IA — conversão de fala em texto, análise baseada em LLM, síntese de voz e percepção multimodal — dependem de áudio em tempo real. Os desenvolvedores que trabalham com as APIs de voz e Video da Vonage vêm solicitando há muito tempo uma maneira simples e confiável de receber áudio de uma sessão ativa, processá-lo e enviar respostas de volta.

O Vonage Audio Connector para a Video API e a integração da Voice API com WebSocket permite que os desenvolvedores criem servidores WebSocket que conectam as sessões da Vonage aos fluxos de trabalho de IA.

No entanto, criar servidores WebSocket de baixa latência, gerenciar quadros binários de áudio, coordenar taxas de amostragem e manter conexões com estado pode ser complexo e propenso a erros. Essa complexidade costuma retardar a experimentação, o desenvolvimento de provas de conceito e as implantações em produção.

O SDK do Vonage Audio Connector elimina esse obstáculo.

Exemplos de casos de uso

A cadeia de ferramentas oferece suporte a uma ampla variedade de experiências de IA em tempo real, incluindo:

  • Transcrição de fala para texto

  • Assistentes de reuniões baseados em LLM

  • Análise de sentimento ou intenção em chamadas ao vivo

  • Bots de voz interativos

  • Tradução de idiomas em tempo real

  • Anotação ou resumo automatizado

  • Moderação de áudio e detecção de conformidade

O SDK do Audio Connector

O diagrama a seguir mostra a arquitetura de uma sessão de Video ou conversa de Voice integrada ao SDK do Audio Connector por meio de um WebSocket. O SDK é um pacote em Python (disponível no PyPI) que simplifica a complexidade do gerenciamento de fluxos de áudio via WebSocket das sessões da Vonage.

Diagram of Vonage session sending audio via WebSocket to Audio Connector SDK, then to Customer App, and finally to AI Workflow.

Principais recursos

  • Servidor WebSocket orientado a eventos para receber e enviar áudio PCM

  • Suporte para amostras de 8 kHz, 16 kHz e 24 kHz com processamento automático de quadros

  • Callbacks assíncronos limpos para eventos de conexão, desconexão, mensagem e erro

  • Buffer integrado e controle de temporização para uma reprodução suave

  • Várias conexões simultâneas para fluxos de trabalho com múltiplos agentes ou múltiplos participantes

  • Suporte a TLS para implantações seguras em ambiente de produção

Isso permite que os desenvolvedores se concentrem inteiramente no que desejam criar — pipelines de transcrição, ferramentas de análise, assistentes de voz — sem precisar desenvolver nenhuma infraestrutura de WebSocket.

Introdução ao SDK do Audio Connector

O SDK pode ser instalado a partir do Python Package Index usando um gerenciador de pacotes Python.

pip install vonage-audio-connector-server

Referência

O Guia do desenvolvedor do SDK oferece uma referência básica para configurar/iniciar o servidor WebSocket, definir manipuladores assíncronos para gerenciamento de sessão e áudio e injetar o áudio de volta na sessão de Video por meio do WebSocket.

Informações sobre como estabelecer uma conexão WebSocket a partir de uma sessão de Video para um servidor usando o SDK estão disponíveis na página do desenvolvedor do Audio Connector. Informações sobre como estabelecer uma conexão WebSocket a partir de uma conversa de Voice para um servidor usando o SDK estão disponíveis na página de desenvolvedores do Voice WebSockets.

Código de exemplo

Você pode clonar o código de exemplo para usar o SDK do Audio Connector a partir do repositório do GitHub

Serializador Vonage para Pipecat

Pipecat é uma estrutura de código aberto para orquestrar fluxos de trabalho complexos de IA envolvendo áudio, Video, imagens e texto. Para aplicativos voltados para áudio, o novo Vonage Serializer para Pipecat atua como uma ponte entre as sessões de Voice e Video da Vonage e um pipeline de processamento do Pipecat.

Principais recursos

  • Converte os quadros de áudio recebidos da Vonage para o formato de quadro interno do Pipecat

  • Alinha as taxas de amostragem e as codificações de áudio

  • Suporta DTMF e outros metadados

  • Converte os quadros de áudio do Pipecat de saída de volta em quadros do WebSocket da Vonage

Isso significa que os desenvolvedores podem usar a lista cada vez maior de nós de IA do Pipecat — OpenAI Realtime, Deepgram, Whisper, ElevenLabs, etc. — sem precisar escrever nenhum código de tradução de mídia.

O serializador oferece uma conexão direta entre o áudio de um participante ao vivo e um fluxo de trabalho de IA totalmente programável.

Diagram showing a Vonage voice/video session with bi-directional WebSocket audio linked to a customer-deployed Pipecat application via serializer.

Referência

O Guia do Serializer oferece uma referência básica para configurar o Vonage Serializer com o Pipecat.

Implemente seu primeiro agente de IA

Utilizando o SDK do Vonage Audio Connector ou o Pipecat Serializer oferece aos desenvolvedores uma maneira simples, moderna e compatível com Python de criar agentes de áudio em tempo real — sem precisar reinventar servidores WebSocket ou pipelines de mídia.

Seja para criar um bot de voz, integrar a conversão de fala em texto a um LLM, gerar respostas sintetizadas em tempo real ou analisar o comportamento das chamadas, essas ferramentas oferecem as bases de que você precisa.

Se você estiver pronto para começar, confira:

Conclusão

Com essas ferramentas, você pode implantar seu primeiro agente de IA em questão de minutos — e avançar com confiança na criação de Applications totalmente inteligentes e compatíveis com mídias na plataforma da Vonage.

Tem alguma dúvida ou quer compartilhar o que está criando?

Fique conectado e acompanhe as últimas notícias, dicas e eventos para desenvolvedores.

Compartilhar:

https://a.storyblok.com/f/270183/331x330/f4b074099d/michael-vernick.png
Michael VernickArquiteto de Soluções para Clientes