
Apresentando o Video Connector SDK e o Pipecat Transport para aplicativos de vídeo com IA
Tempo de leitura: 9 minutos
Introdução
As aplicações de IA em tempo real estão transformando a forma como os desenvolvedores criam experiências de vídeo. Seja para alimentar bots de voz com IA, avatares de vídeo, transcrição em tempo real, detecção de emoções ou tradução simultânea, as aplicações modernas exigem cada vez mais acesso em tempo real a fluxos de áudio e vídeo não processados, e não apenas a gravações feitas posteriormente.
Até agora, integrar fluxos de trabalho de IA a uma sessão ao vivo do Vonage Video exigia profundo conhecimento em C++ e no manuseio de mídia em baixo nível. Essa barreira não existe mais. A Vonage lançou duas ferramentas complementares baseadas em Python, projetadas especificamente para desenvolvedores que criam Applications inteligentes e sensíveis à mídia: o Video Connector Server SDK e o Vonage Video Transport for Pipecat.
Juntas, elas facilitam significativamente a transmissão de áudio e vídeo entre sessões do Vonage Video e plataformas de IA, como OpenAI, Deepgram, AWS Nova Sonic, HeyGen e outras. Esta postagem no blog apresenta uma visão geral dessas ferramentas, explica como elas se integram e fornece referências para a implantação do seu primeiro agente de vídeo com tecnologia de IA.
Por que os desenvolvedores precisam de acesso direto a Video e áudio em tempo real
Muitos fluxos de trabalho de IA, incluindo conversão de fala em texto, análise baseada em LLM, síntese de voz, rastreamento de expressões faciais e percepção multimodal, dependem de mídia em tempo real. Os desenvolvedores que trabalham com a Video API da Vonage há muito tempo vêm solicitando uma maneira simples e confiável de receber áudio e Video de uma sessão ativa, processá-los com IA e enviar respostas de volta.
Anteriormente, a única opção do lado do servidor para acessar mídia bruta de uma sessão do Vonage Video era o SDK do Linux em C++. Embora poderoso, sua natureza de baixo nível criava uma curva de aprendizado íngreme que retardava a inovação e limitava a adoção, especialmente entre os desenvolvedores de Python, que constituem a maioria da comunidade de IA/ML.
O SDK do Vonage Video Connector elimina esse atrito.
Exemplos de casos de uso
A cadeia de ferramentas oferece suporte a uma ampla variedade de experiências de IA em tempo real, incluindo:
Agentes de IA de voz e Video (bots): assistentes interativos que veem e ouvem os participantes
Transcrição e legendas em tempo real: conversão de fala em texto ao vivo para acessibilidade e compreensão
Resumos e anotações de reuniões: anotações automatizadas com identificação do orador
Tradução de idiomas: tradução de áudio em tempo real entre os participantes
Detecção de emoções e expressões faciais: análise de sentimentos a partir de quadros de Video
Monitoramento de pacientes e exames: monitoramento remoto por meio de transmissões de Video ao vivo
Avatares de video: respostas em Video geradas por IA e sincronizadas com a Voice
Moderação de conteúdo: detecção em tempo real de conteúdo de áudio ou visual inadequado
O que o SDK do Video Connector oferece
O Video Connector Server SDK é um pacote em Python (disponível no PyPI) que atua como um cliente WebRTC do lado do servidor para sessões de Video da Vonage. Trata-se de um wrapper em Python para o SDK C++ da Vonage para Linux, permitindo a criação de Applications sem interface gráfica e implantáveis na nuvem, sem a necessidade de conhecimento em C++.
Topology of Video Connector Server SDK
Principais recursos
Participação no WebRTC do lado do servidor: participe de uma sessão do Vonage Video como cliente do lado do servidor
Áudio e Video bidirecionais: publicar e assinar transmissões de áudio e Video em tempo real
Formatos de mídia de alta qualidade: áudio transmitido como PCM de 16 bits (até 48 kHz); Video como quadros brutos de 8 bits até FHD 1080p30
Continuidade automatizada de mídia: lida de forma inteligente com interrupções na transmissão de mídia
Assinatura de legendas (beta): receba legendas geradas automaticamente a partir da sessão
Identificação individual de fluxos de áudio (beta): diferenciar e processar pacotes de áudio por participante
Arquitetura orientada a eventos: callbacks assíncronos avançados para eventos de sessão e de mídia
Implantação em nuvem e headless: projetado para uso no lado do servidor em ambientes em contêineres
Isso permite que os desenvolvedores se concentrem inteiramente no que desejam criar — pipelines de IA, ferramentas de análise, bots de Video — sem precisar escrever nenhum código relacionado ao WebRTC ou à infraestrutura de mídia.
Introdução ao SDK do Video Connector
O SDK pode ser instalado a partir do Python Package Indexe foi projetado com base em um fluxo de trabalho orientado a eventos: conecte-se a uma sessão, inscreva-se nos fluxos dos participantes, receba quadros de áudio e Video por meio de callbacks, processe-os com seu pipeline de IA e publique as respostas de volta na sessão.
Referência
A documentação para desenvolvedores do Video Connector oferece uma referência completa para configurar sessões, definir manipuladores de mídia e publicar áudio e Video de volta em uma sessão.
Vonage Video Transport para Pipecat
Pipecat é uma estrutura de código aberto em Python para orquestrar fluxos de trabalho complexos de IA envolvendo áudio, vídeo, imagens e texto. Ela oferece uma plataforma modular e independente de fornecedores para a construção de pipelines de IA em tempo real. Ela conecta conversão de fala em texto, LLMs, conversão de texto em fala, avatares de vídeo e muito mais com o mínimo de programação.
Para aplicativos voltados para vídeo, o novo Vonage Video Transport para Pipecat atua como uma ponte entre uma sessão ao vivo do Vonage Video e um pipeline de processamento do Pipecat. Ao contrário de um serializador (que lida apenas com a conversão de formatos de áudio), um transport permite a transmissão bidirecional completa de áudio e Video entre uma sessão WebRTC da Vonage e o pipeline do Pipecat.

O Vonage Transport para o Pipecat
Conecta uma sessão do Vonage Video a um pipeline do Pipecat por meio do SDK do Video Connector
Suporta transmissões bidirecionais de áudio e Video
Herdado de Pipecat
BaseTransport,BaseInputTransporteBaseOutputTransportclasses abstratasInicializa usando um ID de sessão da Vonage, um token e uma lista opcional de IDs de stream para se inscrever
Permite o acesso a todo o ecossistema de serviços de IA da Pipecat
Isso significa que os desenvolvedores podem usar a lista cada vez maior de integrações de IA do Pipecat — OpenAI Realtime, AWS Nova Sonic, Deepgram, ElevenLabs, HeyGen, Tavus, Simli e outras — sem precisar escrever nenhum código de conversão de mídia ou WebRTC.
Integrações do serviço Pipecat AI
O Pipecat oferece, de fábrica, um conjunto abrangente e em constante expansão de serviços de IA:
Categoria | Serviços oferecidos | |
Conversão de fala em texto | Deepgram, OpenAI Whisper, AssemblyAI, Azure, Google, AWS Transcribe e outros | |
LLM | OpenAI, Anthropic, Gemini, Grok, Bedrock, Ollama e outras | |
Conversão de texto em fala | ElevenLabs, Cartesia, OpenAI, AWS Polly, Google e outras empresas | |
Fala para Fala | AWS Nova Sonic, OpenAI Realtime, Gemini Live | |
Avatares em Video | HeyGen, Simli, Tavus | |
Para consultar a lista mais recente, acesse a página de serviços compatíveis com o Pipecat.
Referência
O documentação para desenvolvedores do Vonage Video Connector Pipecat Transport oferece uma referência completa para configurar o Vonage Transport e criar seu primeiro agente de vídeo com tecnologia Pipecat.
Exemplos de applications
Para ajudar você a começar rapidamente, a Vonage disponibiliza Applications de exemplo que demonstram casos de uso reais:
Echo Server: um aplicativo simples que repete o áudio e o Video de volta para a sessão, útil para validar sua configuração
Video Avatar com legendas (Pipecat): um fluxo de trabalho completo utilizando o AWS Nova Sonic para conversão de voz em voz e o HeyGen para respostas de avatares em Video geradas por IA, com legendas em tempo real
Descrição em áudio do Video (Pipecat): utiliza a IA Moondream para reconhecimento de Video e conversão de texto em fala, a fim de descrever o que está acontecendo na transmissão de Video em tempo real
O código de exemplo está disponível no repositório de versões. Começar é bem simples:
Baixe e descompacte o arquivo tar do SDK do repositório de versões
Instalar o Docker
Abra o
README.mdno diretório principal e compile a imagem do DockerCrie uma sessão do Vonage Video e um
session.jsonarquivo com as credenciais da sua sessãoExecute os exemplos do servidor echo ou do Pipecat seguindo as instruções
README.mdem cada diretório de exemplo
Como as ferramentas se encaixam
A Vonage agora oferece uma cadeia de ferramentas completa em Python para integrar IA tanto em sessões de Voice quanto de Video:
Ferramenta | Transporte | Recursos |
|---|---|---|
SDK do Conector de Áudio | WebSocket | Somente áudio (Sessões da Voice API e da Video API) |
Serializador Pipecat | WebSocket | Somente áudio (Sessões da Voice API e da Video API) |
SDK do Video Connector | WebRTC | Áudio + Video (Sessões da Video API) |
Pipecat Transportes | WebRTC | Áudio + Video (Sessões da Video API) |
Se o seu caso de uso for apenas áudio, o SDK do Audio Connector e o Serializador Pipecat são o ponto de partida certo. Se você precisar de acesso completo a áudio e Video—para avatares, detecção de emoções, IA visual ou agentes multimodais—, o SDK do Video Connector e o Pipecat Transport são as ferramentas ideais para você.
Conclusão
O SDK do Vonage Video Connector e o Pipecat Transport oferecem uma abordagem simplificada, moderna e centrada em Python para a criação de agentes de áudio e vídeo em tempo real. Essas ferramentas eliminam a necessidade de os desenvolvedores gerenciarem os complexos mecanismos internos do WebRTC, escreverem código em C++ ou construírem manualmente pipelines de mídia.
Seja para criar um bot com avatar de vídeo, integrar a conversão de fala em texto a um LLM, analisar expressões faciais em tempo real ou desenvolver um assistente de reuniões baseado em IA, essas ferramentas oferecem as bases de que você precisa.
Se você estiver pronto para começar, confira:
Agora você pode implantar seu primeiro agente de vídeo com IA em questão de minutos e avançar com confiança no desenvolvimento de Applications totalmente inteligentes e compatíveis com mídia na plataforma da Vonage.
Tem alguma dúvida ou quer compartilhar o que está criando?
Inscreva-se no Boletim Informativo para Desenvolvedores
Siga-nos no X (antigo Twitter) para ficar por dentro das novidades
Assista aos tutoriais no nosso canal do YouTube
Conecte-se conosco na página de desenvolvedores da Vonage no LinkedIn
Fique conectado e acompanhe as últimas notícias, dicas e eventos para desenvolvedores.