Serializador de Áudio da Vonage para o Pipecat
Visão geral
Pipecat é uma estrutura de código aberto para a criação de aplicativos de IA conversacional de voz e multimodal. Ela coordena serviços de IA — como conversão de fala em texto, modelos de linguagem e conversão de texto em fala — juntamente com transportes de rede e processamento de áudio/vídeo para produzir conversas com baixa latência e som natural.
O Serializador de Áudio da Vonage para o Pipecat é um componente de transporte que faz a ponte entre um pipeline do Pipecat e a plataforma da Vonage. Ele lida com a conversão do formato de áudio e a conectividade WebSocket necessárias para receber áudio de uma sessão de voz ou vídeo da Vonage e enviar o áudio processado de volta em tempo real.
Como funciona
A Vonage encaminha o áudio para serviços externos por meio de conexões WebSocket gerenciadas. O Vonage Audio Serializer atua como adaptador de protocolo entre esse fluxo WebSocket e o pipeline de áudio interno do Pipecat:
- Sua aplicação Pipecat inicia um servidor WebSocket utilizando o serializador da Vonage como sua camada de transporte.
- A Vonage abre uma conexão WebSocket com o seu servidor — seja a partir de uma sessão de vídeo por meio de
Conector de áudio, ou a partir de uma chamada de voz por meio de um NCCO
connectação. - O serializador converte o formato de áudio da Vonage recebido nos quadros PCM esperados pelo Pipecat, e os envia para o seu pipeline.
- Seu pipeline processa o áudio por meio dos serviços de IA configurados e retorna uma resposta.
- O serializador converte o áudio de saída de volta para o formato esperado pela Vonage e o envia pelo WebSocket, onde é reproduzido para os participantes da sessão.
Relação com outras integrações do Vonage Pipecat
A Vonage oferece duas integrações distintas com o Pipecat, destinadas a diferentes casos de uso:
| Integração | Transporte | Caso de uso |
|---|---|---|
| Serializador de Áudio da Vonage | WebSocket de áudio (Conector de áudio / NCCO de voz) | Fluxos de IA exclusivamente de áudio para sessões de voz ou vídeo |
| Vonage Video Transport para Pipecat | WebRTC (Conector de Vídeo) | Pipelines que também processam ou geram vídeo, como avatares de vídeo |
Use o Audio Serializer quando seu pipeline precisar apenas processar e retornar áudio. Use o Vonage Video Transport for Pipecat quando seu pipeline também precisar trabalhar com quadros de vídeo.
Quando usar o Serializador de Áudio da Vonage
- Assistentes de IA de voz em tempo real: Implemente um bot de voz baseado em LLM dentro de uma sessão do Vonage Video ou em uma chamada telefônica recebida.
- Transcrição e tradução em tempo real: Envie o áudio da sessão por meio de um serviço de transcrição e envie a transcrição traduzida de volta aos participantes.
- Gravação e análise de chamadas: Capture e analise o conteúdo das conversas de chamadas de voz ou vídeo em tempo real.
- Processamento de efeitos de áudio: Aplique filtragem, redução de ruído ou outras transformações ao áudio antes que ele chegue aos participantes.
- Moderação automatizada: Detectar e tomar medidas em relação a discursos que não estejam em conformidade ou sejam inadequados, à medida que eles ocorram.
Veja também
- Conecte o Pipecat a uma sessão do Vonage — Guia passo a passo com instruções para sessões de vídeo e voz
- Conector de áudio — Como o Audio Connector transmite áudio de uma sessão de vídeo para um WebSocket
- SDK do Servidor de Conectores de Áudio — Crie seu próprio servidor personalizado de processamento de áudio via WebSocket sem o Pipecat
- Vonage Video Transport para Pipecat — Integração com o Pipecat para pipelines que processam tanto vídeo quanto áudio
- Documentação do Pipecat