SDK del servidor de conectores de audio
Visión general
El SDK del servidor Vonage Audio Connector es una biblioteca de Python para crear puntos finales WebSocket del lado del servidor que envían y reciben audio PCM en tiempo real de las sesiones de la Video API de Vonage. Está construida sobre el Conector de audioque permite extraer secuencias de audio de una sesión en directo y enviarlos a un servidor WebSocket externo.
El SDK abstrae el protocolo WebSocket de bajo nivel, el ciclo de vida de la conexión, el almacenamiento en búfer de fotogramas de audio y la gestión del tiempo para que puedas centrarte en el procesamiento de audio y la integración de servicios de IA.
Cómo funciona
Cuando una sesión de Vonage Video utiliza el Audio Connector, el enrutador multimedia de la sesión abre una conexión WebSocket con tu servidor y comienza a transmitir audio PCM. El SDK del servidor del Audio Connector gestiona esa conexión mediante un modelo basado en eventos:
- El SDK inicia un servidor WebSocket que escucha en un host y puerto configurables.
- Cuando el Conector de Audio abre una conexión, el SDK dispara un
on_connecty pasa un al código de la aplicación. - Su aplicación registra manejadores en el manejador del cliente para recibir tramas de audio
(
on_message), detectar la desconexión (on_disconnect), y gestionar los errores (on_error). - Tu aplicación procesa el audio —por ejemplo, reenviándolo a un servicio de conversión de voz a texto— y devuelve el audio procesado o los mensajes de control a la sesión a través del mismo identificador de cliente.
El SDK gestiona internamente el almacenamiento en búfer del audio y la sincronización de los fotogramas, lo que garantiza una reproducción fluida y sincronizada cuando se reenvía el audio a la sesión.
Capacidades clave
- Arquitectura basada en eventos: El ciclo de vida del servidor (inicio, parada) y los eventos de conexión (conexión, desconexión, mensaje, error) se gestionan mediante llamadas de retorno asíncronas, lo que permite mantener la lógica de tu aplicación desacoplada de la gestión de conexiones.
- Audio bidireccional en tiempo real: Recibe audio PCM sin procesar de la sesión y devuelve audio PCM procesado, con frecuencias de muestreo configurables (8 kHz, 16 kHz, 24 kHz).
- Conexiones simultáneas múltiples: Permite gestionar varias sesiones de Audio Connector al mismo tiempo, lo que lo hace ideal para flujos de trabajo de IA multitenant o a gran escala.
- Compatibilidad con SSL/TLS: Conexiones WebSocket seguras con un contexto SSL proporcionado para producción.
- Gestión de fotogramas de audio: El almacenamiento en búfer y el control de tiempo integrados sincronizan los fotogramas de audio salientes para que no tengas que implementar la lógica de ritmo tú mismo.
Cuándo utilizar este SDK
Utiliza el SDK de Audio Connector Server cuando necesites conectar el audio de una sesión de Vonage Video en directo a un flujo de procesamiento del lado del servidor. Entre los casos más habituales se incluyen:
- Asistentes de IA conversacionales: Crea bots de voz utilizando un proceso de «voz a texto» → LLM → «texto a voz» directamente dentro de una sesión de vídeo.
- Transcripción y traducción en directo: Transmita audio a un servicio de transcripción y subtítulos o voz traducida en tiempo real.
- Análisis de sentimientos y tonos: Detecte señales de emoción o de conformidad durante las llamadas en directo.
- Biometría de voz: Identifique o autentique a los oradores a partir de su flujo de audio.
- Entrenamiento en tiempo real: Proporcione comentarios generados por IA a los agentes durante las llamadas de los clientes.
- Toma de notas automatizada: Genere resúmenes, transcripciones y elementos de acción a partir del audio de la sesión.
- Moderación de contenidos: Marque los discursos inapropiados o no conformes en el momento en que se produzcan.
Si tu caso de uso incluye el procesamiento de vídeo o avatares de vídeo, además del audio, ten en cuenta la SDK del servidor Video Connector o el
- Vonage Video Transport para Pipecat en su lugar.
Si desea conectarse a un pipeline pre-construido del marco Pipecat AI en lugar de implementar su propio procesamiento de audio, consulte la sección "Procesamiento de audio". propio procesamiento de audio, consulte la Serializador de audio Vonage para Pipecat.
Véase también
- Configurar el SDK del servidor del conector de audio - Instalación instalación y configuración
- Conector de audio - Cómo el Conector de audio subyacente transmite audio de una sesión a un WebSocket
- Serializador de audio Vonage para Pipecat - Conexión de canalizaciones de Pipecat a sesiones de Vonage