https://a.storyblok.com/f/270183/1368x665/229d3bd67d/26may_dev-blog_ai-video-apps-conn-sdk-pipecat.jpg

Présentation de Video Connector SDK et de Pipecat Transport pour les applications vidéo d'IA

Publié le May 28, 2026

Temps de lecture : 9 minutes

Introduction

Les applications d'IA en temps réel transforment la façon dont les développeurs créent des expériences vidéo. Qu'elles alimentent des bots vocaux d'IA, des avatars vidéo, la transcription en temps réel, la détection des émotions ou la traduction linguistique en direct, les applications modernes nécessitent de plus en plus un accès en temps réel aux flux audio et vidéo bruts, et pas seulement des enregistrements a posteriori.

Jusqu'à présent, l'intégration de flux de travail d'IA dans une session Vonage Video en direct nécessitait une expertise approfondie en C++ et en manipulation de médias de bas niveau. Cet obstacle a disparu. Vonage a introduit deux outils complémentaires basés sur Python, conçus spécifiquement pour les développeurs d'applications intelligentes et sensibles aux médias : le Video Connector Server SDK et le Vonage Video Transport pour Pipecat.

Ensemble, ils facilitent considérablement la diffusion audio et vidéo entre les sessions Vonage Video et les frameworks d'IA tels que OpenAI, Deepgram, AWS Nova Sonic, HeyGen, et bien d'autres. Ce billet de blog donne un aperçu de ces outils, explique comment ils s'intègrent et fournit des références pour déployer votre premier agent vidéo alimenté par l'IA.

Pourquoi les développeurs ont-ils besoin d'un accès direct à la vidéo et à l'audio en temps réel ?

De nombreux flux de travail d'IA, notamment la conversion de la parole en texte, l'analyse pilotée par LLM, la synthèse vocale, le suivi des expressions faciales et la perception multimodale, dépendent des médias en temps réel. Les développeurs qui travaillent avec l Video API de Vonage de Vonage demandent depuis longtemps un moyen simple et fiable de recevoir de l'audio et de la vidéo à partir d'une session active, de les traiter avec l'IA et de renvoyer des réponses.

Auparavant, la seule option côté serveur pour accéder aux médias bruts d'une session Vonage Video était le logiciel Linux C++ SDK. Bien que puissant, sa nature de bas niveau créait une courbe d'apprentissage abrupte qui ralentissait l'innovation et limitait l'adoption, en particulier parmi les développeurs Python qui constituent la majorité de la communauté AI/ML.

Le SDK SDK du connecteur Video de Vonage élimine ce problème.

Exemples de cas d'utilisation

La chaîne d'outils prend en charge un large éventail d'expériences d'IA en temps réel, notamment :

  • Agents d'IA vocaux et vidéo (bots)assistants interactifs qui voient et entendent les participants

  • Transcription et sous-titrage en temps réel: conversion en direct de la parole en texte pour l'accessibilité et la compréhension

  • Résumés et notes de réunionsPrise de notes automatisée avec identification de l'orateur

  • Traduction linguistiqueTraduction audio en temps réel entre les participants

  • Détection des émotions et des expressions facialesAnalyse des sentiments à partir d'images vidéo

  • Surveillance des patients et des examensSurveillance à distance à l'aide de flux vidéo en direct

  • Video avatars: Réponses vidéo générées par l'IA et synchronisées avec la voix.

Modération de contenu: détection en temps réel des contenus audio ou visuels inappropriés

Les avantages du SDK Video Connector

Le SDK Video Connector Server est un paquetage Python (disponible sur PyPI) qui agit comme un client WebRTC côté serveur pour les sessions Video de Vonage. Il s'agit d'une enveloppe Python autour du SDK C++ de Vonage Linux, permettant des applications sans tête et déployables dans le cloud sans nécessiter d'expertise en C++.

A diagram showing how the Video Connector Server SDK is integrated into an end-to-end video session.Topology of Video Connector Server SDK

Capacités clés

  • Participation WebRTC côté serveur: rejoindre une session Vonage Video en tant que client côté serveur.

  • Audio et Video bidirectionnels: publier et s'abonner à des flux audio et vidéo en temps réel

  • Formats de médias de haute qualitéaudio en PCM 16 bits (jusqu'à 48 kHz) ; vidéo en images brutes 8 bits jusqu'à FHD 1080p30

  • Continuité automatisée des médiasLa continuité des médias : gère intelligemment les lacunes dans la diffusion des médias

  • Abonnement aux légendes (bêta): recevoir des sous-titres générés automatiquement lors de la session

  • Identification des flux audio individuels (bêta)Identification des flux audio individuels : différencier et traiter les paquets audio par participant

  • Architecture axée sur les événementsLe système de gestion de l'information : des rappels asynchrones riches pour les événements liés aux sessions et aux médias

  • Déploiement dans le nuage et sans têteLa technologie de l'information : conçue pour une utilisation côté serveur dans des environnements conteneurisés

Cela permet aux développeurs de se concentrer entièrement sur ce qu'ils veulent construire - pipelines d'IA, outils d'analyse, bots vidéo - sans avoir besoin d'écrire le moindre code WebRTC ou d'infrastructure média.

Premiers pas avec le SDK Video Connector

Le SDK peut être installé à partir de l'index des paquets Python (Python Package Index). Python Package IndexIl est conçu autour d'un flux de travail axé sur les événements : se connecter à une session, s'abonner aux flux des participants, recevoir des images audio et vidéo via des rappels, les traiter avec votre pipeline d'IA et publier les réponses dans la session.

Référence

La documentation du développeur Documentation du développeur Video Connector fournit une référence complète pour la configuration de sessions, la mise en place de gestionnaires de médias et la publication d'audio et de vidéo dans une session.

Vonage Video Transport pour Pipecat

Pipecat est un framework Python open-source pour l'orchestration de workflows d'IA complexes à travers l'audio, la vidéo, les images et le texte. Il fournit une plateforme modulaire et neutre pour construire des pipelines d'IA en temps réel. Il connecte la parole au texte, les LLM, la synthèse vocale, les avatars vidéo, et plus encore avec un codage minimal.

Pour les applications axées sur la vidéo, la nouvelle solution de transport vidéo de Vonage Video Transport pour Pipecat sert de pont entre une session Vonage Video en direct et un pipeline de traitement Pipecat. Contrairement à un sérialiseur (qui gère la conversion de format audio uniquement), un transport permet une conversion audio et vidéo bidirectionnelle complète. et vidéo entre une session WebRTC de Vonage et le pipeline Pipecat.

Flowchart of a video setup: Vonage Video Session connects via WebRTC to a Customer Application Server, which processes raw audio/video and links to AI Engines.

Le transport Vonage pour Pipecat

  • Connecte une session Video de Vonage à un pipeline Pipecat via le SDK du connecteur vidéo.

  • Prise en charge des flux audio et vidéo bidirectionnels

  • Hérite de Pipecat's BaseTransport, BaseInputTransport, et BaseOutputTransport classes abstraites

  • S'initialise à l'aide d'un identifiant de session Vonage, d'un jeton et d'une liste facultative d'identifiants de flux auxquels s'abonner.

  • Permet d'accéder à l'ensemble de l'écosystème de services d'IA de Pipecat

Cela signifie que les développeurs peuvent utiliser la liste croissante d'intégrations d'IA de Pipecat - OpenAI Realtime, AWS Nova Sonic, Deepgram, ElevenLabs, HeyGen, Tavus, Simli, et bien d'autres - sans écrire de code de traduction de médias ou de WebRTC.

Pipecat AI Service Integrations

Pipecat prend en charge un ensemble riche et croissant de services d'intelligence artificielle :

Catégorie

Services d'appui

De la parole au texte

Deepgram, OpenAI Whisper, AssemblyAI, Azure, Google, AWS Transcribe, etc.

LLM

OpenAI, Anthropic, Gemini, Grok, Bedrock, Ollama, etc.

Synthèse vocale

ElevenLabs, Cartesia, OpenAI, AWS Polly, Google, etc.

La synthèse vocale

AWS Nova Sonic, OpenAI Realtime, Gemini Live

Avatars vidéo

HeyGen, Simli, Tavus

Pour obtenir la liste la plus récente, consultez la page Page des services supportés par Pipecat.

Référence

La documentation du développeur du connecteur vidéo de Vonage Vonage Video Connector Pipecat Transport developer documentation (en anglais) fournit une référence complète pour la configuration de Vonage Transport et la création de votre premier agent vidéo alimenté par Pipecat.

Exemples d'Applications

Pour vous aider à démarrer rapidement, Vonage fournit des exemples d'Applications démontrant des cas d'utilisation réels :

  • Serveur d'échoEcho Server : une application simple qui renvoie l'audio et la Video à la session, utile pour valider votre installation.

  • Video Avatar with Captions (Pipecat): un pipeline complet utilisant AWS Nova Video pour la synthèse vocale et HeyGen pour les réponses des avatars vidéo générées par l'IA, avec des sous-titres en direct.

  • Description audio de la vidéo (Pipecat)Pipecat : utilise Moondream AI pour la reconnaissance vidéo et la synthèse vocale afin de décrire en temps réel ce qui se passe dans le flux vidéo.

Un exemple de code est disponible dans le dépôt dépôt des versions. La prise en main est simple :

  1. Télécharger et extraire l'archive du SDK à partir du répertoire des versions.

  2. Installer Docker

  3. Ouvrez le fichier README.md dans le répertoire principal et construire l'image Docker

  4. Créez une session Vonage Video et un fichier session.json avec les informations d'identification de la session

  5. Exécutez les exemples du serveur d'écho ou de Pipecat en suivant les instructions du fichier README.md dans chaque répertoire d'exemples

Comment les outils s'intègrent-ils les uns aux autres ?

Vonage propose désormais une chaîne d'outils Python complète pour intégrer l'IA dans les sessions Voice et Video :

Outil

Transport

Capacités

Connecteur audio SDK

WebSocket

Audio uniquement

(sessions Voice API et Video API)

Sérialiseur Pipecat

WebSocket

Audio uniquement

(sessions Voice API et Video API)

Connecteur vidéo SDK

WebRTC

Audio + Video

(sessions Video API)

Pipecat Transport

WebRTC

Audio + Video

(sessions Video API)

Si votre cas d'utilisation est uniquement audiole Audio Connector SDK et le Pipecat Serializer sont le bon point de départ. Si vous avez besoin d'un d'un accès complet à l'audio et à la Video-pour les avatars, la détection des émotions, l'IA visuelle ou les agents multimodaux, le Video Connector SDK et Pipecat Transport sont les outils qu'il vous faut.

Conclusion

Le SDK Vonage Video Connector et Pipecat Transport offrent une approche rationalisée, moderne et centrée sur Python pour la création d'agents audio et vidéo en temps réel. Grâce à ces outils, les développeurs n'ont plus besoin de gérer des éléments internes WebRTC complexes, d'écrire du code C++ ou de construire manuellement des pipelines de médias.

Que vous construisiez un bot avatar vidéo, que vous intégriez la synthèse vocale à un LLM, que vous analysiez les expressions faciales en temps réel ou que vous créiez un assistant de réunion alimenté par l'IA, ces outils vous fournissent les bases dont vous avez besoin.

Si vous êtes prêt à commencer, explorez :

Vous pouvez désormais déployer votre premier agent vidéo IA en quelques minutes et construire en toute confiance vers des applications entièrement intelligentes et sensibles aux médias sur la plateforme Vonage.

Vous avez une question ou souhaitez partager ce que vous construisez ?

Restez connecté et tenez-vous au courant des dernières nouvelles, astuces et événements concernant les développeurs.

Partager:

https://a.storyblok.com/f/270183/331x330/f4b074099d/michael-vernick.png
Michael VernickArchitecte de solutions clients