
Présentation de Video Connector SDK et de Pipecat Transport pour les applications vidéo d'IA
Temps de lecture : 9 minutes
Introduction
Les applications d'IA en temps réel transforment la façon dont les développeurs créent des expériences vidéo. Qu'elles alimentent des bots vocaux d'IA, des avatars vidéo, la transcription en temps réel, la détection des émotions ou la traduction linguistique en direct, les applications modernes nécessitent de plus en plus un accès en temps réel aux flux audio et vidéo bruts, et pas seulement des enregistrements a posteriori.
Jusqu'à présent, l'intégration de flux de travail d'IA dans une session Vonage Video en direct nécessitait une expertise approfondie en C++ et en manipulation de médias de bas niveau. Cet obstacle a disparu. Vonage a introduit deux outils complémentaires basés sur Python, conçus spécifiquement pour les développeurs d'applications intelligentes et sensibles aux médias : le Video Connector Server SDK et le Vonage Video Transport pour Pipecat.
Ensemble, ils facilitent considérablement la diffusion audio et vidéo entre les sessions Vonage Video et les frameworks d'IA tels que OpenAI, Deepgram, AWS Nova Sonic, HeyGen, et bien d'autres. Ce billet de blog donne un aperçu de ces outils, explique comment ils s'intègrent et fournit des références pour déployer votre premier agent vidéo alimenté par l'IA.
Pourquoi les développeurs ont-ils besoin d'un accès direct à la vidéo et à l'audio en temps réel ?
De nombreux flux de travail d'IA, notamment la conversion de la parole en texte, l'analyse pilotée par LLM, la synthèse vocale, le suivi des expressions faciales et la perception multimodale, dépendent des médias en temps réel. Les développeurs qui travaillent avec l Video API de Vonage de Vonage demandent depuis longtemps un moyen simple et fiable de recevoir de l'audio et de la vidéo à partir d'une session active, de les traiter avec l'IA et de renvoyer des réponses.
Auparavant, la seule option côté serveur pour accéder aux médias bruts d'une session Vonage Video était le logiciel Linux C++ SDK. Bien que puissant, sa nature de bas niveau créait une courbe d'apprentissage abrupte qui ralentissait l'innovation et limitait l'adoption, en particulier parmi les développeurs Python qui constituent la majorité de la communauté AI/ML.
Le SDK SDK du connecteur Video de Vonage élimine ce problème.
Exemples de cas d'utilisation
La chaîne d'outils prend en charge un large éventail d'expériences d'IA en temps réel, notamment :
Agents d'IA vocaux et vidéo (bots)assistants interactifs qui voient et entendent les participants
Transcription et sous-titrage en temps réel: conversion en direct de la parole en texte pour l'accessibilité et la compréhension
Résumés et notes de réunionsPrise de notes automatisée avec identification de l'orateur
Traduction linguistiqueTraduction audio en temps réel entre les participants
Détection des émotions et des expressions facialesAnalyse des sentiments à partir d'images vidéo
Surveillance des patients et des examensSurveillance à distance à l'aide de flux vidéo en direct
Video avatars: Réponses vidéo générées par l'IA et synchronisées avec la voix.
Modération de contenu: détection en temps réel des contenus audio ou visuels inappropriés
Les avantages du SDK Video Connector
Le SDK Video Connector Server est un paquetage Python (disponible sur PyPI) qui agit comme un client WebRTC côté serveur pour les sessions Video de Vonage. Il s'agit d'une enveloppe Python autour du SDK C++ de Vonage Linux, permettant des applications sans tête et déployables dans le cloud sans nécessiter d'expertise en C++.
Topology of Video Connector Server SDK
Capacités clés
Participation WebRTC côté serveur: rejoindre une session Vonage Video en tant que client côté serveur.
Audio et Video bidirectionnels: publier et s'abonner à des flux audio et vidéo en temps réel
Formats de médias de haute qualitéaudio en PCM 16 bits (jusqu'à 48 kHz) ; vidéo en images brutes 8 bits jusqu'à FHD 1080p30
Continuité automatisée des médiasLa continuité des médias : gère intelligemment les lacunes dans la diffusion des médias
Abonnement aux légendes (bêta): recevoir des sous-titres générés automatiquement lors de la session
Identification des flux audio individuels (bêta)Identification des flux audio individuels : différencier et traiter les paquets audio par participant
Architecture axée sur les événementsLe système de gestion de l'information : des rappels asynchrones riches pour les événements liés aux sessions et aux médias
Déploiement dans le nuage et sans têteLa technologie de l'information : conçue pour une utilisation côté serveur dans des environnements conteneurisés
Cela permet aux développeurs de se concentrer entièrement sur ce qu'ils veulent construire - pipelines d'IA, outils d'analyse, bots vidéo - sans avoir besoin d'écrire le moindre code WebRTC ou d'infrastructure média.
Premiers pas avec le SDK Video Connector
Le SDK peut être installé à partir de l'index des paquets Python (Python Package Index). Python Package IndexIl est conçu autour d'un flux de travail axé sur les événements : se connecter à une session, s'abonner aux flux des participants, recevoir des images audio et vidéo via des rappels, les traiter avec votre pipeline d'IA et publier les réponses dans la session.
Référence
La documentation du développeur Documentation du développeur Video Connector fournit une référence complète pour la configuration de sessions, la mise en place de gestionnaires de médias et la publication d'audio et de vidéo dans une session.
Vonage Video Transport pour Pipecat
Pipecat est un framework Python open-source pour l'orchestration de workflows d'IA complexes à travers l'audio, la vidéo, les images et le texte. Il fournit une plateforme modulaire et neutre pour construire des pipelines d'IA en temps réel. Il connecte la parole au texte, les LLM, la synthèse vocale, les avatars vidéo, et plus encore avec un codage minimal.
Pour les applications axées sur la vidéo, la nouvelle solution de transport vidéo de Vonage Video Transport pour Pipecat sert de pont entre une session Vonage Video en direct et un pipeline de traitement Pipecat. Contrairement à un sérialiseur (qui gère la conversion de format audio uniquement), un transport permet une conversion audio et vidéo bidirectionnelle complète. et vidéo entre une session WebRTC de Vonage et le pipeline Pipecat.

Le transport Vonage pour Pipecat
Connecte une session Video de Vonage à un pipeline Pipecat via le SDK du connecteur vidéo.
Prise en charge des flux audio et vidéo bidirectionnels
Hérite de Pipecat's
BaseTransport,BaseInputTransport, etBaseOutputTransportclasses abstraitesS'initialise à l'aide d'un identifiant de session Vonage, d'un jeton et d'une liste facultative d'identifiants de flux auxquels s'abonner.
Permet d'accéder à l'ensemble de l'écosystème de services d'IA de Pipecat
Cela signifie que les développeurs peuvent utiliser la liste croissante d'intégrations d'IA de Pipecat - OpenAI Realtime, AWS Nova Sonic, Deepgram, ElevenLabs, HeyGen, Tavus, Simli, et bien d'autres - sans écrire de code de traduction de médias ou de WebRTC.
Pipecat AI Service Integrations
Pipecat prend en charge un ensemble riche et croissant de services d'intelligence artificielle :
Catégorie | Services d'appui | |
De la parole au texte | Deepgram, OpenAI Whisper, AssemblyAI, Azure, Google, AWS Transcribe, etc. | |
LLM | OpenAI, Anthropic, Gemini, Grok, Bedrock, Ollama, etc. | |
Synthèse vocale | ElevenLabs, Cartesia, OpenAI, AWS Polly, Google, etc. | |
La synthèse vocale | AWS Nova Sonic, OpenAI Realtime, Gemini Live | |
Avatars vidéo | HeyGen, Simli, Tavus | |
Pour obtenir la liste la plus récente, consultez la page Page des services supportés par Pipecat.
Référence
La documentation du développeur du connecteur vidéo de Vonage Vonage Video Connector Pipecat Transport developer documentation (en anglais) fournit une référence complète pour la configuration de Vonage Transport et la création de votre premier agent vidéo alimenté par Pipecat.
Exemples d'Applications
Pour vous aider à démarrer rapidement, Vonage fournit des exemples d'Applications démontrant des cas d'utilisation réels :
Serveur d'échoEcho Server : une application simple qui renvoie l'audio et la Video à la session, utile pour valider votre installation.
Video Avatar with Captions (Pipecat): un pipeline complet utilisant AWS Nova Video pour la synthèse vocale et HeyGen pour les réponses des avatars vidéo générées par l'IA, avec des sous-titres en direct.
Description audio de la vidéo (Pipecat)Pipecat : utilise Moondream AI pour la reconnaissance vidéo et la synthèse vocale afin de décrire en temps réel ce qui se passe dans le flux vidéo.
Un exemple de code est disponible dans le dépôt dépôt des versions. La prise en main est simple :
Télécharger et extraire l'archive du SDK à partir du répertoire des versions.
Installer Docker
Ouvrez le fichier
README.mddans le répertoire principal et construire l'image DockerCréez une session Vonage Video et un fichier
session.jsonavec les informations d'identification de la sessionExécutez les exemples du serveur d'écho ou de Pipecat en suivant les instructions du fichier
README.mddans chaque répertoire d'exemples
Comment les outils s'intègrent-ils les uns aux autres ?
Vonage propose désormais une chaîne d'outils Python complète pour intégrer l'IA dans les sessions Voice et Video :
Outil | Transport | Capacités |
|---|---|---|
Connecteur audio SDK | WebSocket | Audio uniquement (sessions Voice API et Video API) |
Sérialiseur Pipecat | WebSocket | Audio uniquement (sessions Voice API et Video API) |
Connecteur vidéo SDK | WebRTC | Audio + Video (sessions Video API) |
Pipecat Transport | WebRTC | Audio + Video (sessions Video API) |
Si votre cas d'utilisation est uniquement audiole Audio Connector SDK et le Pipecat Serializer sont le bon point de départ. Si vous avez besoin d'un d'un accès complet à l'audio et à la Video-pour les avatars, la détection des émotions, l'IA visuelle ou les agents multimodaux, le Video Connector SDK et Pipecat Transport sont les outils qu'il vous faut.
Conclusion
Le SDK Vonage Video Connector et Pipecat Transport offrent une approche rationalisée, moderne et centrée sur Python pour la création d'agents audio et vidéo en temps réel. Grâce à ces outils, les développeurs n'ont plus besoin de gérer des éléments internes WebRTC complexes, d'écrire du code C++ ou de construire manuellement des pipelines de médias.
Que vous construisiez un bot avatar vidéo, que vous intégriez la synthèse vocale à un LLM, que vous analysiez les expressions faciales en temps réel ou que vous créiez un assistant de réunion alimenté par l'IA, ces outils vous fournissent les bases dont vous avez besoin.
Si vous êtes prêt à commencer, explorez :
Vous pouvez désormais déployer votre premier agent vidéo IA en quelques minutes et construire en toute confiance vers des applications entièrement intelligentes et sensibles aux médias sur la plateforme Vonage.
Vous avez une question ou souhaitez partager ce que vous construisez ?
S'abonner à la Bulletin d'information du développeur
Suivez-nous sur X (anciennement Twitter) pour les mises à jour
Regardez les tutoriels sur notre chaîne YouTube
Connectez-vous avec nous sur la page Vonage Developer sur LinkedIn
Aidez-nous à améliorer l'expérience des développeurs en remplissant notre formulaire de commentaires « Voice of the Developer »
Restez connecté et tenez-vous au courant des dernières nouvelles, astuces et événements concernant les développeurs.