Transcripciones posteriores a las llamadas
Puedes obtener una transcripción de texto de un archivo de la Video API.
Esta página incluye las siguientes secciones:
- Resumen de las características
- Activar la transcripción y el resumen al iniciar un archivo
- Consultar el estado de la transcripción
- Formato de transcripción
- Descargar transcripciones
- Limitaciones/Problemas conocidos
- Preguntas frecuentes
Resumen de las características
Los servidores de la Video API de Vonage generan transcripciones tras las llamadas utilizando inteligencia artificial y otras tecnologías de vanguardia.
Las transcripciones se activan al iniciar un archivo mediante la API REST.
Una vez finalizada la grabación del archivo, la transcripción estará disponible en formato JSON.
Activar la transcripción y el resumen al iniciar un archivo
Cuando utilices la API REST de Video de Vonage para iniciar un archivo, establece el parámetro hasAudio y hasTranscription propiedades a true en las propiedades JSON que envió al método REST de inicio de archivo:
Además, puede incluir un transcriptionProperties con un objeto hasSummary (booleano) y/o primaryLanguageCode (cadena). Al establecer hasSummary Si se establece en «true», se incluirá un resumen generado por IA en la transcripción. Si se establece en «false» o no se especifica (el valor por defecto es false), no se incluirá el resumen de la transcripción. Si la transcripción es para otro idioma que no sea el "en-US" (por defecto), configure la propiedad primaryLanguageCode con un código de idioma admitido.
Conjunto outputMode (en los datos POST) a "individual". Hay transcripciones disponibles para archivos de transmisiones individuales sólo.
Establezca el valor de api_key a la clave API de tu proyecto de OpenTok. Establece el valor de json_web_token a un token web JSON (véase la sección Autenticación en la API REST (documentación).
Para conocer otras opciones de archivo, consulta la documentación de la Iniciar el método REST de archivo.
La respuesta a una llamada al método REST «start archive» incluirá hasTranscription y transcription además de las otras propiedades documentadas de la respuesta:
{
"createdAt" : 1384221730555,
"duration" : 0,
"hasAudio" : true,
"hasVideo" : true,
"id" : "b40ef09b-3811-4726-b508-e41a0f96c68f",
"name" : "The archive name you supplied",
"outputMode" : "individual",
"projectId" : 123456,
"reason" : "",
"resolution" : "640x480",
"sessionId" : "flR1ZSBPY3QgMjkgMTI6MTM6MjMgUERUIDIwMTN",
"size" : 0,
"status" : "started",
"streamMode" : "auto",
"hasTranscription" : true,
"transcription" : {
"hasSummary": true,
"primaryLanguageCode": "ja-JP",
"reason": "",
"status": "requested",
"url": ""
}
}
Véase Consultar el estado de la transcripción para obtener información sobre la obtención dinámica de los datos de transcripción.
En un sesión archivada automáticamentela transcripción no se iniciará automáticamente. Deberá iniciar un segundo archivo, utilizando la opción multiArchiveTag para la transcripción (véase Archivos simultáneos).
Actualmente, la API REST de Vonage Video admite transcripciones. Esta función no está disponible en los SDK de servidor de Vonage Video.
Consultar el estado de la transcripción
La respuesta de los métodos REST para archivos de listados y recuperación de información de archivo incluirá hasTranscription y transcription propiedades:
{
"id" : "b40ef09b-3811-4726-b508-e41a0f96c68f",
"event": "archive",
"createdAt" : 1723584124,
"duration" : 328,
"name" : "the archive name",
"projectId" : 123456,
"reason" : "",
"sessionId" : "2_MX40NzIwMzJ-flR1ZSBPERUIDIwMTN-MC45NDQ2MzE2NH4",
"size" : 18023312,
"status" : "uploaded",
"hasTranscription" : true,
"transcription": {
"status": "available",
"url": "URL for downloading the transcription, if available",
"reason": "The reason for failure, if status is set to failed",
"hasSummary": true,
"primaryLanguageCode": "The configured language code"
}
}
El hasTranscription Esta propiedad es un valor booleano que indica si la transcripción está habilitada para el archivo.
El transcription propiedad: un objeto con las siguientes propiedades:
-
status(Cadena) - El estado de la transcripción, que puede ser uno de los siguientes:"requested"- LahasTranscriptionLa propiedad se estableció entruedurante la llamada de inicio del archivo, pero la transcripción aún no ha comenzado."failed"- La transcripción ha fallado. Compruebe lareasonInmueble: para más información."started"— La transcripción está en curso."available"— La transcripción se puede descargar desde OpenTok. Consulta laurlpropiedad."uploaded"- La transcripción está disponible para su descarga desde el bucket de S3 o el contenedor de Azure que especificó en su cuenta de Video API. Busque transcription.zip en la carpeta de ID de archivo de su destino de almacenamiento de archivos. Consulte Almacenamiento de archivos.
-
url(Cadena) — La URL para descargar la transcripción, si elstatusse establece en"available". -
reason(Cadena) - El motivo del fallo de transcripción, si elstatusse establece en"failed". -
hasSummary(Booleano) — Indica si la transcripción incluye un resumen generado por IA. -
primaryLanguageCode(Cadena) — El código de idioma configurado para la transcripción.
También puede establecer una devolución de llamada de estado de archivo para tu Account de la Video API. Véase Cambios en el estado del archivo. Los datos de la llamada de retorno también incluirán hasTranscription y transcription propiedades.
Formato de transcripción
La transcripción se proporciona como un archivo ZIP comprimido. El archivo descomprimido es un archivo de texto con datos JSON.
La transcripción incluye segmentos de texto individuales. Cada segmento se corresponde con un canal de audio concreto (procedente de una de las secuencias de audio de la sesión).
El JSON tiene las siguientes propiedades de primer nivel:
-
job_id- Un identificador único para la transcripción. -
timestamp— Una cadena de fecha conforme a la norma ISO 8601 que indica cuándo se creó el archivo de transcripción. -
language- Se establece en"en-US". -
channels_metadata- Una matriz de objetos que definen cada canal de audio. Cada objeto anidpropiedad, que es el ID de transmisión de OpenTok. Puedes añadir datos de identificación de la conexión cuando crear un token de cliente para cada usuario. Puedes utilizar llamadas de retorno para monitorizar la sesión para obtener los ID de los flujos y los datos de conexión de cada uno de ellos. A continuación, puede utilizarlos para identificar al usuario del flujo en la transcripción. -
transcription— Un objeto que contiene los detalles de la transcripción (véase más abajo).
El transcription tiene las siguientes propiedades:
-
number_of_channels- Número de canales de audio individuales del archivo incluidos en la transcripción. -
confidence— Un objeto con dos propiedades:overallychannels. EnoverallLa propiedad es la confianza estimada de toda la transcripción (de 0 a 1,0). Lachannelses una matriz que enumera la confianza estimada de cada canal en la transcripción. -
reliability- Un objeto con una propiedad:score. Enscorees una cifra que indica la fiabilidad global estimada de la transcripción (de 0 a 1,0). -
summary- Si ajusta elhasSummarypropiedad deltranscriptionPropertiesoponerse atrueAl iniciar el archivo, se incluye esta propiedad. Se establece como un resumen de la transcripción generado por IA. -
segments— Una serie de segmentos individuales de la transcripción.
Cada objeto del segments array tiene las siguientes propiedades:
-
text- El texto transcrito del segmento. -
formatted- El texto formateado (con puntuación) del segmento. -
confidence- Un número, de 0 a 1,0, que representa la confianza estimada de la transcripción del segmento. -
channel- El número entero que identifica el canal de audio para el segmento. -
start_ms— El desplazamiento del inicio del segmento respecto al inicio de la transcripción, en milisegundos. -
end_ms— La distancia entre el final del segmento y el inicio de la transcripción, en milisegundos. -
raw_data— Una matriz de objetos para cada palabra del segmento de transcripción.
Cada raw_data El objeto incluye las siguientes propiedades:
-
word— Un comentario sobre el segmento. -
confidence- Un número, de 0 a 1,0, que representa la confianza estimada de la palabra transcrita. -
start_ms- Desplazamiento del inicio de la palabra desde el inicio de la transcripción, en milisegundos. -
end_ms- Desplazamiento del final de la palabra desde el inicio de la transcripción, en milisegundos.

Descargar transcripciones
Hay dos formas de descargar el archivo de transcripción de un archivo: a través de la API REST o a través del panel de control para desarrolladores.
Descargar a través de la API REST
Puedes descargar el archivo de transcripción de un archivo concreto llamando a la función Recuperar información de archivo Método REST y comprobar el transcription.url propiedad en la respuesta. Si el transcription.status se establece en "available" o "uploaded"El transcription.url Esta propiedad contiene una URL para descargar el archivo de transcripción.
Utiliza una solicitud HTTP GET para descargar el archivo de transcripción desde la URL. Por ejemplo:
Descargar a través del panel de control para desarrolladores
Puede descargar la transcripción de una llamada específica si el almacenamiento de reserva siguiendo estos pasos:
- Abre el panel de control para desarrolladores.
- Selecciona un proyecto de la lista de proyectos y ve a la Archivado sección. Haz clic en el Lista de archivos botón.
- Si lo deseas, puedes proporcionar un ID de archivo o ID de sesión para filtrar los resultados.
- En la lista de resultados, localice la sesión correspondiente.
- Pasa el ratón por encima del Estado de esa sesión y haga clic en el botón Descargar transcripción botón.

Limitaciones/problemas conocidos
-
Las transcripciones solo están disponibles para los archivos de transmisiones individuales, no para los archivos combinados.
-
Las transcripciones no son compatibles con los archivos encriptados.
-
Esta función actualmente es compatible con la API REST de Vonage Video, no con los SDK del servidor de Vonage Video.
-
La duración máxima de una transcripción es de 120 minutos.
-
La transcripción posterior a la llamada no cumple todos los Zonas regionales de medios de comunicación (véase más abajo).
| Asistencia para la zona de medios regional | Disponible durante la fase alfa | Disponible cuando esté en fase de acceso general |
|---|---|---|
| USA | Sí | Sí |
| EU | Sí | Sí |
| Canadá | No | En función de los requisitos |
| Alemania | No | En función de los requisitos |
| Australia | No | En función de los requisitos |
| Japón | No | En función de los requisitos |
| Corea del Sur | No | En función de los requisitos |
Preguntas frecuentes
Preguntas frecuentes:
¿Cuántas transmisiones se pueden analizar en una sola sesión?
Hasta 50 grabaciones con un máximo de 120 minutos transcritos.
¿Funciona la función de transcripción tras la llamada tanto con sesiones enrutadas como con sesiones retransmitidas?
La función de transcripciones posteriores a la llamada está pensada para sesiones enrutadas (sesiones que utilizan el Enrutador multimedia de Vonage).
Si falla la carga de la transcripción en un bucket de S3 configurado por el cliente, ¿funciona el mecanismo de reintento o de alternativa de forma similar a la carga de archivos?
Sí, el mecanismo de reintento para PCT funciona exactamente igual que para las cargas de archivos normales.
En los casos en que la transcripción retrocede y se carga en la nube de Vonage, ¿necesitará el cliente utilizar una solicitud HTTP GET para obtener el enlace de descarga de la transcripción?
Cuando cambia el estado de la transcripción, el cliente debe recibir una devolución de llamada que incluya la URL de descarga. Si no se registra ninguna devolución de llamada, el enlace de descarga solo podrá recuperarse mediante una solicitud HTTP GET.
Una vez recibido el enlace de descarga de la transcripción, permite una descarga directa. Está previsto introducir la autenticación para descargar la transcripción?
No hay planes de introducir un sistema de autenticación para el enlace. El enlace de descarga tiene un plazo de validez breve. Si no se accede a él dentro de ese plazo, habrá que realizar una nueva solicitud para obtener un enlace nuevo.
Aunque varios usuarios se hayan unido a la sesión, el archivo de transcripción es un único archivo JSON. Cómo diferenciamos a los usuarios?
Cada entrada de transcripción del archivo está asociada a un número de canal específico, asignado a cada flujo. El archivo también incluye un channels_metadata propiedad, que proporciona información sobre el identificador de la transmisión correspondiente a cada identificador de canal.