https://a.storyblok.com/f/270183/1368x665/1f9a4507bc/26jun_building-predictable-agentic-workflows_blog_r2.png

Tu agente de IA te está mintiendo: cómo los flujos de trabajo generan resultados fiables

Publicado el June 23, 2026

Tiempo de lectura: 20 minutos

En este artículo descubrirás cómo el equipo de IA de Vonage utilizó flujos de trabajo para hacer que los sistemas de IA con capacidad de agencia fueran más predecibles, reproducibles y aptos para su implementación en producción.

Introducción

La IA generativa es probabilística por naturaleza. Si le pides a un modelo de IA que redacte un correo electrónico, resuma una reunión o genere código, las ligeras diferencias en los resultados entre una ejecución y otra no suelen suponer ningún problema. En muchas tareas creativas o exploratorias, la variación forma parte del valor.

Los sistemas analíticos son diferentes.

Cuando se utilizan sistemas de inteligencia artificial para clasificar a los empleados, generar informes operativos, analizar las interacciones con los clientes o identificar tendencias empresariales, la coherencia es fundamental. Si una misma consulta sobre los mismos datos arroja resultados diferentes cada vez, resulta difícil confiar en los resultados o tomar decisiones basadas en ellos.

Durante los experimentos internos realizados en Vonage, pudimos comprobarlo de primera mano mientras desarrollábamos flujos de trabajo de análisis basados en inteligencia artificial para los datos sobre la experiencia del cliente. En una de las pruebas, el sistema clasificó a María como la mejor agente de atención al cliente. Quince minutos más tarde, con la misma configuración, el mismo sistema situó a James en primer lugar. En una tercera prueba, Priya fue la que obtuvo el mejor resultado.

Illustration showing an AI analytics system returning different top-ranked support representatives at different times using the same query and dataset. Maria is ranked first at 2:00 PM, James at 2:15 PM, and Priya at 2:30 PM, demonstrating variability in agentic AI outputs.The same AI analytics query produced different top-ranked representatives across repeated runs, despite using the same dataset and prompt.

Para un análisis exploratorio, este tipo de variabilidad puede resultar aceptable. Sin embargo, en el caso de los paneles de control programados, las revisiones operativas, los flujos de trabajo de control de calidad o los informes de cumplimiento normativo, los resultados inconsistentes se convierten rápidamente en un problema de producción.

Esto planteó una cuestión importante para el equipo de IA de Vonage: ¿cómo se consigue que los sistemas agentales sean más predecibles cuando la coherencia es fundamental?

Para investigar esto, llevamos a cabo una serie de experimentos en los que comparamos la ejecución estándar basada en agentes con vías de ejecución basadas en flujos de trabajo, diseñadas para fijar la metodología analítica, reducir la desviación en el razonamiento y mejorar la reproducibilidad. Los resultados demostraron que los flujos de trabajo pueden mejorar significativamente la coherencia en los sistemas analíticos basados en IA sin eliminar la flexibilidad que hace que los agentes sean útiles en primer lugar.

¿Por qué se producen las desviaciones en los sistemas agenticos?

El problema de la fiabilidad en los sistemas agentivos

Los sistemas agenticos modernos no se limitan a generar texto. Analizan problemas, eligen metodologías analíticas, escriben código intermedio, realizan cálculos y determinan cómo deben presentarse los resultados.

Las pequeñas diferencias en el razonamiento que se producen al inicio de un ciclo de ejecución agencial pueden acumularse y dar lugar a resultados sustancialmente diferentes en fases posteriores del proceso.

Durante nuestros experimentos, observamos repetidamente el mismo patrón: consultas idénticas realizadas sobre conjuntos de datos idénticos producían resultados diferentes en cada ejecución. Una solicitud como:

«¿Quiénes son mis 10 mejores representantes?»

podría dar lugar a tres empleados diferentes entre los mejores de la empresa en tan solo media hora.

Los datos subyacentes nunca cambiaron. Lo que cambió fue el proceso de razonamiento del agente.

Para responder a una consulta como esta, un agente tiene que tomar una serie de decisiones antes de escribir una sola línea de código de análisis:

  • ¿Qué indicadores son los más importantes?

  • ¿Cómo deberían ponderarse esos indicadores?

  • ¿Cómo se deben normalizar los valores?

  • ¿Qué umbrales o filtros deberían aplicarse?

  • ¿Cómo deben presentarse los resultados finales?

Esas decisiones no se definen explícitamente en la indicación. El modelo las deduce durante la ejecución, y pequeñas diferencias en el razonamiento pueden dar lugar a distintos enfoques analíticos.

En una ejecución, el agente podría dar prioridad a las puntuaciones de satisfacción del cliente y empatía. En otra, podría dar más peso a la tasa de resolución o excluir por completo a los agentes con un volumen bajo de llamadas. El resultado es una ruta de cálculo diferente y, en última instancia, una clasificación diferente.

Este tipo de variabilidad es manejable durante la fase de exploración. Sin embargo, en los sistemas de producción —donde los informes, los paneles de control, los Audits y las decisiones operativas dependen de la coherencia— se convierte en un problema de fiabilidad.

¿Por qué los bucles ReAct amplifican la varianza?

La mayoría de los agentes de IA modernos utilizan un patrón de razonamiento conocido comúnmente como ReAct (razonar → actuar → observar). En lugar de generar una única respuesta, el agente sigue una secuencia de decisiones y llamadas a herramientas.

Un flujo de ejecución simplificado podría ser el siguiente:

Motivo → Comprender el conjunto de datos
Acción → Consultar las columnas disponibles
Observar → Revisar las características disponibles
Razonar → Seleccionar métricas y metodología
Actuar → Generar el código de análisis
Observar → Evaluar los resultados
Razonar → Dar formato a la respuesta final

Cada paso del razonamiento genera una nueva oportunidad de divergencia.

Un pequeño cambio al principio del proceso —como seleccionar métricas diferentes o asignar ponderaciones ligeramente distintas— puede alterar todos los pasos posteriores. El agente puede generar un código de análisis diferente, aplicar filtros distintos o calcular las puntuaciones de otra manera, incluso cuando la consulta y el conjunto de datos originales sigan siendo idénticos.

El siguiente diagrama ilustra cómo una sola decisión basada en el razonamiento puede llevar al agente a seguir vías de ejecución completamente diferentes.

Diagram illustrating how an AI agent using a ReAct loop can produce different analytical results from the same query and dataset. The workflow shows Reason, Act, and Observe steps, with divergence beginning during metric selection. Different reasoning paths lead to different weights, calculations, rankings, and top representatives such as Maria, James, and Priya.A small reasoning difference inside a ReAct loop can compound into different analytical methodologies, calculations, and final outputs across repeated agent runs.

Este efecto acumulativo es uno de los principales retos de los sistemas de agentes de producción. Cuanto más larga es la cadena de razonamiento, más posibilidades hay de que los resultados varíen de una ejecución a otra.

La hipótesis: ¿pueden los flujos de trabajo reducir la variabilidad?

Para reducir esta variabilidad, analizamos si los flujos de trabajo podían limitar los componentes del sistema que más contribuían a la deriva analítica.

En lugar de permitir que el agente invente una nueva metodología cada vez que se ejecuta una consulta, un flujo de trabajo proporciona una ruta de ejecución predefinida basada en una «ejecución de referencia» validada. El flujo de trabajo conserva la estructura analítica que generó un resultado fiable, incluyendo:

  • indicadores seleccionados

  • lógica de cálculo

  • umbrales y filtros

  • estructura y formato de la salida

Nota >> Consulta la configuración completa del experimento y la ejecución de referencia en el repositorio de GitHub.

El agente sigue realizando el análisis e interactuando con datos en tiempo real, pero las decisiones metodológicas fundamentales ya no se vuelven a calcular en cada ejecución.

Un paso simplificado del flujo de trabajo podría ser algo así:

PASO 2: Métricas de rendimiento agregadas de los agentes
OBJETIVO: Calcular las métricas de rendimiento medias de todas las llamadas
ACCIÓN: Agrupar por agent_id y calcular las medias
RESULTADO: Conjunto de datos de puntuación coherente para la clasificación

El objetivo no era hacer que los agentes fueran deterministas en el sentido tradicional del software. En cambio, queríamos comprobar si los flujos de trabajo podían reducir la deriva del razonamiento lo suficiente como para que los resultados analíticos fueran más estables, reproducibles y aptos para la producción.

Evaluación de la previsibilidad del flujo de trabajo

Para evaluar si los flujos de trabajo podían reducir la variabilidad en los sistemas de agentes analíticos, llevamos a cabo una serie de experimentos controlados utilizando datos reales sobre la experiencia de los clientes.

Configuración del experimento

Hemos probado las mismas consultas analíticas en repetidas ocasiones con un conjunto de datos de un centro de atención al cliente que contiene:

  • ~3.900 interacciones con los clientes

  • 33 representantes de atención al cliente

  • 20 características de rendimiento extraídas

En todos los experimentos se utilizó Claude Opus 4.5 a través de AWS Bedrock con los ajustes de temperatura predeterminados.

Para cada caso de prueba, primero ejecutamos la consulta 10 veces utilizando un flujo de ejecución estándar basado en agentes. A continuación, creamos un flujo de trabajo a partir de una «ejecución de referencia» validada y lo ejecutamos otras 10 veces con el mismo conjunto de datos.

El objetivo: medir en qué medida variaron los resultados entre una ejecución y otra, y si los flujos de trabajo podrían reducir esa desviación.

Nota >> La configuración exacta del experimento se puede consultar en el apéndice de GitHub.

Experimento 1: Coherencia en la clasificación

Nuestro primer experimento se centró en una consulta analítica sencilla:

«¿Quiénes son mis 10 mejores representantes según los indicadores de rendimiento global?»

A primera vista, esto parece sencillo. Sin embargo, el agente aún tiene que tomar varias decisiones analíticas antes de poder generar una clasificación:

  • ¿Qué indicadores son los más importantes?

  • ¿Cómo deberían ponderarse esos indicadores?

  • ¿Cómo se deben normalizar las puntuaciones?

  • ¿Qué filtros o umbrales deberían aplicarse?

Sin un flujo de trabajo, esas decisiones variaban de una ejecución a otra.

El agente recreaba la metodología cada vez

En las diez ejecuciones independientes de la misma consulta, el agente generó repetidamente diferentes enfoques analíticos. Modificó las ponderaciones de las métricas, utilizó diferentes escalas de puntuación y varió el número de factores de rendimiento incluidos en la clasificación.

En algunas simulaciones, la satisfacción del cliente tuvo el mayor peso. En otras, la tasa de resolución se convirtió en el factor determinante. En algunas simulaciones se utilizó una escala de puntuación de 0 a 1, mientras que en otras se pasó a una escala de 0 a 100.

Esos pequeños cambios metodológicos dieron lugar a resultados distintos. Tres representantes diferentes ocuparon el primer puesto en las diez series.

Table showing how an AI analytics agent changed scoring methodologies across 10 repeated executions of the same query. Different runs used different scoring scales, metric weights, and numbers of metrics, resulting in different top-ranked representatives including Maria, James, and Priya.Repeated executions of the same AI ranking query produced different scoring methodologies, metric weights, and top-ranked representatives across 10 independent runs.

La variabilidad no se debió a cambios en los datos. La variación en la clasificación se debió a que el agente reinterpretaba continuamente cómo debía funcionar el propio análisis.

Comparación de clasificaciones con y sin flujos de trabajo

Para comprobar si los flujos de trabajo reducían esta desviación, repetimos el experimento utilizando un flujo de trabajo generado a partir de una «ejecución de referencia» validada.

Sin un flujo de trabajo, las clasificaciones variaban considerablemente de una ejecución a otra. Aparecían, desaparecían o cambiaban de posición de forma drástica distintos representantes entre una ejecución y otra. Algunas ejecuciones incluso arrojaban menos de 10 resultados porque el agente formateaba la respuesta de manera diferente.

Una vez establecido el flujo de trabajo, las clasificaciones se volvieron mucho más estables. El mismo representante ocupaba el primer puesto en todas las ejecuciones del flujo de trabajo, el mismo representante ocupaba el segundo puesto en todas las ejecuciones del flujo de trabajo, y la lista completa de los diez primeros representantes se mantenía idéntica en todas las ejecuciones.

Solo se observaron pequeñas diferencias en el orden de las posiciones más bajas de la clasificación.

Comparison chart showing AI-generated ranking outputs with and without workflows across repeated runs. Without workflows, different representatives appear and rankings change significantly between runs. With workflows, the same top representatives remain consistent across executions with only minor ordering differences.Workflow-constrained executions produced significantly more stable ranking results across repeated runs compared to fully dynamic agentic execution.

Las mejoras en la consistencia fueron apreciables en todas y cada una de las métricas de clasificación que evaluamos:

  • La consistencia del Top-1 mejoró del 60 % al 100 %

  • La superposición del Top-10 se mantuvo totalmente estable en todas las ejecuciones del flujo de trabajo

  • La similitud en la clasificación aumentó significativamente entre las ejecuciones

Los flujos de trabajo redujeron tanto la desviación en la clasificación como la desviación metodológica. Volveremos sobre dos implicaciones importantes (la corrección y la velocidad de ejecución) en la sección de conclusiones.

Experimento 2: Sensibilidad a la formulación de las consultas

En nuestro segundo experimento se evaluó el grado de sensibilidad del agente ante pequeñas variaciones en la formulación del lenguaje natural.

Planteamos la misma pregunta de cuatro formas ligeramente diferentes:

  • «¿Quiénes son mis 10 mejores comerciales?»

  • «Muéstrame a los 10 comerciales con mejores resultados»

  • «Enumera los 10 mejores comerciales según su rendimiento»

  • «¿Qué comerciales tienen los mejores resultados?»

Cada variante se llevó a cabo varias veces, tanto con flujos de trabajo como sin ellos.

Sin un flujo de trabajo, estos pequeños cambios en la redacción solían dar lugar a un comportamiento analítico notablemente diferente. Términos como «mejores representantes», «con mejor rendimiento» y «mejores métricas» llevaban al agente a interpretar la tarea de formas distintas. En algunas ejecuciones, el análisis se centró en mayor medida en indicadores clave de rendimiento (KPI) cuantificables, como la tasa de resolución, mientras que en otras se hizo hincapié en la valoración emocional o en una puntuación compuesta más amplia.

Por lo general, las personas interpretan estas frases como equivalentes. El agente, sin embargo, no lo hizo.

Con los flujos de trabajo activados, la redacción pasó a tener mucha menos importancia, ya que la metodología de ejecución ya estaba definida. En lugar de volver a realizar el análisis para cada variación de redacción, el sistema reutilizaba la misma ruta de ejecución validada.

Los resultados mostraron mejoras cuantificables tanto en la consistencia como en la estabilidad de la ejecución.

Results table comparing AI query phrasing sensitivity with and without workflows. Workflow-enabled runs show faster response times, lower response length variance, and higher structural similarity across different phrasings of the same analytical query.Workflow-constrained executions produced more consistent analytical structures and response formats across different phrasings of the same query.

Los flujos de trabajo redujeron el impacto de la ambigüedad lingüística y hicieron que el comportamiento del sistema fuera más predecible en solicitudes semánticamente similares.

Experimento 3: Agregación y coherencia de las tendencias

La variabilidad en las clasificaciones es fácil de apreciar. La desviación en la agregación suele ser más difícil de detectar, pero resulta mucho más peligrosa en los sistemas de generación de informes de producción.

Para comprobar cómo se desenvolvían los agentes ante tareas analíticas más complejas, ejecutamos repetidamente la siguiente consulta sobre el mismo conjunto de datos:

«Calcula la puntuación media de sentimiento agrupada por categoría_motivo_llamadae identifica qué categorías presentan tendencias a la baja».

A diferencia de una simple consulta de clasificación, este tipo de solicitud obliga al agente a tomar varias decisiones analíticas en distintos niveles durante su ejecución:

  • ¿Cómo se deben agrupar las categorías?

  • ¿Cómo se deben calcular las medias?

  • ¿Cómo se debería definir el término «en declive»?

  • ¿Qué filtros o umbrales deberían aplicarse?

Diagram showing how an AI agent handling an aggregation query must make decisions about grouping logic, trend calculations, averaging methods, and filtering rules. Different choices lead to different analytical outputs, including varying categories flagged as declining trends.Complex aggregation queries require agents to make multiple methodological decisions that can lead to inconsistent analytical outcomes across repeated runs.

Sin flujos de trabajo, estas decisiones variaban notablemente de una ejecución a otra. Algunas ejecuciones utilizaban intervalos de tiempo distintos para el análisis de tendencias; otras agrupaban las categorías de forma diferente; algunas excluían por completo las categorías de bajo volumen, mientras que otras las incluían.

Como consecuencia, una misma categoría podría aparecer como «en descenso» en una ejecución y como «estable» en otra, aunque los datos no hayan cambiado en absoluto.

Este tipo de variabilidad es importante porque las consultas de agregación constituyen el núcleo de los sistemas de informes operativos. Los paneles de control, los análisis de indicadores clave de rendimiento (KPI), los informes de cumplimiento normativo y los resúmenes ejecutivos dependen todos de que los cálculos arrojen resultados coherentes a lo largo del tiempo.

Con los flujos de trabajo activados, la metodología de agregación se mantuvo estable en todas las ejecuciones. La lógica de agrupación, los cálculos de tendencias, los umbrales y las reglas de filtrado se conservaron tal y como figuraban en la definición validada del flujo de trabajo, lo que permitió obtener resultados reproducibles en ejecuciones repetidas.

Los flujos de trabajo redujeron el riesgo de desviación analítica en situaciones de presentación de informes en las que la coherencia no solo es útil, sino que es un requisito legal.

Experimento 4: Casos límite y criterios ambiguos

Nuestro último experimento se centró en consultas con criterios intencionadamente ambiguos o contradictorios.

Le preguntamos al agente:

«Busca comerciales que presenten riesgos de incumplimiento normativo y que, al mismo tiempo, cuenten con un alto nivel de satisfacción de los clientes».

Este tipo de solicitud es habitual en el análisis operativo. A menudo, los equipos necesitan identificar combinaciones inusuales de señales, como el caso de empleados que generan una gran cantidad de comentarios de los clientes y, al mismo tiempo, suscitan una elevada preocupación en materia de cumplimiento normativo.

El problema es que términos como «alta satisfacción del cliente» y «riesgo de incumplimiento» no están definidos matemáticamente en la propia consulta. El agente debe decidir qué significan esos umbrales durante la ejecución.

Sin flujos de trabajo, esas definiciones variaban considerablemente de una ejecución a otra.

En algunas evaluaciones, «alta satisfacción» se refería a puntuaciones superiores a 4,5. En otras, el umbral bajaba hasta situarse cerca de 3,0. La definición de «riesgo de cumplimiento» también variaba en función de cómo interpretara el agente las escalaciones, los resultados de las Audits o las infracciones de las políticas.

Como resultado, la misma consulta arrojaba entre 5 y 16 representantes.

Diagram showing threshold drift in an AI analytics system across repeated executions of the same query. Different runs interpreted 'high customer satisfaction' using different thresholds on a 5-point scale, resulting in 5, 14, and 16 representatives being returned despite using the same dataset.Ambiguous analytical criteria caused the AI agent to apply different thresholds across repeated runs, producing significantly different result counts from the same query and dataset.

Al habilitar los flujos de trabajo, esas decisiones sobre los umbrales se mantuvieron tal y como figuraban en la definición validada del flujo de trabajo, lo que dio lugar a resultados considerablemente más estables en todas las ejecuciones.

Comparison chart showing consistency improvements for ambiguous AI edge-case queries with and without workflows. Workflow-enabled executions achieved higher count consistency, greater result overlap, and improved output stability compared to dynamic agentic executions without workflows.Workflows improved consistency and result stability for ambiguous edge-case queries by preserving threshold definitions across repeated runs.

Incluso con los flujos de trabajo, los casos extremos seguían siendo más difíciles de estabilizar que los experimentos de clasificación mencionados anteriormente en el artículo. El lenguaje empresarial ambiguo introduce, por naturaleza, más variabilidad que las tareas analíticas claramente definidas.

Sin embargo, los flujos de trabajo siguieron reduciendo significativamente la deriva de los umbrales y mejoraron la coherencia en:

  • recuento de resultados

  • solapamiento representativo

  • estabilidad de la salida

Esto es importante para sistemas operativos como:

  • detección de anomalías

  • informes de auditoría

  • revisiones de cumplimiento

  • sistemas de alertas automatizados

En estos entornos, unos umbrales inconsistentes pueden dar lugar a falsos positivos, falsos negativos o conjuntos de resultados marcados totalmente diferentes de una ejecución a otra.

Lo que hemos aprendido

En los cuatro experimentos, el agente no dejaba de cambiar la forma en que realizaba el análisis. Cada vez que tenía que tomar una decisión ambigua, generaba variabilidad en los resultados.

Sin flujos de trabajo, los agentes cambiaban constantemente la forma de abordar el análisis en sí. Seleccionaban métricas diferentes, ajustaban los umbrales, interpretaban las expresiones de forma distinta y modificaban la lógica de agrupación o filtrado entre una ejecución y otra, incluso cuando la consulta y el conjunto de datos originales no habían cambiado en absoluto.

Los flujos de trabajo redujeron esa variabilidad al mantener la metodología analítica de una «serie de referencia» validada.

Lección 1: Los flujos de trabajo reducen las desviaciones metodológicas

La principal causa de las inconsistencias fue el cambio en la metodología analítica subyacente al sistema.

En todos los experimentos, los agentes se desviaron repetidamente en zonas como:

  • ponderación métrica

  • definiciones de umbral

  • lógica de agrupación

  • reglas de filtrado

  • cálculos de tendencias

  • fórmulas de puntuación

Cada pequeño cambio en el razonamiento provocaba diferencias posteriores en la generación de código, los cálculos, las clasificaciones y los resultados.

Los flujos de trabajo limitaban esas decisiones al mantener:

  • métricas fijas

  • umbrales fijos

  • rutas de cálculo fijas

  • orden de ejecución fijo

En lugar de volver a crear la metodología en cada ejecución, el sistema reutilizó un proceso analítico ya validado.

Side-by-side diagram comparing AI analytical execution with and without workflows. Without workflows, dynamic reasoning leads to different metrics, thresholds, calculations, and outputs. With workflows, validated execution paths preserve fixed methodologies and produce more stable outputs.Workflows stabilize AI analytical systems by preserving validated methodologies, thresholds, and calculations across repeated executions."Esto redujo tanto la desviación en el razonamiento como la desviación en los resultados en las ejecuciones repetidas.

Lección 2: Los flujos de trabajo mejoran la coherencia operativa

El impacto quedó patente. Una vez activados los flujos de trabajo, observamos lo siguiente:

  • clasificaciones más estables

  • resultados de agregación reproducibles

  • lo que cuenta son los resultados más predecibles

  • menos variaciones de formato

  • una estructura analítica más coherente

Esto es importante porque los sistemas de producción dependen de que los resultados se mantengan estables a lo largo del tiempo. Los paneles de control, los sistemas de control de calidad, las revisiones de cumplimiento y los procesos automatizados de generación de informes parten de la base de que una misma consulta sobre los mismos datos debería arrojar resultados sustancialmente similares.

Sin esa coherencia, resulta difícil confiar en los sistemas posteriores.

Los experimentos también demostraron que los flujos de trabajo resultaban más eficaces cuando la propia tarea analítica estaba bien definida. Las tareas claras de clasificación y agregación se estabilizaron de forma significativamente mayor que las consultas sobre casos límite, que presentaban un alto grado de ambigüedad.

Lección 3: La coherencia no garantiza la corrección

Una de las principales conclusiones de los experimentos fue que la coherencia y la corrección no son lo mismo.

Un flujo de trabajo puede mantener de forma fiable una metodología que sea estadísticamente débil, defectuosa desde el punto de vista operativo o sesgada.

En un experimento de clasificación, el representante que ocupaba sistemáticamente los primeros puestos también presentaba uno de los tamaños de muestra más reducidos del conjunto de datos. El flujo de trabajo reproducía el mismo resultado en todas las ocasiones, pero eso no hacía que la conclusión fuera automáticamente fiable.

Los flujos de trabajo conservan las decisiones analíticas. No comprueban si dichas decisiones son correctas.

La revisión humana sigue siendo importante:

  • La selección de métricas debe evaluarse con cuidado

  • Los umbrales requieren conocimientos especializados en la materia

  • Es necesario validar la lógica de agregación

  • Los casos extremos requieren criterio operativo.

Esto cobra importancia antes de que los flujos de trabajo se implementen en los sistemas de producción que influyen en las decisiones empresariales o en los resultados de los clientes.

El objetivo no es simplemente la reproducibilidad. El objetivo es un análisis reproducible y bien gestionado.

Lección 4: ¿Por qué las ejecuciones del flujo de trabajo eran más rápidas?

Las ejecuciones de los flujos de trabajo fueron sistemáticamente más rápidas en todos los experimentos.

Sin flujos de trabajo, el agente dedicaba tiempo a realizar repetidamente las siguientes tareas:

  • exploración del conjunto de datos

  • replanteamiento de las metodologías

  • revisar los cálculos

  • revisar los enfoques analíticos

  • generar rutas de ejecución alternativas

Cada paso adicional de razonamiento suponía más llamadas al LLM, más sobrecarga de ejecución y más posibilidades de divergencia.

Con los flujos de trabajo, se eliminó gran parte de ese razonamiento exploratorio. La ruta de ejecución ya estaba definida, por lo que el sistema podía centrarse en ejecutar el análisis en lugar de reinventarlo.

El hecho de reducir los desvíos analíticos dio lugar a:

  • rutas de ejecución más cortas

  • tiempos de respuesta más cortos

  • un comportamiento más predecible en tiempo de ejecución

Las mejoras en el rendimiento no fueron totalmente deterministas, pero la tendencia se mantuvo constante en todos los experimentos: un menor número de desvíos analíticos dio lugar a una ejecución más rápida y estable.

Comparison charts showing AI workflow execution performance with and without workflows. Workflow-enabled executions show lower average response times and fewer execution steps compared to fully dynamic agentic runs, demonstrating reduced reasoning overhead and improved efficiency.Workflow-constrained executions completed faster and required fewer reasoning steps than fully dynamic agentic executions.

Cuándo utilizar los flujos de trabajo

Los experimentos demostraron que los flujos de trabajo resultan más útiles en sistemas en los que la coherencia es más importante que la exploración.

Los flujos de trabajo resultan muy adecuados cuando:

  • Los informes deben ser reproducibles.

  • Los resultados se envían a los sistemas o paneles de control posteriores.

  • La lógica analítica debe mantenerse estable a lo largo del tiempo.

  • Los resultados se revisan durante la ejecución o se someten a Audit posteriormente.

  • Los equipos necesitan clasificaciones, umbrales o cálculos coherentes en todas las ejecuciones repetidas.

Esto es especialmente importante para:

  • informes operativos

  • revisiones de cumplimiento

  • Sistemas de control de calidad

  • detección de anomalías

  • alertas automáticas

  • plataformas de análisis de clientes

En estos entornos, la reproducibilidad es mucho más importante que la creatividad.

Sin embargo, los flujos de trabajo no son la solución adecuada para todos los casos de uso.

El razonamiento agencial dinámico sigue aportando valor cuando:

  • explorar conjuntos de datos desconocidos

  • elaborar hipótesis

  • generar perspectivas analíticas alternativas

  • experimentar con metodologías

  • buscando patrones inesperados

En esos casos, la variabilidad puede resultar realmente útil, ya que ayuda a poner de manifiesto diferentes enfoques y puntos de vista.

La disyuntiva clave es la flexibilidad frente a la coherencia. Los flujos de trabajo limitan intencionadamente algunas partes del proceso de razonamiento para que el comportamiento analítico resulte más predecible con el paso del tiempo.

Conclusión

Los agentes de IA son potentes porque pueden razonar de forma dinámica, adaptarse al contexto y generar enfoques analíticos sobre la marcha. Pero esa flexibilidad también conlleva variabilidad.

En los cuatro experimentos se observó el mismo patrón: cuando la metodología analítica se dejaba totalmente dinámica, los resultados variaban de una ejecución a otra, incluso cuando la consulta y los datos subyacentes no cambiaban en absoluto.

Los flujos de trabajo redujeron esa desviación al conservar las decisiones críticas en las que se basaba el análisis, entre ellas las métricas, los umbrales, la lógica de agrupación y las rutas de ejecución.

No hacen que los sistemas agenticos sean perfectamente deterministas, ni garantizan su corrección. La revisión humana, la validación y los conocimientos especializados en la materia siguen siendo fundamentales.

Sin embargo, cuando la coherencia, la reproducibilidad y la fiabilidad operativa son factores importantes, los flujos de trabajo ofrecen una forma práctica de hacer que los sistemas agentivos sean considerablemente más predecibles en entornos de producción.

¿Tienes alguna pregunta o algo que compartir? Únete a la conversación en Slack de la comunidad de Vonagey mantente actualizado con el Boletín para desarrolladoressíguenos en X (antes Twitter)suscríbete a nuestro canal de YouTube para ver tutoriales en video, y sigue la página de página para desarrolladores de Vonage en LinkedInun espacio para que los desarrolladores aprendan y se conecten con la comunidad. Mantente conectado, comparte tu progreso y entérate de las últimas noticias, consejos y eventos para desarrolladores.

Recursos adicionales

Los experimentos descritos en este artículo se han llevado a cabo con el apoyo de un flujo de trabajo validado de «golden run», junto con las configuraciones de los experimentos, las definiciones de las métricas y los ejemplos de implementación.

Para los lectores interesados en profundizar en la metodología, hemos publicado los materiales complementarios completos en GitHub:

Repositorio para crear flujos de trabajo agenticos predecibles

El repositorio incluye:

  • el flujo de trabajo completo de «Golden Run» en siete pasos,

  • configuraciones experimentales,

  • definiciones métricas,

  • ejemplos de validación y gestión de casos extremos,

  • y los diagramas que aparecen a lo largo de este artículo.

Compartir:

https://a.storyblok.com/f/270183/400x400/cda8f62cb2/michael-patkin.png
Michael PatkinCientífico de datos principal

Michael Patkin es científico de datos principal en Vonage y cuenta con más de 15 años de experiencia en aprendizaje automático, desarrollando sistemas basados en inteligencia artificial para el análisis de conversaciones, la extracción de información y la automatización de la investigación.