Ir al contenido principal

Cómo usar la evaluación de agentes automatizada de Astra para implementar agentes de IA confiables

Resumen

Cuando creas un agente de IA en Astra, el sistema no solo lo genera y te deja a ti el resto del trabajo. Genera casos de prueba automáticamente para ayudarte a evaluar y mejorar tu agente desde el principio.

Este artículo explica cómo las pruebas automatizadas, la optimización de instrucciones (prompts) y el panel de evaluación funcionan en conjunto para ayudarte a lanzar un agente fiable y de alto rendimiento con menos esfuerzo manual.

Instrucciones

Cómo funciona la evaluación automatizada del agente

Tan pronto como se crea tu agente, Astra genera automáticamente casos de prueba. Esto elimina la necesidad de configurar pruebas manualmente y reduce el tiempo dedicado a ensayo y error.

Cuando abras la página de Evaluación (Evaluation), verás un conjunto de casos de prueba generados automáticamente a partir de las instrucciones actuales de tu agente.

Estos casos de prueba establecen una base de rendimiento. Te ayudan a comprender cómo responde tu agente ante diferentes tipos de conversaciones, casos excepcionales y escenarios de riesgo. Estos escenarios abarcan desde consultas estándar hasta problemas complejos.

Cómo ejecutar la evaluación y ver los resultados

¿Prefieres un recorrido visual? Mira nuestra guía en vídeo sobre cómo evaluar tus agentes de IA de Astra:

Puedes seleccionar casos de prueba específicos de la lista para ejecutar la evaluación, o hacer clic en Ejecutar todo (Run all) para evaluar todos los casos de prueba disponibles a la vez.

Una vez completada la evaluación, el sistema te mostrará el rendimiento del agente en tiempo real. Esto te ayuda a identificar rápidamente instrucciones poco claras, incompletas o contradictorias.

Verás los resultados generales de la evaluación, incluyendo:

  • Puntuación de eficiencia: qué tan bien manejó el agente de IA las preguntas.

  • Precisión: qué tan correctas fueron las respuestas del agente de IA.

  • Latencia: qué tan rápido respondió el agente de IA.

También puedes ver los siguientes detalles en el resumen de la evaluación:

  • Pregunta: la pregunta de prueba utilizada para evaluar al agente de IA.

  • Categoría: el tipo de pregunta, como consulta estándar, problema implícito o pregunta fuera de tema.

  • Respuesta esperada: la respuesta que se espera que proporcione el agente de IA.

  • Respuesta de la IA: la respuesta real generada por el agente de IA.

  • Métricas: muestra la puntuación de eficiencia de la respuesta.

  • Estado: indica si el agente de IA aprobó o reprobó la evaluación.

  • Notas: muestra información adicional sobre el caso de prueba, como si la pregunta fue generada automáticamente, cargada mediante CSV o añadida manualmente.

Puedes hacer clic en cualquier caso de prueba individual para ver resultados detallados, incluyendo:

  • Resumen de la evaluación: un desglose de cómo respondió el agente y por qué aprobó o reprobó.

  • Comportamiento esperado: la respuesta correcta o ideal que el agente debería haber proporcionado.

Cada resultado incluye una explicación detallada de cómo el agente interpretó la entrada del usuario y si respondió correctamente. Esto facilita la detección de brechas y permite refinar tus instrucciones con precisión.

Lo que debes hacer:

  • Revisar los resultados de cada caso de prueba.

  • Comparar la respuesta del agente con el resumen de la evaluación.

  • Comprobar si la respuesta coincide con el comportamiento esperado.

Cómo ver el análisis y las recomendaciones de la IA

Haz clic en Analizar resultados (Analyse results) para revisar el resultado de la evaluación. El sistema puede tardar unos instantes en procesar el análisis.

Una vez completado el análisis, haz clic en Ver recomendación (View recommendation) para ver sugerencias de optimización impulsadas por IA.

El sistema resume los problemas principales y proporciona recomendaciones prácticas para mejorar la precisión y fiabilidad del agente.

Revisa cuidadosamente las sugerencias de alta prioridad. Estas pueden incluir añadir reglas claras para ciertas solicitudes o definir instrucciones paso a paso para tareas complejas como el seguimiento de pedidos.

Cómo actualizar las instrucciones del agente

Después de revisar las sugerencias, haz clic en Actualizar instrucciones (Update instructions) para aplicar automáticamente las mejoras. Esta función ayuda a optimizar el proceso de refinamiento del agente utilizando los conocimientos obtenidos de las pruebas y análisis del mundo real. Tardará unos instantes y mostrará los resultados.

Revisar y aplicar cambios

La pantalla de Revisar instrucciones actualizadas (Review updated instructions) mostrará los cambios propuestos. Aquí puedes ver cómo se añaden las nuevas reglas y directrices a las instrucciones existentes del agente.

Después de la optimización:

  • El portal resalta las actualizaciones propuestas.

  • Puedes ver claramente qué se ha modificado y por qué.

  • Revisa cuidadosamente las mejoras sugeridas.

Desplázate por las instrucciones actualizadas para asegurarte de que cumplen con tus requisitos.

Confirma que las sugerencias de la IA se alineen con tu voz de marca y tus procesos de negocio.

Haz clic en Aceptar (Accept) para finalizar la actualización.

Ejecutar la evaluación de nuevo

Después de guardar los cambios, haz clic en Ejecutar todo (Run all) nuevamente para volver a evaluar al agente utilizando los mismos casos de prueba. El sistema ejecutará la evaluación con las instrucciones actualizadas. Cuando se complete la prueba, deberías ver que todos los escenarios fueron aprobados.

Este proceso muestra cómo las funciones de análisis y recomendación te ayudan a mejorar y optimizar de forma iterativa el rendimiento de tu agente de IA.

¿Ha quedado contestada tu pregunta?