La evaluación de agentes debe ser sistemática y repetible. Detallamos métricas de éxito de tareas, depuración basada en trazas y políticas de seguridad para agentes que usan LLMs de código abierto.
Suite de evaluación
- Éxito de tarea y puntuaciones de calidad
- Análisis de errores de herramientas
- Paneles de latencia y coste
- Violaciones de políticas de seguridad

