Agent Evaluation Design
AvanzadaPruebasContexto mínimo: 32K
Crea evaluaciones repetibles para agentes de IA que miden el éxito de las tareas, el uso correcto de herramientas, la fundamentación, la latencia, el coste y la recuperación segura en escenarios realistas de extremo a extremo.
Esta descripción se ha traducido automáticamente y todavía no ha sido revisada.
Casos de uso
- Controles de publicación de agentes
- Medición de la calidad del uso de herramientas
- Evaluación de agentes en producción
Prompt de ejemplo
Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.
Modelos recomendados
Herramientas compatibles
claude-codecursorkiroany
Modalidades
Entrada: text, code, file
→Salida: text, code
Autor
OpenModels Community