Agent Evaluation Design

AvanzadaPruebasContexto mínimo: 32K

Crea evaluaciones repetibles para agentes de IA que miden el éxito de las tareas, el uso correcto de herramientas, la fundamentación, la latencia, el coste y la recuperación segura en escenarios realistas de extremo a extremo.

Esta descripción se ha traducido automáticamente y todavía no ha sido revisada.

Casos de uso

  • Controles de publicación de agentes
  • Medición de la calidad del uso de herramientas
  • Evaluación de agentes en producción

Prompt de ejemplo

Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.

Modelos recomendados

Herramientas compatibles

claude-codecursorkiroany

Modalidades

Entrada: text, code, file
Salida: text, code

Autor

OpenModels Community

@openmodelsrun