Agent Evaluation Design

FortgeschrittenTestsMindestens 32K Kontext

Erstellt wiederholbare Evaluationen für KI-Agenten, die Aufgabenerfolg, korrekten Werkzeugeinsatz, Grounding, Latenz, Kosten und sichere Wiederherstellung in realistischen End-to-End-Szenarien messen.

Diese Beschreibung wurde automatisch übersetzt und noch nicht redaktionell geprüft.

Anwendungsfälle

  • Freigabekontrollen für Agenten
  • Messung der Qualität des Werkzeugeinsatzes
  • Evaluation von Agenten im Produktivbetrieb

Beispiel-Prompt

Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.

Empfohlene Modelle

Kompatible Werkzeuge

claude-codecursorkiroany

Modalitäten

Eingabe: text, code, file
→
Ausgabe: text, code

Autor

OpenModels Community

@openmodelsrun