Agent Evaluation Design
FortgeschrittenTestsMindestens 32K Kontext
Erstellt wiederholbare Evaluationen für KI-Agenten, die Aufgabenerfolg, korrekten Werkzeugeinsatz, Grounding, Latenz, Kosten und sichere Wiederherstellung in realistischen End-to-End-Szenarien messen.
Diese Beschreibung wurde automatisch übersetzt und noch nicht redaktionell geprüft.
Anwendungsfälle
- Freigabekontrollen für Agenten
- Messung der Qualität des Werkzeugeinsatzes
- Evaluation von Agenten im Produktivbetrieb
Beispiel-Prompt
Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.
Empfohlene Modelle
Kompatible Werkzeuge
claude-codecursorkiroany
Modalitäten
Eingabe: text, code, file
→Ausgabe: text, code
Autor
OpenModels Community