Agent Evaluation Design
İleriTestEn az 32K bağlam
Gerçekçi uçtan uca senaryolarda görev başarısını, araç kullanım doğruluğunu, dayanaklılığı, gecikmeyi, maliyeti ve güvenli toparlanmayı ölçen yeniden üretilebilir AI agent değerlendirmeleri oluşturur.
Bu açıklama otomatik olarak çevrilmiştir ve henüz editör tarafından incelenmemiştir.
Kullanım alanları
- Agent sürüm kabul kriterleri
- Araç kullanım kalitesini değerlendirme
- Production AI agent'larını doğrulama
Örnek prompt
Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.
Önerilen modeller
Uyumlu araçlar
claude-codecursorkiroany
Modaliteler
Giriş: text, code, file
→Çıkış: text, code
Yazar
OpenModels Community