Agent Evaluation Design

İleriTestEn az 32K bağlam

Gerçekçi uçtan uca senaryolarda görev başarısını, araç kullanım doğruluğunu, dayanaklılığı, gecikmeyi, maliyeti ve güvenli toparlanmayı ölçen yeniden üretilebilir AI agent değerlendirmeleri oluşturur.

Bu açıklama otomatik olarak çevrilmiştir ve henüz editör tarafından incelenmemiştir.

Kullanım alanları

  • Agent sürüm kabul kriterleri
  • Araç kullanım kalitesini değerlendirme
  • Production AI agent'larını doğrulama

Örnek prompt

Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.

Önerilen modeller

Uyumlu araçlar

claude-codecursorkiroany

Modaliteler

Giriş: text, code, file
Çıkış: text, code

Yazar

OpenModels Community

@openmodelsrun