Agent Evaluation Design
ПродвинутыйТестированиеМинимальный контекст: 32K
Создаёт воспроизводимые оценки AI-агентов, измеряющие успешность задач, корректность использования инструментов, обоснованность, задержку, стоимость и безопасное восстановление в реалистичных сквозных сценариях.
Описание переведено автоматически и пока не проверено редактором.
Варианты использования
- Критерии допуска релиза агента
- Оценка качества использования инструментов
- Проверка производственных AI-агентов
Пример промпта
Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.
Рекомендуемые модели
Совместимые инструменты
claude-codecursorkiroany
Модальности
Вход: text, code, file
→Выход: text, code
Автор
OpenModels Community