Agent Evaluation Design

ПродвинутыйТестированиеМинимальный контекст: 32K

Создаёт воспроизводимые оценки AI-агентов, измеряющие успешность задач, корректность использования инструментов, обоснованность, задержку, стоимость и безопасное восстановление в реалистичных сквозных сценариях.

Описание переведено автоматически и пока не проверено редактором.

Варианты использования

  • Критерии допуска релиза агента
  • Оценка качества использования инструментов
  • Проверка производственных AI-агентов

Пример промпта

Design an evaluation suite for this agent. Define representative tasks, success criteria, tool assertions, cost and latency metrics, safety checks, and release thresholds.

Рекомендуемые модели

Совместимые инструменты

claude-codecursorkiroany

Модальности

Вход: text, code, file
Выход: text, code

Автор

OpenModels Community

@openmodelsrun
Agent Evaluation Design — AI Agent Skill | OpenModels