LLM Output Evaluation

AvanzadatestingContexto mínimo: 32K

Defines repeatable quality evaluation for LLM outputs using representative datasets, scoring rubrics, model-graded checks, human review sampling, and regression thresholds.

Casos de uso

  • LLM quality gates
  • Prompt benchmarking
  • Model migration validation

Prompt de ejemplo

Create an evaluation plan for this LLM feature, including representative cases, a scored rubric, automated checks, human-review sampling, and release thresholds.

Modelos recomendados

Herramientas compatibles

claude-codecursorkiroany

Modalidades

Entrada: text, file
Salida: text, code

Skills relacionadas

Autor

OpenModels Community

@openmodelsrun