LLM Output Evaluation
AvanzadatestingContexto mínimo: 32K
Defines repeatable quality evaluation for LLM outputs using representative datasets, scoring rubrics, model-graded checks, human review sampling, and regression thresholds.
Casos de uso
- LLM quality gates
- Prompt benchmarking
- Model migration validation
Prompt de ejemplo
Create an evaluation plan for this LLM feature, including representative cases, a scored rubric, automated checks, human-review sampling, and release thresholds.
Modelos recomendados
Herramientas compatibles
claude-codecursorkiroany
Modalidades
Entrada: text, file
→Salida: text, code
Skills relacionadas
Autor
OpenModels Community