Fine-Tuning Dataset Curator

AvanzadadataContexto mínimo: 32K

Curates high-quality datasets for supervised fine-tuning (SFT) and preference optimization (DPO/RLHF). Covers deduplication, quality filtering, formatting into chat/instruction templates, train/validation splits, label balancing, contamination checks against eval sets, and PII scrubbing. Produces clean, well-documented datasets ready for training.

Casos de uso

  • Building an SFT dataset from support transcripts
  • Constructing preference pairs for DPO
  • Deduplicating and quality-filtering training data
  • Checking for eval-set contamination
  • Formatting data into instruction/chat templates

Prompt de ejemplo

I have raw examples for fine-tuning a support assistant: [describe data].
Produce a curation plan and scripts that:
1. Deduplicate and filter low-quality examples
2. Scrub PII and unsafe content
3. Format into an instruction/chat template
4. Create balanced train/validation splits
5. Check for contamination against my eval set

Modelos recomendados

Herramientas compatibles

claude-codekiroany

Modalidades

Entrada: text, file
Salida: text, file

Skills relacionadas

Autor

OpenModels Community

@openmodelsrun