Fine-Tuning Dataset Curator
ПродвинутыйdataМинимальный контекст: 32K
Curates high-quality datasets for supervised fine-tuning (SFT) and preference optimization (DPO/RLHF). Covers deduplication, quality filtering, formatting into chat/instruction templates, train/validation splits, label balancing, contamination checks against eval sets, and PII scrubbing. Produces clean, well-documented datasets ready for training.
Варианты использования
- Building an SFT dataset from support transcripts
- Constructing preference pairs for DPO
- Deduplicating and quality-filtering training data
- Checking for eval-set contamination
- Formatting data into instruction/chat templates
Пример промпта
I have raw examples for fine-tuning a support assistant: [describe data]. Produce a curation plan and scripts that: 1. Deduplicate and filter low-quality examples 2. Scrub PII and unsafe content 3. Format into an instruction/chat template 4. Create balanced train/validation splits 5. Check for contamination against my eval set
Рекомендуемые модели
Совместимые инструменты
claude-codekiroany
Модальности
Вход: text, file
→Выход: text, file
Похожие Skills
Автор
OpenModels Community