🧮 ML Research Engineering · Evaluation Integrity
Document datasets with datasheets
Provenance, composition, collection process, and limitations recorded before modeling begins.
foundation~30 minResearch EngineersML ScientistsPhD Researchers
Steps
- 1Record provenance chain: sources, licenses, consent basis for personal data
- 2Quantify composition: demographics/classes/languages with known skews stated
- 3Document collection mechanics and any filtering applied
- 4List known failure modes and unsuitable-use cases explicitly
- 5Version datasheets with dataset versions — they evolve together
- 6Review for PII leakage risks with fresh eyes before release
Common Pitfalls
- ▲Datasets inherited without provenance entering production models
- ▲Limitations sections written only when reviewers ask
Commands
Install with skills CLI
$ npx skills add aniruddhaadak80/skills --skill evaluation-integrity-datasheet-documentationInstall globally
$ npx skills add aniruddhaadak80/skills --skill evaluation-integrity-datasheet-documentation -gTags
#datasets#documentation#responsible-ai#ml-research#evaluation-integrity