Post-training dataCOLM 2026
MegaScience
Open post-training datasets for scientific reasoning, including the 1.25M-instance MegaScience mixture and TextbookReasoning.
- HF · all datasets
- 127.7K downloads
- Open corpus
- 1.25M instances
Open datasets, code, and models from my recent work. Metrics below are mid-2026 public snapshots and are shown as all-time totals where available.
Open corpora for scientific and mathematical reasoning.
Post-training dataCOLM 2026
Open post-training datasets for scientific reasoning, including the 1.25M-instance MegaScience mixture and TextbookReasoning.
Pre-training dataAI4Math @ ICML 2025
A 70B+ token math-web corpus curated and refined for reinforcement-learning-friendly mid-training.
Pre-training dataCOLM 2025
A 371B-token open math corpus unifying web, code, and synthetic mathematical data.
Pre-training dataNeurIPS D&B 2024
A quality-first, 9.5B-token math corpus spanning textbooks, papers, forums, and the web.
Ways to refine corpora and study reasoning behavior.
Data refinementICML 2025
Tiny language models that programmatically refine corpora, with 500B+ open DCLM-Pro tokens.
Models & pre-training dataAI4Math @ ICML 2025
Open mid-training recipes, models, and pre-training data for reinforcement-learning-friendly reasoning.