Constarium
← Search

Table · dataset · 2026

LittleCurriculum

Listed in Hugging Face Datasets

LittleCurriculum LittleCurriculum is an ~88B-token English pretraining corpus derived from FineWeb-Edu.

Description

It is filtered to align with U.S. Common Core standards for grades K–5, removing documents containing academic concepts and skills characteristic of later grades. It is the training corpus for the LittleLearner models, designed to study language models under a controlled knowledge boundary.

See the LittleLearner paper for methodology, validation, and experiments.… See the full description on the dataset page: huggingface.co/datasets/littlelearner/LittleCurriculum.

Links

Documentation and papers

Catalogue records · 1

Topics

Stated by source
text · text generation
Provenance · 1 source records, 10 field assertions
SourceKeyLast seenRaw
Hugging Face Datasetslittlelearner/LittleCurriculum10 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · Hugging Faceconnector:huggingface@1.0.0/gated
concepts[field].local:field:computer-science-aimapping · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].hf_modality:textsource · Hugging Faceconnector:huggingface@1.0.0
concepts[task].hf_task:text-generationsource · Hugging Faceconnector:huggingface@1.0.0/tags[task_categories:*]
created_datesource · Hugging Faceconnector:huggingface@1.0.0
descriptionsource · Hugging Faceconnector:huggingface@1.0.0/description
license_textsource · Hugging Faceconnector:huggingface@1.0.0
publication_datesource · Hugging Faceconnector:huggingface@1.0.0
titlesource · Hugging Faceconnector:huggingface@1.0.0/id
updated_datesource · Hugging Faceconnector:huggingface@1.0.0