Constarium
← Search

Data · dataset · 2022

WikiSplit

Listed in Hugging Face Datasets

One million English sentences, each split into two sentences that together preserve the original meaning, extracted from Wikipedia Google's WikiSplit dataset was constructed automatically from the publicly available Wikipedia revision history.

Description

Although the dataset contains some inherent noise, it can serve as valuable training data for models that split or merge sentences.

Links

Documentation and papers

Catalogue records · 1

Topics

Provenance · 1 source records, 8 field assertions
SourceKeyLast seenRaw
Hugging Face Datasetsgoogle-research-datasets/wiki_split12 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · Hugging Faceconnector:huggingface@1.0.0/gated
concepts[field].local:field:computer-science-aimapping · Hugging Faceconnector:huggingface@1.0.0
created_datesource · Hugging Faceconnector:huggingface@1.0.0
descriptionsource · Hugging Faceconnector:huggingface@1.0.0/description
licensesource · Hugging Faceconnector:huggingface@1.0.0/tags[license:*]
publication_datesource · Hugging Faceconnector:huggingface@1.0.0
titlesource · Hugging Faceconnector:huggingface@1.0.0/id
updated_datesource · Hugging Faceconnector:huggingface@1.0.0