Constarium
← Search

Data · dataset · 2022

wiki_lingua

Listed in Hugging Face Datasets

WikiLingua is a large-scale multilingual dataset for the evaluation of crosslingual abstractive summarization systems.

Description

The dataset includes ~770k article and summary pairs in 18 languages from WikiHow. The gold-standard article-summary alignments across languages was done by aligning the images that are used to describe each how-to step in an article.

Links

Where it is published

Catalogue records · 1

Topics

Stated by source
summarization
Inferred from text
Image 65%
Provenance · 1 source records, 10 field assertions
SourceKeyLast seenRaw
Hugging Face DatasetsGEM/wiki_lingua12 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · Hugging Faceconnector:huggingface@1.0.0/gated
concepts[field].local:field:computer-science-aimapping · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].local:modality:imageenrichment · Hugging Facekeyword-concept-rules@1.0.0title+description (65%)
concepts[task].hf_task:summarizationsource · Hugging Faceconnector:huggingface@1.0.0/tags[task_categories:*]
created_datesource · Hugging Faceconnector:huggingface@1.0.0
descriptionsource · Hugging Faceconnector:huggingface@1.0.0/description
license_textsource · Hugging Faceconnector:huggingface@1.0.0
publication_datesource · Hugging Faceconnector:huggingface@1.0.0
titlesource · Hugging Faceconnector:huggingface@1.0.0/id
updated_datesource · Hugging Faceconnector:huggingface@1.0.0