Constarium
← Search

Table · dataset · 2022

Catalan Textual Corpus

Listed in Hugging Face Datasets

Dataset Card for Catalan Textual Corpus Dataset

Description

Summary

The Catalan Textual Corpus is a 1760-million-token web corpus of Catalan built from several sources. It consists of 1,758,388,896 tokens, 73,172,152 sentences, and 12,556,365 documents. Documents are separated by single new lines.

Read the rest (1 more)

These boundaries have been preserved as long as the license allowed it. This work is licensed under a Creative Commons Attribution Share Alike 4.0 International license.… See the full description on the dataset page: huggingface.co/datasets/projecte-aina/catalan_textual_corpus.

Links

Documentation and papers

Catalogue records · 1

Topics

Stated by source
fill mask · text
Provenance · 1 source records, 10 field assertions
SourceKeyLast seenRaw
Hugging Face Datasetsprojecte-aina/catalan_textual_corpus12 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · Hugging Faceconnector:huggingface@1.0.0/gated
concepts[field].local:field:computer-science-aimapping · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].hf_modality:textsource · Hugging Faceconnector:huggingface@1.0.0
concepts[task].hf_task:fill-masksource · Hugging Faceconnector:huggingface@1.0.0/tags[task_categories:*]
created_datesource · Hugging Faceconnector:huggingface@1.0.0
descriptionsource · Hugging Faceconnector:huggingface@1.0.0/description
licensesource · Hugging Faceconnector:huggingface@1.0.0/tags[license:*]
publication_datesource · Hugging Faceconnector:huggingface@1.0.0
titlesource · Hugging Faceconnector:huggingface@1.0.0/id
updated_datesource · Hugging Faceconnector:huggingface@1.0.0