Constarium
← Search

Text · dataset · 2022

Llamacha/monolingual-quechua-iic

Listed in Hugging Face Datasets

Dataset Card for Monolingual-Quechua-IIC Dataset

Description

Summary

We present Monolingual-Quechua-IIC, a monolingual corpus of Southern Quechua, which can be used to build language models using Transformers models. This corpus also includes the Wiki and OSCAR corpora. We used this corpus to build Llama-RoBERTa-Quechua, the first language model for Southern Quechua using Transformers.

Read the rest (1 more)

Supported Tasks and Leaderboards More Information Needed Languages Southern… See the full description on the dataset page: huggingface.co/datasets/Llamacha/monolingual-quechua-iic.

Links

Catalogue records · 1

Topics

Stated by source
fill mask · text
Provenance · 1 source records, 10 field assertions
SourceKeyLast seenRaw
Hugging Face DatasetsLlamacha/monolingual-quechua-iic10 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · Hugging Faceconnector:huggingface@1.0.0/gated
concepts[field].local:field:computer-science-aimapping · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].hf_modality:textsource · Hugging Faceconnector:huggingface@1.0.0
concepts[task].hf_task:fill-masksource · Hugging Faceconnector:huggingface@1.0.0/tags[task_categories:*]
created_datesource · Hugging Faceconnector:huggingface@1.0.0
descriptionsource · Hugging Faceconnector:huggingface@1.0.0/description
licensesource · Hugging Faceconnector:huggingface@1.0.0/tags[license:*]
publication_datesource · Hugging Faceconnector:huggingface@1.0.0
titlesource · Hugging Faceconnector:huggingface@1.0.0/id
updated_datesource · Hugging Faceconnector:huggingface@1.0.0