Constarium
← Search

Data · dataset · 2022

TibetanQA: Tibetan Dataset for Machine Reading Comprehension

Listed in ScienceDB

This paper constructs a dataset for Tibetan machine reading comprehension.

Description

The data comes from Yunzang website, and covers 12 fields of nature, culture, education, geography, history, life, society, art, technology, people, science and sports. The questions and answers of the dataset are manually entered and marked by 20 Tibetan professionals.

It contains 631 articles, 903 paragraphs, and 2,000 question-and-answer pairs constructed based on the paragraphs. Data items mainly include article ID, title, paragraph, question and answer. The publication of this dataset is of great value for promoting the development of Tibetan information processing. 

Links

Where it is published

Catalogue records · 1

Topics

Inferred from text
Linguistics 69%
Provenance · 1 source records, 11 field assertions
SourceKeyLast seenRaw
ScienceDB10.11922/sciencedb.j00001.003518 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · scidb cnconnector:scidb_cn@1.0.0
concepts[field].anzsrc:group:4704enrichment · scidb cntaxonomy-embedding@1.0.0title+keywords+description (69%)
concepts[field].local:field:earth-environmentalmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:engineeringmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:humanitiesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:life-sciencesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:social-sciencemapping · scidb cnconnector:scidb_cn@1.0.0
descriptionsource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/description
licensesource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/rights
publication_datesource · scidb cnconnector:scidb_cn@1.0.0
titlesource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/title