Constarium
← Search

Data · dataset · 2024

Experimental dataset for cross-lingual text classification based on sentence vector weighting

Listed in ScienceDB

Description

该实验数据集包含论文中三个实验中使用的数据。数据集 I 整合了 THUCNews、Xinhua.com、国际文传电讯社、法国门户网站 Linternaute 和西班牙报纸 Excélsior,共计 1,610 个文本,是一个四种语言的二元分类数据集。数据集 II 整合了 Xinhua.com、联合通讯社、《世界报》和俄罗斯通讯社 Novosti,共有 2,745 个文本,是一个四种语言的四重分类数据集。数据集III来自多语言公共数据集Reuters RCV1/RCV2。从数据集的中文、德文、法文和丹麦文馆藏中选出仅标有单一类别的文本,即CCAT(企业/工业)、ECAT(经济学)、GCAT(政府/社会)和MCAT(市场)四个类别,共计3,200个文本。

Links

Where it is published

Catalogue records · 1

Topics

Inferred from text
Linguistics 70% · Text 75%
Provenance · 1 source records, 11 field assertions
SourceKeyLast seenRaw
ScienceDB10.57760/sciencedb.j00133.002609 d agoJSON v1
FieldAssertionExtractorEvidence
concepts[field].anzsrc:group:4704enrichment · scidb cntaxonomy-embedding@1.0.0title+keywords+description (70%)
concepts[field].local:field:earth-environmentalmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:engineeringmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:humanitiesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:life-sciencesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:social-sciencemapping · scidb cnconnector:scidb_cn@1.0.0
concepts[modality].local:modality:textenrichment · scidb cnkeyword-concept-rules@1.0.0title+description (75%)
descriptionsource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/description
license_textsource · scidb cnconnector:scidb_cn@1.0.0
publication_datesource · scidb cnconnector:scidb_cn@1.0.0
titlesource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/title