Constarium
← Search

Data · dataset · 2018

Twitter corpus of Resource-Scarce Languages for Sentiment Analysis and Multilingual Emoji Prediction

Listed in DataCite

This dataset is created by leveraging the social media platforms such as twitter for developing corpus across multiple languages.

Description

The corpus creation methodology is applicable for resource-scarce languages provided the speakers of that particular language are active users on social media platforms. We present an approach to extract social media microblogs such as tweets (Twitter).

We created corpus for multilingual sentiment analysis and emoji prediction in Hindi, Bengali and Telugu. Further, we perform and analyze multiple NLP tasks utilizing the corpus to get interesting observations.

Links

Topics

Inferred from text
Corpus linguistics 76%

Related

Provenance · 1 source records, 11 field assertions
SourceKeyLast seenRaw
DataCite10.6084/m9.figshare.6477782.v312 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · DataCiteconnector:datacite@1.0.0/data/attributes/rightsList
byte_sizesource · DataCiteconnector:datacite@1.0.0
concepts[field].anzsrc:field:470404enrichment · DataCitetaxonomy-embedding@1.1.0title+keywords+description (76%)
concepts[field].fos:computer-and-information-sciencessource · DataCiteconnector:datacite@1.0.0
concepts[field].fos:languages-and-literaturesource · DataCiteconnector:datacite@1.0.0
created_datesource · DataCiteconnector:datacite@1.0.0
descriptionsource · DataCiteconnector:datacite@1.0.0/data/attributes/descriptions
licensesource · DataCiteconnector:datacite@1.0.0/data/attributes/rightsList
publication_datesource · DataCiteconnector:datacite@1.0.0/data/attributes/dates
titlesource · DataCiteconnector:datacite@1.0.0/data/attributes/titles/0/title
updated_datesource · DataCiteconnector:datacite@1.0.0