Constarium
← Search

Data · dataset · 2026

HFV: A Multimodal Singing Dataset for Hehuang Hua'er

Listed in ScienceDB

Hehuang Hua'er is a representative folk singing tradition in northwestern China, integrating oral literature, musical forms, and local cultural memory.

Description

To facilitate the structured preservation and computational analysis of Hehuang Hua'er performance materials, this study presents HFV, a multimodal singing dataset for Hehuang Hua'er. HFV contains 228 multimodal singing samples with a total video duration of 14,301.72 s (approximately 3.97 h), covering 223 unique songs, 72 quling types, 7 sentence patterns, and 9 topic categories.

Each sample consists of a singing video, aligned audio directly extracted from the embedded video track, lyric text, cultural labels, and structured metadata. A unified sample identifier is used to establish sample-level associations among video, audio, text, and cultural attributes. Data quality is evaluated from four aspects: structural completeness, statistical associations between lyrics and cultural labels, basic acoustic analyzability, and the analyzability of singing-related visual information.

Read the rest (1 more)

The results demonstrate that HFV has strong structural integrity and favorable conditions for basic computational analysis, while providing an integrated multimodal representation that links cultural semantics, singing acoustics, and visual performance information. The dataset can support cultural-label modeling, singing-voice acoustic analysis, visual-feature analysis of singing performance, cross-modal retrieval, and multimodal representation learning, and can further provide a multimodal data foundation for virtual singing, audio-driven face generation, and related digital-human research.

Links

Where it is published

Catalogue records · 1

Topics

Inferred from text
Audio 75% · Music 72% · Text 75% · Video 75%
Provenance · 1 source records, 14 field assertions
SourceKeyLast seenRaw
ScienceDB10.57760/sciencedb.0136s8 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · scidb cnconnector:scidb_cn@1.0.0
concepts[field].anzsrc:group:3603enrichment · scidb cntaxonomy-embedding@1.0.0title+keywords+description (72%)
concepts[field].local:field:earth-environmentalmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:engineeringmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:humanitiesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:life-sciencesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:social-sciencemapping · scidb cnconnector:scidb_cn@1.0.0
concepts[modality].local:modality:audioenrichment · scidb cnkeyword-concept-rules@1.0.0title+description (75%)
concepts[modality].local:modality:textenrichment · scidb cnkeyword-concept-rules@1.0.0title+description (75%)
concepts[modality].local:modality:videoenrichment · scidb cnkeyword-concept-rules@1.0.0title+description (75%)
descriptionsource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/description
licensesource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/rights
publication_datesource · scidb cnconnector:scidb_cn@1.0.0
titlesource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/title