Data · dataset · 2025
CMiLBench: A Hierarchical Multitask Benchmark for Low-Resource Minority Languages in China
Listed in ScienceDB
As large language models (LLMs) continue to advance, they achieve strong performance on high-resource language tasks and show promising potential for low-resource language processing.
Description
However, existing benchmarks primarily focus on high-resource languages, with limited coverage of Chinese minority languages. To address this gap, we introduce CMiLBench (Chinese Minority Language Benchmark), a comprehensive evaluation framework targeting three key Chinese minority languages: Tibetan, Mongolian, and Uyghur.
CMiLBench comprises 17 task categories and 24,663 samples, covering both language understanding and generation. Several tasks are derived from native corpora and culturally grounded content, offering a realistic assessment of model performance in authentic minority language scenarios. Tasks are stratified into five difficulty levels, and evaluation is conducted using both automatic metrics and LLM-as-a-Judge scoring.
Read the rest (1 more)
We evaluate 14 leading commercial and open-source LLMs, demonstrating that CMiLBench serves as a reliable benchmark and is broadly applicable for evaluating LLMs’ capabilities in Chinese minority languages, thereby calibrating current technological progress and advancing research and application development of multilingual models for low-resource languages.
Links
Where it is published
- DOI doi.org/10.57760/sciencedb.29160 ↗
DOI / persistent id · from scidb cn
Catalogue records · 1
- OAI-PMH record scidb.cn/oai?verb=GetRecord&metadataPrefix=oai_dc&identifier=10.57760%2… ↗
metadata API · from scidb cn
Topics
- From keywords
- Computer Science & AI · Earth & Environmental Science · Engineering · Humanities · Life Sciences · Social Science
- Inferred from text
- Artificial intelligence 72%
Provenance · 1 source records, 12 field assertions
| Source | Key | Last seen | Raw |
|---|---|---|---|
| ScienceDB | 10.57760/sciencedb.29160 | 9 d ago | JSON v1 |
| Field | Assertion | Extractor | Evidence |
|---|---|---|---|
| access_level | source · scidb cn | connector:scidb_cn@1.0.0 | |
| concepts[field].anzsrc:group:4602 | enrichment · scidb cn | taxonomy-embedding@1.0.0 | title+keywords+description (72%) |
| concepts[field].local:field:computer-science-ai | mapping · scidb cn | connector:scidb_cn@1.0.0 | |
| concepts[field].local:field:earth-environmental | mapping · scidb cn | connector:scidb_cn@1.0.0 | |
| concepts[field].local:field:engineering | mapping · scidb cn | connector:scidb_cn@1.0.0 | |
| concepts[field].local:field:humanities | mapping · scidb cn | connector:scidb_cn@1.0.0 | |
| concepts[field].local:field:life-sciences | mapping · scidb cn | connector:scidb_cn@1.0.0 | |
| concepts[field].local:field:social-science | mapping · scidb cn | connector:scidb_cn@1.0.0 | |
| description | source · scidb cn | connector:scidb_cn@1.0.0 | /metadata/dc/description |
| license | source · scidb cn | connector:scidb_cn@1.0.0 | /metadata/dc/rights |
| publication_date | source · scidb cn | connector:scidb_cn@1.0.0 | |
| title | source · scidb cn | connector:scidb_cn@1.0.0 | /metadata/dc/title |