Constarium
← Search

Data · dataset · 2026

CC-Bench

Listed in ScienceDB

This dataset (CC-Bench) is a multilingual parallel benchmark designed to probe the knowledge boundaries of large language models.

Description

It integrates the multilingual alignment features of the MKQA dataset with the high-quality, human-annotated question-answering pairs from the TyDi QA dataset, utilizing its "unanswerable" labels to distinguish between known and unknown question sets. The benchmark comprises 10,000 cross-domain evaluation samples spanning fields such as sports, history, and basic medicine, and is further categorized into factual and text-based subsets.

It is primarily used to quantify cross-lingual semantic stability, supporting cognitive boundary detection, retrieval-augmented gating optimization, and hallucination mitigation in black-box scenarios.

Links

Where it is published

Catalogue records · 1

Topics

Inferred from text
Linguistics 71%
Provenance · 1 source records, 10 field assertions
SourceKeyLast seenRaw
ScienceDB10.57760/sciencedb.j00133.006908 d agoJSON v1
FieldAssertionExtractorEvidence
concepts[field].anzsrc:group:4704enrichment · scidb cntaxonomy-embedding@1.0.0title+keywords+description (71%)
concepts[field].local:field:earth-environmentalmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:engineeringmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:humanitiesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:life-sciencesmapping · scidb cnconnector:scidb_cn@1.0.0
concepts[field].local:field:social-sciencemapping · scidb cnconnector:scidb_cn@1.0.0
descriptionsource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/description
license_textsource · scidb cnconnector:scidb_cn@1.0.0
publication_datesource · scidb cnconnector:scidb_cn@1.0.0
titlesource · scidb cnconnector:scidb_cn@1.0.0/metadata/dc/title