Text · dataset · 2025
tw-audio
Listed in Hugging Face Datasets
Description
Dataset Card for tw-audio 本資料集收錄臺灣語境下的繁體中文音訊(含說話人音檔與對應轉寫文本),可作為自動語音辨識(ASR)任務之訓練/評測資料;音檔來源為公開可取得之臺灣口音中文語料。 Dataset Details Dataset Description 資料集提供兩種讀取方式: default 設定:以 metadata.jsonl 為入口,並參照 audio/ 目錄下的 wav 檔。 parquet 設定:將音訊與 metadata 一起打包為 parquet shards,方便以 datasets 直接載入。 每筆樣本至少包含一段音訊與對應的轉寫文字,可作為臺灣腔調中文 ASR 模型訓練、Whisper 等模型的微調資料。 Curated by: Huang Liang Hsun Language(s) (NLP): Traditional Chinese(臺灣口音) License: cc-by-nc-sa-4.0 Dataset Sources… See the full description on the dataset page: huggingface.co/datasets/lianghsun/tw-audio.
Links
Get the data
- Hugging Face dataset page huggingface.co/datasets/lianghsun/tw-audio ↗
Gated (manual) - request access on the dataset page
landing page · request access · from Hugging Face
Catalogue records · 1
- Hub API huggingface.co/api/datasets/lianghsun/tw-audio ↗
metadata API · from Hugging Face
Topics
- Stated by source
- audio · automatic speech recognition · tabular · text
- From keywords
- Audio · Computer Science & AI
- Inferred from text
- Artificial intelligence 71%
Provenance · 1 source records, 14 field assertions
| Source | Key | Last seen | Raw |
|---|---|---|---|
| Hugging Face Datasets | lianghsun/tw-audio | 12 d ago | JSON v1 |
| Field | Assertion | Extractor | Evidence |
|---|---|---|---|
| access_level | source · Hugging Face | connector:huggingface@1.0.0 | /gated |
| concepts[field].anzsrc:group:4602 | enrichment · Hugging Face | taxonomy-embedding@1.1.0 | title+keywords+description (71%) |
| concepts[field].local:field:computer-science-ai | mapping · Hugging Face | connector:huggingface@1.0.0 | |
| concepts[modality].hf_modality:audio | source · Hugging Face | connector:huggingface@1.0.0 | |
| concepts[modality].hf_modality:tabular | source · Hugging Face | connector:huggingface@1.0.0 | |
| concepts[modality].hf_modality:text | source · Hugging Face | connector:huggingface@1.0.0 | |
| concepts[modality].local:modality:audio | mapping · Hugging Face | vocabulary-mapper@1.0.0 | keywords['audio'] |
| concepts[task].hf_task:automatic-speech-recognition | source · Hugging Face | connector:huggingface@1.0.0 | /tags[task_categories:*] |
| created_date | source · Hugging Face | connector:huggingface@1.0.0 | |
| description | source · Hugging Face | connector:huggingface@1.0.0 | /description |
| license | source · Hugging Face | connector:huggingface@1.0.0 | /tags[license:*] |
| publication_date | source · Hugging Face | connector:huggingface@1.0.0 | |
| title | source · Hugging Face | connector:huggingface@1.0.0 | /id |
| updated_date | source · Hugging Face | connector:huggingface@1.0.0 |