Constarium
← Search

Table · dataset · 2025

Tamazight-Arabic Speech Translation Dataset

Listed in Hugging Face Datasets

Description

Tamazight-Arabic Speech Recognition Dataset This is the Tamazight-NLP organization-hosted version of the Tamazight-Arabic Speech Recognition Dataset. This dataset contains ~15.5 hours of Tamazight (Tachelhit dialect) speech paired with Arabic transcriptions, designed for automatic speech recognition (ASR) and speech-to-text translation tasks. Dataset Details Total Examples: 20,344 audio segments Training Set: 18,309 examples (~8.9GB) Test Set: 2,035 examples (~992MB)… See the full description on the dataset page: huggingface.co/datasets/Tamazight-NLP/Tamazight-Speech-to-Arabic-Text.

Links

Topics

Stated by source
audio · text · translation
Provenance · 1 source records, 11 field assertions
SourceKeyLast seenRaw
Hugging Face DatasetsTamazight-NLP/Tamazight-Speech-to-Arabic-Text12 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · Hugging Faceconnector:huggingface@1.0.0/gated
concepts[field].local:field:computer-science-aimapping · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].hf_modality:audiosource · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].hf_modality:textsource · Hugging Faceconnector:huggingface@1.0.0
concepts[modality].local:modality:audiomapping · Hugging Facevocabulary-mapper@1.0.0keywords['speech']
concepts[task].hf_task:translationsource · Hugging Faceconnector:huggingface@1.0.0/tags[task_categories:*]
created_datesource · Hugging Faceconnector:huggingface@1.0.0
descriptionsource · Hugging Faceconnector:huggingface@1.0.0/description
publication_datesource · Hugging Faceconnector:huggingface@1.0.0
titlesource · Hugging Faceconnector:huggingface@1.0.0/id
updated_datesource · Hugging Faceconnector:huggingface@1.0.0