Data · dataset · 2025
Code for Improving Video Caption Accuracy with LLMs
Listed in DaRUS
As part of the IKILeUS project at the University of Stuttgart, research was conducted to explore how Large Language Models (LLMs) can enhance the accuracy and contextual relevance of automatic speech recognition (ASR)-generated captions.
Description
While ASR tools provide a foundation for accessibility, they often produce grammatical errors, misinterpret homophones, and struggle with domain-specific terminology. To address these challenges, experiments were conducted using LLMs such as GPT-3.5 and Llama2-13B to refine and correct captioning errors.
The models were evaluated using standard NLP metrics such as Word Error Rate (WER), BLEU, and ROUGE scores, demonstrating notable improvements in caption accuracy. The findings suggest that LLMs can effectively enhance the readability, coherence, and precision of automatically generated captions, offering a promising direction for improving video accessibility for the Deaf and Hard of Hearing (DHH) community.
Links
Where it is published
- Dataverse dataset page darus.uni-stuttgart.de/dataset.xhtml?persistentId=doi%3A10.18419%2FDARUS-4776 ↗
landing page · from darus uni stuttgart de
- DOI doi.org/10.18419/darus-4776 ↗
DOI / persistent id · from darus uni stuttgart de
Catalogue records · 1
- Dataverse API darus.uni-stuttgart.de/api/datasets/:persistentId/?persistentId=doi%3A10.18419%2FDARU… ↗
metadata API · from darus uni stuttgart de
Topics
- Stated by source
- Computer and Information Science
- Inferred from text
- Artificial intelligence 70% · Audio 65% · Video 75%
Provenance · 1 source records, 10 field assertions
| Source | Key | Last seen | Raw |
|---|---|---|---|
| DaRUS | doi:10.18419/DARUS-4776 | 9 d ago | JSON v1 |
| Field | Assertion | Extractor | Evidence |
|---|---|---|---|
| concepts[field].anzsrc:group:4602 | enrichment · darus uni stuttgart de | taxonomy-embedding@1.1.0 | title+keywords+description (70%) |
| concepts[field].dataverse_subject:computer-and-information-science | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 | /subjects |
| concepts[modality].local:modality:audio | enrichment · darus uni stuttgart de | keyword-concept-rules@1.0.0 | title+description (65%) |
| concepts[modality].local:modality:video | enrichment · darus uni stuttgart de | keyword-concept-rules@1.0.0 | title+description (75%) |
| created_date | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 | |
| description | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 | /description |
| publication_date | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 | |
| title | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 | /name |
| updated_date | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 | |
| version_label | source · darus uni stuttgart de | connector:darus_uni_stuttgart_de@1.0.0 |