Constarium
← Search

Table · dataset · 2025

LusoClin: Dataset of synthetic clinical notes in European Portuguese generated using an open-source large language model, along with prompting and evaluation data

Listed in INESC TEC Research Data Repository

LusoClin is a publicly available dataset of fully synthetic clinical notes in European Portuguese, generated using an open-source large language model and carefully curated prompts.

Description

The dataset simulates realistic clinical narratives while ensuring that no real patient data is included, enabling privacy-preserving research on clinical text retrieval. The primary purpose of LusoClin is to support the development, evaluation, and benchmarking of clinical information retrieval (IR) systems in Portuguese, with a particular focus on European Portuguese, a low-resource language in the clinical domain.

The dataset is designed to enable research on clinical document retrieval, semantic search over electronic health records, patient cohort identification, and domain-specific retrieval model adaptation. To support retrieval-oriented experimentation, LusoClin includes automatically annotated clinical entities, facilitating medical concept indexing and hybrid IR approaches that combine lexical and semantic representations.

Read the rest (1 more)

The dataset can also be used for related information extraction tasks—such as named entity recognition, document classification, and summarization—which often serve as components of clinical IR pipelines. In addition, LusoClin provides a foundation for training, fine-tuning, and evaluating domain-adapted language and retrieval models for Portuguese clinical text. **About the dataset:** XML files comprising 54,518 fully synthetic clinical notes in European Portuguese, divided into 4 types: 14,253 admission notes, 13,561 ambulatory notes, 9,032 discharge summaries, and 17,672 nursing notes; CSV file with prompts and responses from prompt engineering; CSV files with prompts and responses from synthetic dataset generation; TXT files containing 1,000 clinical notes (250 of each type) taken from the synthetic dataset and used during automatic evaluation; TXT files detailing the improvements made to LusoClin's old version, which led to its current version.

Links

Topics

Stated by source
CS: Computer Science
Inferred from text
Text 75%
Provenance · 1 source records, 12 field assertions
SourceKeyLast seenRaw
INESC TEC Research Data Repositoryf46f58ef-0ab8-4c9d-b009-5150ecde01445 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[field].local:field:computer-science-aimapping · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[field].local:field:engineeringmapping · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[field].local:field:medicine-healthmapping · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
concepts[modality].local:modality:textenrichment · rdm inesctec ptkeyword-concept-rules@1.0.0title+description (75%)
concepts[topic].ckan_group:rdm_inesctec_pt:cs-computer-sciencesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
created_datesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
descriptionsource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0/notes
license_textsource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
publication_datesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0
titlesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0/title
updated_datesource · rdm inesctec ptconnector:rdm_inesctec_pt@1.0.0