Constarium
← Search

Table · dataset · 2026

Supplementary file 1_Feedback-driven rule induction and retrieval-augmented bias mitigation for large language models.pdf

Listed in figshare and Loughborough Research Repository — shown once because both records carry DOI 10.3389/frai.2026.1925701.s001

Introduction<p>Large Language Models (LLMs) are becoming widely adopted for reasoning and decision-support tasks, yet they can inherit and reproduce gender-related biases present in their training data.

Description

Most existing bias-mitigation strategies depend on fine-tuning, reinforcement learning, prompt engineering, or interventions during pre-training, requiring either parameter updates or extensive manual prompt design. These requirements limit their applicability when the underlying model is available only as a closed-source or black-box system.</p>Methods<p>This work explores whether bias-mitigation knowledge can instead be separated from the model and reused without altering its parameters.

We propose a feedback-driven external alignment memory framework for post-hoc gender bias mitigation that transforms identified bias into concise corrective rules through an iterative feedback process. These rules are stored independently of the model parameters and are retrieved during inference to influence future responses. Retrieval is performed using cosine-similarity matching between an incoming query and previously stored examples, allowing corrective knowledge to be reused while maintaining complete model independence.</p>Results<p>Evaluation on selected subsets of BBQ, BiasNLI, CoBias, CrowS-Pairs, and WinoBias shows measurable reductions in gender-related bias.

Read the rest (2 more)

In the 120-record evaluation, Gender Assumption (GA) decreases from 15.83 to 7.08%, while Stereotypical Gender Assumption (SGA) decreases from 24.16 to 7.08%. Gender Neutral responses increase from 75.00 to 90.415%, and response quality improves from 4.15 to 4.211. A larger 500-record evaluation further indicates that corrective rules learned earlier continue to provide benefits when applied beyond the original feedback corpus, reducing GA from 13.8 to 12.0% and SGA from 14.4 to 11.0%.

During the same evaluation, Gender Neutral responses increase from 78.6 to 83.2%, while response quality improves from 4.00 to 4.05.</p>Discussion<p>These results indicate that corrective alignment knowledge can be maintained as a reusable external memory and incorporated during inference to improve fairness in black-box large language models without retraining or modifying model parameters.</p>

Links

Where it is published

Catalogue records · 1

Topics

Inferred from text
Artificial intelligence 74%
Provenance · 2 source records, 29 field assertions
SourceKeyLast seenRaw
figshareoai:figshare.com:article/339621169 d agoJSON v1
Loughborough Research Repositoryoai:figshare.com:article/339621169 d agoJSON v1
FieldAssertionExtractorEvidence
access_levelsource · figshare comconnector:figshare_com@1.0.0
concepts[field].anzsrc:group:4602enrichment · figshare comtaxonomy-embedding@1.0.0title+keywords+description (74%)
concepts[field].local:field:astronomymapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:chemistrymapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:chemistrymapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:computer-science-aimapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:computer-science-aimapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:earth-environmentalmapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:earth-environmentalmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:economics-financemapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:economics-financemapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:engineeringmapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:engineeringmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:humanitiesmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:humanitiesmapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:life-sciencesmapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:life-sciencesmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:materials-sciencemapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:mathematics-statisticsmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:medicine-healthmapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:medicine-healthmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:ocean-atmosphericmapping · figshare comconnector:figshare_com@1.0.0
concepts[field].local:field:psychology-behavioralmapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:social-sciencemapping · repository lboro ac ukconnector:repository_lboro_ac_uk@1.0.0
concepts[field].local:field:social-sciencemapping · figshare comconnector:figshare_com@1.0.0
descriptionsource · figshare comconnector:figshare_com@1.0.0/metadata/dc/description
licensesource · figshare comconnector:figshare_com@1.0.0/metadata/dc/rights
publication_datesource · figshare comconnector:figshare_com@1.0.0
titlesource · figshare comconnector:figshare_com@1.0.0/metadata/dc/title