Pith. sign in

Measuring implicit bias in explicitly unbiased large language models.arXiv preprint arXiv:2402.04105

10 Pith papers cite this work. Polarity classification is still indexing.

10 Pith papers citing it

citation-role summary

background 3

citation-polarity summary

roles

background 3

polarities

background 2 unclear 1

representative citing papers

Reducing Political Manipulation with Consistency Training

cs.CL · 2026-05-21 · unverdicted · novelty 5.0 · 2 refs

PCT is a reinforcement learning approach that trains LLMs for symmetric sentiment and helpfulness across paired opposing political prompts, reducing covert bias while preserving general performance.

First, Do No Harm (With LLMs): Mitigating Racial Bias via Agentic Workflows

cs.CY · 2026-04-20 · unverdicted · novelty 4.0

All five tested LLMs deviated from US race-stratified disease distributions in synthetic case generation, while retrieval-based agentic workflows improved mean p-value by 0.0348, median p-value by 0.1166, and mean difference by 0.0949 for DeepSeek V3 in diagnosis ranking.

citing papers explorer

Showing 10 of 10 citing papers.