{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:Q46LMPYGKFRIZTF272XY34WYBK","short_pith_number":"pith:Q46LMPYG","schema_version":"1.0","canonical_sha256":"873cb63f0651628cccbafeaf8df2d80a8b12377fd93c2febd54e2016d6b30490","source":{"kind":"arxiv","id":"2404.10160","version":6},"attestation_state":"computed","paper":{"title":"Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Aihua Pei, Haoxuan Ma, Haoyu Wang, Jiaqi Huo, Jiaqi Li, Pengliang Ji, Ruoxi Cheng, Shuirong Cao, Zhiqiang Wang","submitted_at":"2024-04-15T22:18:50Z","abstract_excerpt":"Bias in LLMs can harm user experience and societal outcomes. However, current bias mitigation methods often require intensive human feedback, lack transferability to other topics or yield overconfident and random outputs. We find that involving LLMs in role-playing scenario boosts their ability to recognize and mitigate biases. Based on this, we propose Reinforcement Learning from Multi-role Debates as Feedback (RLDF), a novel approach for bias mitigation replacing human feedback in traditional RLHF. We utilize LLMs in multi-role debates to create a dataset that includes both high-bias and low"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2404.10160","kind":"arxiv","version":6},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2024-04-15T22:18:50Z","cross_cats_sorted":[],"title_canon_sha256":"53a4831ca3bf6721002f64d9bd406a42dbb654595e8bf9f3e6066d8e3f21a02f","abstract_canon_sha256":"8f84e13f3480c6a679c958678fde49ff7f10d7511c5b9dc974d8f3975a176293"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:56:04.248805Z","signature_b64":"eCqsfoQBWctssHRBz3fIT7Lp/nLPGFwfhIXPl5wm7S6EnUI81b7d0i/XQpxz0JdS6ZV2sl0ZrK+cx9c4qSntDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"873cb63f0651628cccbafeaf8df2d80a8b12377fd93c2febd54e2016d6b30490","last_reissued_at":"2026-07-05T08:56:04.248378Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:56:04.248378Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reinforcement Learning from Multi-role Debates as Feedback for Bias Mitigation in LLMs","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.AI","authors_text":"Aihua Pei, Haoxuan Ma, Haoyu Wang, Jiaqi Huo, Jiaqi Li, Pengliang Ji, Ruoxi Cheng, Shuirong Cao, Zhiqiang Wang","submitted_at":"2024-04-15T22:18:50Z","abstract_excerpt":"Bias in LLMs can harm user experience and societal outcomes. However, current bias mitigation methods often require intensive human feedback, lack transferability to other topics or yield overconfident and random outputs. We find that involving LLMs in role-playing scenario boosts their ability to recognize and mitigate biases. Based on this, we propose Reinforcement Learning from Multi-role Debates as Feedback (RLDF), a novel approach for bias mitigation replacing human feedback in traditional RLHF. We utilize LLMs in multi-role debates to create a dataset that includes both high-bias and low"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2404.10160","kind":"arxiv","version":6},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2404.10160/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2404.10160","created_at":"2026-07-05T08:56:04.248436+00:00"},{"alias_kind":"arxiv_version","alias_value":"2404.10160v6","created_at":"2026-07-05T08:56:04.248436+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2404.10160","created_at":"2026-07-05T08:56:04.248436+00:00"},{"alias_kind":"pith_short_12","alias_value":"Q46LMPYGKFRI","created_at":"2026-07-05T08:56:04.248436+00:00"},{"alias_kind":"pith_short_16","alias_value":"Q46LMPYGKFRIZTF2","created_at":"2026-07-05T08:56:04.248436+00:00"},{"alias_kind":"pith_short_8","alias_value":"Q46LMPYG","created_at":"2026-07-05T08:56:04.248436+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.29269","citing_title":"HunterAgent: Neuro-Symbolic Attack Trace Reconstruction under Anti-Forensics","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2603.14222","citing_title":"Membership Inference for Contrastive Pre-training Models with Text-only PII Queries","ref_index":37,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK","json":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK.json","graph_json":"https://pith.science/api/pith-number/Q46LMPYGKFRIZTF272XY34WYBK/graph.json","events_json":"https://pith.science/api/pith-number/Q46LMPYGKFRIZTF272XY34WYBK/events.json","paper":"https://pith.science/paper/Q46LMPYG"},"agent_actions":{"view_html":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK","download_json":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK.json","view_paper":"https://pith.science/paper/Q46LMPYG","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2404.10160&json=true","fetch_graph":"https://pith.science/api/pith-number/Q46LMPYGKFRIZTF272XY34WYBK/graph.json","fetch_events":"https://pith.science/api/pith-number/Q46LMPYGKFRIZTF272XY34WYBK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK/action/storage_attestation","attest_author":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK/action/author_attestation","sign_citation":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK/action/citation_signature","submit_replication":"https://pith.science/pith/Q46LMPYGKFRIZTF272XY34WYBK/action/replication_record"}},"created_at":"2026-07-05T08:56:04.248436+00:00","updated_at":"2026-07-05T08:56:04.248436+00:00"}