{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:F56LKI27C3UA6CG2UW3R7DKAXW","short_pith_number":"pith:F56LKI27","schema_version":"1.0","canonical_sha256":"2f7cb5235f16e80f08daa5b71f8d40bdb88adb96b1bd0ac529e89933c85ac284","source":{"kind":"arxiv","id":"2502.03953","version":2},"attestation_state":"computed","paper":{"title":"Fairness Aware Reinforcement Learning via Proximal Policy Optimization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.MA","authors_text":"Elizabeth Black, Gabriele La Malfa, Jie M. Zhang, Michael Luck","submitted_at":"2025-02-06T10:45:55Z","abstract_excerpt":"Fairness in multi-agent systems (MAS) focuses on equitable reward distribution among agents in scenarios involving sensitive attributes such as race, gender, or socioeconomic status. This paper introduces fairness in Proximal Policy Optimization (PPO) with a penalty term derived from a fairness definition such as demographic parity, counterfactual fairness, or conditional statistical parity. The proposed method, which we call Fair-PPO, balances reward maximisation with fairness by integrating two penalty components: a retrospective component that minimises disparities in past outcomes and a pr"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2502.03953","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.MA","submitted_at":"2025-02-06T10:45:55Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"70c299f46dbe40577df7c74162926b435148f07851104878b66f0b99d1fe17e2","abstract_canon_sha256":"49d1586aa55edab39adf888bf8e47d75996eb17fa26e84420473bce608568716"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:02:40.363069Z","signature_b64":"KgJclxFW5lbJZ1vgYNDXIjOz7zQjjVc3HoQSjNyoPPakHSAvEbnATqvv0rQdevSaceQqxsYyfUtT2lDHRPtCDw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2f7cb5235f16e80f08daa5b71f8d40bdb88adb96b1bd0ac529e89933c85ac284","last_reissued_at":"2026-07-05T12:02:40.362551Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:02:40.362551Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Fairness Aware Reinforcement Learning via Proximal Policy Optimization","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.MA","authors_text":"Elizabeth Black, Gabriele La Malfa, Jie M. Zhang, Michael Luck","submitted_at":"2025-02-06T10:45:55Z","abstract_excerpt":"Fairness in multi-agent systems (MAS) focuses on equitable reward distribution among agents in scenarios involving sensitive attributes such as race, gender, or socioeconomic status. This paper introduces fairness in Proximal Policy Optimization (PPO) with a penalty term derived from a fairness definition such as demographic parity, counterfactual fairness, or conditional statistical parity. The proposed method, which we call Fair-PPO, balances reward maximisation with fairness by integrating two penalty components: a retrospective component that minimises disparities in past outcomes and a pr"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2502.03953","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2502.03953/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2502.03953","created_at":"2026-07-05T12:02:40.362609+00:00"},{"alias_kind":"arxiv_version","alias_value":"2502.03953v2","created_at":"2026-07-05T12:02:40.362609+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2502.03953","created_at":"2026-07-05T12:02:40.362609+00:00"},{"alias_kind":"pith_short_12","alias_value":"F56LKI27C3UA","created_at":"2026-07-05T12:02:40.362609+00:00"},{"alias_kind":"pith_short_16","alias_value":"F56LKI27C3UA6CG2","created_at":"2026-07-05T12:02:40.362609+00:00"},{"alias_kind":"pith_short_8","alias_value":"F56LKI27","created_at":"2026-07-05T12:02:40.362609+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2511.14135","citing_title":"AdaFair-MARL: Enforcing Adaptive Fairness Constraints in Multi-Agent Reinforcement Learning","ref_index":11,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW","json":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW.json","graph_json":"https://pith.science/api/pith-number/F56LKI27C3UA6CG2UW3R7DKAXW/graph.json","events_json":"https://pith.science/api/pith-number/F56LKI27C3UA6CG2UW3R7DKAXW/events.json","paper":"https://pith.science/paper/F56LKI27"},"agent_actions":{"view_html":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW","download_json":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW.json","view_paper":"https://pith.science/paper/F56LKI27","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2502.03953&json=true","fetch_graph":"https://pith.science/api/pith-number/F56LKI27C3UA6CG2UW3R7DKAXW/graph.json","fetch_events":"https://pith.science/api/pith-number/F56LKI27C3UA6CG2UW3R7DKAXW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW/action/storage_attestation","attest_author":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW/action/author_attestation","sign_citation":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW/action/citation_signature","submit_replication":"https://pith.science/pith/F56LKI27C3UA6CG2UW3R7DKAXW/action/replication_record"}},"created_at":"2026-07-05T12:02:40.362609+00:00","updated_at":"2026-07-05T12:02:40.362609+00:00"}