{"as_of":"2026-08-07T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85664de9a1d4364f285d0acfbbd75adaa3048381fc2ce639da58c1a3141ab6dd","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:16:36.596455Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:04:43.641141Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11344","snapshot_observed_at":"2026-08-03T03:04:43.641141Z","title":"Guiding llm decision- making with fairness reward models.arXiv preprint arXiv:2507.11344,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-03T07:10:48.024369Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.641141Z"},"links":{"cited_paper":"/paper/2507.11344","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:3c493d76437cbd69ff5b096bd3a3ecb284109663133c242b512f97fd182eb270","observation_id":"9610f636-a3ec-4be5-8de9-6de0de29ed12","resolution":{"observed_at":"2026-08-03T03:04:43.641141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.11344/citation-record","integrity":"/paper/2507.11344/integrity","json":"/paper/2507.11344/citation-record.json","paper":"/paper/2507.11344"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.15281","last_updated":"2024-03-22T15:23:19Z","snapshot_observed_at":"2026-07-06T17:49:03.650707Z","submitted_at":"2024-03-22T15:23:19Z","title":"Measuring Gender and Racial Biases in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15281","snapshot_observed_at":"2026-08-06T17:16:32.884393Z","title":"Measuring gender and racial biases in large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:32.884393Z"},"links":{"cited_paper":"/paper/2403.15281","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:bac64127f863224b2b2535f3c92161a03a2e1212684da84926940dc80cd089ce","observation_id":"cc0a3585-45aa-400c-838d-eacbb62a00c1","resolution":{"observed_at":"2026-08-06T17:16:32.884393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.870461Z","title":"Machine bias","venue":null,"work_id":"e30746bb-c3ed-4e11-9764-014098d12245","year":2016},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:32.959005Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:d136eb7d6e0d5bf7da82fa90c39dc8a782d911c423126fb1dd5a5a66c2c3a2b2","observation_id":"4590bfba-9322-4d44-873f-0f74b1f7c85a","resolution":{"observed_at":"2026-08-06T17:16:40.945369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T17:16:33.065618Z","title":"Bowman, Zac Hatfield-Dodds, Ben Mann, Dario Amodei, Nicholas Joseph, Sam McCandlish, Tom Brown, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.065618Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:28ad13dbf3adb25a29e5769649547e3cf5167700c06289b1d2674294bc65d6e9","observation_id":"6913c2f1-197a-417e-ad0d-12708f06defb","resolution":{"observed_at":"2026-08-06T17:16:33.065618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.665170Z","title":"Fairness and Machine Learning","venue":null,"work_id":"0134028d-b6d6-4484-8874-852e0ab48dce","year":2019},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.157482Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:f207f063fd768809a48c92bcb59e58f72b2e6eccc031dbaaf6342647f810038e","observation_id":"bef5e4b2-8799-4ec8-9c16-6493857ec85b","resolution":{"observed_at":"2026-08-06T17:16:40.754525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.257599Z","title":"Scaling test-time compute with open models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.257599Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:ad06f101009a5d132dadb79f10951860acda20a3f1de3a555726341ce69cdc2d","observation_id":"3eb81b7a-0873-4112-a139-5ff3577d6dc2","resolution":{"observed_at":"2026-08-06T17:16:33.257599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.528042Z","title":"On the dangers of stochastic parrots: Can language models be too big? In Proceedings of the 2021 ACM conference on fairness, accountability, and transparency, 2021","venue":null,"work_id":"1bb2eb08-6139-4a5e-8bd9-c671f75f0b32","year":2021},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.326485Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:22df187fc667efc9d4b5dbf0ce4685e71886f907977501006e3f85ae90d7e3bb","observation_id":"c4fe649e-1b8b-4dc1-89ca-8e56190bfcda","resolution":{"observed_at":"2026-08-06T17:16:40.598198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-06T17:16:33.404516Z","title":"Red-teaming large language models using chain of utterances for safety-alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.404516Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b401af11baaf3dffaf8a7a03f8fdeaab45926c4ffedc7695ec5fe24055b969e9","observation_id":"dc893af8-465b-4303-8687-e6e0658b8567","resolution":{"observed_at":"2026-08-06T17:16:33.404516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8560.33175","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.442680Z","title":"Nuanced metrics for measuring unintended bias with real data for text classification","venue":null,"work_id":"4dc3e92e-cfcc-42af-99ca-336cb406b300","year":2019},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.483416Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b7913e2149c295d08df72147d2e2e927dc22b2fe5d8f947d58af1353d2dcd4e2","observation_id":"92d27a1c-2a61-4ff2-90cc-dfa72e7dab6e","resolution":{"observed_at":"2026-08-06T17:16:37.508219Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21787","last_updated":"2024-12-30T19:03:24Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:57:25Z","title":"Large Language Monkeys: Scaling Inference Compute with Repeated Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21787","snapshot_observed_at":"2026-08-06T17:16:33.556042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.556042Z"},"links":{"cited_paper":"/paper/2407.21787","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:11c3bbacb9828b719c60acb565075f3b974ea4f0d27fe50e29eb3f4be9f9059a","observation_id":"4262d806-a84a-47fd-b2a0-ee476739ab06","resolution":{"observed_at":"2026-08-06T17:16:33.556042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.353588Z","title":"Alphamath almost zero: Process supervision without process","venue":null,"work_id":"9b35d276-2bea-4db7-b525-162ee5b899f4","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.639423Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:ad6dfaee7242c61c8938e436459eb0a91ea2c58ddc76ac819ff10e1f15287f53","observation_id":"239b4c31-6913-46f3-9ac9-11e8803335b2","resolution":{"observed_at":"2026-08-06T17:16:40.391505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:40.160346Z","title":"Fair prediction with disparate impact: A study of bias in recidivism prediction instruments","venue":null,"work_id":"3a701644-771a-4735-a243-9648e643859c","year":2017},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.697395Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:37d674efc151bd87c490a3cf302291b4d80e673a8e543595efc7dbb7d780f93c","observation_id":"dbf97b6b-53b1-4d69-a55f-9a8f909d4e79","resolution":{"observed_at":"2026-08-06T17:16:40.258768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.731709Z","title":"Bias in bios: A case study of semantic representation bias in a high-stakes setting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.731709Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:4d4b80dd3e9e4fa72041d1b36a654dd8f465037795e855334f07400f668ee404","observation_id":"343f7e75-8f04-4cd2-94e2-ecf33192fb98","resolution":{"observed_at":"2026-08-06T17:16:33.731709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.808567Z","title":"Evaluation of A frican A merican language bias in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.808567Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:482a0e765df7e83e5896c1b089caf92f6f29718b9af43657cdf5548723f24e21","observation_id":"00a43689-dcc9-4192-bb08-549b22fc27af","resolution":{"observed_at":"2026-08-06T17:16:33.808567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.964552Z","title":"The accuracy, fairness, and limits of predicting recidivism","venue":null,"work_id":"5652172f-0cec-47d1-9b3c-6f72e1eed965","year":2018},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.911279Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:d6498a85e80442e7e42e4583e281c245f0893cf457e05aae6e859824987ef1f9","observation_id":"f03e6d9e-b996-492b-aec9-b8026dcf5c23","resolution":{"observed_at":"2026-08-06T17:16:40.061471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:33.978846Z","title":"Gaebler, Sharad Goel, Aziz Huq, and Prasanna Tambe","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:33.978846Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:21e5f6296116f0837c7d97db403ddbda471508004c1bae200fa91bc9de2f9030","observation_id":"b10125fd-8937-4a2b-992b-c60ee033dfe7","resolution":{"observed_at":"2026-08-06T17:16:33.978846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.020800Z","title":"Gallegos, Ryan A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.020800Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:21daa8e31dd8c77d62fcd66b50c7de890cab1e30d198abfbd074682c35a53072","observation_id":"0451b8b3-e928-4242-98f0-b59fb8bd9c21","resolution":{"observed_at":"2026-08-06T17:16:34.020800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.109032Z","title":"Debiasing pre-trained language models via efficient fine-tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.109032Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:7025491447ff461fc0b7932c8200d212384b62a41b5713a411d7439b1759fb25","observation_id":"a90cb941-9963-4151-ac92-b617a720e87a","resolution":{"observed_at":"2026-08-06T17:16:34.109032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10915","last_updated":"2026-05-01T02:07:46Z","snapshot_observed_at":"2026-07-06T19:51:28.494860Z","submitted_at":"2024-11-16T23:54:53Z","title":"Bias in Large Language Models: Origin, Evaluation, and Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10915","snapshot_observed_at":"2026-08-06T17:16:34.192370Z","title":"Bias in large language models: Origin, evaluation, and mitigation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.192370Z"},"links":{"cited_paper":"/paper/2411.10915","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:396abfe95ddce92cb987748182339476078341a0242885aafc24487b862e8806","observation_id":"7b79ff65-f079-4643-808a-ac6998336767","resolution":{"observed_at":"2026-08-06T17:16:34.192370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.720392Z","title":"Equality of opportunity in supervised learning","venue":null,"work_id":"5ec2627d-a177-4468-a8d3-3e55b003f5bb","year":2016},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.276605Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:a718ec0736dc60c4e76b49edf9f142ca6e2c0847a0cc29660f3061fb97dddabf","observation_id":"bd06d18d-8403-4b1c-ab91-237c5b3ab031","resolution":{"observed_at":"2026-08-06T17:16:39.817344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.484224Z","title":"V- ST ar: Training verifiers for self-taught reasoners","venue":null,"work_id":"5cf1bda8-63d4-4df9-ad66-8e7955c0f888","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.383923Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:1f7786bd10c3aa32e98c621cc9e7d9d8c234f598d11ffd345eca651cbce280c6","observation_id":"38241025-f83b-4642-b5c0-b8ff424c9674","resolution":{"observed_at":"2026-08-06T17:16:39.593074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17218","last_updated":"2025-08-22T05:59:31Z","snapshot_observed_at":"2026-07-06T18:05:59.538624Z","submitted_at":"2024-04-26T07:46:29Z","title":"Prompting Techniques for Reducing Social Bias in LLMs through System 1 and System 2 Cognitive Processes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.17218","snapshot_observed_at":"2026-08-06T17:16:34.481000Z","title":"Prompting techniques for reducing social bias in llms through system 1 and system 2 cognitive processes, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.481000Z"},"links":{"cited_paper":"/paper/2404.17218","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:5ddfbee357c826aa8eef6e43ef6b07158597eda0d7634f99de044bb282996c79","observation_id":"947a5ebd-3ab4-4f84-bdae-3aba1c02254e","resolution":{"observed_at":"2026-08-06T17:16:34.481000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15585","last_updated":"2024-01-28T06:50:10Z","snapshot_observed_at":"2026-08-04T20:46:47.002631Z","submitted_at":"2024-01-28T06:50:10Z","title":"Evaluating Gender Bias in Large Language Models via Chain-of-Thought Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15585","snapshot_observed_at":"2026-08-06T17:16:34.600067Z","title":"Evaluating gender bias in large language models via chain-of-thought prompting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.600067Z"},"links":{"cited_paper":"/paper/2401.15585","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:93824528f8145ed5c3a0f51a0836514e7e0f842f7d80c77aacfc0aedef0d7768","observation_id":"2332d80b-b2c0-4c99-a2ea-c78009ee6401","resolution":{"observed_at":"2026-08-06T17:16:34.600067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.308564Z","title":"Gender bias and stereotypes in large language models","venue":null,"work_id":"0f48f451-79e5-4c0a-84d0-e4b6c235b161","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.673173Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b3090dda4cb80381d443a20ba38da612808641c66a0a03419d75b51c001782ad","observation_id":"a4162730-f66a-4fd6-a73f-a2ff60492451","resolution":{"observed_at":"2026-08-06T17:16:39.391977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.751145Z","title":"When do pre-training biases propagate to downstream tasks? a case study in text summarization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.751145Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:f92080e4c3714addf1ebce0e4e856a44bb687ce3a8df6a004af1c604a7a2889d","observation_id":"53e20214-70cc-4ab7-9c6c-fc3770a5e16d","resolution":{"observed_at":"2026-08-06T17:16:34.751145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.831656Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.831656Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:8b531bc756dc61b2d4a077c34c0db059ee3bec3183f0040ce7c9d3dcb8202cf0","observation_id":"be259f34-6ba6-4adb-8604-6aafe16ff023","resolution":{"observed_at":"2026-08-06T17:16:34.831656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:34.904157Z","title":"Debiasing large language models with structured knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.904157Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:d53196b6de66dff679ff49bf0a4ca96be7d49a85b19625a9a1fa9775214af400","observation_id":"190bf357-95f7-4a39-aaa5-303b39125cf7","resolution":{"observed_at":"2026-08-06T17:16:34.904157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:39.102241Z","title":"Fairness-guided few-shot prompting for large language models","venue":null,"work_id":"85667f45-38b6-432f-9234-00d5d6e09066","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:34.978458Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:3531930c5ec749acaeaad284100cb044eb6426f46e6d9ba83957b59b12fb8578","observation_id":"2598aec9-9663-4997-98ea-eabef42f61dc","resolution":{"observed_at":"2026-08-06T17:16:39.143969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03537","last_updated":"2024-12-04T18:32:42Z","snapshot_observed_at":"2026-08-05T10:30:35.588186Z","submitted_at":"2024-12-04T18:32:42Z","title":"Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models","version":1},"cited_work":{"arxiv_id":"2412.03537","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03537","snapshot_observed_at":"2026-08-06T17:16:37.099185Z","title":"Evaluating Gender Bias Transfer between Pre-trained and Prompt-Adapted Language Models","venue":"cs.CL","work_id":"b5484507-8e76-499e-83be-e21e12eee761","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.106211Z"},"links":{"cited_paper":"/paper/2412.03537","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:e8abdb9777d286efc3e35793888ee24c33168e1f56bb2942184a16f797602a76","observation_id":"9462b191-baa9-4f9c-94b9-b23826ce9b3b","resolution":{"observed_at":"2026-08-06T17:16:37.148249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:16:35.181824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.181824Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:1cde5e8a5af01e7a6c0fdf75cea372ca54c8d2fc3c34cce9ab989d7c91ee2453","observation_id":"859b9ccb-1d88-421a-a44e-d564ed349bdf","resolution":{"observed_at":"2026-08-06T17:16:35.181824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.257114Z","title":"Bias in word embeddings","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.257114Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:24fd418c780cf227ebc4d6c6037c8ecab0e79f98299fe318d664c26d9bfdb532","observation_id":"783d5837-a48e-499d-a173-cb7bbc3cbe03","resolution":{"observed_at":"2026-08-06T17:16:35.257114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.331592Z","title":"BBQ : A hand-built bias benchmark for question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.331592Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:63954e05d7f21a9a57e0d7dcc16179b4ae1d1ae212314d7dffe40cdb659e9360","observation_id":"9e44a4c7-fa98-46e4-9acf-a30085eee4c7","resolution":{"observed_at":"2026-08-06T17:16:35.331592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.390548Z","title":"Divine LL a MA s: Bias, stereotypes, stigmatization, and emotion representation of religion in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.390548Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:64bfce3e788534e43c1bbd10fcb513e37a7bf0ff3b9434a16300ed29be73cdd9","observation_id":"9cc90f10-3013-4f17-84e3-a0c5d69a5fa5","resolution":{"observed_at":"2026-08-06T17:16:35.390548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T17:16:35.420119Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.420119Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:7037051d9de73781588ad09d92dd2661231c173b4b55fc70d371a6d14224394f","observation_id":"4ffbd460-dc6e-49e7-ad19-a74ea5f316da","resolution":{"observed_at":"2026-08-06T17:16:35.420119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.468808Z","title":"On second thought, let ' s not think step by step! bias and toxicity in zero-shot reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.468808Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:e8bcb4703c46e393ae08863d9282fcc3a6ac9d62f6eb85d501c871e63bbc63cd","observation_id":"e61e2c6e-e099-4736-b1a5-13274a76cb76","resolution":{"observed_at":"2026-08-06T17:16:35.468808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T17:16:35.536089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.536089Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:9dc6694b23f83868b2dbad253e61459258cbeaec4328e260344489262cf255f6","observation_id":"245ea5f8-203a-4e87-bff7-c98f74010643","resolution":{"observed_at":"2026-08-06T17:16:35.536089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.586343Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.586343Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:a6f1f5c80d1109b813f0b6da629a6d74fb15e09aab050f1c990f6697fdad0912","observation_id":"030d9034-1f56-404f-8756-deceb6222eda","resolution":{"observed_at":"2026-08-06T17:16:35.586343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09162","last_updated":"2023-08-31T20:02:47Z","snapshot_observed_at":"2026-08-04T11:25:28.135361Z","submitted_at":"2023-07-18T11:38:45Z","title":"Unveiling Gender Bias in Terms of Profession Across LLMs: Analyzing and Addressing Sociological Implications","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09162","snapshot_observed_at":"2026-08-06T17:16:35.620778Z","title":"Unveiling gender bias in terms of profession across llms: Analyzing and addressing sociological implications, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.620778Z"},"links":{"cited_paper":"/paper/2307.09162","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:4b28fce23f50e0f90ae1bed8fe2e0bdb3606dd74a2259e7cb2343069233b87cd","observation_id":"95250af8-c97c-46be-a444-562177b8bedc","resolution":{"observed_at":"2026-08-06T17:16:35.620778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.820453Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing","venue":null,"work_id":"74f5370d-8dcf-428f-b0f6-234577fc4cee","year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.716278Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:63273f509c9122a607bdcefe1c937912198bfa20aa51579893e4647dedf871d8","observation_id":"8608611d-f52e-4665-9817-335e646aebb2","resolution":{"observed_at":"2026-08-06T17:16:38.931655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T17:16:35.783003Z","title":"Llama 2: Open foundation and fine-tuned chat models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.783003Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:e01fe26dd586fde962fba618638c8a7f7bf02ae22aeff059aba5e5a27e2d1791","observation_id":"d7875b3e-8f1c-4a5f-8efc-69c0403a9a3d","resolution":{"observed_at":"2026-08-06T17:16:35.783003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.621465Z","title":null,"venue":null,"work_id":"443e1693-a754-401d-9f54-03ba78273a28","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.833352Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:c5721d9fd397f9025ce53b5daf0ff42525a2b8e2053f5f8f09efeda0419453ba","observation_id":"6c9db766-0caa-4e05-9fec-c551aea0eb4b","resolution":{"observed_at":"2026-08-06T17:16:38.742876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-06T17:16:35.915640Z","title":"Solving math word problems with process- and outcome-based feedback, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.915640Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:31fabbf0035e4b8ec02ef2e87d2b0cd587767a90b66ee39f1459690d60fb8b2d","observation_id":"3dc15b25-52bb-478c-806a-b86504c164a0","resolution":{"observed_at":"2026-08-06T17:16:35.915640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:35.989318Z","title":"``kelly is a warm person, joseph is a role model'': Gender biases in LLM -generated reference letters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:35.989318Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:b180c005a46efe2ad52272cc789126ffd63fca006e79f9702263c12df95fbd0e","observation_id":"b12e44ce-f502-4ebc-bb0c-56257c9e3fd6","resolution":{"observed_at":"2026-08-06T17:16:35.989318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.352626Z","title":"Alphazero-like tree-search can guide large language model decoding and training","venue":null,"work_id":"53f19deb-5979-48d0-bf48-993b29bd705f","year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.045452Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:4d7771ce2f7846590ffdb4946e9214726eccf6511be189736e5358835619c08b","observation_id":"29756c0c-8d77-4321-9d5a-05cec139544b","resolution":{"observed_at":"2026-08-06T17:16:38.444517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:36.088433Z","title":"Math-shepherd: Verify and reinforce LLM s step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.088433Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:3e3d8d1b94c61fa979cc320da2c01c181f1d3af2968b6740f72da8938e0ee144","observation_id":"e181325b-299b-43e9-bb30-c8b23d172bf4","resolution":{"observed_at":"2026-08-06T17:16:36.088433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:36.146401Z","title":"Chi, Sharan Narang, Aakanksha Chowdhery, and Denny Zhou","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.146401Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:dfd8cfa0f3ebcf1c52e0a90523f974b011c6ee27194ad2c44e261dfd042d9439","observation_id":"7c31743d-7da5-4686-854c-00a05a8c5382","resolution":{"observed_at":"2026-08-06T17:16:36.146401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:36.231787Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.231787Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:88275b18cdc050d6e893db8155dc57df891612a7e923b45ae8464eee8221082e","observation_id":"772ded21-26f9-4b76-b258-59b652fba045","resolution":{"observed_at":"2026-08-06T17:16:36.231787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:38.189489Z","title":"Blueprint for an ai bill of rights: Making automated systems work for the american people, 2022","venue":null,"work_id":"7a48c1f9-417d-430f-8e7a-0aeac150a889","year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.304543Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:d0aaa37b79a98300f14f738ceae78b15fefaeffb84514622c3ec36ef23e64214","observation_id":"88bccc54-0090-4147-bc83-1e6642df3a25","resolution":{"observed_at":"2026-08-06T17:16:38.256514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.956377Z","title":"Gender, Race, and Intersectional Bias in Resume Screening via Language Model Retrieval, page 1578–1590","venue":null,"work_id":"06ddd081-1c06-4470-972b-339ea2faf970","year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.347103Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:248608bb539917d721aedd705281035badb3cb812f68d8c73146cf82bc66f717","observation_id":"c54b5ecf-f6f7-4f39-9b13-2616c96509ba","resolution":{"observed_at":"2026-08-06T17:16:38.048677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.853744Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"ca7a0f0c-3399-4eef-90c2-e817193e9e17","year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.376580Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:cbb16469169cf66b4bce1ce599ecb2ce13e594ae464889a118078ab786b4e47b","observation_id":"1d5547e0-35a6-46fd-99a2-8b8afe9eff28","resolution":{"observed_at":"2026-08-06T17:16:37.868649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-06T17:16:36.465705Z","title":"Scaling relationship on learning mathematical reasoning with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.465705Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:f820411a0fb57a1c732c19a0c43cc711067b260bb78ac0770b65004c97c55217","observation_id":"cb3dabd6-abbe-4d12-8f41-a7466d145002","resolution":{"observed_at":"2026-08-06T17:16:36.465705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.730858Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":"ac374e11-3b44-4833-9b91-65cdd9314235","year":2022},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.543036Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:56b9df151293722401d358d04f356c5951e0d00e5f87439e7e1d801d871d5b7d","observation_id":"2b9ef331-a297-4a24-8175-a6f9d936f503","resolution":{"observed_at":"2026-08-06T17:16:37.780741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:16:37.639239Z","title":"Towards effective discrimination testing for generative ai","venue":null,"work_id":"c1304d49-0717-4151-a4bc-a7b48c849d17","year":2025},"citing_paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:16:36.596455Z"},"links":{"citing_paper":"/paper/2507.11344"},"observation_digest":"sha256:f232a7c260c0a1a4907b83d68b1a087e1bd0652a8aa95045a5c99a97d21c0eb4","observation_id":"a49fec15-69e9-48ca-ac85-03ab78d9f5f8","resolution":{"observed_at":"2026-08-06T17:16:37.675829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.11344","last_updated":"2025-07-15T14:20:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T17:07:52.860515Z","submitted_at":"2025-07-15T14:20:23Z","title":"Guiding LLM Decision-Making with Fairness Reward Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 1 inbound Pith citation observation for arXiv:2507.11344."}