{"as_of":"2026-08-08T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f40bb5d9f8c1f247b35aa07882352aa9ed6aebf8f4c611087948faf67680bea","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:09:53.635786Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T15:09:53.635786Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking.arXiv preprint arXiv:2312.09244, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:53.635786Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:887fc9948ab1a87b9e84341d730c806d031c0b57c789c082e08d3561cf8e8a9c","observation_id":"f9169d0a-e4b5-4e96-b42f-62d01dd8571c","resolution":{"observed_at":"2026-08-07T15:09:53.635786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T14:42:26.655153Z","title":"arXiv preprint arXiv:2312.09244","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17897","last_updated":"2025-05-23T13:44:59Z","snapshot_observed_at":"2026-08-07T14:36:04.064380Z","submitted_at":"2025-05-23T13:44:59Z","title":"T2I-Eval-R1: Reinforcement Learning-Driven Reasoning for Interpretable Text-to-Image Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:42:26.655153Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.17897"},"observation_digest":"sha256:2566f17daa1aff1c328f5803a0a580c3f2adbd915adc81b9de1bbbb24218947f","observation_id":"fbe83929-5b8f-41df-8304-74f43f8010da","resolution":{"observed_at":"2026-08-07T14:42:26.655153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T14:11:30.866015Z","title":"Helping or herding? re- ward model ensembles mitigate but do not eliminate re- ward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-08T09:59:11.314701Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.866015Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:cafcb2bc60ae8cc8b368cf986ca053f8a20727c7ef062ae15e82ddddc831be93","observation_id":"39000e2c-02cc-43e3-bb45-c39de069dde3","resolution":{"observed_at":"2026-08-07T14:11:30.866015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T14:01:04.764200Z","title":"Helping or herd- ing? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-07T13:49:33.928724Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:04.764200Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:ae8772aaf6958a69a6cb0329127b94bb1e070717d6e467a591dc6615a71a2a05","observation_id":"85ccfc5b-4c63-4600-9e91-6f20604f8e6a","resolution":{"observed_at":"2026-08-07T14:01:04.764200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T11:04:06.833906Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.833906Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:9e50b0d74f58679238e6387d2a0d7b69392890a53ec372e0da1af6d6f799f301","observation_id":"3caeb390-76d5-4292-abbc-7d1102c841bb","resolution":{"observed_at":"2026-08-07T11:04:06.833906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T21:02:42.365297Z","title":"Pfohl, Deepak Ramachandran, Peter Shaw, and Jonathan Berant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01368","last_updated":"2025-07-02T05:10:29Z","snapshot_observed_at":"2026-08-07T10:10:33.545000Z","submitted_at":"2025-07-02T05:10:29Z","title":"Activation Reward Models for Few-Shot Model Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:02:42.365297Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.01368"},"observation_digest":"sha256:b66b2581330b8ddadbbd859dbf96bd1ca998c6724eb0424283249abe316c9262","observation_id":"0b8325f5-f3fe-49db-925f-63231a3714a4","resolution":{"observed_at":"2026-08-06T21:02:42.365297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T19:28:54.348620Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-08T15:26:44.713063Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:54.348620Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:2f017fdb43559a22998dbeeb4016bb0e2e21fae11274b0eabde30e173115d704","observation_id":"3366544c-778c-497b-a6c4-f82a7b6c2df9","resolution":{"observed_at":"2026-08-06T19:28:54.348620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2507.06419","last_updated":"2026-06-04T20:44:16Z","snapshot_observed_at":"2026-08-06T19:02:44.982053Z","submitted_at":"2025-07-08T21:56:33Z","title":"Teach a Reward Model to Correct Itself: Reward Guided Adversarial Failure Discovery for Robust Reward Modeling","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-19T05:16:22.274580Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.06419"},"observation_digest":"sha256:9c7c46af8b8e10d91934ce4bcf710da6010d81f92339e91b7501115aa1d6f9c6","observation_id":"1fb147b1-feb1-4f5e-ab42-0d89a6116e3c","resolution":{"observed_at":"2026-05-19T05:17:05.782526Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T18:51:28.145339Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-08T11:06:36.428118Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:28.145339Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:4611a18cfa5823f14e448c0b8b3d9a1e5be7b4f4b115631a5fbf911369a84a63","observation_id":"2eceda81-b0f9-4057-8cee-6fd326be5e8f","resolution":{"observed_at":"2026-08-06T18:51:28.145339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T17:21:35.194359Z","title":"Heller, Stephen Pfohl, Deepak Ramachandran, Pe- ter Shaw, and Jonathan Berant","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11155","last_updated":"2025-07-15T10:04:27Z","snapshot_observed_at":"2026-08-06T17:12:51.246126Z","submitted_at":"2025-07-15T10:04:27Z","title":"Bridging the Gap in Vision Language Models in Identifying Unsafe Concepts Across Modalities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:21:35.194359Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.11155"},"observation_digest":"sha256:7d1cb1f2892224fba336019fa70df648d781d2d14941ac7832eb2ffd51defd46","observation_id":"1936df79-e57c-42bc-a82a-46f309452a11","resolution":{"observed_at":"2026-08-06T17:21:35.194359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2507.15698","last_updated":"2026-05-19T07:11:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T15:07:59Z","title":"CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T23:24:43.556606Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.15698"},"observation_digest":"sha256:b1de84bb0475ec8b589ba36b63b5de0a38130d562193c02904082961206d7b71","observation_id":"9d88245e-cb38-489a-962f-89e09abc6976","resolution":{"observed_at":"2026-05-21T23:25:45.324401Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-06T15:40:14.278132Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-08T08:50:14.371298Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:14.278132Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:2788d2b662537ddbb00d9e6cecf5675ab90a418ed0fe85635c8dc99d5e4eb28d","observation_id":"d2b52343-ad36-4d03-85ab-8d46ab45da4f","resolution":{"observed_at":"2026-08-06T15:40:14.278132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2509.03403","last_updated":"2026-05-15T21:29:46Z","snapshot_observed_at":"2026-07-06T22:23:00.681940Z","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-21T22:38:57.833414Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2509.03403"},"observation_digest":"sha256:090a9dc08a912298c5d508c5137bdf6a91afcc9dc5f661cff3fca8b8dbcddcbb","observation_id":"d33daff4-48b0-4d19-ad27-e641f2b9cd80","resolution":{"observed_at":"2026-05-21T22:40:43.264520Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2601.21350","last_updated":"2026-05-16T02:45:10Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:45Z","title":"Factored Causal Representation Learning for Robust Reward Modeling in RLHF","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T14:18:33.768962Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2601.21350"},"observation_digest":"sha256:890909a47056bdf373de450c77aac970bc8516543d8f6ae32a8207870e1d16b0","observation_id":"2209bca8-a672-4f0c-963f-839ffae29ba4","resolution":{"observed_at":"2026-05-21T14:20:13.678202Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-03T03:04:43.502437Z","title":"Helping or herding? reward model ensembles mitigate but do not eliminate reward hacking.arXiv preprint arXiv:2312.09244,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.502437Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:bec8107db81c777211dd78b29134f88f913c6412790ce17ac8405b4d8de63269","observation_id":"53c188b7-ccb1-488a-a157-1e3c3af0e5bf","resolution":{"observed_at":"2026-08-03T03:04:43.502437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2604.02686","last_updated":"2026-04-03T03:30:34Z","snapshot_observed_at":"2026-08-02T18:52:24.780545Z","submitted_at":"2026-04-03T03:30:34Z","title":"Beyond Semantic Manipulation: Token-Space Attacks on Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T20:29:31.354743Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2604.02686"},"observation_digest":"sha256:2156f9cccec0d6678d85ea27631dca1f97ce72ed118388f999eb7d08562adf0d","observation_id":"d1462243-f2f0-4201-a5d6-c14fc88c3639","resolution":{"observed_at":"2026-05-13T20:33:16.862524Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2604.18547","last_updated":"2026-04-20T17:40:33Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:40:33Z","title":"FUSE: Ensembling Verifiers with Zero Labeled Data","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T03:39:25.678190Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2604.18547"},"observation_digest":"sha256:11e9e84c9ad66c63d82618b431d47e4490f83664802cd1bcfc343c8fb368ccfb","observation_id":"647e0a61-a9b6-445e-b119-5b1e41c6d209","resolution":{"observed_at":"2026-05-11T12:26:09.053345Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2604.19193","last_updated":"2026-04-21T08:04:02Z","snapshot_observed_at":"2026-08-02T22:05:18.077263Z","submitted_at":"2026-04-21T08:04:02Z","title":"How Far Are Video Models from True Multimodal Reasoning?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:44:52.920816Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2604.19193"},"observation_digest":"sha256:7e6f1613191952da9e128696492000c56ef9a4ee5c0dbe8bbe2311d261fbdc12","observation_id":"c2445045-e6d9-4182-b38a-59f9449287e6","resolution":{"observed_at":"2026-05-11T12:51:04.216352Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.00754","last_updated":"2026-05-08T13:29:37Z","snapshot_observed_at":"2026-08-08T18:40:41.828798Z","submitted_at":"2026-05-01T16:07:34Z","title":"Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T19:33:35.690030Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.00754"},"observation_digest":"sha256:23ad7d2e7be6db806b2cfd6c6b8828fdb13d5283b49ba1e563bc4ac970bd042f","observation_id":"5dba58d5-f855-4cff-9966-6e019721a62f","resolution":{"observed_at":"2026-05-09T19:35:39.104230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.00754","last_updated":"2026-05-08T13:29:37Z","snapshot_observed_at":"2026-08-08T18:40:41.828798Z","submitted_at":"2026-05-01T16:07:34Z","title":"Themis: Training Robust Multilingual Code Reward Models for Flexible Multi-Criteria Scoring","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T01:56:43.707252Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.00754"},"observation_digest":"sha256:1dee3993efac72c7292288e31c7bef4ea357a26336684d7f419eeec8d88801b4","observation_id":"91e20ee9-df19-4181-bc55-03a36ca23865","resolution":{"observed_at":"2026-05-11T02:15:52.406421Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.04542","last_updated":"2026-05-06T06:42:47Z","snapshot_observed_at":"2026-07-06T23:17:18.486586Z","submitted_at":"2026-05-06T06:42:47Z","title":"Power Distribution Bridges Sampling, Self-Reward RL, and Self-Distillation","version":1},"reference_index":126,"source":"arxiv_source","source_observed_at":"2026-05-08T16:53:00.860162Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.04542"},"observation_digest":"sha256:956c0a529152358d6e155c34b2a3edae57a3d08e71a7a6201facd4fecec9d15f","observation_id":"595dd3df-fe53-4938-8421-b6fd18a0d474","resolution":{"observed_at":"2026-05-11T17:56:08.381340Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.06987","last_updated":"2026-05-07T22:05:23Z","snapshot_observed_at":"2026-07-31T05:30:22.249144Z","submitted_at":"2026-05-07T22:05:23Z","title":"Response Time Enhances Alignment with Heterogeneous Preferences","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-11T01:04:26.288913Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.06987"},"observation_digest":"sha256:1487d95d01a5f5f18aa24103efcde68194f850f5ed5953b0cb3555263390a793","observation_id":"b20806bf-3933-4d79-9015-e98990d3525c","resolution":{"observed_at":"2026-05-11T04:45:59.518594Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.15855","last_updated":"2026-05-15T11:14:13Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T11:14:13Z","title":"Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T19:48:17.049547Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.15855"},"observation_digest":"sha256:3986ce7e5097d43f846cf6c964259d46b8544c129f4b51988bd1722ebede6c20","observation_id":"e39bdd7b-6892-43cb-a10e-85be05c618c2","resolution":{"observed_at":"2026-05-20T19:48:57.332773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.21351","last_updated":"2026-06-05T02:45:04Z","snapshot_observed_at":"2026-08-08T05:29:49.969359Z","submitted_at":"2026-05-20T16:15:52Z","title":"The Human-AI Delegation-Verification Dilemma: Individual Strategies, Collective Equilibria and Sociotechnical Lock-in","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T03:42:08.309581Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.21351"},"observation_digest":"sha256:f3b0ac35f32c289516fc7933d90b083098a4a931143c2aedb33bed479a1de618","observation_id":"8342c137-ccd7-40b3-9b84-bd3eec498c32","resolution":{"observed_at":"2026-05-21T03:43:55.658050Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.21351","last_updated":"2026-06-05T02:45:04Z","snapshot_observed_at":"2026-08-08T05:29:49.969359Z","submitted_at":"2026-05-20T16:15:52Z","title":"The Human-AI Delegation-Verification Dilemma: Individual Strategies, Collective Equilibria and Sociotechnical Lock-in","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T17:07:54.749167Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.21351"},"observation_digest":"sha256:2c58793c380514a4edc605285ee1350ee1a742bbcf2cf3e8bb31c063fa4c6491","observation_id":"cb4d80df-6aaf-4f90-8445-5265e2833eb8","resolution":{"observed_at":"2026-06-30T17:14:56.535054Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:ef7d08ae5816c8f73b5da7534e3a6fb12ded41a020ea65fbdc918071ca039cdd","observation_id":"c03e3297-ef02-4b98-b201-5ac4c2e9b141","resolution":{"observed_at":"2026-05-22T09:41:22.293334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:ce9f13250d86364d81a9d6a2419de7f363ceba16253146b8906b96bb1c65bffc","observation_id":"683dab4d-0563-4100-970f-496a022b5b2b","resolution":{"observed_at":"2026-05-22T09:41:21.380125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-30T17:17:39.899234Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:42c808e1556f178e31bcda38dc93c11c8a3337954866564c4a9d4134f1c606de","observation_id":"76842f9b-559e-43ae-8c8d-84afba033d7b","resolution":{"observed_at":"2026-06-30T17:34:58.060030Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2606.03131","last_updated":"2026-06-02T04:18:08Z","snapshot_observed_at":"2026-08-02T20:05:30.693121Z","submitted_at":"2026-06-02T04:18:08Z","title":"HARVE: Hacking-Aware Reward-Head Vector Editing for Robust Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T11:32:16.166724Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2606.03131"},"observation_digest":"sha256:d1ea67d47dd171067639586dd47ea927721d35d4964063acd56c7f694a23abf5","observation_id":"9ca641ca-ca54-47dc-9f8b-594dc499edfa","resolution":{"observed_at":"2026-07-02T01:46:26.792724Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2606.09073","last_updated":"2026-06-10T20:16:58Z","snapshot_observed_at":"2026-08-08T13:42:19.414774Z","submitted_at":"2026-06-08T06:15:30Z","title":"A Unifying Lens on Reward Uncertainty in RLHF","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T17:11:46.549150Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2606.09073"},"observation_digest":"sha256:e85509a3da0b80c0796d6ac9fd2a3e2f8677df637d3566e66617726d1a68d1d5","observation_id":"16667bdb-4ecb-4f3a-816d-7d452f5c4284","resolution":{"observed_at":"2026-07-03T00:27:29.842084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:b52f451141492f5f926731531b330147cc65b18738710dd1efa91c0db36d11c8","observation_id":"45b67a8f-0ef7-4aeb-9754-43663e65f0db","resolution":{"observed_at":"2026-07-03T01:37:30.548957Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2606.19818","last_updated":"2026-06-18T05:46:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T05:46:32Z","title":"Uncertainty-Aware Reward Modeling for Stable RLHF","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T18:14:33.673995Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2606.19818"},"observation_digest":"sha256:f747b65e4e5425db8a9eeb52b462464a12297114ab6c752cec152f6dd4533a2b","observation_id":"ce4e1c54-6b51-44d1-9195-3b9771a503d0","resolution":{"observed_at":"2026-07-04T03:19:30.697631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2606.29805","last_updated":"2026-06-30T14:53:46Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T05:33:22Z","title":"Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T06:13:11.013395Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2606.29805"},"observation_digest":"sha256:7cb1b4e864864c2abb13bc8fcbf6446fa44bd3acc958b8655fecd14b96800490","observation_id":"8b1a7393-77d3-4d5c-8dd4-545a86f3333d","resolution":{"observed_at":"2026-06-30T06:14:18.664913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":"2312.09244","doi":"10.48550/arxiv.2312.09244","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"J., Fisch, A., Heller, K., Pfohl, S., Ramachandran, D., Shaw, P., and Berant, J","venue":"arXiv (Cornell University)","work_id":"0d3df61b-eeb7-4a01-98a5-de379e1ac583","year":2024},"citing_paper":{"arxiv_id":"2606.29805","last_updated":"2026-06-30T14:53:46Z","snapshot_observed_at":"2026-07-07T00:03:45.783349Z","submitted_at":"2026-06-29T05:33:22Z","title":"Clearer Sight, Fewer Lies: Oriented Pickup Preference Optimization for Multimodal Hallucination Mitigation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-01T07:01:26.911110Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2606.29805"},"observation_digest":"sha256:124c72d10969c853a10be4c014102fb8054e91ae5e297f7089d3e2c57d5b278f","observation_id":"c52b93cc-4f9a-46e5-8677-0fc57a8e894f","resolution":{"observed_at":"2026-07-01T07:05:28.611341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.318631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-07-31T13:41:42.277767Z","title":"InProceedings of the 58th Annual Meeting of the Association for Computational Linguistics, pages 4040–4054, Online","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24484","last_updated":"2026-07-27T14:20:59Z","snapshot_observed_at":"2026-08-08T03:38:18.679543Z","submitted_at":"2026-07-27T14:20:59Z","title":"What do Reward Models Memorize?","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-07-31T13:41:42.277767Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2607.24484"},"observation_digest":"sha256:e440013d20608a2a7ded7eb947a820b05756d33eaaf85fca5cfcf4c834e598d4","observation_id":"1589a814-1230-4d0d-a3e6-e6e0514900d8","resolution":{"observed_at":"2026-07-31T13:41:42.277767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.09244/citation-record","integrity":"/paper/2312.09244/integrity","json":"/paper/2312.09244/citation-record.json","paper":"/paper/2312.09244"},"outbound":[],"paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2312.09244."}