{"as_of":"2026-08-12T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8df6e8cf1f05ddee1f55ea89d05b881ee57f8ab25bd4638f46f8e2bb0e365d7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:57:54.254039Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-10T23:57:54.254039Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.19792","last_updated":"2025-08-21T16:32:06Z","snapshot_observed_at":"2026-08-11T02:57:24.471944Z","submitted_at":"2024-12-27T18:45:36Z","title":"InfAlign: Inference-aware language model alignment","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T23:57:54.254039Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2412.19792"},"observation_digest":"sha256:f8143fed312163a0a59d123d08dee3f2c2def6cb34960078d4db00aea16e84ed","observation_id":"56747fdd-9082-453d-8616-4d7b19198df2","resolution":{"observed_at":"2026-08-10T23:57:54.254039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-10T19:55:50.559707Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.09620","last_updated":"2025-05-29T02:21:03Z","snapshot_observed_at":"2026-08-11T17:33:39.125301Z","submitted_at":"2025-01-16T16:00:37Z","title":"Beyond Reward Hacking: Causal Rewards for Large Language Model Alignment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T19:55:50.559707Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2501.09620"},"observation_digest":"sha256:4124a29619e5d6023e16ec6ae1298f0796848933f2f41f15bcc14e323de6bb71","observation_id":"3404ba26-329b-4d9c-837a-3c7f7aaaffc3","resolution":{"observed_at":"2026-08-10T19:55:50.559707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-10T17:50:56.339928Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13124","last_updated":"2025-01-21T05:36:13Z","snapshot_observed_at":"2026-08-10T22:23:15.426042Z","submitted_at":"2025-01-21T05:36:13Z","title":"Debate Helps Weak-to-Strong Generalization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T17:50:56.339928Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2501.13124"},"observation_digest":"sha256:e610727b290ee3c88d12486407f176f1b2c2d778136ceb2e164fc7c2c49dc9e7","observation_id":"a093c96a-6bff-4f54-83cc-876ca28f9af7","resolution":{"observed_at":"2026-08-10T17:50:56.339928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-09T11:47:17.522690Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04354","last_updated":"2025-02-04T18:47:11Z","snapshot_observed_at":"2026-08-09T19:08:38.829460Z","submitted_at":"2025-02-04T18:47:11Z","title":"Reviving The Classics: Active Reward Modeling in Large Language Model Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T11:47:17.522690Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2502.04354"},"observation_digest":"sha256:08bfbe2f8e455f6d8b2e89a70ea46b01e116d935b887cb0be00152cf98a95f70","observation_id":"e538dc2d-97f4-4c23-8dd9-ab195e63b329","resolution":{"observed_at":"2026-08-09T11:47:17.522690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-09T11:32:47.837706Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.837706Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:944803e30aafb76c9355081d5e19a40297d9c1fb97deb5a483696c41dcd4cf14","observation_id":"5258d64d-76db-48d4-accb-5a59a590a8eb","resolution":{"observed_at":"2026-08-09T11:32:47.837706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-08T14:27:51.051139Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.051139Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:96be2e3b381db90a765144310b6e252bf1fefc0a76d115b8c8df9c3b4b0b09fd","observation_id":"0c3fe5c1-4a8a-434b-865d-c3999a37b8c8","resolution":{"observed_at":"2026-08-08T14:27:51.051139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-07T11:04:06.902238Z","title":"Reward model ensembles help mitigate overoptimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.902238Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:b2dd17bacd602039374e8ba364fba03cbe69050ef7a4cab0b5070bff5dd091af","observation_id":"726b7ead-80f1-4df5-a9f2-480b78a979cd","resolution":{"observed_at":"2026-08-07T11:04:06.902238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T18:51:30.200216Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07375","last_updated":"2025-07-10T01:56:56Z","snapshot_observed_at":"2026-08-09T22:55:04.253881Z","submitted_at":"2025-07-10T01:56:56Z","title":"Bradley-Terry and Multi-Objective Reward Modeling Are Complementary","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:51:30.200216Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.07375"},"observation_digest":"sha256:0044c39450e90e2349da297af1e2a69b9787c22343c3f78577198bea3c60d828","observation_id":"1560d3f1-fc0a-4acf-8370-8e9b79abaaec","resolution":{"observed_at":"2026-08-06T18:51:30.200216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T16:34:24.968234Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-09T20:19:53.961381Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.968234Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:ce46295ab7960035d043a5883c04ad5c443dbcf8e3ef68db024278d356fe13a4","observation_id":"12d4acc6-c2fe-47e3-8ed9-3c0a9e4d5f3e","resolution":{"observed_at":"2026-08-06T16:34:24.968234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-06T15:40:13.721341Z","title":"Reward model ensembles help mitigate overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-08T08:50:14.371298Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:13.721341Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:0caddad8e292eb8d14884ad003ab5e86377f7553e9ccaabf061ed04e7935f5f0","observation_id":"d81661bf-1992-4d60-91f9-a40889259d1e","resolution":{"observed_at":"2026-08-06T15:40:13.721341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2601.21350","last_updated":"2026-05-16T02:45:10Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:45Z","title":"Factored Causal Representation Learning for Robust Reward Modeling in RLHF","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T14:18:33.768962Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2601.21350"},"observation_digest":"sha256:db00550ca08950f5bc46043f60dd94f548d484c7ae7026c8ed9495e8ef47d91e","observation_id":"32ede528-99af-4867-8c7c-71b624daa0fc","resolution":{"observed_at":"2026-05-21T14:20:13.627586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-08-11T00:22:45.021836Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:75de775715a3b56e74b013d219ee88b5d54a8d991b59c49103ad4580df49220b","observation_id":"b7eced65-43f1-4476-b2e8-5780b93e53dc","resolution":{"observed_at":"2026-05-16T06:37:28.509853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-08-11T00:22:45.021836Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:c8615f7f677c2752836c0a476f7854a81054dd78e775806d5a4341a8eba9f3fb","observation_id":"7146a6c9-53c9-47d7-a33f-47bb6137bb49","resolution":{"observed_at":"2026-05-21T13:10:10.523375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2604.14265","last_updated":"2026-04-15T17:12:56Z","snapshot_observed_at":"2026-07-06T23:02:05.116649Z","submitted_at":"2026-04-15T17:12:56Z","title":"Reinforcement Learning via Value Gradient Flow","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T13:18:16.532434Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2604.14265"},"observation_digest":"sha256:5c21c81ef4f2a76b0540b3a5ac767d84715877efdc5b6a5d21374154b14a69f1","observation_id":"96982241-62cb-40e8-b1b3-331ca867a0ba","resolution":{"observed_at":"2026-05-10T13:20:25.590488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2604.18547","last_updated":"2026-04-20T17:40:33Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T17:40:33Z","title":"FUSE: Ensembling Verifiers with Zero Labeled Data","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T03:39:25.678190Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2604.18547"},"observation_digest":"sha256:9f06a36eb50cd7bd234c724a58a46e246c04d39f77e6fc3ae18a4e8c34b8064a","observation_id":"4c002d6f-dab3-463b-8179-4bf45742812e","resolution":{"observed_at":"2026-05-11T12:26:09.036855Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.07105","last_updated":"2026-05-08T01:32:22Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:32:22Z","title":"Theoretical Limits of Language Model Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T01:18:37.614335Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.07105"},"observation_digest":"sha256:b57a3637e8db3eec4e2dfde88eab8a1a0a84eef4f534d4b9e83f4c2132689a52","observation_id":"21372565-3424-40f8-a0fe-139255f3463c","resolution":{"observed_at":"2026-05-11T04:30:56.966652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.09808","last_updated":"2026-05-10T23:06:24Z","snapshot_observed_at":"2026-08-02T12:27:41.948284Z","submitted_at":"2026-05-10T23:06:24Z","title":"Quantifying the Utility of User Simulators for Building Collaborative LLM Assistants","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-12T02:28:13.317630Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.09808"},"observation_digest":"sha256:7bc61dc913dc70e19bdc17a4fdd651d8936b88606fd2c37d057a50c662735c10","observation_id":"48120300-4e5a-45c6-b2a4-d5056048f549","resolution":{"observed_at":"2026-05-12T07:36:46.897334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.10983","last_updated":"2026-05-13T08:00:49Z","snapshot_observed_at":"2026-08-11T13:39:42.198478Z","submitted_at":"2026-05-09T04:41:02Z","title":"TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T07:36:16.811765Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.10983"},"observation_digest":"sha256:ef82db686e0f0887f62315012b851832cb7df6f4e338a88795223871036f1d5c","observation_id":"5ed0fe47-9729-45d5-b6c2-bebe997b37a6","resolution":{"observed_at":"2026-05-13T07:37:29.192797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.10983","last_updated":"2026-05-13T08:00:49Z","snapshot_observed_at":"2026-08-11T13:39:42.198478Z","submitted_at":"2026-05-09T04:41:02Z","title":"TMPO: Trajectory Matching Policy Optimization for Diverse and Efficient Diffusion Alignment","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-14T22:01:21.695270Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.10983"},"observation_digest":"sha256:3626b480fbf4c56684e14bb1a0f0c058a05e834602f9bff6f727def55563e805","observation_id":"44d10863-751c-4a77-bdd7-f20068c52e47","resolution":{"observed_at":"2026-05-14T22:03:02.908788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.11865","last_updated":"2026-05-12T09:46:26Z","snapshot_observed_at":"2026-08-11T20:34:49.565496Z","submitted_at":"2026-05-12T09:46:26Z","title":"Variance-aware Reward Modeling with Anchor Guidance","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T05:11:05.546092Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.11865"},"observation_digest":"sha256:b667bc35767d26b95e6e11257fca32278e7785ad1d6e651f8fba9db37419bc17","observation_id":"6e2d1bdb-71b1-4184-acae-d07b2895a53b","resolution":{"observed_at":"2026-05-13T05:12:17.505258Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:6d743a9851a26d164c61158bce8ad1110f14742e46fb6bba205a0d864efde106","observation_id":"cbef8efc-0e05-4646-a69f-dc02226ae345","resolution":{"observed_at":"2026-05-22T09:41:22.253533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-22T09:38:04.387777Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:320c1b331bf381d2e8fcbc7a85c5c8e702cc006bc6d03f01880353a19a9e9c93","observation_id":"f2ebf4ad-b424-4b6e-a21d-1fed4734bd6e","resolution":{"observed_at":"2026-05-22T09:41:21.386002Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2605.21602","last_updated":"2026-05-24T21:06:51Z","snapshot_observed_at":"2026-07-31T05:05:49.494448Z","submitted_at":"2026-05-20T18:08:21Z","title":"Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-30T17:17:39.899234Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2605.21602"},"observation_digest":"sha256:a84b4270417038ef99b3ea2271aa74f8d871875917fddcc3a73a08d12a718c11","observation_id":"c0c514f6-1221-492d-82a9-150c6bb749d0","resolution":{"observed_at":"2026-06-30T17:34:58.057414Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:5499690a39b9ac610a4cd2c1710ca1757d9714b02cba7bf0e39c4f70bea2c847","observation_id":"926e9c09-7e2b-4af4-b7dc-b6714b222c07","resolution":{"observed_at":"2026-07-03T01:37:30.389148Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2606.19818","last_updated":"2026-06-18T05:46:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T05:46:32Z","title":"Uncertainty-Aware Reward Modeling for Stable RLHF","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T18:14:33.673995Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2606.19818"},"observation_digest":"sha256:e01c6cee0eeea52364030bc9b4628d413fe8537b6206a630001170baa2377a1d","observation_id":"ef72fedb-2c99-414b-baf1-f5c5b96e8386","resolution":{"observed_at":"2026-07-04T03:19:30.702713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2606.23597","last_updated":"2026-06-22T17:02:53Z","snapshot_observed_at":"2026-08-04T13:40:03.543286Z","submitted_at":"2026-06-22T17:02:53Z","title":"Against Proxy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T08:26:50.595370Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2606.23597"},"observation_digest":"sha256:4422a0293d0aeb712a0de366153563d72ccb2e2b3073131b00d30333cabc0b1f","observation_id":"d6cad619-e42a-43b6-bd45-7ad7a0fa5bd8","resolution":{"observed_at":"2026-07-04T10:49:46.643173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2606.27291","last_updated":"2026-06-25T17:09:12Z","snapshot_observed_at":"2026-08-07T17:19:12.939014Z","submitted_at":"2026-06-25T17:09:12Z","title":"Designing Reward Signals for Portable Query Generation: A Case Study in Industrial Semantic Job Search","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T05:10:59.825246Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2606.27291"},"observation_digest":"sha256:4463e42ca5e7857c169f0e888d70a8bf3d752f7dfb5522cd194de4a2f51c19fd","observation_id":"d9ac9227-cc96-4ce7-8e35-5affe4476085","resolution":{"observed_at":"2026-07-04T13:29:51.705362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2606.29834","last_updated":"2026-06-29T06:19:35Z","snapshot_observed_at":"2026-08-05T12:21:57.329914Z","submitted_at":"2026-06-29T06:19:35Z","title":"STEAM: Self-Supervised Temporal Ensemble Advantage Modeling for Real-World Robot Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:17:48.731091Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2606.29834"},"observation_digest":"sha256:2cdacf3e581738220a8505b098344f51252596775d0b5e0fe4f31633cdedb81e","observation_id":"325d1168-d703-44be-b697-bc9e1cf32054","resolution":{"observed_at":"2026-06-30T06:24:19.479860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2310.02743 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":283,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:0cb3895d0df3321f9c00a6387dad45759e08ad038de045c29c4943e6560ec9db","observation_id":"50ba71a1-39ee-4081-94da-de8cc3d99fab","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-02T08:41:05.531058Z","title":"arXiv preprint arXiv:2310.02743 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":284,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:05.531058Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:cff6bc66ef255f91ae9212f2b2d77449949725becb47e6a6ce526d4dfcc7f6eb","observation_id":"d41dcab2-c667-4af5-a4dc-773fd6247303","resolution":{"observed_at":"2026-08-02T08:41:05.531058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization","version":2},"cited_work":{"arxiv_id":"2310.02743","doi":"10.48550/arxiv.2310.02743","metadata_source":"pith","pith_arxiv_id":"2310.02743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward Model Ensembles Help Mitigate Overoptimization , March 2024","venue":"cs.LG","work_id":"676cee74-bbbe-4612-a3a9-87676dd3a6a3","year":2023},"citing_paper":{"arxiv_id":"2607.05904","last_updated":"2026-07-07T06:59:30Z","snapshot_observed_at":"2026-08-07T17:54:33.012334Z","submitted_at":"2026-07-07T06:59:30Z","title":"More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T21:20:07.569587Z"},"links":{"cited_paper":"/paper/2310.02743","citing_paper":"/paper/2607.05904"},"observation_digest":"sha256:7fde7c7674e179992e213495dac81993c2f2085ba89c491378f36df4315793aa","observation_id":"e426a20c-f573-4c4b-a2db-4c6fccabcff7","resolution":{"observed_at":"2026-07-08T21:25:38.636176Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:20.66747+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2310.02743/citation-record","integrity":"/paper/2310.02743/integrity","json":"/paper/2310.02743/citation-record.json","paper":"/paper/2310.02743"},"outbound":[],"paper":{"arxiv_id":"2310.02743","last_updated":"2024-03-10T16:14:58Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T21:31:23.847628Z","submitted_at":"2023-10-04T11:34:22Z","title":"Reward Model Ensembles Help Mitigate Overoptimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2310.02743."}