{"as_of":"2026-08-09T02:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d8a1f3cf072c933846f886cd6cd5a81af935edacfd2c7a9909e5b0177d9e6c1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":22,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:41.769204Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2502.13957","last_updated":"2026-05-16T17:37:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:56:03Z","title":"Supervising the search process produces reliable and generalizable information-seeking agents","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T02:18:27.204122Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2502.13957"},"observation_digest":"sha256:39db62832130d5788ae86132c4e556834f7f237ef1c28aca56fef4d0dcf1ffa0","observation_id":"d48a086d-209a-4c6b-8926-5cf6b54b797e","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-13T01:36:23.845366Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2502.17419"},"observation_digest":"sha256:57c69450149343b90bd69839de9ef810c114b4368f80b790fb646ac278f2ca5c","observation_id":"58c6321b-7665-4423-8b27-86437a460e6d","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T13:21:41.769204Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00042","last_updated":"2025-05-28T08:39:35Z","snapshot_observed_at":"2026-08-07T13:12:36.585457Z","submitted_at":"2025-05-28T08:39:35Z","title":"Enhancing Tool Learning in Large Language Models with Hierarchical Error Checklists","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T13:21:41.769204Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2506.00042"},"observation_digest":"sha256:75a9e9bee6ac76333d86312efb2b4b2d5a7169b91ee6eab1e4d6a4cbac83989b","observation_id":"e947c3dd-4fd3-4e12-876b-9d57f2af9dbf","resolution":{"observed_at":"2026-08-07T13:21:41.769204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T11:04:06.897214Z","title":"Reward shaping to mitigate reward hacking in rlhf,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:06.897214Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:26d4aac6b5c5f87cbbc6a4ac827d3d17af187f67b7f67bc7ae094d86622cf74e","observation_id":"5c3df9b4-277a-4135-b4c4-75ffb9785030","resolution":{"observed_at":"2026-08-07T11:04:06.897214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:5c71e8c93cd73910c3a3ded43a04070505a17490edf12080521ee6b7ff0906a2","observation_id":"f1f2f615-d4f8-4f43-a686-c92943506c4b","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2601.21350","last_updated":"2026-05-16T02:45:10Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T07:18:45Z","title":"Factored Causal Representation Learning for Robust Reward Modeling in RLHF","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T14:18:33.768962Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2601.21350"},"observation_digest":"sha256:c8b8d8677376767f7db6c93a5a58b396b638f785c5936c6026ec8077e4f4a931","observation_id":"1e5c7b63-c8d2-41ef-ba7f-41347e6abf8c","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2604.17328","last_updated":"2026-05-23T14:02:35Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T08:48:46Z","title":"Rethinking the Comparison Unit in Sequence-Level Reinforcement Learning: An Equal-Length Paired Training Framework from Loss Correction to Sample Construction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T06:23:14.905706Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2604.17328"},"observation_digest":"sha256:6ad79d7028587c461b82a8a80703b0ebd97e0c77749c8954f58348981a288b00","observation_id":"f423b48c-8cd7-4e5b-85fb-08c49e2b8e17","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:9d07b16a3c3eba98e2cc98a212e396567866d23a36bd08d7925f7b962d080fee","observation_id":"e0aa7ce6-4486-46d5-b0d7-cff2b43fe244","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.04431","last_updated":"2026-05-06T02:50:00Z","snapshot_observed_at":"2026-07-06T23:17:13.770090Z","submitted_at":"2026-05-06T02:50:00Z","title":"Towards Robust LLM Post-Training: Automatic Failure Management for Reinforcement Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T18:19:41.302164Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.04431"},"observation_digest":"sha256:cce621a53f75fda365238050b6140450e8d155b5382f84742677eb267977395d","observation_id":"a496afa7-0edb-44c0-95fa-ff04bd50f10b","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-02T20:51:09.770289Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"reference_index":260,"source":"arxiv_source","source_observed_at":"2026-05-08T14:10:49.634358Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.06036"},"observation_digest":"sha256:bd19c4b5ae9536e9caaccb793945b2c6b79447727ea678bc48c3222e2e46f2b5","observation_id":"31879369-3523-4a1d-82b4-7a711302bdb3","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.08496","last_updated":"2026-05-08T21:21:59Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T21:21:59Z","title":"Latent Personality Alignment: Improving Harmlessness Without Mentioning Harms","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T01:46:49.586630Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.08496"},"observation_digest":"sha256:9d6434ebc757a29020fead0650db3c3d86d14bf85bae1b07def32396620a5a9a","observation_id":"28cb54ed-920c-419c-8d23-2482c8cc6dad","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.11865","last_updated":"2026-05-12T09:46:26Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:46:26Z","title":"Variance-aware Reward Modeling with Anchor Guidance","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-13T05:11:05.546092Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.11865"},"observation_digest":"sha256:81638b73ebf78331dc54d7d89b663349088f94b9e99e25399fef0e48ac3b3124","observation_id":"4409e985-2190-4e31-b2d7-ef560d706b26","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-03T08:00:52.890954Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T04:08:51.578772Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.12474"},"observation_digest":"sha256:9db37b486012c87ccd48cf76edf6bcde9dad45d3ac487428d8381f92a4a1bf6b","observation_id":"b3fc049c-ece3-453c-8748-63065fc9883b","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.14220","last_updated":"2026-05-14T00:27:35Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-14T00:27:35Z","title":"Diagnosing Training Inference Mismatch in LLM Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T02:05:44.813341Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.14220"},"observation_digest":"sha256:cfcae36a8b20a8158e6cd2b90c0bb3e7a30ea9c4fc720e559ee864c5bd571b37","observation_id":"c98675b8-a2c6-45e8-bd29-ddb4c5b20399","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T12:43:56.522345Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:6057c43e80acca07bce15399a34e38d88d455d133986d099b3cd8d8eb7b0f217","observation_id":"f03a1e6c-f8f9-45b8-b88b-552164449677","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:50:00.963837Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:79f211d8999b6aec733ed72af1928a18f7fe98ec71dd7556fd1668425f632e31","observation_id":"c4ec532b-ea35-4495-8772-1c98695e82ae","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2605.18721","last_updated":"2026-05-21T04:23:01Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:50:27Z","title":"General Preference Reinforcement Learning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-22T09:24:39.228616Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2605.18721"},"observation_digest":"sha256:f7917ac88cbe99777badc88eff1328233771e344d723e7ec2f5bf69a054d5b1a","observation_id":"67adf7ce-7aa5-4b17-8c48-c0279bdd6785","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:29d4c133f084d5a341b4ba0237af1bd1966d0573b1972c8595cd45e295868ec7","observation_id":"23180915-ff3b-4ee9-a737-6d9700bc46a9","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.11052","last_updated":"2026-06-09T16:17:19Z","snapshot_observed_at":"2026-08-05T14:17:36.486236Z","submitted_at":"2026-06-09T16:17:19Z","title":"Attention Amnesia in Hybrid LLMs: When CoT Fine-Tuning Breaks Long-Range Recall, and How to Fix It","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T13:08:57.218711Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.11052"},"observation_digest":"sha256:9e1b64dd3b67cd898c367e6594c091dd511311a5d0269fd031b644245de21506","observation_id":"542a30f0-8e1a-428d-8eaf-16dd502c6c43","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.17682","last_updated":"2026-06-16T08:48:58Z","snapshot_observed_at":"2026-08-01T05:53:08.805029Z","submitted_at":"2026-06-16T08:48:58Z","title":"From Trainee to Trainer: LLM-Designed Training Environment for RL with Multi-Agent Reasoning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T00:59:50.038405Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.17682"},"observation_digest":"sha256:ab4399d45b6bd33a8f01c91192aa33f8c3d72a47b3bf8d09a43a3c3c4bcb285c","observation_id":"f25422c1-50d3-4e78-8a25-94556b030c76","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.19818","last_updated":"2026-06-18T05:46:32Z","snapshot_observed_at":"2026-07-06T23:55:05.932014Z","submitted_at":"2026-06-18T05:46:32Z","title":"Uncertainty-Aware Reward Modeling for Stable RLHF","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T18:14:33.673995Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.19818"},"observation_digest":"sha256:e185374ebd603420281ddc301534d192f06492bf0fd54348211652c5c24a8288","observation_id":"ae675e5a-4070-45e6-a112-598783ebdaa7","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF","version":6},"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.18770","snapshot_observed_at":"2026-08-07T01:35:47.288139Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2606.25757","last_updated":"2026-06-24T12:31:14Z","snapshot_observed_at":"2026-07-07T00:00:12.737052Z","submitted_at":"2026-06-24T12:31:14Z","title":"OPERA: Aligning Open-Ended Reasoning via Objective Perplexity-based Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-25T21:00:37.797967Z"},"links":{"cited_paper":"/paper/2502.18770","citing_paper":"/paper/2606.25757"},"observation_digest":"sha256:c74f2deeccbcdd325cbcf5057b97f47701ca9c6039430fca9b2bf5f31bd7e781","observation_id":"0c0ba185-f333-4895-adb9-702110f2cef1","resolution":{"observed_at":"2026-08-07T01:35:47.288139Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.18770/citation-record","integrity":"/paper/2502.18770/integrity","json":"/paper/2502.18770/citation-record.json","paper":"/paper/2502.18770"},"outbound":[],"paper":{"arxiv_id":"2502.18770","last_updated":"2026-08-06T10:33:17Z","latest_version":6,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T01:09:00.501131Z","submitted_at":"2025-02-26T02:57:59Z","title":"Reward Shaping to Mitigate Reward Hacking in RLHF"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 22 inbound Pith citation observations for arXiv:2502.18770."}