{"as_of":"2026-08-04T18:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aee723a28f73766e6d757f207d9ef5435e999492bb2cb361d3712d7dcdd83c75","coverage":[{"denominator":8,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T12:22:49.708718Z","state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.25189/citation-record","integrity":"/paper/2605.25189/integrity","json":"/paper/2605.25189/citation-record.json","paper":"/paper/2605.25189"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.18037","last_updated":"2026-07-03T01:59:26Z","snapshot_observed_at":"2026-08-02T22:07:33.644090Z","submitted_at":"2026-02-20T07:32:22Z","title":"Gradient Regularization Mitigates Reward Hacking in Reinforcement Learning from Human Feedback and Verifiable Rewards","version":2},"cited_work":{"arxiv_id":"2602.18037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.18037","snapshot_observed_at":"2026-07-07T01:16:06.081071Z","title":"Gradient regularization prevents reward hacking in reinforcement learning from human feedback and verifiable rewards.arXiv preprint arXiv:2602.18037, 2026","venue":null,"work_id":"9876096b-f25e-4b12-b904-f587d47a079d","year":2026},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2602.18037","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:a1790474284b258725f6aae8ec906352dd3440952d11451ca623eb7abaa3299a","observation_id":"07a8bcc9-1ba9-474a-bab3-e838e28b545f","resolution":{"observed_at":"2026-07-07T01:16:06.081071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.04220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T21:06:34.823682Z","title":"On grpo collapse in search-r1: The lazy likelihood- displacement death spiral","venue":null,"work_id":"ccf2c4a4-1d0c-436f-a160-0001f11cc060","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:dbc34a2785f8eb722f9477e71285a8bd1b53471b763e60432c2547a2cfdf2c49","observation_id":"ac1388ec-7d60-4724-96f0-db8c0098503e","resolution":{"observed_at":"2026-06-30T12:24:39.621034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:9d1ead1e5c7974f774127a3203e712124fbaf045d09edcece26d065e66fcb70d","observation_id":"99887f51-e9c0-45e4-899e-329e22056f11","resolution":{"observed_at":"2026-06-30T12:24:39.617075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24138","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T22:39:00.973740Z","title":"GARDO: Reinforcing diffusion models without reward hacking","venue":null,"work_id":"0f625cc6-9e6f-4185-9c68-eca92e12284a","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:84fa464c1aaf7cc302c6951cddda9a5354a49b8bcc828c3236231318b239c6d1","observation_id":"67f17294-4440-485d-adf9-44ac7c497b7c","resolution":{"observed_at":"2026-06-30T12:24:39.636165Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03185","last_updated":"2025-03-13T17:35:13Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:22:15Z","title":"Correlated Proxies: A New Definition and Improved Mitigation for Reward Hacking","version":4},"cited_work":{"arxiv_id":"2403.03185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03185","snapshot_observed_at":"2026-07-01T10:05:40.200096Z","title":"Correlated proxies: A new definition and improved mitigation for reward hacking.arXiv preprint arXiv:2403.03185","venue":null,"work_id":"fa298c70-3b16-480b-a247-e58d893e1de3","year":2024},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2403.03185","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:fe4c58e1059259d02ceded74c590cd03de524d6bf8dcde4a6dc78244eba6d969","observation_id":"9340113c-aa56-4a4b-8ee1-294f5aa71c62","resolution":{"observed_at":"2026-06-30T12:24:39.629009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23235","last_updated":"2025-06-29T13:45:54Z","snapshot_observed_at":"2026-07-06T21:49:18.028734Z","submitted_at":"2025-06-29T13:45:54Z","title":"Generalist Reward Models: Found Inside Large Language Models","version":1},"cited_work":{"arxiv_id":"2506.23235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23235","snapshot_observed_at":"2026-07-02T23:07:27.285466Z","title":"arXiv preprint arXiv:2506.23235 , year=","venue":null,"work_id":"c6fbb042-2b4a-4efd-9bcb-d869857c1b5c","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2506.23235","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:a20017a62a07734d8c09a274e3eb6e883a714b8c6290c51ea373ef5f0caa1e21","observation_id":"b9b50137-25e4-46c4-8d25-5ef029d8dfd0","resolution":{"observed_at":"2026-06-30T12:24:39.632631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.02495","doi":"10.48550/arxiv.2504.02495","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":"be1aa439-dad2-4f1c-b107-a8c1d5a94e91","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:0a55e54872cd4367553b94ac4417968e1bc082859aaf5a60f24fc0e7e9b7d94a","observation_id":"2ab2e77b-637f-4c56-bf79-50d71119482c","resolution":{"observed_at":"2026-06-30T12:24:39.643213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22777","last_updated":"2025-07-13T15:36:35Z","snapshot_observed_at":"2026-07-06T21:48:59.271767Z","submitted_at":"2025-06-28T06:37:10Z","title":"Teaching Models to Verbalize Reward Hacking in Chain-of-Thought Reasoning","version":2},"cited_work":{"arxiv_id":"2506.22777","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.22777","snapshot_observed_at":"2026-06-30T15:34:47.983586Z","title":"Teaching models to verbalize reward hacking in chain-of-thought reasoning","venue":null,"work_id":"f2960264-b4bd-4176-b5c0-6974f82b48fa","year":2025},"citing_paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T12:22:49.708718Z"},"links":{"cited_paper":"/paper/2506.22777","citing_paper":"/paper/2605.25189"},"observation_digest":"sha256:f89cdd9550f4b90fff2b9caf4cbbd91a7fb6e71659e2e8cec56a871402167225","observation_id":"57d7f00b-157e-4cc2-a731-ce0ac2d98dd7","resolution":{"observed_at":"2026-06-30T12:24:39.625126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.25189","last_updated":"2026-05-24T17:34:34Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:35:11.987278Z","submitted_at":"2026-05-24T17:34:34Z","title":"Directional Alignment Mitigates Reward Hacking in Reinforcement Learning for Language Models"},"reference_resolution":{"displayed":8,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":8,"verified_fuzzy":0},"total_outbound_references":8},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 8 of 8 outbound references and 0 inbound Pith citation observations for arXiv:2605.25189."}