{"as_of":"2026-08-16T14:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d5d7d34894ffdda2b4b6da0705b2442e9d21da497ef3310821b313aee9fb0f17","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:56:41.084268Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:19:34.840954Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20150","snapshot_observed_at":"2026-08-03T12:19:34.840954Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.03525","last_updated":"2026-05-26T16:39:06Z","snapshot_observed_at":"2026-08-15T07:29:36.779987Z","submitted_at":"2026-01-07T02:29:49Z","title":"Beyond Binary: Turning Partial Success into Dense Verifiable Rewards for Reinforcement Learning in Code Generation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T12:19:34.840954Z"},"links":{"cited_paper":"/paper/2507.20150","citing_paper":"/paper/2601.03525"},"observation_digest":"sha256:6dea1c640dd4a2ee1e2d399599b8010b810d39431c823e686407929a662a06fa","observation_id":"b86ffbcb-f091-4df2-8a86-c7aa1ba77b3b","resolution":{"observed_at":"2026-08-03T12:19:34.840954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.20150/citation-record","integrity":"/paper/2507.20150/integrity","json":"/paper/2507.20150/citation-record.json","paper":"/paper/2507.20150"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-15T06:09:25.789897Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-15T17:56:40.998568Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:40.998568Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:6d0662e21e11b480b3274710c6a73a3b57a15c4d9707bdb73dfce47fbe81e29e","observation_id":"5a7b6546-5f47-4b35-ac84-a2438a216ce7","resolution":{"observed_at":"2026-08-15T17:56:40.998568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-15T17:56:41.008415Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.008415Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:5d558cb2ff9b6100310675305bb87c75e6f130e7aeecf96eb8deeacd661a4c3b","observation_id":"b1e01e78-4e71-473c-94a6-2deb1c3f5060","resolution":{"observed_at":"2026-08-15T17:56:41.008415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05776","last_updated":"2021-06-20T22:23:24Z","snapshot_observed_at":"2026-08-14T13:37:36.446325Z","submitted_at":"2021-02-10T23:31:53Z","title":"Defense Against Reward Poisoning Attacks in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05776","snapshot_observed_at":"2026-08-15T17:56:41.018945Z","title":"Defense against reward poisoning attacks in reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.018945Z"},"links":{"cited_paper":"/paper/2102.05776","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:1ee2fa3b3496b6bcacae055e126ff4ba14050f841a6b53a40a0e5c886f1483ea","observation_id":"ef49e7f3-9dab-4f2f-8752-72992aa824ae","resolution":{"observed_at":"2026-08-15T17:56:41.018945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-15T11:48:26.826304Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-15T17:56:41.028809Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.028809Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:5ff35589a865e66583c040cd52eb57bbd4d9ddb802ce31cc1d8fdfd77aa21519","observation_id":"08201b88-4bc2-466f-99b0-7405c37ae0b0","resolution":{"observed_at":"2026-08-15T17:56:41.028809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-14T04:22:20.981738Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-15T17:56:41.033080Z","title":"Deliberative alignment: Reasoning enables safer language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.033080Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:c9d0f4c3448abcb41df706d0c49d321d90a91eec85a981f44da717a29905e9bb","observation_id":"0fc187ff-f529-490d-ac32-1ed0bab4e3bd","resolution":{"observed_at":"2026-08-15T17:56:41.033080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23829","last_updated":"2025-04-01T14:48:02Z","snapshot_observed_at":"2026-08-16T12:45:26.696220Z","submitted_at":"2025-03-31T08:22:49Z","title":"Crossing the Reward Bridge: Expanding RL with Verifiable Rewards Across Diverse Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23829","snapshot_observed_at":"2026-08-15T17:56:41.062832Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.062832Z"},"links":{"cited_paper":"/paper/2503.23829","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:249260aea0f12a38d1b79e731fc36516c850dfba67cec1b091381740a2aea46c","observation_id":"0ae26018-5913-4345-bf2f-319ccf727136","resolution":{"observed_at":"2026-08-15T17:56:41.062832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-15T17:56:41.067681Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.067681Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:6612dbc46a4f78780d9630d4ba19755a7beda1130a0631d0a2599d29175a8b42","observation_id":"00fe4cc6-6b70-4895-b35d-e92c2d86bd2c","resolution":{"observed_at":"2026-08-15T17:56:41.067681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T17:56:41.075895Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.075895Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:d99fcc0f7d3e6db43e5fca69b1774a3701c4b391399f15108c7f814dfa94e179","observation_id":"803f4fed-0a88-4288-a3d0-ba591b2e511d","resolution":{"observed_at":"2026-08-15T17:56:41.075895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:56:41.487172Z","title":null,"venue":null,"work_id":"fcd07cae-ed39-4748-adc7-80ce2386347f","year":1998},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.079766Z"},"links":{"citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:f1120041376bdc925a6e56215f9bff0e591a8638a063ad50540d77a2730d577c","observation_id":"5d513ce0-0a9e-4640-9569-6636b90a197a","resolution":{"observed_at":"2026-08-15T17:56:41.491657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:56:41.471745Z","title":"spurious reasoning","venue":null,"work_id":"fada3032-da8d-4cf4-8498-1150a8b647c1","year":2025},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.084268Z"},"links":{"citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:4428fa0b48512dbca5245787b51e720a93016e9c865a9a92c9df6f8167b5cb69","observation_id":"15b88e43-d525-4a12-8c13-5251498e696f","resolution":{"observed_at":"2026-08-15T17:56:41.477462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-15T17:56:41.023330Z","title":"Towards reasoning era: A survey of long chain-of-thought for reasoning large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":1963,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.023330Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:6e082d4a6198e7f0f65c816ceb086eda8b168e582aa9fcbadf1bd1d36c1b3e86","observation_id":"78913d69-3cbb-4bef-9023-1c2d92327ffc","resolution":{"observed_at":"2026-08-15T17:56:41.023330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:56:41.050554Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.050554Z"},"links":{"citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:788ebe0f322670e670faec8e3810989431a78072f6728c45ad35fe632ee73706","observation_id":"d70c39aa-a11a-4a9d-816c-329a2cd21bb1","resolution":{"observed_at":"2026-08-15T17:56:41.050554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T17:56:41.054541Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.054541Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:86d4aa64626b00319ccfc3de636fcb4de3a7fdc1a4259303a4e52a7dfa66aecf","observation_id":"f50b2653-10c6-49bf-975f-081d70d6f876","resolution":{"observed_at":"2026-08-15T17:56:41.054541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-15T17:56:41.058636Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.058636Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:fc1d358f034d20adc67b16c3248406737ff588dd1b9e8bb2ac46463506ec46a3","observation_id":"4eb82b6c-d6ae-483f-bd21-7cc8eca0f49b","resolution":{"observed_at":"2026-08-15T17:56:41.058636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-15T17:56:41.041784Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.041784Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:a64466199d09bba47867cadd406b7abacb3e7aed3fdebae7f0d35d5ea541f518","observation_id":"6183f9fc-4be1-4bdf-953a-7cd4438515d7","resolution":{"observed_at":"2026-08-15T17:56:41.041784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-15T17:56:41.071930Z","title":"Chi, Samuel Miserendino, Johannes Heidecke, Tejal Patwardhan, and Dan Mossing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.071930Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:325de19d6055f38a25d316c8e7d303e82881913ceb307e31a069e1c1281f9a93","observation_id":"fd17ebcf-4b39-4eac-af62-47d1c12e5df4","resolution":{"observed_at":"2026-08-15T17:56:41.071930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-15T17:56:41.014266Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.014266Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:2f2e4ce081f8fc0f5bca0d81c46dc5056d56da9c137234f5f94703e7f40cce78","observation_id":"4c93f222-a987-42fb-b239-849d117f537f","resolution":{"observed_at":"2026-08-15T17:56:41.014266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-14T12:50:25.203482Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-15T17:56:41.046033Z","title":"Modomodo: Multi-domain data mixtures for multimodal llm reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.046033Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:1363d0dc041151252f43cf60568338b34ecf14e2b8ce8fee72e13581d87a869a","observation_id":"0c63d43f-c85a-4e12-882d-bfe71776b201","resolution":{"observed_at":"2026-08-15T17:56:41.046033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T17:56:41.037293Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.037293Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:97ebc8a44b3c11b47cb15279441d4e818c0fb23e9202188b116df8ffd08242de","observation_id":"3826fd40-049f-4b4b-bdde-f91ab48284b9","resolution":{"observed_at":"2026-08-15T17:56:41.037293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T17:56:41.003583Z","title":"Shuai Bai, Keqin Chen, Xuejing Liu, Jialin Wang, Wenbin Ge, Sibo Song, Kai Dang, Peng Wang, Shijie Wang, Jun Tang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T17:56:41.003583Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.20150"},"observation_digest":"sha256:7c490db87055db9b84f8cc1c1806b708f42ebb2d73fcb341c106e1eb8111e71b","observation_id":"fc062070-efd6-41d5-ba8a-75fbb2cef70e","resolution":{"observed_at":"2026-08-15T17:56:41.003583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20150","last_updated":"2025-07-27T06:56:10Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T09:14:28.693961Z","submitted_at":"2025-07-27T06:56:10Z","title":"The Policy Cliff: A Theoretical Analysis of Reward-Policy Maps in Large Language Models"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2507.20150."}