{"as_of":"2026-08-21T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:90aaef5304379f58f02338318be500dc6253cf7e092273e0dfdc037d020be554","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:51:25.450746Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:14:19.399777Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.582742Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17515","snapshot_observed_at":"2026-08-03T05:14:19.399777Z","title":"Urpo: A unified reward & policy optimization framework for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-12T09:46:52.523380Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:19.399777Z"},"links":{"cited_paper":"/paper/2507.17515","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:33b819b0d9463ff94e90b204e5a3ea09fad5277ac609300374f8363e7e03efb5","observation_id":"27b9735b-8a94-4cb8-bfd3-6a74ed075534","resolution":{"observed_at":"2026-08-03T05:14:19.399777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.17515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17515","snapshot_observed_at":"2026-07-01T20:56:13.582742Z","title":"Urpo: A unified reward & policy optimization framework for large language models","venue":null,"work_id":"a104bf5a-1006-40d3-a8b2-e61bc2323234","year":2025},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-08-18T06:14:17.992551Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2507.17515","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:612a4c3b3d031ee42cb7f9ea6f78be842b1c216c0d5b605c7ea82feba0e76063","observation_id":"26c944a4-d31b-42fc-ac1f-727d2d44be7e","resolution":{"observed_at":"2026-05-10T14:00:28.696133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"cited_work":{"arxiv_id":"2507.17515","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.17515","snapshot_observed_at":"2026-07-01T20:56:13.582742Z","title":"Urpo: A unified reward & policy optimization framework for large language models","venue":null,"work_id":"a104bf5a-1006-40d3-a8b2-e61bc2323234","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":199,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2507.17515","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:a11558d42c6e58c830d9314c0c7ae3136e086fc40993d399ab71d2856a1d2720","observation_id":"46e8ad6d-eb00-4005-812f-c4a412b6898d","resolution":{"observed_at":"2026-07-01T20:56:13.584112Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.17515/citation-record","integrity":"/paper/2507.17515/integrity","json":"/paper/2507.17515/citation-record.json","paper":"/paper/2507.17515"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T14:51:25.370171Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.370171Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:427724ceab5e811f09185b630561ac500287964fdfddcdeacf7c0344b5c5a965","observation_id":"952b4499-3103-4a5f-9bad-4a9ad8609a59","resolution":{"observed_at":"2026-08-06T14:51:25.370171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-14T13:46:28.086398Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-06T14:51:25.381797Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.381797Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:15f5f2c880c3a6ebe668b53504ac77f2627aa781d9b4cedc17dd0063629f0931","observation_id":"ad92ed78-b216-439c-a5d4-87b4e42ae997","resolution":{"observed_at":"2026-08-06T14:51:25.381797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22312","last_updated":"2025-05-29T09:07:33Z","snapshot_observed_at":"2026-08-15T23:24:42.542733Z","submitted_at":"2025-05-28T12:56:04Z","title":"Skywork Open Reasoner 1 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22312","snapshot_observed_at":"2026-08-06T14:51:25.393581Z","title":"Skywork open reasoner 1 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.393581Z"},"links":{"cited_paper":"/paper/2505.22312","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:bd7b512bbad645bad35a9c5bc1098eb5fd2b7e4fd45164733e36383a8618fe91","observation_id":"8e04d0d6-e7a9-4627-84d0-9a1e08554e4c","resolution":{"observed_at":"2026-08-06T14:51:25.393581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-06T14:51:25.396830Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.396830Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:0ec886fe75dc679b3bb2f3533368202b28a998201b141cfc2d5ded48bed6319d","observation_id":"04f15869-2750-4dc7-b7ce-191bdb2543a1","resolution":{"observed_at":"2026-08-06T14:51:25.396830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-06T14:51:25.403341Z","title":"Rlaif vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.403341Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:00c678282d6d6b0545bce24d39e51d3d96e5820fc4ae20eef2cc71dd48d985e0","observation_id":"2b7340c7-0fdd-4941-8604-8eeb0c96109e","resolution":{"observed_at":"2026-08-06T14:51:25.403341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-06T14:51:25.407063Z","title":"Skywork-reward: Bag of tricks for reward modeling in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.407063Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:754f1f4370af5c7eaf5484c2c21fc209cfad57b3e3a9b851f99ea6b9c7a9868e","observation_id":"b7c407c9-2d4f-4be5-ac1f-0a661227b2ad","resolution":{"observed_at":"2026-08-06T14:51:25.407063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T14:51:25.410064Z","title":"Inference-time scaling for generalist reward modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.410064Z"},"links":{"citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:ff1204e0e0c18d55c1f07879d763755e6fecd8c9aa91fdc6f5dc57c63a001c8d","observation_id":"e667bb08-d015-43f3-8595-c926925194cd","resolution":{"observed_at":"2026-08-06T14:51:25.410064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T14:51:25.413138Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.413138Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:63c22b0b89eb8262e6c2f2e93d530e108bf0301e51e1f884a4d4aa24aa4459e1","observation_id":"e9f9cf97-8a36-4916-b2fa-b57603f5e83a","resolution":{"observed_at":"2026-08-06T14:51:25.413138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1205.2618","last_updated":"2012-05-09T18:25:09Z","snapshot_observed_at":"2026-08-15T03:23:25.220336Z","submitted_at":"2012-05-09T18:25:09Z","title":"BPR: Bayesian Personalized Ranking from Implicit Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1205.2618","snapshot_observed_at":"2026-08-06T14:51:25.416391Z","title":"Bpr: Bayesian personalized ranking from implicit feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.416391Z"},"links":{"cited_paper":"/paper/1205.2618","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:10485235b634d9a578c36e07c698a98bed45cf208826e3622f85d454af407bea","observation_id":"3bf7c51d-776f-471c-bb18-ed29a60eb10f","resolution":{"observed_at":"2026-08-06T14:51:25.416391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T14:51:25.419490Z","title":"Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Y Wu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.419490Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:6103e1c9cb506be76ddcdb77bd95c9ef9bd8dd1b730aae79ae29a8815332b61d","observation_id":"2c42e392-b627-4cc1-bfde-6e24ddda2fc1","resolution":{"observed_at":"2026-08-06T14:51:25.419490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20512","last_updated":"2025-06-25T14:58:13Z","snapshot_observed_at":"2026-08-13T20:01:19.714358Z","submitted_at":"2025-06-25T14:58:13Z","title":"OctoThinker: Mid-training Incentivizes Reinforcement Learning Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20512","snapshot_observed_at":"2026-08-06T14:51:25.423521Z","title":"Octothinker: Mid-training incentivizes reinforcement learning scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.423521Z"},"links":{"cited_paper":"/paper/2506.20512","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:90e20d0c1994d1d5aea841687d7cd72b29d3e234d93f9c02ff64c667e50f30a7","observation_id":"d8941b72-95c4-4586-a154-9027845a5560","resolution":{"observed_at":"2026-08-06T14:51:25.423521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T14:51:25.426843Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.426843Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:e87602dbc23024f3f3c1e19c42515568853a7957cd707b63d13118cc3a5425e7","observation_id":"5b2a5dc6-36d6-4581-814e-d8c97300f54d","resolution":{"observed_at":"2026-08-06T14:51:25.426843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T14:51:25.430191Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.430191Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:a39b204abded8d45edcbcfd25722d1484ceb7601f32ac3f4b1cc7d355dc5f426","observation_id":"989ca361-9d54-4bfb-9821-11b471c1ccc4","resolution":{"observed_at":"2026-08-06T14:51:25.430191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-18T05:01:20.543826Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T14:51:25.433932Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.433932Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:20e14265c6bf45512207f1d45308c62655ee2920941d777d859d947ba2b8f452","observation_id":"07c88954-0191-4d73-9788-9c3ebca59d6d","resolution":{"observed_at":"2026-08-06T14:51:25.433932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09267","last_updated":"2024-06-11T12:22:14Z","snapshot_observed_at":"2026-08-17T12:33:37.899223Z","submitted_at":"2024-02-14T15:52:42Z","title":"Self-Alignment for Factuality: Mitigating Hallucinations in LLMs via Self-Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09267","snapshot_observed_at":"2026-08-06T14:51:25.437067Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.437067Z"},"links":{"cited_paper":"/paper/2402.09267","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:11f527dc4f5e8904f5ae8749647ad447463bcf1e9705f8d89b66c208342f5ea6","observation_id":"2e281e93-06b0-4e24-8a8f-50013c59e1b2","resolution":{"observed_at":"2026-08-06T14:51:25.437067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-06T14:51:25.440378Z","title":"Learning to reason without external rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.440378Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:a80ab39d8db71a842e59ba71c953ec05735618e23349185a9ce75cf4d5cd826f","observation_id":"3f7246bd-1778-43cc-aa36-525c58dfdc26","resolution":{"observed_at":"2026-08-06T14:51:25.440378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09893","last_updated":"2025-04-04T11:45:02Z","snapshot_observed_at":"2026-08-16T13:09:53.449886Z","submitted_at":"2024-10-13T16:06:54Z","title":"RMB: Comprehensively Benchmarking Reward Models in LLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09893","snapshot_observed_at":"2026-08-06T14:51:25.443699Z","title":"Rmb: Comprehensively benchmarking reward models in llm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.443699Z"},"links":{"cited_paper":"/paper/2410.09893","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:d72e263c34acd4b87bb0b8873399879148cc0ea094bc59bb3eb61ea06ee00173","observation_id":"0d4aa580-82cb-4bd6-ab26-895ceb6edbdb","resolution":{"observed_at":"2026-08-06T14:51:25.443699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21493","last_updated":"2025-05-27T17:56:27Z","snapshot_observed_at":"2026-08-13T18:42:34.464744Z","submitted_at":"2025-05-27T17:56:27Z","title":"Reinforcing General Reasoning without Verifiers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21493","snapshot_observed_at":"2026-08-06T14:51:25.447032Z","title":"Reinforcing general reasoning without verifiers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.447032Z"},"links":{"cited_paper":"/paper/2505.21493","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:3da23f8b2e5e3ce7ce8783cc0f1569157a66c2093bdaa9c4a9a646768709ca2d","observation_id":"d9cb06d2-5012-4061-985a-434b37d473ca","resolution":{"observed_at":"2026-08-06T14:51:25.447032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-21T16:54:14.450108Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T14:51:25.450746Z","title":"Fine-tuning language models from human preferences","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.450746Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:ee02097fd4f3d917cb7d9e3849263d3594558112cac236ca805b8ccc4e74018a","observation_id":"45e30223-ad4e-4469-8a6d-66eca0c5373e","resolution":{"observed_at":"2026-08-06T14:51:25.450746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T14:51:25.378319Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.378319Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:63e5be240aed312e5b6018f1c13dbcbc0c6a609333dc43aa05df7e5f31721835","observation_id":"a7440627-50e2-427f-a08f-f9acecb18f6d","resolution":{"observed_at":"2026-08-06T14:51:25.378319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-19T21:41:44.622958Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T14:51:25.400168Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.400168Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:4988a65a5d77457785c304fe82d3d400443270a8d86ddbae563c462ab2b07c2f","observation_id":"6a8794c5-e013-4c25-839e-2ec8f30c545c","resolution":{"observed_at":"2026-08-06T14:51:25.400168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T14:51:25.374231Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.374231Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:2887ec31b4059f4c545018d3b4552f9cf35a67aefceed76e96bb79e6b5ccd1b8","observation_id":"cb4fb983-6682-461f-8570-5f87f50e3973","resolution":{"observed_at":"2026-08-06T14:51:25.374231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T14:51:25.389900Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.389900Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:f244883ddc5530c7807d9b3ea11eeef503348e7d07099cf87e4ce79da0ba9461","observation_id":"6559628d-565c-4fa1-b7d0-9c0e26d7c9de","resolution":{"observed_at":"2026-08-06T14:51:25.389900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T14:51:25.386031Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T14:51:25.386031Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.17515"},"observation_digest":"sha256:ba3f30ecdc09b1a35f8b8b811d1df9175c1d038bb1c913476bb90f68504707da","observation_id":"be06d7d8-bd0f-4fba-8ed6-6c9a0d21f315","resolution":{"observed_at":"2026-08-06T14:51:25.386031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.17515","last_updated":"2025-07-23T13:52:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:13:50.722826Z","submitted_at":"2025-07-23T13:52:27Z","title":"URPO: A Unified Reward & Policy Optimization Framework for Large Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 3 inbound Pith citation observations for arXiv:2507.17515."}