{"as_of":"2026-08-07T05:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85c9f623fe98ca17a377b1349abf480fd4a5419d58291dfea6a0d31a3f7bb007","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:53:09.484847Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T20:58:19.104482Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:56:01.761633Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"cited_work":{"arxiv_id":"2603.00963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.00963","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stabi- lizing policy optimization via logits convexity.arXiv preprint arXiv:2603.00963","venue":null,"work_id":"7aaa305e-9e20-4be6-9b58-79b04d3b22c7","year":null},"citing_paper":{"arxiv_id":"2604.13197","last_updated":"2026-08-04T16:37:12Z","snapshot_observed_at":"2026-08-07T05:14:50.373387Z","submitted_at":"2026-04-14T18:19:54Z","title":"Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:15.962965Z"},"links":{"cited_paper":"/paper/2603.00963","citing_paper":"/paper/2604.13197"},"observation_digest":"sha256:3aaaa78f9fffcc958eb27a66e963821c20e4242eaa94bd7045ac7820cfd85ff2","observation_id":"b0a4bd84-7b6f-40d8-85b9-1a1e00f6396a","resolution":{"observed_at":"2026-06-02T03:04:05.363647Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.00963","snapshot_observed_at":"2026-07-12T20:58:19.104482Z","title":"Stabi- lizing policy optimization via logits convexity.arXiv preprint arXiv:2603.00963,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.13197","last_updated":"2026-08-04T16:37:12Z","snapshot_observed_at":"2026-08-07T05:14:50.373387Z","submitted_at":"2026-04-14T18:19:54Z","title":"Unleashing Implicit Rewards: Prefix-Value Learning for Distribution-Level Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T20:58:19.104482Z"},"links":{"cited_paper":"/paper/2603.00963","citing_paper":"/paper/2604.13197"},"observation_digest":"sha256:140c3c5c18bf56cebe8e5579b9c7c6c77db902c8e897817511d6700b32f754c5","observation_id":"22b2d736-9ff7-4af2-aba3-6e4e5900bae4","resolution":{"observed_at":"2026-07-12T20:58:19.104482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.00963/citation-record","integrity":"/paper/2603.00963/integrity","json":"/paper/2603.00963/citation-record.json","paper":"/paper/2603.00963"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-07T04:50:43.413490Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-02T19:53:07.595577Z","title":"Minimax- m1: Scaling test-time compute efficiently with lightning attention.arXiv preprint arXiv:2506.13585, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:07.595577Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:377380bdc0e4125c1a686a93c91153c15246b507c9c582cbd69cff152e132be7","observation_id":"404904fe-7036-4f2d-a49d-842460e67567","resolution":{"observed_at":"2026-08-02T19:53:07.595577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T04:45:43.043822Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-02T19:53:07.706557Z","title":"press/v235/cui24f.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:07.706557Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:569aa238bf93a94883bdadbde2631343f2a3aa8a0f69489919437ab0b3d66214","observation_id":"73a0700a-0d2e-4a57-a14a-421d727feebb","resolution":{"observed_at":"2026-08-02T19:53:07.706557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-02T19:53:07.813705Z","title":"Minillm: Knowl- edge distillation of large language models.arXiv preprint arXiv:2306.08543,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:07.813705Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:4178dbbacb1fa5ca2a075e81be52cd75fcae6a95fa4cf7d923d0c23c52e5df87","observation_id":"59dbce43-6432-4300-b4d8-c551396d6bbe","resolution":{"observed_at":"2026-08-02T19:53:07.813705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-02T19:53:08.307029Z","title":"From $r$ to $qˆ*$: Your language model is secretly a q- function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.307029Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:641561cff42a71e30c265c20f6508458f22ea4e3cc5d6ebe3a0312986fb3c8bd","observation_id":"1ffb8ba8-62cd-47d8-aa2a-61471182c523","resolution":{"observed_at":"2026-08-02T19:53:08.307029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14731","last_updated":"2025-06-18T02:53:14Z","snapshot_observed_at":"2026-08-07T00:07:34.919609Z","submitted_at":"2025-06-17T17:12:34Z","title":"Ring-lite: Scalable Reasoning via C3PO-Stabilized Reinforcement Learning for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14731","snapshot_observed_at":"2026-08-02T19:53:08.502936Z","title":"Ring-lite: Scalable reasoning via c3po-stabilized reinforcement learning for llms.arXiv preprint arXiv:2506.14731,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.502936Z"},"links":{"cited_paper":"/paper/2506.14731","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:f7056a2b1ad3e8adb2594b453dedde652604a8d89173970e623977ec0819a083","observation_id":"c822d43c-a000-4fea-8898-e4eba2f046e8","resolution":{"observed_at":"2026-08-02T19:53:08.502936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T19:53:08.621723Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.621723Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:76fc2d20ab6013c999f760fb8a7272073024ceb8b628fef492b05a9a5fcab6b4","observation_id":"9b95b6dd-9cba-47c4-ba27-802b4ecd1a1f","resolution":{"observed_at":"2026-08-02T19:53:08.621723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-07T02:56:21.377033Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-08-02T19:53:08.739032Z","title":"What’s behind ppo’s collapse in long-cot? value optimization holds the secret.arXiv preprint arXiv:2503.01491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.739032Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:6dcaaa6e7b9fc8a216899255b11f367b757b05c8844b8efa97a511f0150bb253","observation_id":"7951a39a-8e29-4105-9e88-6df39b8ef26c","resolution":{"observed_at":"2026-08-02T19:53:08.739032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02835","last_updated":"2025-05-09T13:39:58Z","snapshot_observed_at":"2026-08-05T02:34:33.557081Z","submitted_at":"2025-05-05T17:59:50Z","title":"R1-Reward: Training Multimodal Reward Model Through Stable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02835","snapshot_observed_at":"2026-08-02T19:53:08.856440Z","title":"R1-reward: Training multimodal reward model through stable rein- forcement learning.arXiv preprint arXiv:2505.02835,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.856440Z"},"links":{"cited_paper":"/paper/2505.02835","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:b328a103a63fc05697c5598fadf18801bb4fb02521c13880900a8811811ba9af","observation_id":"20f7ae9c-bff9-4157-9b2c-6b5ac5d508e4","resolution":{"observed_at":"2026-08-02T19:53:08.856440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-02T19:53:08.971429Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.971429Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:947c6955ff22fe8d980f75e8ccbfa9f91ee8cb2b8ab92b48b8c047fdeb59bd96","observation_id":"0b4f0e5c-2109-440b-8fed-60bde5b5d0b8","resolution":{"observed_at":"2026-08-02T19:53:08.971429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-02T19:53:09.115910Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:09.115910Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:c6bff0039aa9ec9264c1eb3909f8bf34a5d6911cfc7b199128b2b38b97a17958","observation_id":"221083bd-c429-4d9a-9d64-47c01145b324","resolution":{"observed_at":"2026-08-02T19:53:09.115910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15868","last_updated":"2025-09-08T10:20:38Z","snapshot_observed_at":"2026-08-05T18:06:32.818174Z","submitted_at":"2025-08-21T00:20:47Z","title":"CARFT: Boosting LLM Reasoning via Contrastive Learning with Annotated Chain-of-Thought-based Reinforced Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15868","snapshot_observed_at":"2026-08-02T19:53:09.204030Z","title":"Carft: Boosting llm reasoning via contrastive learning with an- notated chain-of-thought-based reinforced fine-tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:09.204030Z"},"links":{"cited_paper":"/paper/2508.15868","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:8d491ed7eed415bbc60f8513229c6496dd1a2ce3b6efaba43066e9e9b72536fb","observation_id":"2391cd77-dfb3-4a1b-886f-c5b2b48ee6cd","resolution":{"observed_at":"2026-08-02T19:53:09.204030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:53:09.278564Z","title":"To address this, they propose a pretraining procedure for the value model, and decouple the λ in GAE for the policy and value model computations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:09.278564Z"},"links":{"citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:8e6a820ba5a967cc32351623f88eeaedf488d9ddf30e948ce0a546b6a52d4fbf","observation_id":"15919a99-9074-41fb-b1e1-c97b3525a8ad","resolution":{"observed_at":"2026-08-02T19:53:09.278564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:53:09.354384Z","title":"Similarly, Shao et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:09.354384Z"},"links":{"citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:49cf10be075d06f0e92fd3f6a78168e5887766f726870adcd14eee0b535bb648","observation_id":"972b9aed-1cc3-410a-bc62-018c17593ba8","resolution":{"observed_at":"2026-08-02T19:53:09.354384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:53:09.484847Z","title":"Building upon the same idea, DCPO (Yang et al., 2025b) addresses the limitation in DAPO, where the same clip range is set for different positions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:09.484847Z"},"links":{"citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:ae3e8fe1a481d7f0710c64a0448694c8210b9d3438481d9ed9f3a94c4af49b55","observation_id":"04fcd6b7-ccd5-4a9d-ac89-fe4776e09aef","resolution":{"observed_at":"2026-08-02T19:53:09.484847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T19:53:08.385115Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.385115Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:876eea921530e7a2c4b7d8f18b3b75f29df9459ece2ae692151e246dc47dfdcb","observation_id":"906355fb-d127-40b4-8a78-ba2ec430365a","resolution":{"observed_at":"2026-08-02T19:53:08.385115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T19:53:08.113911Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.113911Z"},"links":{"citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:804c5ae81b7236f8ba45d1257796195dcdef3652626821cb517d02a7fd895004","observation_id":"43196cf2-9d1d-4c7e-8452-a3ed04166d7f","resolution":{"observed_at":"2026-08-02T19:53:08.113911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23235","last_updated":"2025-06-29T13:45:54Z","snapshot_observed_at":"2026-08-06T21:45:17.363392Z","submitted_at":"2025-06-29T13:45:54Z","title":"Generalist Reward Models: Found Inside Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23235","snapshot_observed_at":"2026-08-02T19:53:08.222944Z","title":"Generalist re- ward models: Found inside large language models.arXiv preprint arXiv:2506.23235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.222944Z"},"links":{"cited_paper":"/paper/2506.23235","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:2d484c1f8ab1c369a1382812ca5633260064d4e8d88ae9949105925e2cb569f0","observation_id":"8a908f5f-d786-4004-a0c4-5edab5a2b6e7","resolution":{"observed_at":"2026-08-02T19:53:08.222944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T19:53:07.923480Z","title":"Deepseek-r1: In- centivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:07.923480Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:c01e303489aa5293141075aa9d69f7d7fe648528b53625d98035e4fae800c661","observation_id":"faadda65-7e26-489b-a2a4-0e551a95f1db","resolution":{"observed_at":"2026-08-02T19:53:07.923480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16574","last_updated":"2024-12-08T14:22:13Z","snapshot_observed_at":"2026-07-06T18:50:43.893885Z","submitted_at":"2024-07-23T15:27:37Z","title":"TLCR: Token-Level Continuous Reward for Fine-grained Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16574","snapshot_observed_at":"2026-08-02T19:53:07.503407Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:07.503407Z"},"links":{"cited_paper":"/paper/2407.16574","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:98026d84ccda64160d0954ac4aa763e3bc67f61831c222c58c71988d99514039","observation_id":"69356ac8-eeec-4bed-9ebf-82ed49ed2f7a","resolution":{"observed_at":"2026-08-02T19:53:07.503407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-02T19:53:08.005719Z","title":"K., Xu, H., and Shen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:08.005719Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:8c93cd21e62b392e318b33f9b3f93eab260b843080ee1194cbf0f75aa4c97b07","observation_id":"64088392-ed46-4f74-a279-93297f8bb234","resolution":{"observed_at":"2026-08-02T19:53:08.005719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 2 inbound Pith citation observations for arXiv:2603.00963."}