{"as_of":"2026-08-09T14:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4847b6171cdd2c6140b46e3e2975640987e0287f1d93f07051fd705e5997cc4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T06:04:01.630684Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:26:29.891495Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-09T06:04:01.630684Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03095","last_updated":"2025-02-05T11:41:43Z","snapshot_observed_at":"2026-08-09T07:07:23.846920Z","submitted_at":"2025-02-05T11:41:43Z","title":"Reveal the Mystery of DPO: The Connection between DPO and RL Algorithms","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T06:04:01.630684Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2502.03095"},"observation_digest":"sha256:c9f2bc23e926affd418d3c76628494b44fdf6c71e02fbc205faf72bb4ae82c2e","observation_id":"b252c8a5-7a7f-4a73-b37a-d5639dbc3f5a","resolution":{"observed_at":"2026-08-09T06:04:01.630684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-08T18:10:53.450848Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-09T13:54:38.102857Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.450848Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:bddde01f0d74fff5834e7182536c8e2f99e9bce46885af936fc22d9bc2fe2aa1","observation_id":"0247b814-5dab-4ed2-8f03-997e2df12d94","resolution":{"observed_at":"2026-08-08T18:10:53.450848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T14:52:54.045722Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17315","last_updated":"2026-06-02T22:13:24Z","snapshot_observed_at":"2026-08-07T22:00:02.564609Z","submitted_at":"2025-05-22T22:09:47Z","title":"Longer Context, Deeper Thinking: Uncovering the Role of Long-Context Ability in Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:54.045722Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.17315"},"observation_digest":"sha256:1ab05ce1ba6905147e4fdf4db6ab706b584a5cc766e0c7f4229c2f4552275054","observation_id":"889509a3-c750-4706-85c5-c48ab90abe70","resolution":{"observed_at":"2026-08-07T14:52:54.045722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T14:16:36.509160Z","title":"Genome Engineering using CRISPR/- Cas Systems,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:36.509160Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:78af7669d6567ee08978f7109babbf8ced673c6013c2b84487febeadc85aee6f","observation_id":"d3bbb883-9740-4886-bf2b-91166959f7c4","resolution":{"observed_at":"2026-08-07T14:16:36.509160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T14:11:32.199965Z","title":"[Zhong et al., 2024] Han Zhong, Guhao Feng, Wei Xiong, Li Zhao, Di He, Jiang Bian, and Liwei Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:32.199965Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:93f6410aefefe7672a2ce15924ab3c2e0eaf92eda968f86aa4312d6c1849f9c4","observation_id":"c4de7e60-b185-4ffc-a5e9-0029ea61649a","resolution":{"observed_at":"2026-08-07T14:11:32.199965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T11:32:29.379167Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-09T00:47:31.746531Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:29.379167Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:a539bc8374343213d923dba8422afbbfe1c4e97499e47fb81cf45ea7abee07d0","observation_id":"c31fd329-18ae-4c4a-af35-5ef3063ac485","resolution":{"observed_at":"2026-08-07T11:32:29.379167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T00:33:56.770706Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13888","last_updated":"2025-06-16T18:10:51Z","snapshot_observed_at":"2026-08-07T00:24:17.297652Z","submitted_at":"2025-06-16T18:10:51Z","title":"VL-GenRM: Enhancing Vision-Language Verification via Vision Experts and Iterative Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T00:33:56.770706Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2506.13888"},"observation_digest":"sha256:77207ee743eab13fe12a4a3d78264724ec682b4860328093fadad811806cfd45","observation_id":"4dc8e471-1f47-4447-9f08-d0e01cf6afef","resolution":{"observed_at":"2026-08-07T00:33:56.770706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-06T16:34:25.297970Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":116,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.297970Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:779fe062e132eed7b01eb0069a4b970f37a673f2a816fa9fb07e2842024f3255","observation_id":"99c591d9-b88d-4fbb-b681-f880534ff6fc","resolution":{"observed_at":"2026-08-06T16:34:25.297970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-06T14:13:07.171442Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf, May 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19672","last_updated":"2025-07-25T20:52:58Z","snapshot_observed_at":"2026-08-07T12:02:14.124506Z","submitted_at":"2025-07-25T20:52:58Z","title":"Alignment and Safety in Large Language Models: Safety Mechanisms, Training Paradigms, and Emerging Challenges","version":1},"reference_index":241,"source":"arxiv_source","source_observed_at":"2026-08-06T14:13:07.171442Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2507.19672"},"observation_digest":"sha256:9830932da08e68c018babcf3d130875bca003b97c701bc95ea8cadd4a8e4180d","observation_id":"4b519ca3-8bb9-4684-b640-aa5f040cee17","resolution":{"observed_at":"2026-08-06T14:13:07.171442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-05T20:20:56.616695Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10839","last_updated":"2025-08-14T17:05:44Z","snapshot_observed_at":"2026-08-07T07:02:18.670963Z","submitted_at":"2025-08-14T17:05:44Z","title":"Reinforced Language Models for Sequential Decision Making","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:20:56.616695Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2508.10839"},"observation_digest":"sha256:60372f191f36875ced2c4140e0f0d099d35372a92d560200a9abbc9d52110495","observation_id":"50ee1f6f-2450-4e74-b775-ef523dadca71","resolution":{"observed_at":"2026-08-05T20:20:56.616695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T20:30:17.581842Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2510.08141"},"observation_digest":"sha256:3f5f5795bf426233af13578a28709259673bbe66ee5b00ec33cbf7702842c07d","observation_id":"49e5d7b9-3262-4791-be36-9cff586dd82b","resolution":{"observed_at":"2026-05-21T20:30:35.448387Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-03T03:04:45.181190Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:45.181190Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:5726872ce7a88858b2e5561d071a632fdd4cf0732fcac0f476210645d4ebadfe","observation_id":"53e47d89-a31c-4e6e-af69-5298c870e248","resolution":{"observed_at":"2026-08-03T03:04:45.181190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-02T19:53:09.115910Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.00963","last_updated":"2026-06-01T02:47:36Z","snapshot_observed_at":"2026-08-06T07:57:44.856455Z","submitted_at":"2026-03-01T07:40:12Z","title":"Stabilizing Policy Optimization via Logits Convexity","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T19:53:09.115910Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2603.00963"},"observation_digest":"sha256:c6bff0039aa9ec9264c1eb3909f8bf34a5d6911cfc7b199128b2b38b97a17958","observation_id":"221083bd-c429-4d9a-9d64-47c01145b324","resolution":{"observed_at":"2026-08-02T19:53:09.115910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2603.07433","last_updated":"2026-05-13T01:27:10Z","snapshot_observed_at":"2026-08-09T13:21:23.189786Z","submitted_at":"2026-03-08T03:10:39Z","title":"Data Agent: Learning to Select Data via End-to-End Dynamic Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T15:23:23.950152Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2603.07433"},"observation_digest":"sha256:2a0c5e8a403b9fcea6386b1c9d513c0af28cba0b780d4a708e723c92887118dd","observation_id":"c6edb85f-1d54-4e2e-b47c-4c321981fc4f","resolution":{"observed_at":"2026-05-15T15:26:10.907667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2604.06804","last_updated":"2026-04-08T08:17:25Z","snapshot_observed_at":"2026-08-02T18:54:27.178723Z","submitted_at":"2026-04-08T08:17:25Z","title":"LASER: A Data-Centric Method for Low-Cost and Efficient SQL Rewriting based on SQL-GRPO","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:04.225059Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2604.06804"},"observation_digest":"sha256:402a931a57f329c6e348a6da4d4e6e74a7fed57b6a150d151ac6f0413c31826a","observation_id":"67517349-28f0-43f7-bcc5-089ed583c2bc","resolution":{"observed_at":"2026-05-11T07:16:02.137107Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2605.11217","last_updated":"2026-05-11T20:29:39Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:29:39Z","title":"Leveraging RAG for Training-Free Alignment of LLMs","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-13T02:41:07.016045Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2605.11217"},"observation_digest":"sha256:d1dce03dfd8c605413a71211e7210737109ae9fa8dd3b657ea664a4b48833397","observation_id":"4f94fb72-2b09-4a9c-bbe7-9d8a3c520e93","resolution":{"observed_at":"2026-05-13T02:42:08.175821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:8871dc1394a006ee6f2ff494e4a5dc4587eaf2a60d12fd7465851efbd32248f3","observation_id":"5e8257b5-3f06-4443-a5d7-190b1c47cf5a","resolution":{"observed_at":"2026-05-13T04:57:17.231849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:4b96f267459718b68be81f0880769408b3a8d6de7233c6982c1ae8a39ae40787","observation_id":"1d51c5b1-3850-4a7d-9b06-c6f90c87d07e","resolution":{"observed_at":"2026-05-15T05:45:06.597442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2605.24005","last_updated":"2026-05-30T07:28:43Z","snapshot_observed_at":"2026-08-01T08:48:45.727255Z","submitted_at":"2026-05-19T07:27:50Z","title":"LC-ERD: Mining Latent Logic for Self-Evolving Reasoning via Consistency-Regulated Reward Decomposition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T18:44:14.878564Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2605.24005"},"observation_digest":"sha256:315d638cd3a0e0015e80a559f9d0b78cf6f77bfd9d27bd6da2030309710c9cf0","observation_id":"3aaa981a-1563-4582-893a-02f8c5267fe0","resolution":{"observed_at":"2026-06-30T18:45:00.011746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":"2404.18922","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-02T03:26:29.891495Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922","venue":null,"work_id":"f26483a9-ed17-46f4-b818-4362b330a98e","year":2024},"citing_paper":{"arxiv_id":"2606.03937","last_updated":"2026-06-03T10:57:29Z","snapshot_observed_at":"2026-08-07T09:41:05.441336Z","submitted_at":"2026-06-02T17:26:55Z","title":"Entropy Is Not Enough: Unlocking Effective Reinforcement Learning for Visual Reasoning via Vision-Anchored Token Selection","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T09:58:34.557353Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2606.03937"},"observation_digest":"sha256:c7ef9153777919e7a9c06d0863dea935a12064736e70309183f57dcca8bf2ff4","observation_id":"bc0dafb7-0105-4645-91a7-0b0856f5d5c4","resolution":{"observed_at":"2026-07-02T03:26:29.893054Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2404.18922 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:917368b496097e255526dea6ebcebe6607c6e1e9d7445ab5cbb656b91a5959ce","observation_id":"697697b2-7bb0-4d44-972b-3bbb27b06c37","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-02T08:41:06.696808Z","title":"arXiv preprint arXiv:2404.18922 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":292,"source":"arxiv_source","source_observed_at":"2026-08-02T08:41:06.696808Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:3860307f401f52bd5a5c511cd7fbae354a1f0e27fdfe58cbd70314f4475ea7c5","observation_id":"943e17f6-f6c4-493b-86dd-ea745a096419","resolution":{"observed_at":"2026-08-02T08:41:06.696808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-01T18:39:41.185696Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-07T01:23:16.372746Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.185696Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:583914692c386027f8d47e14541fa441f65843c458fad5c3d8bdaa418176d8d4","observation_id":"ee81150d-a934-48b1-8599-f78542a401ea","resolution":{"observed_at":"2026-08-01T18:39:41.185696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.18922/citation-record","integrity":"/paper/2404.18922/integrity","json":"/paper/2404.18922/citation-record.json","paper":"/paper/2404.18922"},"outbound":[],"paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2404.18922."}