{"as_of":"2026-08-15T22:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4d8598427e01f361ceee443868dc700b365f18bc389eb36df81251a0697b244","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":67,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:07:08.079012Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T11:16:11.296273Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-13T20:49:59.656333Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T01:42:19.004468Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2410.08146"},"observation_digest":"sha256:6a3ffc842708a5457f53bb1a94c982f7f987682a8ffb5059d372092ba3e7117e","observation_id":"d46ce63e-8996-4551-81a3-11bee3ec1ad3","resolution":{"observed_at":"2026-05-21T01:42:19.201696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-11T21:58:46.573945Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03920","last_updated":"2025-07-20T01:35:50Z","snapshot_observed_at":"2026-08-13T18:26:40.752514Z","submitted_at":"2024-12-05T06:46:46Z","title":"A Survey on Large Language Model-Based Social Agents in Game-Theoretic Scenarios","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T21:58:46.573945Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2412.03920"},"observation_digest":"sha256:97aa39265476e393b487350bf600b8360af31c1a35495b15cea89458dea434e3","observation_id":"09915755-9dcb-4e1b-b0af-9d6ef12953fd","resolution":{"observed_at":"2026-08-11T21:58:46.573945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-11T17:57:44.301141Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08347","last_updated":"2024-12-11T12:41:36Z","snapshot_observed_at":"2026-08-14T23:45:37.142961Z","submitted_at":"2024-12-11T12:41:36Z","title":"SmolTulu: Higher Learning Rate to Batch Size Ratios Can Lead to Better Reasoning in SLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T17:57:44.301141Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2412.08347"},"observation_digest":"sha256:748fe3fd70725a7f5a678902274ec149dfcbae808f08902f6ef074cacf83c6fc","observation_id":"24be95d8-0663-42f6-9192-92e5cd642d3e","resolution":{"observed_at":"2026-08-11T17:57:44.301141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-10T21:51:08.144783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.03884","last_updated":"2025-05-30T04:56:02Z","snapshot_observed_at":"2026-08-14T02:18:54.465541Z","submitted_at":"2025-01-07T15:46:42Z","title":"AlphaPO: Reward Shape Matters for LLM Alignment","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T21:51:08.144783Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2501.03884"},"observation_digest":"sha256:d7ce3d01fbd33fde1ba6377baed83db2ab1617d6e8c4f91b8570e08c21c90dfe","observation_id":"d43bdd78-07f9-409b-8162-5646d56c8996","resolution":{"observed_at":"2026-08-10T21:51:08.144783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:30450b9c05da1d2c7b96f4a725d5d5460c898ecf168aa82c92f335065abf189a","observation_id":"2c82506e-c364-4e71-897b-b8ac5ab0a83f","resolution":{"observed_at":"2026-05-15T21:20:59.221163Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-10T18:05:43.046044Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-10T17:58:02.856512Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T18:05:43.046044Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2501.11651"},"observation_digest":"sha256:e7ebf1e7c446bff12218ce35574b566b6f314f13331f30081f9ac9f1cacfd792","observation_id":"7264ae2e-8654-42d1-9a4e-1d75ffc76cea","resolution":{"observed_at":"2026-08-10T18:05:43.046044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-11T20:23:30.763794Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2502.01456"},"observation_digest":"sha256:7835da63b91a3eb3f47692c80c30f9729df9f88def95d75c4d86e58bfbf49c7b","observation_id":"660afd43-a456-4ade-93de-089f31c37342","resolution":{"observed_at":"2026-05-11T20:23:30.899521Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-09T14:56:00.220169Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-14T15:03:39.227865Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:56:00.220169Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2502.01600"},"observation_digest":"sha256:2116542a8d9622e7bdf1f42d1c8aced53ef7c9c42c60cdabe15f2ae89204d7e3","observation_id":"d8060d98-83f4-4402-b46b-a9de15137134","resolution":{"observed_at":"2026-08-09T14:56:00.220169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-08T14:27:51.010658Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06781","last_updated":"2025-02-10T18:57:29Z","snapshot_observed_at":"2026-08-09T17:45:05.773418Z","submitted_at":"2025-02-10T18:57:29Z","title":"Exploring the Limit of Outcome Reward for Learning Mathematical Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T14:27:51.010658Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2502.06781"},"observation_digest":"sha256:e71d11332726abdf154b688cfc07af2fd53ea4feb574edc049f349acad5c16fc","observation_id":"f8d070c7-893d-42df-86e7-3ed7693068de","resolution":{"observed_at":"2026-08-08T14:27:51.010658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2502.12272","last_updated":"2026-04-30T11:57:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-17T19:16:37Z","title":"Learning to Reason at the Frontier of Learnability","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T02:41:21.571824Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2502.12272"},"observation_digest":"sha256:f54f90ed117b63b7d500dfc65bba502d4171652abc836eb18771249770cb657d","observation_id":"66fa54c1-421c-4938-8538-0c19b137cf03","resolution":{"observed_at":"2026-05-23T02:42:26.025966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T23:33:10.824995Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2503.14476"},"observation_digest":"sha256:6c6a4c3cc9a5d0d79d51af6b000e62c88c6d17104edfb0a04da9e22346bf7ea3","observation_id":"531ef94a-12a6-4835-b0ef-ade283579f4a","resolution":{"observed_at":"2026-05-22T23:35:13.436228Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-15T00:17:23.280437Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":165,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:86d4487cd5fa65f8c59c6253fd7545f309e791cf8a6f2a04f780bcfde177c7c6","observation_id":"9884ecf5-e565-4cd1-8f51-55f1320569f9","resolution":{"observed_at":"2026-05-22T19:32:01.369168Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-22T18:46:11.571831Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2504.13818"},"observation_digest":"sha256:60d40c295cd3eebf26f90ca4a30accefbee64ca0720053f9bdba3c6112b9e727","observation_id":"679cdec8-d62f-4978-b54c-89a068006e56","resolution":{"observed_at":"2026-05-22T18:46:56.989883Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-08-15T17:20:54.840134Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:04.779597Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2504.20571"},"observation_digest":"sha256:4f8eb97f11484b201da54a07144694df6ce4551f991b787278ca0420e173088b","observation_id":"5c437fa1-e43b-4fe2-9ac4-1f9243aeb264","resolution":{"observed_at":"2026-05-15T19:51:04.893040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-15T21:07:08.079012Z","title":"Courville, and Nicolas Le Roux","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.10937","last_updated":"2025-05-16T07:15:30Z","snapshot_observed_at":"2026-08-15T20:58:31.954810Z","submitted_at":"2025-05-16T07:15:30Z","title":"Reasoning with OmniThought: A Large CoT Dataset with Verbosity and Cognitive Difficulty Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:07:08.079012Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.10937"},"observation_digest":"sha256:9dbdd7d0ace85a0fe4b98ee899e3ce096f94d4c5847d639c35e584034b23cafd","observation_id":"e3dc08e0-b3c8-4c0a-8ac5-5e1252dd3826","resolution":{"observed_at":"2026-08-15T21:07:08.079012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2505.10978","last_updated":"2025-10-28T15:11:36Z","snapshot_observed_at":"2026-07-29T19:20:21.974239Z","submitted_at":"2025-05-16T08:26:59Z","title":"Group-in-Group Policy Optimization for LLM Agent Training","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T09:15:08.193357Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.10978"},"observation_digest":"sha256:1501741f4e3d207c659a1df19d4b8e00d98090d64775f103db96879df38fb47a","observation_id":"2fd4e5a9-2fff-427d-9069-f95664080fc9","resolution":{"observed_at":"2026-05-11T09:15:08.648122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T14:56:16.694006Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17218","last_updated":"2025-05-22T18:48:09Z","snapshot_observed_at":"2026-08-15T16:43:46.089116Z","submitted_at":"2025-05-22T18:48:09Z","title":"Effective Reinforcement Learning for Reasoning in Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:56:16.694006Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.17218"},"observation_digest":"sha256:e57cf4bb5e9dfc6b6ecb2aacec7f1508e17449644fac633e9ce6c1444e1293c7","observation_id":"63b5de8a-0e45-4078-b03c-0c1fcbee1a0e","resolution":{"observed_at":"2026-08-07T14:56:16.694006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T12:45:26.663718Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24034","last_updated":"2025-06-02T01:49:51Z","snapshot_observed_at":"2026-08-13T20:34:22.010534Z","submitted_at":"2025-05-29T22:14:15Z","title":"LlamaRL: A Distributed Asynchronous Reinforcement Learning Framework for Efficient Large-scale LLM Training","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:26.663718Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.24034"},"observation_digest":"sha256:b2204d0e4f22968664abda5ee78ba920138a87c800b0c63e931ca9de5113a68f","observation_id":"5139bbd4-11cc-4431-be00-5e305202204e","resolution":{"observed_at":"2026-08-07T12:45:26.663718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T12:32:21.867757Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24273","last_updated":"2026-08-09T16:14:48Z","snapshot_observed_at":"2026-08-13T23:25:57.636484Z","submitted_at":"2025-05-30T06:49:00Z","title":"How Much Backtracking is Enough? Exploring the Interplay of SFT and RL in Enhancing LLM Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:21.867757Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2505.24273"},"observation_digest":"sha256:747aa57314bb42425040c85fdbf2fc7967f4444fd604fe3a18e9b3461eb67e33","observation_id":"743dc8c4-c296-4e3d-837d-dbfc0f4d43cc","resolution":{"observed_at":"2026-08-07T12:32:21.867757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T11:33:54.702600Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-08-14T16:24:43.409019Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:33:54.702600Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.02177"},"observation_digest":"sha256:e389d7249ab0325265f24ec2219d29e505a9cfbc78a6d8f376bbf24332ed93f4","observation_id":"aedd8de2-cdae-4679-b01c-fc73610148f5","resolution":{"observed_at":"2026-08-07T11:33:54.702600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T11:32:30.026404Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment.arXiv preprint arXiv:2410.01679, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-13T09:31:50.592140Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.026404Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:a1241a6890a5e018a59abeae0964ff5de4c64638670f011fb774a418cf8a6e0d","observation_id":"229e0672-ac94-41c0-aad3-7d737231e735","resolution":{"observed_at":"2026-08-07T11:32:30.026404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T05:14:47.060414Z","title":"Kazemnejad, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-14T14:15:07.219394Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:47.060414Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:9fa24f39d42ed515498e99fbecf86516bd9ae43f0ed6698fad0843683c651932","observation_id":"3157642f-77c6-4d89-837c-c2ca43862907","resolution":{"observed_at":"2026-08-07T05:14:47.060414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T04:47:42.410649Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09659","last_updated":"2025-06-11T12:26:45Z","snapshot_observed_at":"2026-08-15T01:56:52.424689Z","submitted_at":"2025-06-11T12:26:45Z","title":"Intent Factored Generation: Unleashing the Diversity in Your Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T04:47:42.410649Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.09659"},"observation_digest":"sha256:50099703c889bca4c4827c3bdcbb6d2de8e7409ba65b16d2087d066107b152db","observation_id":"ecaff3a5-cd06-4143-839f-ef6f18d77e92","resolution":{"observed_at":"2026-08-07T04:47:42.410649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T01:08:21.838257Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-13T15:48:13.584758Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:21.838257Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:bf76b3b2aaa35714b5f309c090e9a8f2599c151565c6e44d284b898d1318e026","observation_id":"ebe55ede-7678-4f2c-8c1e-c65490ac9874","resolution":{"observed_at":"2026-08-07T01:08:21.838257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-06T23:35:35.793524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17533","last_updated":"2025-06-21T01:11:01Z","snapshot_observed_at":"2026-08-14T05:37:59.022330Z","submitted_at":"2025-06-21T01:11:01Z","title":"DuaShepherd: Integrating Stepwise Correctness and Potential Rewards for Mathematical Reasoning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:35.793524Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.17533"},"observation_digest":"sha256:fab5baed5168b1440991bfd8456a95dc24502a9eab6a0ce7120563d4be2863de","observation_id":"abef9125-2b0d-482e-9369-b428b999344d","resolution":{"observed_at":"2026-08-06T23:35:35.793524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-06T23:28:37.524741Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment.arXiv preprint arXiv:2410.01679, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18237","last_updated":"2025-06-23T02:06:04Z","snapshot_observed_at":"2026-08-13T13:54:40.411919Z","submitted_at":"2025-06-23T02:06:04Z","title":"AdapThink: Adaptive Thinking Preferences for Reasoning Language Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:37.524741Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.18237"},"observation_digest":"sha256:164e7d4da5c05148a1ace5d059755694b269bb154a01afd2fa1327892277f8ce","observation_id":"7659bb44-44de-4f05-b2e4-a30d560d3f6d","resolution":{"observed_at":"2026-08-06T23:28:37.524741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-06T22:59:47.529281Z","title":"Aghajohari, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20241","last_updated":"2025-06-25T08:36:12Z","snapshot_observed_at":"2026-08-13T16:56:05.130404Z","submitted_at":"2025-06-25T08:36:12Z","title":"Enhancing Large Language Models through Structured Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:59:47.529281Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2506.20241"},"observation_digest":"sha256:1516a196d9ad9a0a1e7102a2a2d313ac472f67ddbddf449f9932433f4c54f031","observation_id":"7a228f38-abdb-453c-813b-0609cfd6acc2","resolution":{"observed_at":"2026-08-06T22:59:47.529281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-06T18:53:12.630333Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.07017","last_updated":"2025-07-09T16:45:48Z","snapshot_observed_at":"2026-08-15T16:34:53.919919Z","submitted_at":"2025-07-09T16:45:48Z","title":"First Return, Entropy-Eliciting Explore","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:53:12.630333Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2507.07017"},"observation_digest":"sha256:9132a6b14acdcd477abbbc98db7d5be0aff3c67708d7b6f2d50013531ba684cd","observation_id":"4fcc9aa5-d6d3-420c-90c1-532a17c17fe1","resolution":{"observed_at":"2026-08-06T18:53:12.630333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-05T23:49:03.216906Z","title":"arXiv preprint arXiv:2410.01679","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-15T20:21:34.671588Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.216906Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:6fb1b4c67be6ed4774ff5997e3b9985b2369950a478e529e01a9cb104bbfaffd","observation_id":"eed7fb36-b81f-4e42-afde-45576bac2ccc","resolution":{"observed_at":"2026-08-05T23:49:03.216906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-15T16:45:52.821880Z","title":"Vineppo: Refining credit assignment in rl training of llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02522","last_updated":"2026-07-18T15:25:51Z","snapshot_observed_at":"2026-08-15T16:35:16.396450Z","submitted_at":"2025-09-02T17:22:46Z","title":"Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T16:45:52.821880Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.02522"},"observation_digest":"sha256:f5dbaf4f65f46c488453d47116b124b55f7378067f44297cca56b74677146013","observation_id":"b07b515e-c171-45cd-8835-0d1c08964fb0","resolution":{"observed_at":"2026-08-15T16:45:52.821880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:60d1d1b0198efa0670e17c683176dceb58ee601682c7cdf05e1875342eb8e3df","observation_id":"6179bf92-2916-48d4-8521-503ca9af2743","resolution":{"observed_at":"2026-05-18T19:21:48.734746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-15T15:55:56.199088Z","title":"Vineppo: Unlocking rl potential for llm reasoning through refined credit assignment.arXiv preprint arXiv:2410.01679, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.16456","last_updated":"2026-06-10T00:25:53Z","snapshot_observed_at":"2026-08-15T15:47:04.404605Z","submitted_at":"2025-09-19T22:30:23Z","title":"GPO: Learning from Critical Steps to Improve LLM Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:55:56.199088Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.16456"},"observation_digest":"sha256:82a782f3c0c62358e44038da144ee5f1a39f5bc73783bdf89e4b3304ab6561ce","observation_id":"258df9e2-bacb-48fb-a5fc-371f2e2d24b5","resolution":{"observed_at":"2026-08-15T15:55:56.199088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:6fca9bfbe313d47f65ba084e221eed77e77b7a3406f27145f3c5688bc83bf399","observation_id":"1fb923ae-a3f1-4e42-be94-8fce0d68c6c1","resolution":{"observed_at":"2026-05-18T11:56:19.879623Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2602.03452","last_updated":"2026-05-06T05:26:15Z","snapshot_observed_at":"2026-08-15T11:16:29.395834Z","submitted_at":"2026-02-03T12:17:25Z","title":"Beyond Variance: Prompt-Efficient RLVR via Rare-Event Amplification and Bidirectional Pairing","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:50.793194Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2602.03452"},"observation_digest":"sha256:dd6443315d764670c5885ccc9f6736f54c5024fb447eebacc83079bc61375da2","observation_id":"054fc3b3-4d4f-442f-83f4-f9d546c5bdd7","resolution":{"observed_at":"2026-05-16T08:27:36.792411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-03T04:17:27.143818Z","title":"Vineppo: Refining credit assignment in rl training of llms.arXiv preprint arXiv:2410.01679, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.05547","last_updated":"2026-08-05T16:57:37Z","snapshot_observed_at":"2026-08-08T23:12:50.234380Z","submitted_at":"2026-02-05T11:06:37Z","title":"Multi-Task GRPO: Reliable LLM Reasoning Across Tasks","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T04:17:27.143818Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2602.05547"},"observation_digest":"sha256:2c95763bb3c7063ee616dc46a2665505841d7e15a760672d36be219bf472f9bf","observation_id":"859fe84f-2850-4502-9cc9-6efb93a0ed50","resolution":{"observed_at":"2026-08-03T04:17:27.143818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-03T03:04:43.791107Z","title":"Vineppo: Refining credit assignment in rl training of llms.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-12T17:14:29.445906Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.791107Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:07c84734377f44324fff472cee4564eb94e388f3807367fef090342051d7f2bb","observation_id":"292aef98-a97d-4cc6-84ce-9f2450eb9a4d","resolution":{"observed_at":"2026-08-03T03:04:43.791107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-03T00:13:26.456107Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11351","last_updated":"2026-06-28T23:49:44Z","snapshot_observed_at":"2026-08-13T00:03:13.729408Z","submitted_at":"2026-02-11T20:40:43Z","title":"Pushing Forward Pareto Frontiers of Proactive Agents with Behavioral Agentic Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T00:13:26.456107Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2602.11351"},"observation_digest":"sha256:9bfecef690e7d14b0f0e5872dd9f02b247410c9bc3aef73c7232fc06d64e1bf6","observation_id":"fdafd0cb-8359-4589-80fa-a54d0b1c4e9f","resolution":{"observed_at":"2026-08-03T00:13:26.456107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T15:12:06.985609Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:dee25d70fcbd275cdabe9e42a735dd8370eed65c4b48c82c62f758944c87201d","observation_id":"5f1fdd7b-4fd3-4395-bb15-b8b36d29d35f","resolution":{"observed_at":"2026-05-11T11:01:06.836055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T01:04:12.454268Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:56dfd1fa20b1c33b605a62d82abb02fe69f8b76c38fca4d21a494fb7f497010c","observation_id":"3e47f047-efc4-40a2-a348-a2ad4ba492e5","resolution":{"observed_at":"2026-05-11T04:50:54.588405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2604.20659","last_updated":"2026-04-22T15:08:58Z","snapshot_observed_at":"2026-08-15T05:16:18.752791Z","submitted_at":"2026-04-22T15:08:58Z","title":"GRPO-VPS: Enhancing Group Relative Policy Optimization with Verifiable Process Supervision for Effective Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T00:14:29.531510Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2604.20659"},"observation_digest":"sha256:661bde011bb41cd73e74855b013f49e861baa63f94ea04dc4378842a6076c04b","observation_id":"3e1195a2-9c35-4c76-8bb9-831c3d69e442","resolution":{"observed_at":"2026-05-10T00:14:46.346210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-15T01:50:12.462125Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:b292fd3d6b7f4cccf03a76b87aeb1d98a5d3972cd1c4b441f43c94284e845265","observation_id":"dbe3be7e-f002-44ec-b718-ec4a4f173752","resolution":{"observed_at":"2026-05-12T10:21:29.789199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-15T01:50:12.462125Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:ff7c22737906746145970ddb4213cc8ac8236abf44a025aa9c893b8d5fdb1745","observation_id":"60df7934-c0f0-41a7-8f8c-79b03742e514","resolution":{"observed_at":"2026-05-11T22:11:17.149688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-08-15T01:50:12.462125Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:5a7773596a867bfa7822c53c190415516cb622ca87b82016ba9f00ca5a1a4ed1","observation_id":"c42d6553-ecef-4eb9-b9a6-0a35e43a5894","resolution":{"observed_at":"2026-05-19T17:02:40.725434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-15T21:47:26.504858Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:c8cd7a996c03f582441115713c92e6b0d9e52cf80f5023784b50f205923b4eb2","observation_id":"b3006c93-5a7d-400d-ac68-89784e893364","resolution":{"observed_at":"2026-05-11T04:00:55.014461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2605.14558","last_updated":"2026-05-14T08:33:02Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:33:02Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T01:46:24.724553Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2605.14558"},"observation_digest":"sha256:99cb7bcd5e5385c32a5a207ab14c0750c35eb39fb8a3ab3b472a9d9ed8a7cd4b","observation_id":"4c6eab82-1882-4d0a-ba4e-38c3655da520","resolution":{"observed_at":"2026-05-15T01:48:28.628790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2605.15113","last_updated":"2026-05-18T19:19:17Z","snapshot_observed_at":"2026-08-15T21:20:33.403754Z","submitted_at":"2026-05-14T17:27:34Z","title":"Learning from Language Feedback via Variational Policy Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T20:34:36.764090Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2605.15113"},"observation_digest":"sha256:9a006a0492c59dc0d9a7eceb8408da1625e682425d46938451a9876379e3de91","observation_id":"285b56dd-05cd-480c-9a83-30f501a7bdb8","resolution":{"observed_at":"2026-05-20T20:39:00.324286Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2605.21235","last_updated":"2026-05-20T14:24:11Z","snapshot_observed_at":"2026-08-12T22:42:33.005869Z","submitted_at":"2026-05-20T14:24:11Z","title":"LamPO: A Lambda Style Policy Optimization for Reasoning Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T05:11:35.785227Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2605.21235"},"observation_digest":"sha256:ad7f4b22fdacf06789b95e7448c6b7f675aca2d7f097eaf0e3343fb0d3ee5449","observation_id":"a054cb16-c7c7-4cb8-960d-33c1654713d8","resolution":{"observed_at":"2026-05-21T05:13:58.415659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2605.21467","last_updated":"2026-05-20T17:53:09Z","snapshot_observed_at":"2026-08-13T09:41:15.718696Z","submitted_at":"2026-05-20T17:53:09Z","title":"DelTA: Discriminative Token Credit Assignment for Reinforcement Learning from Verifiable Rewards","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-21T05:24:46.545570Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2605.21467"},"observation_digest":"sha256:affc81e956c338c1355d8468d791a042e539c65d36b09c5942e8e72e87f17f1a","observation_id":"cdcf3e34-b79e-4657-b783-19a8cfee7570","resolution":{"observed_at":"2026-05-21T05:29:40.147973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2605.27788","last_updated":"2026-05-27T00:11:31Z","snapshot_observed_at":"2026-08-10T00:44:03.306932Z","submitted_at":"2026-05-27T00:11:31Z","title":"Knowing When to Ask: Segment-Level Credit Assignment for LLM Tool Use","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:49:58.677299Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2605.27788"},"observation_digest":"sha256:5ed973f9f230f6c953bfa6b7259e35ccc2ede5116904685fd55b0fd2fbd49056","observation_id":"2000b893-ccfe-487d-8945-36f0bcf0c6b4","resolution":{"observed_at":"2026-06-29T13:53:28.592676Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.00257","last_updated":"2026-05-29T18:42:06Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T18:42:06Z","title":"ARCA: Adapter-Residual Credit Assignment When Token Signals Degenerate","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T22:54:53.415067Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.00257"},"observation_digest":"sha256:dfa8309043f163e35f85efbe7a395b93b1a65362f9bac508de71d14daef51629","observation_id":"313d9a8a-2f6c-4ca2-bfb1-5f815fd7ac08","resolution":{"observed_at":"2026-07-01T19:16:00.836667Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.01281","last_updated":"2026-05-31T15:06:38Z","snapshot_observed_at":"2026-08-13T03:34:38.867341Z","submitted_at":"2026-05-31T15:06:38Z","title":"RLVR without Ineffective Samples: Group Prioritized Off-Policy Optimization for LLM Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:25:50.758630Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.01281"},"observation_digest":"sha256:7465088e5e4a9ca571059ce64d04768003ec84bd46dff539661c86e9132416b5","observation_id":"c4c6f982-3795-4de8-ac5b-69e43e76e27d","resolution":{"observed_at":"2026-07-01T21:16:13.394437Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.04036","last_updated":"2026-06-02T02:31:13Z","snapshot_observed_at":"2026-08-05T09:50:41.075111Z","submitted_at":"2026-06-02T02:31:13Z","title":"Self-Distilled Policy Gradient","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-28T11:24:11.878439Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.04036"},"observation_digest":"sha256:c6962c1c0b7feeec4d9077857b6c3787030245d4bd7b58696288ffef649d9b3c","observation_id":"f062efd6-2eb7-483f-ab81-f3370396598f","resolution":{"observed_at":"2026-07-02T01:56:27.891368Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.11209","last_updated":"2026-04-23T21:25:47Z","snapshot_observed_at":"2026-08-12T16:31:45.768664Z","submitted_at":"2026-04-23T21:25:47Z","title":"ProcessThinker: Enhancing Multi-modal Large Language Models Reasoning via Rollout-based Process Reward","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-04T20:09:16.222780Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.11209"},"observation_digest":"sha256:94abe5628c0f043267c05fec11d9ec9fc8d72251dfc91a283cbc4930012baa04","observation_id":"026f94e9-4d8e-4b7c-a18b-9b97c165eef9","resolution":{"observed_at":"2026-07-04T20:10:07.051662Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-08-15T21:55:25.625601Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:c4bed106abc9baa79c92e9002bf648530fa1b51b933edcb87b041baef14d5e67","observation_id":"c80068eb-114e-436d-abe5-6da4aa2a9fea","resolution":{"observed_at":"2026-07-04T08:09:40.569959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.29476","last_updated":"2026-06-28T16:11:47Z","snapshot_observed_at":"2026-08-14T02:03:49.084110Z","submitted_at":"2026-06-28T16:11:47Z","title":"CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-30T07:48:29.333893Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.29476"},"observation_digest":"sha256:c3fa90f379aac3ea1d8e5b1f2d80ee8ce912bec4dd8eacbeaf0e52bb64755ee8","observation_id":"80f80eab-c7f2-4122-a141-22f610ac46ad","resolution":{"observed_at":"2026-06-30T07:54:22.302365Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2606.29745","last_updated":"2026-06-29T03:42:01Z","snapshot_observed_at":"2026-08-04T21:51:46.402646Z","submitted_at":"2026-06-29T03:42:01Z","title":"ECHO: Learning Epistemically Adaptive Language Agents with Turn-Level Credit","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T04:36:35.213066Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2606.29745"},"observation_digest":"sha256:ad72167760a829d95661db55a48c07b79f0d65d8fa18af5e42fa171ae5d10f50","observation_id":"887dfdeb-cc6e-4321-a082-49098d3643e3","resolution":{"observed_at":"2026-06-30T16:44:56.587708Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-12T05:47:14.970921Z","title":"VinePPO: Refining credit assignment in RL training of LLMs.arXiv preprint arXiv:2410.01679, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02966","last_updated":"2026-07-09T05:23:35Z","snapshot_observed_at":"2026-08-12T21:53:21.913406Z","submitted_at":"2026-07-03T05:17:48Z","title":"Distill Where the Student Goes: Teacher-Regularized RL for English-Evidence Cross-Lingual RAG","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T05:47:14.970921Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.02966"},"observation_digest":"sha256:e2ba410d6bd200bfbf4fe8b04ab44b60f10eeb681c89693e8f3044e4437e6b16","observation_id":"1f894e4c-bd00-49c7-b473-7880171e54e1","resolution":{"observed_at":"2026-07-12T05:47:14.970921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-12T04:43:45.592808Z","title":"arXiv preprint arXiv:2410.01679 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03126","last_updated":"2026-07-07T03:50:51Z","snapshot_observed_at":"2026-08-13T23:08:24.074865Z","submitted_at":"2026-07-03T09:14:27Z","title":"ACPO: Adaptive Credit Policy Optimization via Fine-Grained Surrogate Entropy","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-12T04:43:45.592808Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.03126"},"observation_digest":"sha256:4485a47c2a143b23cbace184732b9a14b8e393e4c5f79bcc9c71426bd7e0d6f5","observation_id":"4e61ab1e-c568-4a6d-9cbf-62b4391d7674","resolution":{"observed_at":"2026-07-12T04:43:45.592808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-07-07T12:31:42.224094Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:30627e75efb3913da911c40d0aebabd5dec4c8061861d09ce1d6174533d8a6ce","observation_id":"f71504bb-3335-4a32-adbd-5d17756fe24e","resolution":{"observed_at":"2026-07-07T12:33:45.165685Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"VinePPO: Unlocking rl potential for llm reasoning through refined credit assignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:bd0fae746acd5c95f678db4b4e02c195bd628bdb63b0b98bc030ba1ddbe019ee","observation_id":"e68e1632-e745-4550-a34c-fc003f8ded03","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2607.07435","last_updated":"2026-07-08T14:06:14Z","snapshot_observed_at":"2026-08-14T08:38:33.153277Z","submitted_at":"2026-07-08T14:06:14Z","title":"RLVP: Penalize the Path, Reward the Outcome","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-09T11:15:06.569421Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.07435"},"observation_digest":"sha256:ee6f48a87df0f85c3aee0c01cda39f29dae0516cdabbaea5a8c91a277d62be7c","observation_id":"cb0895ee-fa12-415a-95cf-58c0b8c7ecdc","resolution":{"observed_at":"2026-07-09T11:16:11.298001Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-02T04:40:38.083853Z","title":"arXiv preprint arXiv:2410.01679 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14171","last_updated":"2026-07-15T09:37:36Z","snapshot_observed_at":"2026-08-07T02:07:52.899785Z","submitted_at":"2026-07-15T09:37:36Z","title":"Branching Policy Optimization: Sandbox-Native Language Agent Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T04:40:38.083853Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.14171"},"observation_digest":"sha256:bd12b595609560758770eef13b574f3f70830310e9da150443aef5d2a0d11c34","observation_id":"0152b37e-a63f-4c93-ba80-b264a7d4efdc","resolution":{"observed_at":"2026-08-02T04:40:38.083853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-31T01:31:10.823817Z","title":"arXiv preprint arXiv:2410.01679 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27610","last_updated":"2026-07-30T02:55:02Z","snapshot_observed_at":"2026-08-11T00:14:21.879718Z","submitted_at":"2026-07-30T02:55:02Z","title":"Kalman Meets Curriculum: Efficient Dynamic Prompt Selection for Adaptive RL Finetuning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T01:31:10.823817Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.27610"},"observation_digest":"sha256:3fc1c451030cf3e1d5aae7ff7973e92b094e768ae22662b1a014d44a9a6c3924","observation_id":"3494809f-a207-4435-950f-a4ad60214071","resolution":{"observed_at":"2026-07-31T01:31:10.823817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-31T23:39:11.667302Z","title":"Vineppo: Refining credit assignment in rl training of llms.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:11.667302Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:a60813ef341351834f6f8659fcfeaa0e00197c3c8ff394552d88dcfaad000f8c","observation_id":"61fc87b8-3b93-4468-85a1-b746303ea32b","resolution":{"observed_at":"2026-07-31T23:39:11.667302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-31T07:02:36.338599Z","title":"VinePPO: Refining credit assignment in RL training of LLMs.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.338599Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:4995bc7b4fce5a86c97796f4cfe723fd73e3f4ff8e215bf2e1466baf6fb413ba","observation_id":"ee7c5b74-6577-4cb7-87cc-c9ea7e5aa1ab","resolution":{"observed_at":"2026-07-31T07:02:36.338599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-07T01:02:19.185524Z","title":"Amirhossein Kazemnejad, Milad Aghajohari, Eva Portelance, Alessandro Sordoni, Siva Reddy, Aaron Courville, and Nicolas Le Roux","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05631","last_updated":"2026-08-06T05:58:22Z","snapshot_observed_at":"2026-08-15T20:19:02.177804Z","submitted_at":"2026-08-06T05:58:22Z","title":"ChronoVision: Temporal Reasoning via Latent State Reconstruction","version":1},"reference_index":237,"source":"pdf_text","source_observed_at":"2026-08-07T01:02:19.185524Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2608.05631"},"observation_digest":"sha256:cb48fcd52b2ce6622e41baf1090df15a238c5cd0ab5e47930b3f6685acbc0477","observation_id":"e006c770-568d-42b6-a465-2885c785e0ac","resolution":{"observed_at":"2026-08-07T01:02:19.185524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-10T19:29:14.819960Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06861","last_updated":"2026-08-07T06:38:12Z","snapshot_observed_at":"2026-08-15T19:16:11.258131Z","submitted_at":"2026-08-07T06:38:12Z","title":"Gated-BEPO: Confidence-Gated Bellman Credit Assignment for Large Language Model Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T19:29:14.819960Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2608.06861"},"observation_digest":"sha256:dab617948cd807c843c9e23ec10c8bdf5be58c5a8b2eb08c563dd3442640ca46","observation_id":"6f773d29-ae78-4dd9-b3f4-7b028565420b","resolution":{"observed_at":"2026-08-10T19:29:14.819960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.01679/citation-record","integrity":"/paper/2410.01679/integrity","json":"/paper/2410.01679/citation-record.json","paper":"/paper/2410.01679"},"outbound":[],"paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T16:23:58.195255Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 67 inbound Pith citation observations for arXiv:2410.01679."}