{"as_of":"2026-08-07T22:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de3968d6c6f8ea8ba8c3964bcc95a2ae2705617e52a96e96042bc5765bb41a2a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:32:30.615635Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-07T11:32:30.615635Z","title":"Offline reinforcement learning for llm multi-step reasoning.arXiv preprint arXiv:2412.16145, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02553","last_updated":"2025-06-03T07:44:31Z","snapshot_observed_at":"2026-08-07T11:19:28.410568Z","submitted_at":"2025-06-03T07:44:31Z","title":"Response-Level Rewards Are All You Need for Online Reinforcement Learning in LLMs: A Mathematical Perspective","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:30.615635Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2506.02553"},"observation_digest":"sha256:0cca8c04f15176c864e19eba635cac36a4e16982d228caac163159569b4574ac","observation_id":"40d8a2c3-061f-4d2d-ab59-133b144a810e","resolution":{"observed_at":"2026-08-07T11:32:30.615635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T21:55:04.280984Z","title":"Offline reinforcement learning for LLM multi-step reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-07T10:28:04.865350Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:04.280984Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:6a77662adab1bafa73ee2cceca82108ec7b9b12523df7edf44eb1c043c01e822","observation_id":"3c787b02-2301-4e54-b8de-08a800880ea4","resolution":{"observed_at":"2026-08-06T21:55:04.280984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T19:59:37.039893Z","title":"Offline reinforcement learning for llm multi-step reasoning.arXiv preprint arXiv:2412.16145, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-07T07:58:07.578542Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:37.039893Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.04136"},"observation_digest":"sha256:5d0df7924247334b7547194c068e951e434a12a748e09b9a01830286d0d9cd97","observation_id":"1ebdf16a-4c76-47fc-970b-4ff90b9ad66e","resolution":{"observed_at":"2026-08-06T19:59:37.039893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-07T00:23:18.742674Z","title":"arXiv preprint arXiv:2412.16145","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.08806","last_updated":"2025-06-17T06:04:01Z","snapshot_observed_at":"2026-08-07T11:41:33.046626Z","submitted_at":"2025-06-17T06:04:01Z","title":"Think Clearly: Improving Reasoning via Redundant Token Pruning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:23:18.742674Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.08806"},"observation_digest":"sha256:7c23fc91bc6ed9077541a674c0bd0fc3b5290b295f9bd46d06f317410a1d0e40","observation_id":"a9ca7058-d9b0-4a0d-ba6d-d67f668e1201","resolution":{"observed_at":"2026-08-07T00:23:18.742674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-06T15:24:27.704354Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16864","last_updated":"2025-07-21T21:59:05Z","snapshot_observed_at":"2026-08-07T08:20:45.010409Z","submitted_at":"2025-07-21T21:59:05Z","title":"Reinforcement Learning in hyperbolic space for multi-step reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:24:27.704354Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2507.16864"},"observation_digest":"sha256:89713ad0728c1d9d5fee9001b2ad84581cd84846c6b6daf8e7aadaa1a182d268","observation_id":"7e0152b2-7e3e-4348-be31-8bd04f407e02","resolution":{"observed_at":"2026-08-06T15:24:27.704354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2510.08539","last_updated":"2026-05-07T17:44:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T17:53:41Z","title":"On the optimization dynamics of RLVR: Gradient gap and step size thresholds","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T08:34:36.543874Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2510.08539"},"observation_digest":"sha256:b8779f5a1c236e934717249959ccb2d9e5ef65043e8ecadf476385bdf98c5f8a","observation_id":"a2612bc7-e4b2-45f7-82e7-425310cab47c","resolution":{"observed_at":"2026-05-18T08:36:07.334653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2604.04937","last_updated":"2026-02-14T23:45:29Z","snapshot_observed_at":"2026-07-06T22:53:46.999911Z","submitted_at":"2026-02-14T23:45:29Z","title":"Pramana: Fine-Tuning Large Language Models for Epistemic Reasoning through Navya-Nyaya","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-15T21:58:40.973772Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2604.04937"},"observation_digest":"sha256:f93166421af8ea8040cf281b71b35f4b70f36ec7f3239853dcf2f4ba3e86a248","observation_id":"2c55574d-7af5-489b-80b5-00c7710b88e2","resolution":{"observed_at":"2026-05-15T22:00:21.063340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":257,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:91edd2355e821b35cb8ea8220dbaeda8fc2c22b53d0e879a6ab768f32e5f624e","observation_id":"6440f138-b617-4260-9f74-7f4622f8fb3b","resolution":{"observed_at":"2026-07-01T20:56:13.653343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2606.11470","last_updated":"2026-06-09T21:59:37Z","snapshot_observed_at":"2026-07-06T23:50:35.052764Z","submitted_at":"2026-06-09T21:59:37Z","title":"The Periodic Table of LLM Reasoning: A Structured Survey of Reasoning Paradigms, Methods, and Failure Modes","version":1},"reference_index":240,"source":"arxiv_source","source_observed_at":"2026-06-27T12:59:51.091008Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2606.11470"},"observation_digest":"sha256:78a108373306b226297537117adad0f5117492cb4b1185c3afe8d3deae984c8b","observation_id":"6583c324-0b76-40b0-b47f-248c6f4e67b0","resolution":{"observed_at":"2026-06-27T13:00:56.038173Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":"2412.16145","doi":"10.48550/arxiv.2412.16145","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow-DPO: Improving LLM mathematical reasoning through online multi-agent learning.arXiv preprint arXiv:2412.16145","venue":"arXiv (Cornell University)","work_id":"9fd96a78-09b0-4c78-83b6-a3cbe5faa16a","year":2024},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":212,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:91e2fbd6f4c53d6f9bd8d82cb78b6a449a0d6694f7f0b8f7d1ff3b33d96ffe5a","observation_id":"4f89117f-84fb-4cf7-b597-b2bc031fceba","resolution":{"observed_at":"2026-07-04T07:59:40.096925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-01T06:32:23.624774Z","title":"Offline reinforcement learning for LLM multi-step reasoning.arXiv preprint arXiv:2412.16145, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21856","last_updated":"2026-07-23T22:50:23Z","snapshot_observed_at":"2026-08-07T15:15:19.846490Z","submitted_at":"2026-07-23T22:50:23Z","title":"LeAct: Learning to Reason from Expert Actions","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T06:32:23.624774Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2607.21856"},"observation_digest":"sha256:85380a50cb5a24a56531e6efb71c9d8a8b064ee6b41179c716c195d64c29b072","observation_id":"14a4ff1a-7006-4230-be33-2d08996d25f1","resolution":{"observed_at":"2026-08-01T06:32:23.624774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16145","snapshot_observed_at":"2026-08-02T10:18:39.144202Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22642","last_updated":"2026-06-24T00:12:03Z","snapshot_observed_at":"2026-08-07T04:06:13.678510Z","submitted_at":"2026-06-24T00:12:03Z","title":"CRAFT: Learn the Schema, Execute the Plan","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T10:18:39.144202Z"},"links":{"cited_paper":"/paper/2412.16145","citing_paper":"/paper/2607.22642"},"observation_digest":"sha256:6f8bddde2a049f581747a16257f3a9fd748bdb02a660349d00230dd9a9c2148b","observation_id":"8b8a284a-2592-458f-a08e-8596a8c151ca","resolution":{"observed_at":"2026-08-02T10:18:39.144202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16145/citation-record","integrity":"/paper/2412.16145/integrity","json":"/paper/2412.16145/citation-record.json","paper":"/paper/2412.16145"},"outbound":[],"paper":{"arxiv_id":"2412.16145","last_updated":"2024-12-25T18:54:02Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T18:49:45Z","title":"Offline Reinforcement Learning for LLM Multi-Step Reasoning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2412.16145."}