{"as_of":"2026-08-08T13:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c6e6f1aff6476f5b1d648127986da6421bbac024855707b8768b2475a3f0460","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:16:33.590510Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01418/citation-record","integrity":"/paper/2608.01418/integrity","json":"/paper/2608.01418/citation-record.json","paper":"/paper/2608.01418"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.08706","last_updated":"2026-04-09T18:56:12Z","snapshot_observed_at":"2026-08-06T23:50:31.769070Z","submitted_at":"2026-04-09T18:56:12Z","title":"Efficient RL Training for LLMs with Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08706","snapshot_observed_at":"2026-08-06T00:16:33.534858Z","title":"Efficient RL training for LLMs with experience replay.arXiv preprint arXiv:2604.08706,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.534858Z"},"links":{"cited_paper":"/paper/2604.08706","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:f24d78c4f6cc4fb17e7aefb6ef14696bae9f7c31550d347c03d4665fae45a79f","observation_id":"0bc010ef-3952-458c-97ad-d505ee5e4dc3","resolution":{"observed_at":"2026-08-06T00:16:33.534858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.07508","last_updated":"2026-07-08T15:02:19Z","snapshot_observed_at":"2026-08-05T22:35:28.013349Z","submitted_at":"2026-07-08T15:02:19Z","title":"Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2607.07508","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.07508","snapshot_observed_at":"2026-08-06T00:16:33.996094Z","title":"Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning","venue":"cs.LG","work_id":"f65e6073-9465-4220-9d92-fd13367208d2","year":2026},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.548470Z"},"links":{"cited_paper":"/paper/2607.07508","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:1ad107ffa455a495aaa079658c8df85b728d296df0ab3ead3e172baa5a0ce134","observation_id":"54bc4f66-0d05-4dd2-92e8-85cace2ffe15","resolution":{"observed_at":"2026-08-06T00:16:34.000797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26256","last_updated":"2026-04-29T03:25:36Z","snapshot_observed_at":"2026-07-06T23:11:57.238808Z","submitted_at":"2026-04-29T03:25:36Z","title":"DORA: A Scalable Asynchronous Reinforcement Learning System for Language Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26256","snapshot_observed_at":"2026-08-06T00:16:33.553112Z","title":"DORA: A scalable asynchronous reinforcement learning system for language model training.arXiv preprint arXiv:2604.26256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.553112Z"},"links":{"cited_paper":"/paper/2604.26256","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:8dcd198b3f1a7995ce8438eeab987e590c4138f5d4cc6599193aa8436f8a3687","observation_id":"6e93afe7-d628-42b9-88b1-9e5f64e49a58","resolution":{"observed_at":"2026-08-06T00:16:33.553112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:16:33.557592Z","title":"A step back: Prefix importance ratio stabilizes policy optimization.arXiv preprint arXiv:2601.22718,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.557592Z"},"links":{"citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:22d0fc80e359a5da3cdce2e727f5471493ff747d513a6a9e7955493de247c6b0","observation_id":"3f9d414d-f5c0-47c8-a418-2ca9f08cbd35","resolution":{"observed_at":"2026-08-06T00:16:33.557592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12736","last_updated":"2026-04-14T13:50:31Z","snapshot_observed_at":"2026-07-06T23:00:51.385974Z","submitted_at":"2026-04-14T13:50:31Z","title":"Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood","version":1},"cited_work":{"arxiv_id":"2604.12736","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12736","snapshot_observed_at":"2026-08-06T00:16:33.860112Z","title":"Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood","venue":"cs.CL","work_id":"bab9ff34-e1b9-43f0-bf26-5e3b0da086df","year":2026},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.561853Z"},"links":{"cited_paper":"/paper/2604.12736","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:ad73fbaeb6b2c27c53da000aa8bb05502e568794aa07aa4d9e7da237c8ecee7f","observation_id":"4040a79f-ea87-4fa8-a154-8efd0e91c9fe","resolution":{"observed_at":"2026-08-06T00:16:33.864755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07331","last_updated":"2026-05-08T06:35:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T06:35:02Z","title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","version":1},"cited_work":{"arxiv_id":"2605.07331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.07331","snapshot_observed_at":"2026-08-06T00:16:33.639544Z","title":"Rethinking Importance Sampling in LLM Policy Optimization: A Cumulative Token Perspective","venue":"cs.LG","work_id":"62ff8c5c-cb84-4144-b8da-b07c62c89647","year":2026},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.577721Z"},"links":{"cited_paper":"/paper/2605.07331","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:b0057cd68b4d7de779f3d53b61faf23274c83ed052a7bd6bf69d701eef3adfa0","observation_id":"af6dbf80-5fb8-4ea1-acdf-ba5e722f0163","resolution":{"observed_at":"2026-08-06T00:16:33.645888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-06T00:16:33.581880Z","title":"Group sequence policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.581880Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:4d7a5dc7e44e328baf7abaedb01bf7a5a1377ff8e080dbb6380043fd1cec5c3f","observation_id":"89dc932e-66f2-4cf1-a2f5-cd6350771e67","resolution":{"observed_at":"2026-08-06T00:16:33.581880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:16:34.134517Z","title":"LX t=1 CtAβ t tX k=1 zk # = LX k=1 Eπβ","venue":null,"work_id":"63235668-b07a-4515-881b-8c4b57103bfe","year":2017},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.585855Z"},"links":{"citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:30b68d0d80a84c33dc73e634b36007e9168f2a95efcd2cf0fa1b70c1265dd041","observation_id":"0b56770f-0b21-449f-b0ff-bf889c5f8085","resolution":{"observed_at":"2026-08-06T00:16:34.138954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:16:34.120831Z","title":"LX t=k Aβ t (st, at) sk, ak # =E πθ","venue":null,"work_id":"dfbd897f-f32f-473c-8812-e6eb80d0a824","year":2023},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.590510Z"},"links":{"citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:64d74cd65863775266695f49f8eefaf9128e581af72108a047e4e68d296f6bb7","observation_id":"e90a00ca-d151-4699-b0d1-7924275ab189","resolution":{"observed_at":"2026-08-06T00:16:34.124938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:16:33.565799Z","title":"LLMs can learn to reason via off-policy RL.arXiv preprint arXiv:2602.19362,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":2000,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.565799Z"},"links":{"citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:53e9c0a49107f3000b2c9ea44f216aaba6b41328cd8395c9f00c6380adcda573","observation_id":"e3301e55-5ea8-47b7-96d1-c6c14728768f","resolution":{"observed_at":"2026-08-06T00:16:33.565799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T00:16:33.569569Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.569569Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:12861f6c7179da21609827f31a0797a3d9f4ed0a1b9536d1a714bc722b842d1d","observation_id":"f872b028-9c2e-4057-b909-59df10be4880","resolution":{"observed_at":"2026-08-06T00:16:33.569569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T00:16:33.573986Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.573986Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:47105a64122c08c95fad1de100fcc5559d425d72c0f2f2a56fa7a1ff37c7db55","observation_id":"0a330717-f8e5-4aed-824f-a0c464e7ad91","resolution":{"observed_at":"2026-08-06T00:16:33.573986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01365","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:16:34.074200Z","title":"9 Homayoun Honari, Roger Creus Castanyer, Michael Przystupa, Michael Noukhovitch, Pablo Samuel Castro, and Glen Berseth","venue":null,"work_id":"3fb3dade-6dc6-413e-8b4e-10d923dca7ad","year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.544313Z"},"links":{"citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:0dd766269430f311bc207ce240b9ef3aa44e8d1b802d702a629ba658e4bb56f0","observation_id":"f9fca2eb-90a0-4632-8a2c-1b9a3f07ad54","resolution":{"observed_at":"2026-08-06T00:16:34.081238Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-06T00:16:33.539499Z","title":"DeepSeek-V3.2: Pushing the frontier of open large language models.arXiv preprint arXiv:2512.02556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T00:16:33.539499Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.01418"},"observation_digest":"sha256:a7fd546201a8698cd6253d8cc2d71315c8989e101ed2f926f0cd6cfc4ac5b0d2","observation_id":"626811b2-1f25-40a2-801e-a98222fc130d","resolution":{"observed_at":"2026-08-06T00:16:33.539499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01418","last_updated":"2026-08-02T18:02:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T23:26:33.909137Z","submitted_at":"2026-08-02T18:02:03Z","title":"Reusing Rollouts under Policy Lag: Prefix-Normalized Policy Optimization for LLM Reinforcement Learning"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":4,"verified_fuzzy":2},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2608.01418."}