{"as_of":"2026-08-14T18:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fe0e39b21bf38a59433aafb08f6beb350eca70d90723b291531a2308e8a4840","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T14:30:20.959431Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04728/citation-record","integrity":"/paper/2607.04728/integrity","json":"/paper/2607.04728/citation-record.json","paper":"/paper/2607.04728"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Minimax-m1: Scaling test-time compute efficiently with lightning attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:5a3c334ae475535558d2d7b54bdef47c644bff243fad4315b2f6342529bb2b27","observation_id":"a06f6d39-a2dd-4355-ac07-fd68f37a7eb4","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-12T12:02:17.912725Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"The entropy mechanism of reinforcement learning for reasoning language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:dc796eaeec47b7f7287ac4cb02f658c93152d823b7c11309b2aba26ebf869edd","observation_id":"3c1e416c-a0c4-4052-a3bd-b5380f63b673","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.20347","last_updated":"2025-12-01T12:02:46Z","snapshot_observed_at":"2026-08-12T16:05:03.602321Z","submitted_at":"2025-11-25T14:25:19Z","title":"Soft Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.20347","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Soft adaptive policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2511.20347","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:4d1a740a24cc04387436bd033b2cf7f5bf36172e5c51b77c64b7c34b048104f8","observation_id":"273e1317-374f-4713-9a8f-598c35730718","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:e9e2faaa03f00aadf47fd686710cb87387d9af12210a1438a174426852ae1150","observation_id":"5893bd3b-9568-4881-ab4e-d9ba90796236","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18471","last_updated":"2026-04-22T14:35:52Z","snapshot_observed_at":"2026-08-02T15:24:09.026985Z","submitted_at":"2025-10-21T09:48:06Z","title":"CodeRL+: Improving Code Generation via Reinforcement with Execution Semantics Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.18471","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Xue Jiang, Yihong Dong, Mengyang Liu, Hongyi Deng, Tian Wang, Yongding Tao, Rongyu Cao, Binhua Li, Zhi Jin, Wenpin Jiao, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2510.18471","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:66f6a139bc4d521f04874a9b6600bcaafddf0ff9211b0909a144ef76d92a2b5f","observation_id":"401e2898-b4b6-464c-8117-91fcc19a8df3","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Search-r1: Training llms to reason and leverage search engines with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:80dadc7f42d28721099086d8d6a6b85a5f9daa2efa337d4e7126f84616492201","observation_id":"b7449652-6eb0-425e-845c-9361c74c850b","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:6d7c90792534b40fd6fecc8cd9a5802ef749042c2a9937cdd354a790135a1ccd","observation_id":"18a73839-087e-4128-9a07-439a972ec5c8","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"A step back: Prefix importance ratio stabilizes policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:e03f1c25a1186414936e2985e55ed775393f4abfccdc8eeef8a23be1e5714585","observation_id":"9284340e-1586-48fc-89bd-4f886c07094d","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.23075","last_updated":"2026-06-26T02:45:25Z","snapshot_observed_at":"2026-08-14T05:47:30.909171Z","submitted_at":"2025-12-28T20:41:59Z","title":"Trust Region Masking for Long-Horizon LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.23075","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Ets: Energy- guided test-time scaling for training-free rl alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2512.23075","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:f74213e9b738f60cbf5494f66cccf048681763cb6f8e9a2a2dfc5c820297e2df","observation_id":"654a09ac-c475-40c3-9571-0ff876ad20da","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00994","last_updated":"2026-05-28T05:45:59Z","snapshot_observed_at":"2026-08-13T14:35:37.095677Z","submitted_at":"2026-02-01T03:19:22Z","title":"Reasoning and Tool-use Compete in Agentic RL:From Quantifying Interference to Disentangled Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.00994","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Reasoning and tool-use compete in agentic rl: From quantifying interference to disentan- gled tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2602.00994","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:1bd5ba09b258dd5e0fd1f85d6325bc152206bdb4648049ed7f07278dc1bd8b6a","observation_id":"b2187083-7152-45e6-b97d-b56bcbd30d48","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Sparse-rl: Breaking the memory wall in llm reinforcement learning via stable sparse rollouts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:5bf338817b5b174154183abe194b9a6c5c88a1200750744b423e769c5b48a8ed","observation_id":"8da5dd53-26a6-43f2-9975-071ed232866d","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Stabilizing moe reinforcement learning by aligning training and inference routers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:abe3361ea2d4cbae0730afe9415eee85f33808485fae3493ef86c92021f6cef2","observation_id":"966550d4-8039-4999-9ce3-377c0d88fc17","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10511","last_updated":"2023-07-02T07:21:59Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:30:15Z","title":"When Not to Trust Language Models: Investigating Effectiveness of Parametric and Non-Parametric Memories","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10511","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"When not to trust language models: Investigating effectiveness and limitations of parametric and non-parametric memories","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2212.10511","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:5fe932ad23db97fa93a992c8e5fba3ef985c7833ed9d2f70d96f79fcc6257e33","observation_id":"14d476a9-6048-4777-8f0c-4d58f9306b4d","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Measuring and narrowing the compositionality gap in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:561f698c669b911667861e441adcfd511977afdc3157036e5f7c4c53eb3ae81a","observation_id":"3493a053-8c96-43b8-b22b-37a0f47598f3","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:94a86d5bf14277f73e8ed76cc9c93fb28a5c3ccecdc215dc63374303693d2f6d","observation_id":"5f545beb-a004-4881-8812-af5042f968b1","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:72e3fc8562d357f21e92c57208abc19391cf2901174e3c7b076a3b78981db5fa","observation_id":"7a0481f4-1ce8-43fe-b90b-75ad9b522765","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Maximum likelihood reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:7b0a9fe14ce0670935c35ed722098f6fb8cbd547109b0a2e19df0c85a55fecbd","observation_id":"5313c16c-70fc-4fa9-9043-601d12e9eda1","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Every step evolves: Scaling reinforcement learning for trillion-scale thinking model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:240deb0b02b628fe8811480b129d2c36ade1598707250c5bd294bdeddd4ab7da","observation_id":"38afff03-0a3d-44dc-bed8-9dc255baf7c6","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-09T05:05:20.029300Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.29502","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Ucob: Learning to utilize and evolve agentic skills via credit-aware on-policy bidirectional self-distillation.arXiv:2606.29502,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2606.29502","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:019dee135715c00038a7e70b3f7937125db5be35faa3ae73e8245804bdbdc5a3","observation_id":"8c595e6b-63bb-4269-b8e1-862c8c53534b","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Text embeddings by weakly-supervised contrastive pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:42bd53fa0eb595f1202fb09cbf10e937329498885423ca1b62b7afe16bf1d9b3","observation_id":"919c82d0-d2ae-4405-a3b5-08700456d47f","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:4299628150483eb2058d484a788ab57384de2de1c6082f11b52f481164cd45c4","observation_id":"ab5248c1-5f39-4517-8972-f24a69e3cd93","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:50dafb7fc595e85210b1119065e7c630597b2e1fd7409e5b8299b7e40b779b5a","observation_id":"b01057bc-de5b-4b1e-a26e-000787aa8b3b","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:a2d789b72c6b3a0c312afae13ce4cb47a8ec8d64822aeadb385c40cf5a7a32f3","observation_id":"acdb543a-83ee-4fcb-99bc-792c49b9609a","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29734","last_updated":"2026-05-28T10:29:01Z","snapshot_observed_at":"2026-08-13T21:38:35.154772Z","submitted_at":"2026-05-28T10:29:01Z","title":"HTAM: Hierarchical Transition-Attended Memory for Operator Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29734","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Htam: Hierarchical transition-attended memory for operator optimization.arXiv preprint arXiv:2605.29734, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2605.29734","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:4676edcc31af6de4bb0b47ff4bd3b8d3525d7474f32f16641c01954201ee83ca","observation_id":"0884fa46-92f7-4a1a-8e31-ddf7993ad560","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Yanli Zhao, Andrew Gu, Rohan Varma, Liang Luo, Chien-Chin Huang, Min Xu, Less Wright, Hamid Shojanazeri, Myle Ott, Sam Shleifer, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:afc85932adead87241cbce0cd2bf9194b433378ae963bb7ffc96df8cf1df56cc","observation_id":"e61a3fb6-412d-4014-b12c-9fc26347f03b","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Stabilizing reinforcement learning with llms: For- mulation and practices","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:1c0f6f5016a35e3810755afcfdcef2225505dea77e5caffa892bbad44e0c070e","observation_id":"4dee2c79-c12f-4200-8af0-9f02725ea7f1","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:6f6c8c3ab1e1eb9a12f24139b66cfd5db19a8280d86c411f43512f12f25b7d96","observation_id":"cafb0fc6-8c8c-44af-8bce-8e71a9cdd387","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:3961441bcbce8ccee518e9bd09f2ea5a2e7dbe7d95655cbbe15120ee068781b1","observation_id":"b2b2833c-1eec-46c7-a7b0-59f3de53656c","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Table 4: Hyperparameters used in math experi- ments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:30edc2457f8db260af865ba04fe632e7fea699ad0c83f8292481a855e6e791f2","observation_id":"b32333c9-0f0b-4a8e-b95d-a2dfe061f2bc","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:ca41de63507cde4376922cca62c6088fc1c0cf63c0a309cd0b8307561ed39bb0","observation_id":"4e5ad6d9-0f95-4f0a-9bb4-6e3ff8f0b025","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:30:20.959431Z","title":"Table 8: Performance of SIS under varying policy staleness on Qwen3-8B-Base, where stalenessN is the number of mini-batch updates per rollout","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T14:30:20.959431Z"},"links":{"citing_paper":"/paper/2607.04728"},"observation_digest":"sha256:07412461daf4f907d8e31c9581d4a88b8d166565aba45fa338210373e5972a6f","observation_id":"e8ee70f5-9673-485d-917a-f0db747c5ddc","resolution":{"observed_at":"2026-07-11T14:30:20.959431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04728","last_updated":"2026-07-06T06:59:44Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-04T07:22:41.694752Z","submitted_at":"2026-07-06T06:59:44Z","title":"Turning Off-Policy Tokens On-Policy: A Plug-in Approach for Improving LLM Alignment"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2607.04728."}