{"as_of":"2026-08-05T10:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:604b7c284683c12a2c2eb0640cf83ed61b6f7bc1d913dfce821bb892b3ebd5cc","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T14:06:50.522833Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04751/citation-record","integrity":"/paper/2607.04751/integrity","json":"/paper/2607.04751/citation-record.json","paper":"/paper/2607.04751"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Deepseek-v4: Towards highly efficient million-token context intelligence, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:6984554d090079528601e3edafe7d4944db920db343146258e9348f441e620ba","observation_id":"50d9bc73-025b-4908-8b91-bf8db5a8b244","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Revisiting on- policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:fcd49520909a782228bda6a02e60ccdc0dc402b4c2e813f4bea591a10cc9024c","observation_id":"45a6f1f5-e1ee-4487-81b7-3095a2c82701","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"MiniLLM: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:0b2022aaa4acbe35aba99cd3b96d9a7bdda4d6f6b92a5a8c807e228db74bb0ef","observation_id":"a3834600-6e66-434f-bcfb-fc6935b88551","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:657823bf1d105c168331c2e1e2c71f2a3f62d53fe63a10347d899f7b0e059f26","observation_id":"94f8dc6f-a5d1-4b87-a35b-e4f0dd30cbb1","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.07155","last_updated":"2026-07-11T08:43:13Z","snapshot_observed_at":"2026-08-03T11:14:50.541582Z","submitted_at":"2026-01-12T02:57:39Z","title":"Stable On-Policy Distillation through Adaptive Target Reformulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.07155","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Stable on-policy distillation through adaptive target reformulation.arXiv preprint arXiv:2601.07155, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2601.07155","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:409033fa828ddacc0c976d9b5880d8f799c0f57b82da5b05552a22b274f9e384","observation_id":"60f34f8a-e0a9-44c5-856c-7a84f9ac2310","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Approximately optimal approximate reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:4540f7ccf0c280cc7e1ef15104792a2502e011b130e8c8ca137595d900d895a7","observation_id":"44d491eb-2600-47b8-b29b-17eb3d9f1767","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Scaling reasoning efficiently via relaxed on-policy distillation.arXiv preprint arXiv:2603.11137, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:32a57af1908867634193e921a211e2ae06e28b29034cd544eb28aa9a92d8c8ef","observation_id":"d6a37485-07be-4e10-8dfc-d26184901118","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:66cda845ce2713da24110c3b641fd58c934aaef4223cbdeb1aa855767aa065c3","observation_id":"b2b9e8c0-55e7-4d50-9258-c60f58956d2b","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:b03293647faacb69b9e982cc6e1dd77e918ae75026ac22fd2491e224c6ec0cb4","observation_id":"f7f7d7cd-9fac-4721-b148-8f9a5b4f4dc4","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"On-policy distillation.Thinking Machines Lab: Con- nectionism, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:8157c5e37348dd0107bdf419bdbc1633f6629d6b7e887763fc9413520b67dfd2","observation_id":"5b251c66-e121-4082-8b9a-823cbd264d83","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Trust region policy optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:593c5ed80f6b1f7ecd3e1dc0c803b09753072fd55b2edfb9b56df034e2f0f0be","observation_id":"d49b585c-a0c8-45de-9ed6-f5fa94f645d2","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:c4e8d55d96313e85ac95fb8662fd184acba4bf7b280ebce43ff7d8a90c68d9ec","observation_id":"bf3b2550-5ff7-4784-b776-4a191fdde080","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:85e77aa3c90da41ef015ec2bda072aa3e0d554b20046c79b0f1bef47380641c0","observation_id":"afd0ed7b-01ba-4327-9cab-59f833d905c2","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Self-distillation enables continual learning.arXiv preprint arXiv:2601.19897, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:f920decfcd3667ded391b802f164e29b1fd7936858b1ba006452fd6486e72a2b","observation_id":"63e02167-10e1-4612-9d5c-85f7d2d2ef8f","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053, 2019","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:99760bc2342c1f42c726a11a639831061d148afde0156590473436ad44e01e80","observation_id":"65d21487-4e9b-434c-8227-b22a82babf2a","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Mimo-v2-flash technical report.arXiv preprint arXiv:2601.02780, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:73beb774e08ef1ae5ba843f94058bc20fa17ba3a8fadbbb394a818832779a6c4","observation_id":"b153a3be-9986-448e-b601-1415b55cc3f0","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Simple policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:9254a7edb03b87bc3e63ca8767c87ca4856f8a127d27049ab7821c0f91bffcd4","observation_id":"36fe3aac-f7d1-47ab-885e-6d4e50b1a936","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:b7164fd2226eb0cc1924b13549705368bfb7afa024b0fd556d9efd22ed449dd8","observation_id":"43792c86-26fd-407b-ad2f-bbd065be67eb","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Nemotron-cascade 2: Post-training llms with cascade rl and multi-domain on-policy distillation.arXiv preprint arXiv:2603.19220, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:ac547a40f6e3521d2d252b351aa8ea8acd013c5d61bcc1b1d319206c9ff4bbca","observation_id":"2d2d46c9-a650-4c39-8ad9-1c94a96a044a","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:4a0f1c39bc7c71ace2574816a9dfa2fd08581577ed54f63331aefc1a0ad50512","observation_id":"a83808d3-167f-418c-a116-17a9d7b50b21","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Glm-5: from vibe coding to agentic engineering","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:21a7e68f9447e1d50cb28ca6fc8efa05c917a04569862ecce2c6590a26a8f2cb","observation_id":"15a3054d-25f5-4980-90e9-a0396ab1ffb0","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Pytorch fsdp: experiences on scaling fully sharded data parallel.arXiv preprint arXiv:2304.11277, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:4fafbc18d2b7ce57f8e030e7ef20c4ab888c920e4c2af1518cacd05ea35ee780","observation_id":"8f6a5ad7-ef3a-42bf-b02b-4a0d8abc3c07","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Sglang: Efficient execution of structured language model programs.Advances in neural information processing systems, 37: 62557–62583, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:76322672167f0b36956575364eba66d4e6f21dce3afe5ea3291e4b412db6aa7a","observation_id":"ded7804d-05a7-4db6-8cb3-26de4fa5ee7e","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:38f0328be2bbca53d53ec2e61242a705b962ce33517ab6e5bdb992f21aea84f3","observation_id":"fba2cae8-6ce9-487d-9d2b-fadc178e8967","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Since limt→1+ w(t) = 0 , w(t)<0for allt∈(1,2)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:3670eb6a545bac55d2d9f7a191e07149c191051ef359c22ef76e34d068fb53b7","observation_id":"5a8cda0c-cbe3-43ea-8c65-be5b750ea4b9","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:dfed95b4d8753fb71ab4df891353ab99a2525306c834e6ecc3a9faf5be4de094","observation_id":"e00aaba0-1cd5-4ae5-ad0b-449741e1e412","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T14:06:50.522833Z","title":"Since there is only one critical point, this unique stationary point corresponds to the global maximum of f(u)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T14:06:50.522833Z"},"links":{"citing_paper":"/paper/2607.04751"},"observation_digest":"sha256:7eb5425db7255ae2c03dbc007ac7a46b758df13f1aa00ac9d025240e687e78d7","observation_id":"50a270dc-2fab-4272-9fc5-41f210f48b29","resolution":{"observed_at":"2026-07-11T14:06:50.522833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04751","last_updated":"2026-07-06T07:43:36Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T09:58:25.372849Z","submitted_at":"2026-07-06T07:43:36Z","title":"Trust Region Policy Distillation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.04751."}