{"as_of":"2026-08-10T05:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:056693e4796be50c9125b6a2151d8e022a84a6323093d3eb2ede7a1336991a2c","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T18:39:41.431601Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17247/citation-record","integrity":"/paper/2607.17247/integrity","json":"/paper/2607.17247/citation-record.json","paper":"/paper/2607.17247"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:38.757408Z","title":"On-policy distillation of language models: Learning from self- generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:38.757408Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:8b8a42de5b417210ecb8f68f05f9cda7b414295650ede301794819164e5ea4dc","observation_id":"d3639001-7ee8-425c-8e05-8ff8b063389a","resolution":{"observed_at":"2026-08-01T18:39:38.757408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14758","last_updated":"2025-11-08T04:52:16Z","snapshot_observed_at":"2026-07-06T21:43:45.343005Z","submitted_at":"2025-06-17T17:54:03Z","title":"Reasoning with Exploration: An Entropy Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14758","snapshot_observed_at":"2026-08-01T18:39:39.011321Z","title":"Reasoning with exploration: An entropy perspective.arXiv preprint arXiv:2506.14758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.011321Z"},"links":{"cited_paper":"/paper/2506.14758","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:667f8b578faf7f7000dc6b994b288fbf1b046cfac93e4963d54ce48e0a750b84","observation_id":"66aa2a9b-e845-4840-8ca0-79cba8c1e59a","resolution":{"observed_at":"2026-08-01T18:39:39.011321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:41.431601Z","title":null,"venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.431601Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:79547da1f5a6925133b0b1f321f929681e9a200c5022b694fd94f51a6b7da1d5","observation_id":"f747b952-059c-4908-b455-ed0d5199652c","resolution":{"observed_at":"2026-08-01T18:39:41.431601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-01T18:39:39.225995Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.225995Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:1156dc356ef1403ca5d61db5b1f7f0d0e3236132d7f3dcd90c0a5111aadd7202","observation_id":"f308f626-b3e0-4513-abfa-ec7e4c1916f1","resolution":{"observed_at":"2026-08-01T18:39:39.225995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-08-07T13:56:34.167869Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12793","snapshot_observed_at":"2026-08-01T18:39:39.287381Z","title":"Chatglm: A family of large language models from glm-130b to glm-4 all tools.arXiv preprint arXiv:2406.12793,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.287381Z"},"links":{"cited_paper":"/paper/2406.12793","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:65c92e24f6fada10b4ddd53d8413be541d4864fb7c0f94f44d5d3d5a284d9a5a","observation_id":"77c158ab-115d-45df-a6df-efabde58cab0","resolution":{"observed_at":"2026-08-01T18:39:39.287381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:39.349107Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.349107Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:bac1312d4920d0a5ebc59d359b81035fd56e557a98ab380010024d13f1c4eacf","observation_id":"90a82ab3-edb9-4610-a60c-e8a8955ea2aa","resolution":{"observed_at":"2026-08-01T18:39:39.349107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-01T18:39:39.387426Z","title":"Deepseek-coder: When the large language model meets programming–the rise of code intelligence.arXiv preprint arXiv:2401.14196,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.387426Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:c790f5aa66fb7d444a884c1fa8d0d5643d1e90c35b9d9cf92ff755618a4c4588","observation_id":"41a80cd6-60be-4fa5-8f4f-2fd9e34166d0","resolution":{"observed_at":"2026-08-01T18:39:39.387426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T18:39:39.453355Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.453355Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:74fe6e09aaa2f9eb681e23ff3d6643be69e6a03e3f73db632c6c9a8b8736c886","observation_id":"4270e065-4d31-421d-975b-a6971cb08ef9","resolution":{"observed_at":"2026-08-01T18:39:39.453355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:39.613393Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.613393Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:11c9732a3d8c593d4d5d0ae2adbbe0f8774cc78c1bf3b55b2c4905887769a7c2","observation_id":"9e52171a-0e32-40c1-80d6-66c8516014d0","resolution":{"observed_at":"2026-08-01T18:39:39.613393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17445","last_updated":"2025-08-24T16:52:37Z","snapshot_observed_at":"2026-08-05T16:50:00.721840Z","submitted_at":"2025-08-24T16:52:37Z","title":"TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17445","snapshot_observed_at":"2026-08-01T18:39:39.765212Z","title":"Treepo: Bridging the gap of policy optimiza- tion and efficacy and inference efficiency with heuristic tree-based modeling.arXiv preprint arXiv:2508.17445,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.765212Z"},"links":{"cited_paper":"/paper/2508.17445","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:32324d40ecb08a848d1ff2fac71447a1f0183798b235c0c52c6bb98bdba6111c","observation_id":"5d2a8488-18fd-4831-9eac-02fb84f50a6f","resolution":{"observed_at":"2026-08-01T18:39:39.765212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-01T18:39:39.857107Z","title":"Let’s verify step by step.arXiv preprint arXiv:2305.20050,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.857107Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:467b59baab3ced9704e1b52b740bb5bc80b4ce66035223670617d5a8548966ef","observation_id":"d66b7e15-bd33-47c8-b307-b7f66b3528e6","resolution":{"observed_at":"2026-08-01T18:39:39.857107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:39.976099Z","title":"Length-unbiased sequence policy optimization: Revealing and controlling response length variation in rlvr.arXiv preprint arXiv:2602.05261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.976099Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:1e6f1109b872964082a378c0b90018003e59c61602c880e258e74ce9bef6a7da","observation_id":"25e39112-4a92-4e04-897e-81a633265030","resolution":{"observed_at":"2026-08-01T18:39:39.976099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-01T18:39:40.059010Z","title":"Improve mathematical reasoning in language models by automated process supervision.arXiv preprint arXiv:2406.06592,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.059010Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:f2c97bb6de3b752d14e4daac5a01cc606e6d7008d4ebbbf78ae68c0a3d1b12dc","observation_id":"0a52b37e-3c9d-4f12-9be6-b2f196349785","resolution":{"observed_at":"2026-08-01T18:39:40.059010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T18:39:40.146868Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.146868Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:63a725447b4ac179a3cacbf36b43f48adfdd9e459e5e19aa7991534d483442bb","observation_id":"b8d209c0-ab3f-41e1-81fa-19c0cc639450","resolution":{"observed_at":"2026-08-01T18:39:40.146868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-01T18:39:40.268643Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.268643Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:08e153f85ecd83094ac6eee56e961b90d52114b3f679e4784f3640152bad0f4a","observation_id":"35476f98-1e81-4179-a447-6f7e5039932d","resolution":{"observed_at":"2026-08-01T18:39:40.268643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-01T18:39:40.318444Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.318444Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:ba94724c5112ce7e141c059a8630de97f81f7d1c96522a6c88cda3464634b4ff","observation_id":"e4da1c71-9642-46c4-8a6e-806cf355410e","resolution":{"observed_at":"2026-08-01T18:39:40.318444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-08-01T18:39:40.386157Z","title":"Arbitrary entropy policy optimization breaks the exploration bottleneck of reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.386157Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:b8112860495c9f707051034136824fd6a054ff16ffd2275b6f9c608da71c524c","observation_id":"ac733956-c1a5-465e-a790-f3fbbf16fb9a","resolution":{"observed_at":"2026-08-01T18:39:40.386157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07316","last_updated":"2026-05-08T06:25:08Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T06:25:08Z","title":"Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07316","snapshot_observed_at":"2026-08-01T18:39:40.459071Z","title":"Implicit compression regularization: Concise reasoning via internal shorter distributions in rl post-training.arXiv preprint arXiv:2605.07316, 2026a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.459071Z"},"links":{"cited_paper":"/paper/2605.07316","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:3747fdfc264a2b536555a19108f735ecf6e40b45abbc9e5dd885a5f7b973ce3a","observation_id":"ecf09c03-2927-4a36-9243-d9819033cdab","resolution":{"observed_at":"2026-08-01T18:39:40.459071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-01T18:39:40.517367Z","title":"Rethinking kullback-leibler divergence in knowledge distillation for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.517367Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:41ed6354a193e546426b6b3b83c401cc78d2ac4d09fa8f6a5824137f9dcc7395","observation_id":"823550af-5e8d-4066-89dc-f6741deba2b2","resolution":{"observed_at":"2026-08-01T18:39:40.517367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:40.619539Z","title":"On the generalization of sft: A reinforcement learning perspective with reward rectification.arXiv preprint arXiv:2508.05629, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.619539Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:6c74fca5a813a72fcb80d372affc3d00d4bffb3518604dc42378b6f2a02b90e4","observation_id":"e7b7c17c-c775-4d1a-b2e9-a3a38fbc143d","resolution":{"observed_at":"2026-08-01T18:39:40.619539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T18:39:40.700245Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.700245Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:b28e4a01e4972ed2aa3f6a28cd411abf57caca8376dc0b7b299448e85293fad8","observation_id":"723986cb-e5e4-4411-94a7-bf89bd911262","resolution":{"observed_at":"2026-08-01T18:39:40.700245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T18:39:40.772979Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.772979Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:222a7be801b414e71a405cc8f0f98d35baf79d03a2cbc609f2dc2e93282cf22f","observation_id":"3a83a283-4a92-4c3b-82db-f4231eb2b2c1","resolution":{"observed_at":"2026-08-01T18:39:40.772979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-01T18:39:40.846363Z","title":"Learning beyond teacher: Generalized on-policy distillation with reward extrapolation.arXiv preprint arXiv:2602.12125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.846363Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:29e39d9ab1623507341d2e0f235b3c7004517bce664db440b2e59bfa9c1c3589","observation_id":"8acea5ca-4c80-4681-bac4-47206eb3b3dd","resolution":{"observed_at":"2026-08-01T18:39:40.846363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:40.916252Z","title":"Shorterbetter: Guiding reasoning models to find optimal inference length for efficient reasoning.arXiv preprint arXiv:2504.21370,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.916252Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:c17bcb880ec318e595bd4ebc15164aba2b203e6ef5d202d8dc5da2d9553da958","observation_id":"cb87e227-e96b-448c-96c4-342c584747ee","resolution":{"observed_at":"2026-08-01T18:39:40.916252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T18:39:41.004081Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.004081Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:01d0db885bd259657cc4826cf2dd8aa92cf611f2ff11a16dab2b3d6a3e6b3a71","observation_id":"b9216b88-e480-4cc5-add2-b25348642673","resolution":{"observed_at":"2026-08-01T18:39:41.004081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-01T18:39:41.081442Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.081442Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:78ec69bc7d397ce0e540c9d01d4b6b71d314b2fdb1b1fb529505bd90f59f8dc1","observation_id":"866ed5c2-5541-4e61-b98d-380337bf4304","resolution":{"observed_at":"2026-08-01T18:39:41.081442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-01T18:39:41.185696Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf.arXiv preprint arXiv:2404.18922,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.185696Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:1f5868e0b7398ebd86a1c5f4b13b5a79f9768d69a65eb0e6f5eb63ea24c049dc","observation_id":"ee81150d-a934-48b1-8599-f78542a401ea","resolution":{"observed_at":"2026-08-01T18:39:41.185696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:41.299106Z","title":"Consequently, the training procedure cannot directly determine whether the teacher is capable of solving a given problem","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.299106Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:a2d6f4bf59c6e6f2650f3069ec1fab77955b705c333e798cd92e8e422959594c","observation_id":"419e3584-e959-4a1f-b782-c0a758894060","resolution":{"observed_at":"2026-08-01T18:39:41.299106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T18:39:41.371264Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:41.371264Z"},"links":{"citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:d6a1ef4b26a65923fb705d066a953928463df242abf53d8a4b6c537c5c2c897b","observation_id":"74263fe0-6d6e-4c38-9125-3c5ac7ae9bf6","resolution":{"observed_at":"2026-08-01T18:39:41.371264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-01T18:39:39.531202Z","title":"Entropy-aware on-policy distillation of language models.arXiv preprint arXiv:2603.07079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.531202Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:833a899c2d59fb825ad2364d40548771c854984fdc1b71737e0d6d8f4318d69e","observation_id":"a1d7b461-44bc-4f7a-b38b-99ed442eba31","resolution":{"observed_at":"2026-08-01T18:39:39.531202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T18:39:40.211343Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:40.211343Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:512bda3bf39d7e926ad80092ca7bd0e042e99dbfa0b5b6d17cbb2bc5931b5bee","observation_id":"e6b2c343-f33b-4bcb-8a45-fe710ceef832","resolution":{"observed_at":"2026-08-01T18:39:40.211343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-01T18:39:39.130446Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.130446Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:693ac7abb57da32a8edbfc8915237a93836f993e4734a0ee7b9a620619966308","observation_id":"20a53cbf-ad2a-43d3-a965-8e0fa4be83f1","resolution":{"observed_at":"2026-08-01T18:39:39.130446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-01T18:39:39.657391Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.657391Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:6d950de06b46b0f6b77b6b37bebb6dc99c79ef9f67d26ab275dfdacb917fb762","observation_id":"406fe001-ec82-45d6-8d51-a99bcb72e033","resolution":{"observed_at":"2026-08-01T18:39:39.657391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-01T18:39:39.919563Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.919563Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:1ee235fe927a6e5ead37a7db1dd25b260f05588db05134e1ccd26c8eaba1b2d0","observation_id":"fcdb8a70-309e-4690-9fbb-1dfee0c572ca","resolution":{"observed_at":"2026-08-01T18:39:39.919563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-01T18:39:38.885385Z","title":"Matharena: Evaluating llms on uncontaminated math competitions.arXiv preprint arXiv:2505.23281,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:38.885385Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:f95e1935611304bfa1ed297b51b362388e7731e55c0721bffad1def3a41b79ee","observation_id":"a927e4a9-c254-4971-943a-61e6a14053fb","resolution":{"observed_at":"2026-08-01T18:39:38.885385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-01T18:39:38.938706Z","title":"Howard Chen, Noam Razin, Karthik Narasimhan, and Danqi Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:38.938706Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:54ccc8ccff6edf4669555692554956f1ea4397f67ba4bd445a41517e3fe7f0df","observation_id":"b401463d-7b58-4d3d-9f8f-8c43135e25df","resolution":{"observed_at":"2026-08-01T18:39:38.938706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-01T18:39:39.071891Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T18:39:39.071891Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.17247"},"observation_digest":"sha256:72d32087d33b5c0c971bc4522026ffa5f8f96e36b80bce99092c54a38ff932da","observation_id":"99b7d37f-60a2-4deb-9aa7-6557f3e84074","resolution":{"observed_at":"2026-08-01T18:39:39.071891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17247","last_updated":"2026-07-19T13:32:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T15:56:46.583336Z","submitted_at":"2026-07-19T13:32:54Z","title":"Distilled Reinforcement Learning for LLM Post-training"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2607.17247."}