{"as_of":"2026-08-07T18:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59f6d4ce6de6b3958dab7287eba21da8b4e9a8131108164f4f5be29596a08382","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:36:12.724881Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":21,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:15:50.891014Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:33:45.190652Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-05T19:02:43.873939Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13579","last_updated":"2025-08-19T07:24:48Z","snapshot_observed_at":"2026-08-05T19:02:29.495471Z","submitted_at":"2025-08-19T07:24:48Z","title":"Toward Better EHR Reasoning in LLMs: Reinforcement Learning with Expert Attention Guidance","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T19:02:43.873939Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2508.13579"},"observation_digest":"sha256:70c477ee1fee14f0662f24b96b8b3eb52184dd060ad06a5e09aa95e39b29549c","observation_id":"8d152d08-91fd-4ac5-b84e-58206f25b39b","resolution":{"observed_at":"2026-08-05T19:02:43.873939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-04T16:07:44.633196Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":198,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:44.633196Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:baafa5f70459768a9e888e1de153d2e4ec5cb33eec95303dd7b0f19d43c7faa2","observation_id":"5971ec2e-4c87-4006-8d9b-3bd1882168b5","resolution":{"observed_at":"2026-08-04T16:07:44.633196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-04T07:57:26.211367Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.23497","last_updated":"2026-06-03T18:11:47Z","snapshot_observed_at":"2026-08-06T20:23:18.801284Z","submitted_at":"2025-10-27T16:32:12Z","title":"VOLD: Reasoning Transfer from LLMs to Vision-Language Models via On-Policy Distillation","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T07:57:26.211367Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2510.23497"},"observation_digest":"sha256:6a94168b2b9eaf77b785a1b05ca3a44f4fc52ee0ababa7bb3e44a4915c80ca89","observation_id":"f1b486ff-92f8-4c8a-8e3f-8cc7583ff877","resolution":{"observed_at":"2026-08-04T07:57:26.211367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T15:28:07.981488Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2604.10674"},"observation_digest":"sha256:a3521d9f1d91fe88e4a446bb76f76be3f945e85b4a2a20605975dd6f6ddd413c","observation_id":"20561600-97a2-4b49-a18c-94857ce0b58f","resolution":{"observed_at":"2026-05-11T10:31:00.859941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-12T22:24:51.874340Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-02T07:46:19.307542Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T22:24:51.874340Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2604.10688"},"observation_digest":"sha256:19e4adeacc248b112921cfbd1bef02903c5b46de254d4a4f02538c5e56ce9a98","observation_id":"79670b7c-b18d-4eb9-968e-3dbbe5ac9c10","resolution":{"observed_at":"2026-07-12T22:24:51.874340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2604.17614","last_updated":"2026-04-19T20:58:25Z","snapshot_observed_at":"2026-08-01T22:49:57.966435Z","submitted_at":"2026-04-19T20:58:25Z","title":"Characterizing Model-Native Skills","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-10T05:42:49.694715Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2604.17614"},"observation_digest":"sha256:470816930e8eb846a4fd3564ea264e257ec73c871a35b96704e9094078322b2d","observation_id":"3cb03e82-9d72-416d-8c1f-d69e288d04b6","resolution":{"observed_at":"2026-05-10T06:11:20.617234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.07274","last_updated":"2026-05-08T05:37:08Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:37:08Z","title":"Structured Role-Aware Policy Optimization for Multimodal Reasoning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-11T01:24:20.286120Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.07274"},"observation_digest":"sha256:3d07513d0ee0715e20e2bb8e258f0be15bccb6cba0c87dd3b1cf3744bd3ba2da","observation_id":"bf4c15fe-1558-42a2-9fac-0b2e4c0513e2","resolution":{"observed_at":"2026-05-11T04:25:58.237485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.07276","last_updated":"2026-05-08T05:41:25Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:41:25Z","title":"Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T01:21:43.166304Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.07276"},"observation_digest":"sha256:def46990b3b8c2e89da4c3da2646e671889806bcb5f34f8e498ff717b813c9ab","observation_id":"e791c93a-73ea-4480-8d79-6d9ac748c9e9","resolution":{"observed_at":"2026-05-11T04:25:59.234734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-12T01:17:28.124867Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:1d518f807f89936b84bb321d6a95bf289b82abf4d9b9396d8c59873ee7d1c8a6","observation_id":"2f34ad15-5089-42fe-93f8-744e0e90f97d","resolution":{"observed_at":"2026-05-12T08:06:31.269454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.08401","last_updated":"2026-05-15T12:46:04Z","snapshot_observed_at":"2026-08-02T08:20:53.174108Z","submitted_at":"2026-05-08T19:06:55Z","title":"AIPO: Learning to Reason from Active Interaction","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-19T18:07:27.492419Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.08401"},"observation_digest":"sha256:6c5827dbdf277f806f9df4e8e631625a2d0e5dd72ee1d17b9b689299994fbd66","observation_id":"63c379f9-c1f8-456d-86c1-137068c3cfcc","resolution":{"observed_at":"2026-05-19T18:07:42.300161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.08873","last_updated":"2026-05-09T10:51:58Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T10:51:58Z","title":"CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T00:59:44.364491Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.08873"},"observation_digest":"sha256:74e3956af697b51f061da4dfb62ef104f08cb8e7c661b6e83537d9b957c14165","observation_id":"71e57212-c1da-43f2-8692-a5d3608b8faf","resolution":{"observed_at":"2026-05-12T08:31:26.466360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-04T16:10:21.909941Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-14T21:29:36.803832Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:5bc776f999f154d6bc73cb9a7434e63e953ed54580e0b30180ea21967915de36","observation_id":"d23ae8c3-3675-4eba-bd0e-96a9b678e0d9","resolution":{"observed_at":"2026-05-14T21:32:59.839839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.13230","last_updated":"2026-05-28T10:13:36Z","snapshot_observed_at":"2026-08-05T08:58:23.481391Z","submitted_at":"2026-05-13T09:20:03Z","title":"Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:32.638453Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.13230"},"observation_digest":"sha256:69166251a354bbe8b90f792778cb2ce0312c7c5fa1963d0a7a65d1b917db60c2","observation_id":"9246a7d8-c7b7-4c3b-bca6-6d190305d287","resolution":{"observed_at":"2026-05-14T20:12:54.742130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2605.22156","last_updated":"2026-05-21T08:25:27Z","snapshot_observed_at":"2026-07-06T23:32:30.578213Z","submitted_at":"2026-05-21T08:25:27Z","title":"One-Way Policy Optimization for Self-Evolving LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T08:01:05.911650Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2605.22156"},"observation_digest":"sha256:b568ca20b15f03c339142249dc4a814fc67c98a9d6788f1998bb68f31a5030a1","observation_id":"b3a484d2-b832-4b9e-baa0-f76a8cebdf82","resolution":{"observed_at":"2026-05-22T08:01:15.509689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2606.01464","last_updated":"2026-05-31T21:48:26Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T21:48:26Z","title":"Cross-lingual Self-Consistency for Multilingual Reasoning with Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-28T17:04:19.035841Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2606.01464"},"observation_digest":"sha256:3695907e0a6b8f7ec59a9c0e48fc13a0228f62898152e0f5352f44de5c303535","observation_id":"94c30858-349e-4749-b2b8-ac3df692453f","resolution":{"observed_at":"2026-07-01T21:26:14.307856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-07-06T23:53:40.698123Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:c09c9980d1ce63b5593a38b37c85f8d2244113a582f67e28405e40b18d7961a7","observation_id":"e3988326-fb10-4f49-996b-d6c8a77ad7b1","resolution":{"observed_at":"2026-07-03T20:48:56.061982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.02208","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-07T12:33:45.190652Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning.arXiv preprint arXiv:2506.02208","venue":"cs.LG","work_id":"9d8f3f66-6c5c-460e-a336-6c29fcf34a23","year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-07T12:31:42.224094Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:337c83d300e76f3591c1434ed821a0f4bc330b8d954b8088fe37521c250e3bc8","observation_id":"b01bd5d6-69f5-4f3b-b464-8a3f70d817e0","resolution":{"observed_at":"2026-07-07T12:33:45.192381Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning.arXiv preprint arXiv:2506.02208, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:e5ccb884a597ab333eec24629ee1c1a6ccc8f6ef77aabb7a223276aec683f379","observation_id":"64d41ed5-9b4c-4adb-a93e-dcf3a9891769","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-03T11:42:23.970188Z","title":"Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao, Zheng Lin, Weiping Wang, Jiaqi Wang, and Nan Duan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29209","last_updated":"2026-07-31T09:28:16Z","snapshot_observed_at":"2026-08-07T06:42:15.899276Z","submitted_at":"2026-07-31T09:28:16Z","title":"SAF-OPD: Stable Advantage Fusion for On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T11:42:23.970188Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2607.29209"},"observation_digest":"sha256:73585ba615ee7020acd6aa9daa800f4f60e2b39e6f63581460a8686245b8b50c","observation_id":"defd7e1c-7a86-4920-a21b-04d34c45bcf9","resolution":{"observed_at":"2026-08-03T11:42:23.970188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-05T00:22:11.804686Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00782","last_updated":"2026-08-01T17:29:14Z","snapshot_observed_at":"2026-08-07T03:55:00.582409Z","submitted_at":"2026-08-01T17:29:14Z","title":"Distill Where You Fail: Recovering Learning Signals of Negative RL-Groups from Adaptive Teacher Guidance","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T00:22:11.804686Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2608.00782"},"observation_digest":"sha256:b6f31ddce6b7c5964a9b9407c9c819f19dafbaf0a603fd196fa2b2a33c6cc126","observation_id":"9f2baf39-57d6-467d-a5f9-05b0373855a4","resolution":{"observed_at":"2026-08-05T00:22:11.804686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-05T23:15:50.891014Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-07T17:25:52.974656Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.891014Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:b8b840b3bffd45afad5eac2aa7a16b2a2d624f103452b4e1f97292debd3c1b37","observation_id":"f8857167-3609-4823-94d3-4c04bdb123df","resolution":{"observed_at":"2026-08-05T23:15:50.891014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02208/citation-record","integrity":"/paper/2506.02208/integrity","json":"/paper/2506.02208/citation-record.json","paper":"/paper/2506.02208"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:36:07.014768Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.014768Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:b5d7d10d9456524aced70b0389af37a7cf22a5d0c81e60cdf6f96c2d856c8c5b","observation_id":"bc7042eb-a166-4c0b-b74a-cd2032b6d4e7","resolution":{"observed_at":"2026-08-07T11:36:07.014768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T11:36:07.082155Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.082155Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:35ed68dd926c77306b8fe10aa222aa76da584c269f2dbfa04434adc1d6895a0e","observation_id":"f7dc7aca-ab41-496b-9262-ff5d3c0e12f7","resolution":{"observed_at":"2026-08-07T11:36:07.082155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:07.179640Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.179640Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:4731c13465f6f6cc8759d9b8546ea674650c0a625cc3cb602ce435b8ba195d94","observation_id":"765e5ac6-0c77-48d6-9c27-b753eb468eca","resolution":{"observed_at":"2026-08-07T11:36:07.179640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T11:36:07.248952Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.248952Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:903b8df0528171f066344b07909d3bc100855e77cd357b32c0b135d592abb2f0","observation_id":"0abe67f4-1616-4344-87a7-7d1befde2cf9","resolution":{"observed_at":"2026-08-07T11:36:07.248952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-07T11:36:07.317569Z","title":"Sft memorizes, rl generalizes: A comparative study of foundation model post-training.arXiv preprint arXiv:2501.17161, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.317569Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:833227aab449c89bf02a8b77d6ed9fb6910e076434ab419df1c2dfee8fd257d2","observation_id":"10b74300-4e5e-4064-9c79-02fde00a4664","resolution":{"observed_at":"2026-08-07T11:36:07.317569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T11:36:07.392553Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars.arXiv preprint arXiv:2503.01307, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.392553Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:8ff31ec77a831f5d88b598f429457ea684e7b5ce61810ae1c6ab33d0a226cd72","observation_id":"fde08506-4316-42fa-bee1-40c10769b825","resolution":{"observed_at":"2026-08-07T11:36:07.392553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T11:36:07.483115Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model? arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.483115Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:3645196d6018fc4ffdec810eafc38d269df0c04700b33b719f71577246566eb6","observation_id":"c6c94424-5c27-4c1e-a43a-6ffb5ef34c70","resolution":{"observed_at":"2026-08-07T11:36:07.483115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:36:07.606721Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.606721Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:8ee9fc4e0f0c25849c1d7c1b60092ea6e9b90d92d2119db6ad9d1d4974f4c8bc","observation_id":"ac314d5d-d114-4743-b0a3-a854aa170999","resolution":{"observed_at":"2026-08-07T11:36:07.606721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:36:07.702275Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.702275Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:a6cd04652dc60eb7fc128908c0a4f972bb49ef9b3c34cbda762e8597bc840068","observation_id":"7d2a6550-5ba1-47a8-8f6c-338c6aaf1ffc","resolution":{"observed_at":"2026-08-07T11:36:07.702275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:07.799298Z","title":"MiniLLM: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.799298Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:f96c1cb881f395bca4f4ef94f3ea579c26ea2d3a7d9abe95bd5171302ade1e14","observation_id":"83f7f401-d557-4d6b-92b1-4e79f134d3a4","resolution":{"observed_at":"2026-08-07T11:36:07.799298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:07.887382Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.887382Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:c13693e9c2c1e40eba735ceb2f667eac8d86c475ff50b912102dc81aa08e2cd6","observation_id":"bdb5e2ae-83c6-4836-89c2-76006c613c84","resolution":{"observed_at":"2026-08-07T11:36:07.887382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:07.982065Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:07.982065Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:37b6f6fe23fc7289030d8848c1b6497936994c458fe8b25e4f1a82659d24ec6c","observation_id":"d843840d-42bd-470b-8ec8-3c256466c955","resolution":{"observed_at":"2026-08-07T11:36:07.982065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.107034Z","title":"Simple statistical gradient-following algorithms for connectionist reinforce- ment learning.Machine learning, 8:229–256, 1992","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.107034Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:550e86d64a0fbfc894343809123f7482b7ce2eccbff184f711f15dcd3c2b6100","observation_id":"9b3dc8cc-2d26-469f-b746-ed953503706f","resolution":{"observed_at":"2026-08-07T11:36:08.107034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:36:08.225413Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.225413Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:d6c8a0dbf35f22de895156b96f19ad069e20f87fa5a81aea487f8da17360690e","observation_id":"fa379997-f5fc-4b32-8201-78fd2d0c2e37","resolution":{"observed_at":"2026-08-07T11:36:08.225413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T11:36:08.351323Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.351323Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:8b1b4608ebe05ea72d794042a167594687cb08c6c16c8a25375c234096142c86","observation_id":"63bbb3f9-d517-42bb-b2d2-55684a3e8dfd","resolution":{"observed_at":"2026-08-07T11:36:08.351323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T11:36:08.474963Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.474963Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:f26a1ab32da27952d2616c8b6b1e70883214d4e009ab98f369cbc2c7832c9df3","observation_id":"24986511-57a8-42cf-965a-fad7904e2c78","resolution":{"observed_at":"2026-08-07T11:36:08.474963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:16.737451Z","title":"Skywork open reasoner series, 2025","venue":null,"work_id":"f12f179d-dbf4-4ac6-8277-034174630c05","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.595165Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:def1c030293951221d6bf3446ed16b1dceb6648c817af0d8da70b449fbfb426e","observation_id":"fcafc49c-08f5-475c-8c3c-e5f5853c557c","resolution":{"observed_at":"2026-08-07T11:36:16.827525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T11:36:08.708505Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.708505Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:ce7b9ee92ebbd26a048ebf46ee3c700a6a68cd966c28b202cb6eda839c1e003e","observation_id":"1bf8f1ce-8d60-4d61-88b0-4db343a1489f","resolution":{"observed_at":"2026-08-07T11:36:08.708505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T11:36:08.793164Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.793164Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:7c934c58d157cfbaa4313fcf38cef4ae0656068630d204e5f1c7e960e5297d62","observation_id":"73c6af40-6c23-4d1f-a61f-5621a7e42c4b","resolution":{"observed_at":"2026-08-07T11:36:08.793164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:08.875216Z","title":"Knowledge distillation: A survey.International Journal of Computer Vision, 129(6):1789–1819, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.875216Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:1a94ff00b703eceda1db83bbc01eea4f548188f2e41427daf8c139bba76ad6b7","observation_id":"4c1efdd4-34d9-46d0-8e76-6b7344768fe2","resolution":{"observed_at":"2026-08-07T11:36:08.875216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-02T17:17:56.296462Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-07T11:36:08.962794Z","title":"A survey on knowledge distillation of large language models.arXiv preprint arXiv:2402.13116, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:08.962794Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:fa71ea3b25030c56a7722f8e0df87421a1026ddd4cf9ab2d841108848ca0eb29","observation_id":"e0b2c0eb-c1a1-416d-9c42-3cf8e372db2d","resolution":{"observed_at":"2026-08-07T11:36:08.962794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:16.522480Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"17d10728-bf1a-4d59-8735-9ce1df64c10d","year":2023},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.124500Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:9c0b4e88818eea2f67857c2af9c10a7b1665ac9642eae53e3a81204d32bd8bdc","observation_id":"8fe0849b-b15a-4096-a6a1-ac5b7e86f6ea","resolution":{"observed_at":"2026-08-07T11:36:16.605790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T11:36:09.282181Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.282181Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:0da57194466a019454f0df80b72515e42418e33d1fa08efaa324f5d30303baf6","observation_id":"0ffa4b94-4494-4e06-b652-9de3943044cd","resolution":{"observed_at":"2026-08-07T11:36:09.282181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:09.436044Z","title":"Scheduled sampling for sequence prediction with recurrent neural networks.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.436044Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:c19d2effe1f366ed789b226ad5a6a95724ba6d3152c54bb5903f7d08a3dcea4e","observation_id":"8a4949a7-7739-496b-9290-24c4b5e2214b","resolution":{"observed_at":"2026-08-07T11:36:09.436044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T11:36:09.547015Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.547015Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:3430768651413dc892d43646f665c47f803723a1ffece09e95e2aa3819e06540","observation_id":"9bde6c4b-1898-449a-b6f2-7f207c7a0ff8","resolution":{"observed_at":"2026-08-07T11:36:09.547015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:16.381265Z","title":"Distillm: Towards streamlined distillation for large language models","venue":null,"work_id":"5254da1b-0068-4e63-ae80-a4618ef41d5e","year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.711562Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:8f457ea23e4878ecca8a46edf876776941ceef1691ce20c84a4807af035fb6d6","observation_id":"5ed38e51-f35c-47b0-b84c-73a73eb3512c","resolution":{"observed_at":"2026-08-07T11:36:16.432784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:16.182033Z","title":"Approximating kl divergence, 2020","venue":null,"work_id":"aadb57d0-8bc0-452a-918c-0c0f83e8e069","year":2020},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:09.883441Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:b86b0ef53061670ba2702db5f37ea0c406fc1905c0a772d8e4e392627fb6525a","observation_id":"afeefd2b-a743-42bc-90a1-299cb9adfd73","resolution":{"observed_at":"2026-08-07T11:36:16.265393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T11:36:10.031927Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.031927Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:bfecca8797ada648aa46d9854121a658198239946da27a07d8685d513e539d52","observation_id":"3b5264ed-ceff-4107-aa85-5c29be64da69","resolution":{"observed_at":"2026-08-07T11:36:10.031927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:15.989244Z","title":"Pre-training distillation for large language models: A design space exploration, 2024","venue":null,"work_id":"5a92b8cc-89cc-4efe-946f-29cd8f23c3b5","year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.155406Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:710edde022e2d8011ac39b79a387f39decfd2e2bc30bdf2b1c420a44b7039a41","observation_id":"c88f99a5-b262-4dd8-9302-f0c572fbc922","resolution":{"observed_at":"2026-08-07T11:36:16.086261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:15.777128Z","title":"BiLD: Bi-directional logits difference loss for large language model distillation","venue":null,"work_id":"e3faf94f-bc2a-4d83-af26-61c20ff7212c","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.298149Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:7073ad383a3f6db64e6df4fd7b019e1566573538872b6685f9e74935ad7bd937","observation_id":"244eb88d-a527-4565-8259-f45f2a552c91","resolution":{"observed_at":"2026-08-07T11:36:15.869277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:15.618157Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"8f3bc67c-2140-4f2b-80d7-cb3706c44299","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.371235Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:b91dc1b7a1b6e976f933da37ab771ac80ee856200799f33f1ceeb4691be380e8","observation_id":"0a65557f-0eff-4ce8-9462-c60f34a98715","resolution":{"observed_at":"2026-08-07T11:36:15.700903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:10.453941Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.453941Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:58b8eae3b093011be98414b252e9f96227ab7e5015e5ed8bed34414eaa5c8a91","observation_id":"4993a443-3a0a-4499-a443-91937a95b331","resolution":{"observed_at":"2026-08-07T11:36:10.453941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:10.531390Z","title":"Solving quantitative reasoning problems with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.531390Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:64cdf74dda4420acf62a196e471c56710cebfffe2a4f7eefa2fd9aa4f48cf3c4","observation_id":"cd03b761-69a7-40df-a4c4-d29c13369c0a","resolution":{"observed_at":"2026-08-07T11:36:10.531390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:15.432037Z","title":"OlympiadBench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"a7852c0e-41ec-42c3-b5bf-482551673af1","year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.625246Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:01f40cdda891cd17f92fce92504d7fc695b81eb214a843fb5c6e94bf9a290cc7","observation_id":"c7b942b6-733f-40a0-a342-d11f6808d4da","resolution":{"observed_at":"2026-08-07T11:36:15.499677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:15.259321Z","title":"Aimo validation aime dataset","venue":null,"work_id":"d20a5192-b3c6-4183-a627-df1021ada211","year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.707125Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:4a58ba54ea70c4022e8e5f67ba2a36e6eb77c225aefeb5ff8b705b2de16c8bbe","observation_id":"b45921cf-ad96-4ba5-9e2b-bbeaa8da6b24","resolution":{"observed_at":"2026-08-07T11:36:15.335814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:15.069068Z","title":"Aime 2025 dataset","venue":null,"work_id":"f9f9d324-ae59-4633-8814-85b6e39e59c9","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.813788Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:2335fc271148cb5f3db0b2baf1ea3ecac1065b8b5a06765753ccd626ce436c23","observation_id":"bb7a131d-1785-4597-9fa6-533c0bd75d77","resolution":{"observed_at":"2026-08-07T11:36:15.151855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:14.891645Z","title":"Aimo validation amc dataset","venue":null,"work_id":"b9203c35-82c8-4d7e-be71-67f9772c00a7","year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:10.927920Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:d6097eabc9affcf9a70e6a5b8afea2b8c20b0635fdfc18e7a76e57e147fc2af9","observation_id":"fe90f16b-1553-4f5d-a8ae-42d6af02003a","resolution":{"observed_at":"2026-08-07T11:36:14.992241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.038930Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.038930Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:ece261e41109bb29b0ba3ef965c0c051bfa9e5a5d005b8b7998d01847ffad3a0","observation_id":"dd0c1ba1-d1f7-44e2-bacb-b4dc46c3b0df","resolution":{"observed_at":"2026-08-07T11:36:11.038930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.148445Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.148445Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:b54ca1f8ef9ca47cf279e3aa259b4c7327071979ce42bd58f3934099b8915e19","observation_id":"f16dbbe3-df5c-4d3c-9616-a8a3bbc6e0cb","resolution":{"observed_at":"2026-08-07T11:36:11.148445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T11:36:11.258811Z","title":"Kimi k1.5: Scaling reinforcement learning with llms.arXiv preprint arXiv:2501.12599, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.258811Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:8ec2b2dd1cdc5b232a87da49110070b735bdf733b7f0e1d4957e3541315c019b","observation_id":"5dbc0f33-f8de-46b8-97de-972a64557c26","resolution":{"observed_at":"2026-08-07T11:36:11.258811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.370642Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.370642Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:65b9f66d45952915f50cf29ead86e596ccab814128dc6277078d13f15b6d619c","observation_id":"80dff23d-018f-4aec-8fef-f733fdc4ac39","resolution":{"observed_at":"2026-08-07T11:36:11.370642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.453551Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.453551Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:f09ba55b1b26f2473f4398771e7676b084baba0226da0db8c6cc2b6771560cd8","observation_id":"f459ff65-7b51-477a-9514-9323f248acab","resolution":{"observed_at":"2026-08-07T11:36:11.453551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:11.555546Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.555546Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:22463a28a66a222442ee4311306693c9508befba48d7943c16da6b8d85bbfd7b","observation_id":"160b994e-f498-40f6-8b02-1093b0c8370d","resolution":{"observed_at":"2026-08-07T11:36:11.555546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:14.702342Z","title":"Real: Efficient rlhf training of large language models with parameter reallocation","venue":null,"work_id":"b629c0da-cce4-4c7e-8c7b-bb647c74bdd1","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.686276Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:94d7fdf5287fd1104614dce3c72015e8c39031450a9c8fdc31980bf2e8e20477","observation_id":"34d6aff1-a443-423d-9209-95d0fda787a8","resolution":{"observed_at":"2026-08-07T11:36:14.778954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:14.552619Z","title":"Grpo-lead: A difficulty-aware reinforcement learning approach for concise mathematical reasoning in language models, 2025","venue":null,"work_id":"10cc3552-2270-4181-8f72-6eb2ff250cfe","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.787488Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:cc64316a759b9d457d4a88860a615f8c567cbd67fa5d988ef547e6b3c231c6d0","observation_id":"7e50a254-7b2a-4ee5-8528-491aa60a4028","resolution":{"observed_at":"2026-08-07T11:36:14.629956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:14.361285Z","title":"Vapo: Efficient and reliable reinforcement learning for advanced reasoning tasks, 2025","venue":null,"work_id":"e05c10e8-369f-4efd-bd93-d8e229321c1f","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.886528Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:66b88fa3bdddc3804ccfc299b2b81353b44e9cfbc62e76a75ad8f271b86621c6","observation_id":"72b1bc1d-d395-46a4-8d5b-f4cca322fc85","resolution":{"observed_at":"2026-08-07T11:36:14.441647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:14.182394Z","title":"Ddk: Distilling domain knowledge for efficient large language models.Advances in Neural Information Processing Systems, 37:98297–98319, 2024","venue":null,"work_id":"3efafd07-9698-46e6-9d3a-24ff39f27c81","year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:11.965248Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:94370e1fadd80e5177a14690b3fbe7d2f5a1b27db9e0213520188dff064896b4","observation_id":"67c9f8db-a57d-49a3-9c63-1b1fcf80314f","resolution":{"observed_at":"2026-08-07T11:36:14.267835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:14.044895Z","title":"MiniPLM: Knowledge distillation for pre-training language models","venue":null,"work_id":"1ff37684-c3a5-4dd7-a350-73669bcf5575","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.054220Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:2f428b82d26cb147f9b9bf6ee4da3966405f18b36156d238a282719208f4dcb9","observation_id":"d6531b45-3c99-430f-90e8-f2731937a4a0","resolution":{"observed_at":"2026-08-07T11:36:14.084386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:12.127575Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.127575Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:277f78d056f76eea73739b8d0c23f97b73824e5b75c65fd63d5fa2de1b399fb9","observation_id":"8e34778d-f142-4562-a6ea-9c7729e7ce30","resolution":{"observed_at":"2026-08-07T11:36:12.127575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:12.173541Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.173541Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:965f87f1275b5e8121e34415c1f0ffa11e8559ac5e8988dbcecafec45530f5bf","observation_id":"6dcddca4-240e-4726-922b-ca889de1a7c8","resolution":{"observed_at":"2026-08-07T11:36:12.173541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:13.845482Z","title":"Deepdistill: Enhancing llm reasoning capabilities via large-scale difficulty- graded data training, 2025","venue":null,"work_id":"46218ba4-1a23-4219-a496-c6132728de2f","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.265485Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:2252d40f9bcd94faf3af4ab35ae90f6d499f42763e4d74f34d0593436fa2ef68","observation_id":"330fbea0-151f-4883-b379-c5a503a08254","resolution":{"observed_at":"2026-08-07T11:36:13.925082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:13.664873Z","title":"Pre-dpo: Improving data utilization in direct preference optimization using a guiding reference model, 2025","venue":null,"work_id":"193b4923-de12-4cd6-b3eb-41cf6d5e6382","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.371546Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:7bb1d31db3a08dd6c68f09d5c416cde436d9886d72b87a5e989ffe6e6d0ab7dc","observation_id":"bbde0573-9dac-452b-b197-1b7bf71f4c02","resolution":{"observed_at":"2026-08-07T11:36:13.750554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:13.505296Z","title":"Learning to reason under off-policy guidance, 2025","venue":null,"work_id":"203549b5-d100-4c7d-b35c-b8bcefe5c0e5","year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.438497Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:e9da1ec3b4525f6a64320b0f473dfbd089db7797e390f7dcece18de526a9ffd0","observation_id":"61baf1a4-b8ee-4ceb-a47f-da4b5919924a","resolution":{"observed_at":"2026-08-07T11:36:13.586664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:12.562703Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.562703Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:72b5ce46c4d031cb73f3c4c7f0e152cc98d5f932802cd98c79c2813c7b6b551e","observation_id":"20b13da3-a081-4288-a312-8b5136a1e003","resolution":{"observed_at":"2026-08-07T11:36:12.562703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:36:13.227147Z","title":"Math-Verify: Math Verification Library","venue":null,"work_id":"062cbcdb-5843-47da-95b2-6e84a8ba73bf","year":null},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.657275Z"},"links":{"citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:273282d7ee1869055ae937f725b26b2fce296773b02f48d49ee747b10f92b78c","observation_id":"15eb724f-009f-458e-a60b-c5689b12816f","resolution":{"observed_at":"2026-08-07T11:36:13.378646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T11:36:12.724881Z","title":"{question} Let’s think step by step and output the final answer within \\boxed{}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:12.724881Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.02208"},"observation_digest":"sha256:14f82521c3247d293ba19c0cde043971ab70eca4b1fef82506493c0ca307dc81","observation_id":"ee376b38-f867-450a-8b6c-a745e6f202b9","resolution":{"observed_at":"2026-08-07T11:36:12.724881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 21 inbound Pith citation observations for arXiv:2506.02208."}