{"as_of":"2026-08-08T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26db209891e2a0b5a56e434066b097af820b33c0ca796c67f50b5a8c5df18f7b","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T01:04:59.662046Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:05.711475Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-04T22:02:35.499158Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":"2607.05184","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-04T22:02:35.499158Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","venue":"cs.AI","work_id":"2f6b90cc-5e59-4697-87dc-c78d3f7eedd5","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-07T08:04:13.120997Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.791583Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:8f7c3605d80a38ede5ec0d237fc597ec0f3b0e7914d0edff931d0046f6ce4f6a","observation_id":"713f8264-9954-41ac-9f95-00c226482406","resolution":{"observed_at":"2026-08-04T22:02:35.540632Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-06T16:39:05.711475Z","title":"arXiv preprint arXiv:2607.05184","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T17:14:25.484958Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.711475Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:3e74e43998368a22544fc7c7e95b1ca344ac89cfd9379c3f4bf4593c5c8b0bac","observation_id":"de8a8bae-340f-406b-b2b5-d2ebd0a6a75e","resolution":{"observed_at":"2026-08-06T16:39:05.711475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05184/citation-record","integrity":"/paper/2607.05184/integrity","json":"/paper/2607.05184/citation-record.json","paper":"/paper/2607.05184"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07961","last_updated":"2024-12-10T22:57:57Z","snapshot_observed_at":"2026-08-06T12:44:07.837561Z","submitted_at":"2024-12-10T22:57:57Z","title":"Forking Paths in Neural Text Generation","version":1},"cited_work":{"arxiv_id":"2412.07961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.07961","snapshot_observed_at":"2026-07-08T01:14:27.523928Z","title":"Forking paths in neural text generation","venue":"cs.CL","work_id":"655acfb3-d569-4876-aa0f-2bb90c9ec628","year":2024},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2412.07961","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:42fec9fbb9fba811a5ffd918770b686edeb5a071f10ccaf98ac8afbe7b4affe7","observation_id":"cbba8739-0646-4fca-bb69-bfbedf14edfb","resolution":{"observed_at":"2026-07-08T01:14:27.525524Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:f8626efebbd8f64417acbca8b4baf05d4cd721804dbaa3fbcb34f20e5c3c41d4","observation_id":"396f6a89-249f-40bd-88a8-769fa5891127","resolution":{"observed_at":"2026-07-08T01:14:27.516491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.720637Z","title":"Chakravarthy, Anikait Singh, Nathan Lile, and Noah D","venue":null,"work_id":"0237bba7-4497-4fae-ba11-29e92b70065f","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:2313415f4e5eb81404d81a74adfe4b82ee2c34d5629a47da5723d46de95bcd59","observation_id":"eb8f50b2-3593-4b2d-b1de-da1768b4882b","resolution":{"observed_at":"2026-07-08T01:14:27.721941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":"2604.12002","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-07-10T01:46:41.091851Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","venue":"cs.CL","work_id":"075fcc48-23c0-4231-bf6e-c629eb2a169b","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:bcb00ef80f465c30dd715298c815a02b4c5618fe7c132916788883d37e96f8b1","observation_id":"9146e4db-699d-489e-b982-0736d154a3fb","resolution":{"observed_at":"2026-07-08T01:14:27.515390Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:71a5d304d98ffb14d511c9767a9f30ae7562bf573a0b3912fc5aa2b713ae250f","observation_id":"f542e8fc-6641-4546-b5c8-3f025de3e865","resolution":{"observed_at":"2026-07-08T01:14:27.535875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":"2603.24472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-10T00:26:39.269322Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","venue":"cs.CL","work_id":"8df6a2d1-d890-48ae-af85-c11643a91097","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:efd49c923f42943d5f21c143545744d3936936f221648b9fa87ae308278b810e","observation_id":"c3e91af8-c3b6-41ab-9971-e775278d404b","resolution":{"observed_at":"2026-07-08T01:14:27.528143Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-08T04:33:50.104780Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"cited_work":{"arxiv_id":"2411.19943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19943","snapshot_observed_at":"2026-07-08T01:14:27.537549Z","title":"arXiv preprint arXiv:2411.19943 , year =","venue":"cs.CL","work_id":"ba6fd699-ba05-4ff7-a077-bbcade21f6e4","year":2024},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2411.19943","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:5f49aadb917c9ff59392cf0e4655e92fb29585b781aa3450df8663a228be207f","observation_id":"bdadb457-eb31-4c85-8b4e-19aedac412ad","resolution":{"observed_at":"2026-07-08T01:14:27.539267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18779","doi":"10.48550/arxiv.2601.18779","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pope: Learning to reason on hard problems via privileged on-policy exploration","venue":"arXiv (Cornell University)","work_id":"49d6a516-37ca-4bd7-8174-20b4b69db931","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:f3ec127c94dac39225a139e2643296563b9f54dd5fde22795c8682aaed767fa5","observation_id":"e802dbe8-8581-4ab8-9b8b-9a0d04549f24","resolution":{"observed_at":"2026-07-08T01:14:27.537447Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18795","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:57.801171Z","title":"Reuse your flops: Scaling rl on hard problems by conditioning on very off-policy prefixes","venue":null,"work_id":"2be8a44f-c445-4fc6-9eec-82c26f802afc","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:acb850b7b5021fc1611478c7614844d795353dc6cf0ca25c0b9d6f42bb2cade2","observation_id":"36b68aad-dc12-4f62-80a3-5482845b9328","resolution":{"observed_at":"2026-07-08T01:14:27.529342Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:cc28e03396d69956292a70d961d2d1928cb9f0e33d8ac67fb69a1cdb462e4f13","observation_id":"be81aa2d-827e-4823-aac3-1f8519c3e5f3","resolution":{"observed_at":"2026-07-08T01:14:27.531170Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":"2512.13961","doi":"10.1007/s13755-026-00428-z","metadata_source":"pith","pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Olmo 3","venue":"cs.CL","work_id":"74de5f5e-0a69-4f73-862d-e5705fa9f4bb","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:20c8eb5ce3d962a0f44fdb5efcc288ee30899b7d641eb0b382eaf7e0ff874324","observation_id":"1a4d5b85-22a0-4110-8d15-efd0c35c8128","resolution":{"observed_at":"2026-07-08T01:14:27.545307Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.730840Z","title":"Understanding reasoning in thinking language models via steering vectors","venue":null,"work_id":"99a73a4f-a697-405b-9022-461bf0939ca3","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:9e71604aecbe98f741d155fb357c1dce158c21d50d633f37c1db4efeaf5dba20","observation_id":"afbf9a04-0dcf-4fd0-a8b4-6354c8bd52cf","resolution":{"observed_at":"2026-07-08T01:14:27.732244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:c7a6a84a37b4148e5db46f4dd3985f34d0b9abcb950e75831038f90267fc0173","observation_id":"9e148a67-9f7d-4410-9d2a-018a29fd6c7e","resolution":{"observed_at":"2026-07-08T01:14:27.542787Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.01193","last_updated":"2026-06-24T22:44:36Z","snapshot_observed_at":"2026-08-02T16:28:38.685624Z","submitted_at":"2026-04-01T17:39:50Z","title":"Embarrassingly Simple Self-Distillation Improves Code Generation","version":2},"cited_work":{"arxiv_id":"2604.01193","doi":"10.48550/arxiv.2604.01193","metadata_source":"pith","pith_arxiv_id":"2604.01193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Embarrassingly simple self-distillation improves code generation","venue":"cs.CL","work_id":"c0ef109a-9f93-445a-beb2-16ed977cbebc","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2604.01193","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:c26e4d023e72953726e5d5b5c7857db5d251049d8be606b2bcca4a9b8f7f1838","observation_id":"c8272c1a-c400-4d83-9492-cf6d3c41167c","resolution":{"observed_at":"2026-07-08T01:14:27.525726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:de0f0b33bd2367339f12a60e0e2497d15a17e233476fed8185bc1c4821a99873","observation_id":"a309d32f-8968-435e-b44c-7157562fe251","resolution":{"observed_at":"2026-07-08T01:14:27.501845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.729023Z","title":null,"venue":null,"work_id":"0976aac9-03e2-4d2f-893f-90e7e9613b0d","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:4bee300111d86b98199f95abc72818df530895c636ed5df0220de3b139d84e5d","observation_id":"37258f2f-723a-488e-ad56-29a8a099477e","resolution":{"observed_at":"2026-07-08T01:14:27.730229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.718808Z","title":null,"venue":null,"work_id":"a1153dd0-1a42-4f9e-bf97-c39b704c4fc5","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:1bfcb9d2847955c50d2ac3e069a0763147cebeb5a49c02c2e2798223a7ade474","observation_id":"52c3f718-42b9-4900-b8bb-3706cb76ae18","resolution":{"observed_at":"2026-07-08T01:14:27.720002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.724590Z","title":"The Average column averages the three benchmarks","venue":null,"work_id":"63d6f377-2da1-4b86-884c-367d004a8871","year":2048},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:31a21d9c2c9ee8a8db7bc075414175cfbaacccb5b1697d37d47129ec1f3e21fb","observation_id":"dd3ad507-5f89-409f-b287-639a407cfec3","resolution":{"observed_at":"2026-07-08T01:14:27.726381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.722555Z","title":"Epistemic-token OPD applies the same loss only to tokens in the epistemic-marker set","venue":null,"work_id":"3b939d38-fc07-4807-a04e-84e80d0f76ce","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:2f04d5e693f2891091cfff62e26d1e58c0970b8c4c05bc09b166159cbe39785f","observation_id":"d7c7a81d-4e28-47fb-90ac-2186c707c26b","resolution":{"observed_at":"2026-07-08T01:14:27.723944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.733414Z","title":null,"venue":null,"work_id":"c0d3db60-1c82-46f0-914d-4550992a29a0","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:1cb46e7d3fb961aeeda0e38cb947597d512bc111954f019d160b02f3240973e8","observation_id":"cbf32b64-d01a-4caf-b5e1-191965f8354f","resolution":{"observed_at":"2026-07-08T01:14:27.734544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:14:27.727046Z","title":"Blue curves are base thinking models, orange curves are OPSD with full gold-demonstration context, and green curves are OPSD with final-answer-only privileged context","venue":null,"work_id":"aaf579ac-e070-46d9-8877-db3457ac9022","year":2026},"citing_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T01:04:59.662046Z"},"links":{"citing_paper":"/paper/2607.05184"},"observation_digest":"sha256:3da2096a7014eb19abf463662b1e5fde42d3c92524d53e089c8457ba039b79b8","observation_id":"dcfd014f-39a6-41f3-bcd6-0904ee2b91f3","resolution":{"observed_at":"2026-07-08T01:14:27.728454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":6,"parse_uncertain":0,"unresolved":3,"verified_exact":7,"verified_fuzzy":5},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2607.05184."}