{"as_of":"2026-08-17T02:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:72d548a8551bb5e0ae4f505e0ddf1b18a72df2dec716fa5283109f13192dc05f","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:07:54.738215Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:35:19.124618Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T14:39:46.237545Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2607.04037","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04037","snapshot_observed_at":"2026-08-12T14:39:46.237545Z","title":"Reward-Gated On-Policy Distillation","venue":"cs.LG","work_id":"a57832ce-817b-4e72-b9fb-418e95014e59","year":2026},"citing_paper":{"arxiv_id":"2608.10905","last_updated":"2026-08-11T13:27:56Z","snapshot_observed_at":"2026-08-15T20:37:45.555476Z","submitted_at":"2026-08-11T13:27:56Z","title":"ReOrder-OPD:Reliability-Aware Prompt Ordering for On-Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T14:39:46.145211Z"},"links":{"cited_paper":"/paper/2607.04037","citing_paper":"/paper/2608.10905"},"observation_digest":"sha256:6484590503231ada903b87c100e256068aa8e13ba5f2bb4fbdd4f2982416b311","observation_id":"e9198a1b-9d49-494d-b97d-d09a9df0c6d0","resolution":{"observed_at":"2026-08-12T14:39:46.245029Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04037","snapshot_observed_at":"2026-08-16T00:35:19.124618Z","title":"Reward-gated on-policy distillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T23:10:06.518339Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.124618Z"},"links":{"cited_paper":"/paper/2607.04037","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:261568d5147773eb9658d6a584a31ed560845b6ebb16f92368edd300dc9e7bc2","observation_id":"343ca932-becd-49a3-bfbd-a32217317fcd","resolution":{"observed_at":"2026-08-16T00:35:19.124618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.04037/citation-record","integrity":"/paper/2607.04037/integrity","json":"/paper/2607.04037/citation-record.json","paper":"/paper/2607.04037"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Agarwal, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:71d97163d579020f64ca9950948f843bb03d3e075c31dcbdb45edb40f49c9755","observation_id":"dabe41dd-4661-4ec6-b43a-5b36757cd657","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:faba1567a0329f3a14c661bdf511f18da40e139231bfa3a7bd77a03c4fc1f282","observation_id":"ccd41238-23c4-4d4a-8b2a-57730a87a139","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Cobbe, V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:900f02177ec50f66a9602af9eed0e4f9aa2f6c43d4656501b363dd1b76a6c529","observation_id":"9d17f507-6cfe-46c1-b01f-cdcce3cea4da","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Murphy: Reflectivemulti-turnreinforcementlearningforself-correctingcodegenerationinlargelanguage","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:dd8fb14ba364368e7437441be50c39cf63b93777a014e6f52120773d5e2288bf","observation_id":"fd46cde3-a885-4b60-adef-e443b6873a85","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:48ee16444d467bf987aace5312fd46a50d077a52704bd88cff977d817b3bb37d","observation_id":"2532560c-5c4b-4f22-b791-3d031592b46c","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:14ff8732def0c4aa2fd8134a73df6d8e9491d42284e951218c9569f63908914a","observation_id":"5b91f8d8-cb5d-43ec-b5b0-d9d64d07ff2c","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:be75640bd3e259f111fa147db43a1df12404ec42b71285ad88a72cef30033139","observation_id":"a8a9edb0-293c-48c4-9957-203196e074ea","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:721c2abe5c9c1c64b295d899dc640e2b3acf5975c43a8305921bdee1fec98315","observation_id":"7a78c896-030a-4d8e-ae3e-9ce0cc87bdc5","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Hübotter, F","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:1913ebd3fc8761dac7475d3aad82b2a6fd5152037f9553765404de9e7b939625","observation_id":"8f55a362-2f6b-4879-8bf4-01cd1d48bceb","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Explaininyourownwords: Improvingreasoningviatoken-selectivedual knowledgedistillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:a4f5a96fba2d77f3235ce3c107ab55fc0bc17fac7ffba641063a993415ecf87e","observation_id":"71b012c7-1bea-4ebd-a1e2-56cef830bd10","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:0ef960752b5be11405a7e8deda682d7fab705a94cff365ffa445d151ff8d8f87","observation_id":"51dc7e38-14db-4036-bbcd-78e87c80f633","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Understandingr1-zero-like training: A critical perspective","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:88999b011491ec38f9a6edb0acc8fad930b2498dbd32b25c40f3e57bb60dbb1d","observation_id":"5a73ff77-3912-4e04-9725-5f85ff5853ea","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Schulman, F","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:aeac5fdadad0d9ac739ba16ab0e9bf37f105ff1db91041fe38831c56ffc72c8e","observation_id":"68d10316-3bc6-46ac-8449-1bf722e2f5da","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:e2f8aba8188e380479ae850d83b0384baae614e457738401df12e9124387a7ab","observation_id":"f1695f4a-1a48-4b20-a5e5-bc7eeb7ae3cb","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-15T04:42:50.651833Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Shenfeld, M","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:2c775e9b7de354f192f214c3a01653a64af8f073091b39f9e6ddca5e3b8f61d8","observation_id":"cc686297-25b3-4863-bd86-477d70a428a1","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Sprague, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:136379d2023bf08244fdce0c6aee1df3437a8a9fa80a6a03572fe2dfbaa5368f","observation_id":"76c9cb66-bd19-43f3-970c-fd8aa827ba81","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Suzgun, N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:60480ef762221f4a1063d6d47c456310fcb614be6d9f2873a9345f7b197fd7fe","observation_id":"6b05d31b-7c0f-40b3-b5f5-e765a3a67cbd","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:a6e2fe2a996761e56a086eaf3be0274861ada15b3a0f80b0f5277e0f2bbe51e3","observation_id":"269d5db7-efbe-458a-91f4-974b470407ea","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Welbl, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:57031c676f53744af7429c008eb945c806798b2676a2f69381b555fba53d068b","observation_id":"032cf95a-5b64-4edb-8622-4cb92742d0ac","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Kdrl: Post-training reasoning llms via unified knowledge distillation and reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:133df9260791bc62241571e0afe19dfcab9d133f177c32fcdd6903f587a5b86a","observation_id":"8d86fe6c-b348-4d9d-b850-0e963a146349","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:6fa73d913b2010daddc7834ae58a41d4426712b2cff9629eac4953886f776dee","observation_id":"61640c2d-4ec9-41eb-bb24-99695b356187","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:2b6d3ad298416278588e439546172105dc7f4a531ad944be125becf8fcd22c74","observation_id":"511175c2-e0a7-4a45-807f-9aa3af34dad0","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Zhang, S","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:c435120dab442b6e05300f928246701a6e8ce65c34fa23bef26e00bc3799ee54","observation_id":"b84562b4-57b0-4155-aa3f-68f84ee50733","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:3bd4e08c0ce570fb8e03640ca56a311c8a80533c5e4f68656ce9a203a65112cb","observation_id":"3bd2d94a-1d84-4e5d-80a6-4cd8b43010d1","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":"Zheng, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:9d0f734eb966cb47bcf3a970d53a8c8e75f0525b293360f46a43711138138115","observation_id":"060f3a0b-77af-4efa-823e-54fcbe0954a7","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T22:07:54.738215Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T22:07:54.738215Z"},"links":{"citing_paper":"/paper/2607.04037"},"observation_digest":"sha256:936710c1ae1800a45fbb255e82fa386da2fccfc5f3bbc0fda0d13d988eb01e45","observation_id":"0e5fd19e-b112-4cea-9eb0-fe0e2621b12d","resolution":{"observed_at":"2026-07-11T22:07:54.738215Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2607.04037."}