{"as_of":"2026-08-16T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf0ea5f95509c34ed426bfb194b582fd807e87938389fd84e26874d34a95e0c3","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:35:19.167249Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11698/citation-record","integrity":"/paper/2608.11698/integrity","json":"/paper/2608.11698/citation-record.json","paper":"/paper/2608.11698"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.515197Z","title":"On-policy distillation of language mod- els: Learning from self-generated mistakes","venue":null,"work_id":"95befd58-c755-4683-ade9-05390f9605e8","year":2024},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.054951Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:26c246eacad727f10213603b32d1eb6e89b603c4f5bf798dc236cf8479a823d1","observation_id":"8d2f49b6-af66-4f9a-bea5-9792c9e053c9","resolution":{"observed_at":"2026-08-16T00:35:19.520409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-16T00:35:19.060109Z","title":"Rethink- ing on-policy distillation of large language models: Phe- nomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.060109Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:e15d935a01942eedf79382aefc79ea7a46d0dca2efc3aed4ffe8554b2fcc898d","observation_id":"79e2b58e-3191-428c-a018-304fcebf1f0b","resolution":{"observed_at":"2026-08-16T00:35:19.060109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-16T00:35:19.075167Z","title":"Learning beyond teacher: Generalized on-policy distillation with reward extrapo- lation.arXiv preprint arXiv:2602.12125, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.075167Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:bf19d8b688797c3575b7a6b72456625332175186be0abc970fc9234f426e0699","observation_id":"ed9ec3eb-7a5c-4d04-bc22-7cb208b97a1b","resolution":{"observed_at":"2026-08-16T00:35:19.075167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-16T00:35:19.080208Z","title":"Distill- ing the knowledge in a neural network.arXiv preprint arXiv:1503.02531, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.080208Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:fb599e82589ac38d4b97775c5ec8783ffe0d85b4b8aaab74937b43fcc9851425","observation_id":"7f5e6aa7-4a84-4743-a369-f2480d7b71bb","resolution":{"observed_at":"2026-08-16T00:35:19.080208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.085157Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.085157Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:8baa5b749829aed49255350da5ed6288d837406917a809c849f5053e033de7e4","observation_id":"b316f74c-d005-4fb4-8f7c-22dadafd967b","resolution":{"observed_at":"2026-08-16T00:35:19.085157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.498990Z","title":"MiniLLM: Knowledge distillation of large language mod- els","venue":null,"work_id":"acda22f8-5342-4a3c-af4d-f37a86944cdd","year":2024},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.089748Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:b7f97d200f2d5e2395b3a6e2d61ed28bb3ce3dc9354d4e0b3562ecd6c7b1a941","observation_id":"4949b4f3-3c69-414b-98c1-b74f08159cfe","resolution":{"observed_at":"2026-08-16T00:35:19.504125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.094622Z","title":"Model extrapolation expedites alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.094622Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:a3ff0a91d85ad9be0b5123a9f75b3fa2ba9f19d62732e9525bfed24b27978bc7","observation_id":"a8c7552d-97dc-4320-baa3-2eacadd96557","resolution":{"observed_at":"2026-08-16T00:35:19.094622Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.101059Z","title":"LLM-oriented token-adaptive knowledge distillation.Pro- ceedings of the AAAI Conference on Artificial Intelli- gence, 40(40):34070–34078, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.101059Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:4863f168c23d12f2d40aa0148807cebe3eaf33cfb2bdd11852e6630d17ba08f5","observation_id":"46898c64-f0ea-44ef-b5db-7c92ab01bc04","resolution":{"observed_at":"2026-08-16T00:35:19.101059Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i41.40780","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.198382Z","title":"ASKD: Reinforcement learning-style knowledge distillation with quality-adaptive skewness.Proceedings of the AAAI Conference on Ar- tificial Intelligence, 40(41):34781–34789, 2026","venue":null,"work_id":"c9a2bc9b-893d-410d-a55d-2945ee3b4169","year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.105626Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:a93c1569a84dd43aacbbdd4d7554d6b3abd5e0f0c05da8c9952b59ec910971b2","observation_id":"c23c527f-e31f-4cda-a179-1ae2fdd62788","resolution":{"observed_at":"2026-08-16T00:35:19.205464Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07804","last_updated":"2026-06-01T07:36:57Z","snapshot_observed_at":"2026-08-15T03:10:22.466759Z","submitted_at":"2026-05-08T14:38:53Z","title":"Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07804","snapshot_observed_at":"2026-08-16T00:35:19.110461Z","title":"Prune-OPD: Efficient and reliable on-policy dis- tillation for long-horizon reasoning.arXiv preprint arXiv:2605.07804, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.110461Z"},"links":{"cited_paper":"/paper/2605.07804","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:6d9991362c30662d523ee68818af9046fd969d9136b8de6a3bf814d38da08b20","observation_id":"54419194-7d93-41c3-a444-1a01734cd859","resolution":{"observed_at":"2026-08-16T00:35:19.110461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-14T18:05:40.907227Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-16T00:35:19.115157Z","title":"SCOPE: Signal-calibrated on-policy dis- tillation enhancement with dual-path adaptive weighting","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.115157Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:3c626bd3b4af9bd3e65be9aa6db965a09b07531b9c374b6ef11311d5be78d76b","observation_id":"d5b56c85-1b64-442b-bb03-1b6f5daffe81","resolution":{"observed_at":"2026-08-16T00:35:19.115157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09304","last_updated":"2026-06-08T10:11:58Z","snapshot_observed_at":"2026-08-12T23:31:46.629708Z","submitted_at":"2026-06-08T10:11:58Z","title":"SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09304","snapshot_observed_at":"2026-08-16T00:35:19.120078Z","title":"SG-OPD: Sign-gated on- policy distillation via sign-consistency gating and phased teacher sampling.arXiv preprint arXiv:2606.09304, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.120078Z"},"links":{"cited_paper":"/paper/2606.09304","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:7c0ef74060ab295b38b7639cffe9995bad754a7efe3ed6c8c155872cba021c40","observation_id":"7ab18514-f7ae-4c58-b3cf-b0ca4203e93b","resolution":{"observed_at":"2026-08-16T00:35:19.120078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04037","last_updated":"2026-07-04T21:51:22Z","snapshot_observed_at":"2026-08-16T10:32:10.416257Z","submitted_at":"2026-07-04T21:51:22Z","title":"Reward-Gated On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04037","snapshot_observed_at":"2026-08-16T00:35:19.124618Z","title":"Reward-gated on-policy distillation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.124618Z"},"links":{"cited_paper":"/paper/2607.04037","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:fd8abf6467235d34fcc7d8b902610c9943a74423b3b7739e44ecad9b6d76fd86","observation_id":"343ca932-becd-49a3-bfbd-a32217317fcd","resolution":{"observed_at":"2026-08-16T00:35:19.124618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T00:35:19.129403Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.129403Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:49ee767a97babe80fc2556739a8b392e928cd9588f5b3e03d207ddbaaaf5e7f7","observation_id":"60ab21a5-297c-438c-b8c9-98d94c2130db","resolution":{"observed_at":"2026-08-16T00:35:19.129403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:35:19.134187Z","title":"Qwen3 Technical Re- port.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.134187Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:47bc1ecbbe573287bf13ab23d1ad4ed04c00a015408193105c019524f7ebbf63","observation_id":"2cc351a7-de7f-42b0-8719-30b5195aac97","resolution":{"observed_at":"2026-08-16T00:35:19.134187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-13T20:36:12.184426Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-16T00:35:19.138789Z","title":"DeepMath-103K: A large- scale, challenging, decontaminated, and verifiable math- ematical dataset for advancing reasoning.arXiv preprint arXiv:2504.11456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.138789Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:17edbce8260ebc9a8b9331a1c84b40e188da068388c690371bb761ba56c5a9ab","observation_id":"d455d430-d7af-4006-9d85-f977df22ef75","resolution":{"observed_at":"2026-08-16T00:35:19.138789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02078","last_updated":"2024-04-02T16:25:30Z","snapshot_observed_at":"2026-08-16T14:04:14.552299Z","submitted_at":"2024-04-02T16:25:30Z","title":"Advancing LLM Reasoning Generalists with Preference Trees","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02078","snapshot_observed_at":"2026-08-16T00:35:19.143448Z","title":"Advancing LLM reasoning generalists with preference trees.arXiv preprint Preprint– REOPD: Reliability-AdaptiveRew ardExtrapolation forOn-PolicyDistillation 9 arXiv:2404.02078, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.143448Z"},"links":{"cited_paper":"/paper/2404.02078","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:6ce216aa6e1146ba62d8b4594acefb0bff537554055babdba971e3917bc51dd4","observation_id":"bd8c6ada-e011-45c3-ac60-530c11e2b87b","resolution":{"observed_at":"2026-08-16T00:35:19.143448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:35:19.483539Z","title":"Decoupled weight de- cay regularization","venue":null,"work_id":"bdbe70ab-377c-48b9-97af-9534f6f0c5b7","year":2019},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.148303Z"},"links":{"citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:a3e1d229a06aea1defc7b711fae1aa47b81cbdbda4c29f3d1978bbb4c854e0fb","observation_id":"4df29590-f01d-4cb7-982a-e9b5594f2c56","resolution":{"observed_at":"2026-08-16T00:35:19.488791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T00:35:19.152756Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.152756Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:e95c5f69dd2dc96f2703aaec0bc504189a01d36848eb7f2483cf59c1e00ed2b1","observation_id":"7b3b7e15-b9d8-4d91-a529-f2e623f53190","resolution":{"observed_at":"2026-08-16T00:35:19.152756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-16T00:35:19.157784Z","title":"Le, and Charles Sutton","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.157784Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:65cab2f2bd77d26401cc9aaaf2672364499dee9a43840437d5a702316b9ec9d2","observation_id":"1ec700ea-8cb8-495b-8eb0-b14d17c86318","resolution":{"observed_at":"2026-08-16T00:35:19.157784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-16T00:35:19.162472Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation.arXiv preprint arXiv:2305.01210, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.162472Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:9093e356b04f7e5f613f39f9a0346bb0615bd8adccb19000a26060ee11616f99","observation_id":"0e08ed39-0c87-412e-9dba-2d8a1f67fe99","resolution":{"observed_at":"2026-08-16T00:35:19.162472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-16T00:35:19.167249Z","title":"LiveCodeBench: Holistic and contamination free evaluation of large language mod- els for code.arXiv preprint arXiv:2403.07974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.167249Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:2afa8e91d8310b58f738b3372576c1ece8a9a78ba33df5e6fca08b41c6b1b6a1","observation_id":"a93e8f58-8d3a-493b-a754-e4b59ae2cf4b","resolution":{"observed_at":"2026-08-16T00:35:19.167249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-08-12T12:04:07.125000Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-16T00:35:19.070631Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-16T00:35:19.070631Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.11698"},"observation_digest":"sha256:78ca2a4b8f8d24b1bfb1d298a5bebdb07d28e4f95619d4cdd548963d76d80a3e","observation_id":"ce6c5471-a501-4538-a6d5-e41177e99e63","resolution":{"observed_at":"2026-08-16T00:35:19.070631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11698","last_updated":"2026-08-13T01:29:38Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T17:10:06.998978Z","submitted_at":"2026-08-12T06:15:33Z","title":"REOPD: Reliability-Adaptive Reward Extrapolation for On-Policy Distillation"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.11698."}