{"as_of":"2026-08-11T20:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:239961cda3cfde1ff16ccb701b911faa66170ababc9c63de6d4ac25becdaf56b","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:33:49.736376Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06802/citation-record","integrity":"/paper/2608.06802/integrity","json":"/paper/2608.06802/citation-record.json","paper":"/paper/2608.06802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.897576Z","title":null,"venue":null,"work_id":"956fa32e-a767-4cd3-ace2-6a3a9d34099f","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.283956Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:8db72d2848472a7119526355359737174b5d4fdff6a6e88381cdb7b33955c585","observation_id":"ef144179-0aeb-497a-8b68-6a3cbf3a452c","resolution":{"observed_at":"2026-08-10T20:33:50.902438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.881106Z","title":null,"venue":null,"work_id":"e3808f5b-64f7-4237-9fd0-90515ebf0cd5","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.288917Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:6774ba498d212e60273be537bcd0de695a4e6c7102b85a38d3d7c2405f20f30f","observation_id":"b3a4a6ef-e9ba-43be-a079-e48ec06d953b","resolution":{"observed_at":"2026-08-10T20:33:50.885845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.864439Z","title":null,"venue":null,"work_id":"e15fdb40-8c31-42d7-b483-6ec26b81ef75","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.293292Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:3afbeffb2753a5c6ccef7fec2e6d2c6ad56822ed2729614ba2fbf009ee7da803","observation_id":"0a815c92-21ee-4acf-98f2-58340d06e92a","resolution":{"observed_at":"2026-08-10T20:33:50.869843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.303533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.303533Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:1cbf5a9a0f10e4fd721581269d5173bed6ed979abb85e865bdad681e4ae47e7d","observation_id":"65b44c54-7183-4b78-a184-64e58b48c85c","resolution":{"observed_at":"2026-08-10T20:33:49.303533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.308575Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.308575Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:534aefd63fc6430d31962179296d6a5672ccd5347e1ed409a5f2f27ef0648841","observation_id":"67242d56-717b-475b-96dc-048ef4a7c78c","resolution":{"observed_at":"2026-08-10T20:33:49.308575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.824567Z","title":null,"venue":null,"work_id":"fcb65158-542d-4251-9f31-f05579a20a79","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.325258Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b852641a805e17bae192cdc956164262c570fc25674761dac4eb596b7ec01460","observation_id":"91b6f477-29d1-4e9d-b6c5-09ad626b2d45","resolution":{"observed_at":"2026-08-10T20:33:50.830701Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.339547Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.339547Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:99cc8c69ff39bd10342b0a2700280b9439f36acf6a95ebfb0031bffc86f93ac4","observation_id":"857f75f7-5d95-4b61-ae2c-033a272dbfc0","resolution":{"observed_at":"2026-08-10T20:33:49.339547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.344333Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.344333Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:4a1d87788be5a00b4d0ba149601636ffa59b5dd12c82a20a19ff07ac4e5f0c0a","observation_id":"ff6f35e2-0386-4d0d-bc71-efff7f6188da","resolution":{"observed_at":"2026-08-10T20:33:49.344333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.785349Z","title":null,"venue":null,"work_id":"97ed23c2-6a6c-4fbf-9401-05bd077e4575","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.349341Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:5db6e4aca4a34ebcf0a9c23cc6191397172336d1078fde3424fe618d030741ec","observation_id":"65e1b4b9-df83-4814-92d1-a86a36f8f57a","resolution":{"observed_at":"2026-08-10T20:33:50.790647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.378391Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.378391Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:9782d123f910c497c6f3adcd8fc2135a3692c6d11c70da3602a87ecf9d68dc3b","observation_id":"befecebd-cc7a-4c96-8e64-faf26c6091e1","resolution":{"observed_at":"2026-08-10T20:33:49.378391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.386825Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.386825Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:cb406a156182211938eb373cb943d7365cd576a28684be99efdeeada29dda988","observation_id":"ebefdfa2-3963-4a1e-83e7-399b922c7960","resolution":{"observed_at":"2026-08-10T20:33:49.386825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.756105Z","title":null,"venue":null,"work_id":"7f6b517a-cc45-4366-bc95-51e733bd432c","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.400294Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b2428096c3287f8293743e5c267a9849b0e3a8f6e4bdf31f8159c8314b3d2a84","observation_id":"0020694c-0aaa-44d5-b56e-1a5ad49aface","resolution":{"observed_at":"2026-08-10T20:33:50.760481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.740372Z","title":null,"venue":null,"work_id":"f47447c2-fed9-4a13-b377-d84738f03b1c","year":2025},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.404507Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:49ed6600acd9d08d293af2c81365fb7de944f7ab574e0fc8bd83a395cc098bd6","observation_id":"de12a7c6-9535-4c5c-8f62-5d45518e0f07","resolution":{"observed_at":"2026-08-10T20:33:50.745433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.413109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.413109Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c5d5d3c64f83377e4039b97d33ff8282b0bdf6c03216cb6df62872e232c9e580","observation_id":"14923632-3ec7-4448-ab63-5b2032a4baa3","resolution":{"observed_at":"2026-08-10T20:33:49.413109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-10T20:33:49.417102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.417102Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:1738fcacd9e87cf221c03839e8036bd8260bde019c4c3d281615ccda66fc0522","observation_id":"2512885d-a34c-4a01-967c-9394d53d1ddb","resolution":{"observed_at":"2026-08-10T20:33:49.417102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-10T20:33:49.421590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.421590Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:397fad337cb0fea48602fe78930ed1f82fb6d18e4b2135c98f039961e6ba3a10","observation_id":"135e7699-ef97-4eac-89af-1a285999b669","resolution":{"observed_at":"2026-08-10T20:33:49.421590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.709899Z","title":null,"venue":null,"work_id":"c78e7f2f-8ba8-4358-8122-0d6329339f97","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.480137Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c58ff5bd1722a699738ea2fa283974f42f382d9f8882cc954988f9b46517a905","observation_id":"4b21c2c7-3a2d-4746-91d9-e041ee20fcc7","resolution":{"observed_at":"2026-08-10T20:33:50.715339Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.691428Z","title":null,"venue":null,"work_id":"00690e72-3ada-401c-9e66-e6bb4f0b103b","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.484333Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:7a46bbe366a7be85c19834191d72d2742603a5cc40385ba788229c595316b141","observation_id":"1985b918-d122-49ef-8455-8bed5d8fb505","resolution":{"observed_at":"2026-08-10T20:33:50.697789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.501958Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.501958Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:12692193f5a8bb8daf0495c81a5259b3bfb6264e6f351531693a8944e6a6b9fd","observation_id":"e455a69e-0076-4f1a-bee0-6683cec08e28","resolution":{"observed_at":"2026-08-10T20:33:49.501958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.450","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.770797Z","title":"Mixture-of-Subspaces in Low-Rank Adaptation","venue":null,"work_id":"e772aeec-3f90-4f2c-a599-341a14d08e5e","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.506973Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:55ad6423d49faed240b4b003d38b5a0d07d2c298f4b9631b4b50899847d3c93c","observation_id":"016e2d75-2c33-4cd1-9b23-b166f1127ee3","resolution":{"observed_at":"2026-08-10T20:33:49.777643Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.511580Z","title":"Proceedings of the 2016 conference on empirical methods in natural language processing , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.511580Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:28f635263e4d32dcb57ed3d59ae9d687503b2e05e075e7dd778721ef791176b4","observation_id":"81d65f62-bb8f-4dda-b3f7-de26361485ab","resolution":{"observed_at":"2026-08-10T20:33:49.511580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.516946Z","title":"Proceedings of the 31st International Conference on Computational Linguistics , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.516946Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b99eaa01a51c069d1283fc75ebcabbb5b5f32eba94426c84c586a93571cfffbc","observation_id":"9d7e22cd-63b7-4977-b24d-c1971059e000","resolution":{"observed_at":"2026-08-10T20:33:49.516946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.643320Z","title":"Proceedings of ICLR , year=","venue":null,"work_id":"9f795a20-a241-4e3e-b65d-635a6bbd312c","year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.522220Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:d0a202fdb18cea67210fda2b5099462e2424fe3e19c07f3f3cb2549eea43393f","observation_id":"dc13541b-6ebe-4956-b2aa-025976643320","resolution":{"observed_at":"2026-08-10T20:33:50.648240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.527152Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.527152Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:93f343da168406c1f5dc6311755cf70141721d9580e63fb8229e85dbd7442b87","observation_id":"7436aaad-10cb-44cf-9aae-95d096e00430","resolution":{"observed_at":"2026-08-10T20:33:49.527152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-10T20:33:49.531991Z","title":"arXiv preprint arXiv:2602.12125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.531991Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:3a867fc15a66cba456297d29309cb3d403245f10c7ded2c136f6243b0b0c1f12","observation_id":"23f39316-cb15-407a-9623-8087e98d0222","resolution":{"observed_at":"2026-08-10T20:33:49.531991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-10T20:33:49.537124Z","title":"arXiv preprint arXiv:2603.07079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.537124Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:8b5cae35052fe7b6542d06a2e1670db19f153d96bc7276dda296ae9907b224cc","observation_id":"74f6452b-d4b2-4d73-b7ea-8468b7cd0a69","resolution":{"observed_at":"2026-08-10T20:33:49.537124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-08-11T15:38:36.283287Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06387","snapshot_observed_at":"2026-08-10T20:33:49.542550Z","title":"arXiv preprint arXiv:2605.06387 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.542550Z"},"links":{"cited_paper":"/paper/2605.06387","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:2c3eba0ee8fa50b91eb62767ffe2615e619e49680d036d2eb4c92423e402ac89","observation_id":"14ee432b-3311-43b0-9de8-1496e42477d2","resolution":{"observed_at":"2026-08-10T20:33:49.542550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.613163Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"48a56ecc-92b3-4a8d-9620-b47c4566ea2c","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.548093Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:ad4d7942c344822b163d627d2f00e43e3ff983a410ed832d8c7b23a5d71455d3","observation_id":"1c07e88a-f9e5-4b71-b56a-db6b26ca0c15","resolution":{"observed_at":"2026-08-10T20:33:50.619081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07804","last_updated":"2026-06-01T07:36:57Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:38:53Z","title":"Prune-OPD: Efficient and Reliable On-Policy Distillation for Long-Horizon Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07804","snapshot_observed_at":"2026-08-10T20:33:49.552957Z","title":"arXiv preprint arXiv:2605.07804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.552957Z"},"links":{"cited_paper":"/paper/2605.07804","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:0f4246e158dbbb5d2e020d81bb2edee56cdf8bf7c60ace17f3f20a35e45548e1","observation_id":"e1cba832-d5fe-4e4a-b2bb-931f5e5e8df7","resolution":{"observed_at":"2026-08-10T20:33:49.552957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07865","snapshot_observed_at":"2026-08-10T20:33:49.557968Z","title":"arXiv preprint arXiv:2605.07865 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.557968Z"},"links":{"cited_paper":"/paper/2605.07865","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:297388a966df8b734d6e6c5a6942ff1202b89379ccd3fe607b12db70cb0a107c","observation_id":"9d44ea29-b433-4735-91c0-a3250287ac37","resolution":{"observed_at":"2026-08-10T20:33:49.557968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-08-11T17:07:33.755866Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-10T20:33:49.562624Z","title":"arXiv preprint arXiv:2604.08527 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.562624Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:3ec4408c0d639465031c0f67e897e123724a0e8c5222eab34a437ee47b5bad20","observation_id":"7d20e4bc-5b7a-493d-8afd-1169e5382376","resolution":{"observed_at":"2026-08-10T20:33:49.562624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-11T02:54:03.247102Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-10T20:33:49.566675Z","title":"arXiv preprint arXiv:2603.25562 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.566675Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:76681a7786492843225e763b4772a437a9fd478cd717b48b879ef49acf8a35a6","observation_id":"be1f3aea-cb85-4338-99fd-1eb62b584fd7","resolution":{"observed_at":"2026-08-10T20:33:49.566675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-10T20:33:49.570616Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.570616Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c9048eb35eafab34996d879c51dbfa2cb534dc9dbcd389c3c3646b24dc3faf9a","observation_id":"0fe7d395-616c-421f-ade7-2084ad8521c9","resolution":{"observed_at":"2026-08-10T20:33:49.570616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T20:33:49.574650Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.574650Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:5777e59be62cae7d10a375192ad3159c614deaa38829227a8b747fa3c6261b09","observation_id":"3d6cbaa1-dd27-460e-adae-4b852a346f6e","resolution":{"observed_at":"2026-08-10T20:33:49.574650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-07T20:56:10.226252Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-10T20:33:49.578815Z","title":"arXiv preprint arXiv:2604.13010 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.578815Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:2151c889bcf346dba6f49454a127aab16ed78e5f0093ed8d93099bc5c417b488","observation_id":"0368f9e2-4e8a-4a57-a457-3a9184e77478","resolution":{"observed_at":"2026-08-10T20:33:49.578815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12483","last_updated":"2026-05-20T14:15:58Z","snapshot_observed_at":"2026-08-11T14:42:54.259282Z","submitted_at":"2026-05-12T17:57:48Z","title":"Beyond GRPO and On-Policy Distillation: An Empirical Sparse-to-Dense Reward Principle for Language-Model Post-Training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12483","snapshot_observed_at":"2026-08-10T20:33:49.583587Z","title":"arXiv preprint arXiv:2605.12483 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.583587Z"},"links":{"cited_paper":"/paper/2605.12483","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b640bf94d984e9e33dc4e34cfe4d75b4e7f7c6e5cd71627835b6e7056d70a031","observation_id":"501f21e1-f11d-4b09-a796-907dc7d41e52","resolution":{"observed_at":"2026-08-10T20:33:49.583587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31159","last_updated":"2026-05-29T11:06:06Z","snapshot_observed_at":"2026-08-09T14:32:57.358635Z","submitted_at":"2026-05-29T11:06:06Z","title":"Trust-Region Behavior Blending for On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31159","snapshot_observed_at":"2026-08-10T20:33:49.587672Z","title":"arXiv preprint arXiv:2605.31159 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.587672Z"},"links":{"cited_paper":"/paper/2605.31159","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:4f92e53ff7c1b679ffcc80d16f9f33d4cf47b65ac942095c089b5f01c6eb8b0c","observation_id":"5f5ef6b4-ef4e-4b76-9076-b6c0d4f1cec9","resolution":{"observed_at":"2026-08-10T20:33:49.587672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09304","last_updated":"2026-06-08T10:11:58Z","snapshot_observed_at":"2026-08-01T14:37:58.992350Z","submitted_at":"2026-06-08T10:11:58Z","title":"SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09304","snapshot_observed_at":"2026-08-10T20:33:49.591651Z","title":"arXiv preprint arXiv:2606.09304 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.591651Z"},"links":{"cited_paper":"/paper/2606.09304","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:c6d9454734ad8ad19d6c1b6d66cdf01e76665b1f704cfe232f534fda47479d83","observation_id":"43b83b9f-942c-4b4b-b1a9-a1df1bba845f","resolution":{"observed_at":"2026-08-10T20:33:49.591651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.596099Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.596099Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:9c5738866164fbf2f4061c90d879665dedf1908982ab90af026d00e6998a6104","observation_id":"c6fedba5-4b7a-4fce-a823-47355892ff7b","resolution":{"observed_at":"2026-08-10T20:33:49.596099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.600676Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.600676Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:a3573699b52f9fa042109c7a3b70663eeeae8d80ddaed1855b5612c6309a1a31","observation_id":"7c663cbe-dd47-4c61-896e-cb4d4cb831ac","resolution":{"observed_at":"2026-08-10T20:33:49.600676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.606635Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.606635Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:31c59aeefdccd063e01db5eba4acffe66b210000f2911bbff66f326660cd0052","observation_id":"9d5a3855-541c-469a-8940-39754b690b1c","resolution":{"observed_at":"2026-08-10T20:33:49.606635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.612004Z","title":"NeurIPS , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.612004Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:afcf84afe81ad9304f909e78dd581126dcb1f1ee2c66087c94031a2f00686552","observation_id":"4aadfd65-3c26-42a6-9fad-c8a10958991f","resolution":{"observed_at":"2026-08-10T20:33:49.612004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.558464Z","title":"2024 , howpublished =","venue":null,"work_id":"44d0db99-0e81-499d-aa75-e4516b29b14a","year":2024},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.618269Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:2a62181f7d8515c17b4c997682526406f45b0ece3f4cea650b119e4392937e18","observation_id":"5c06ccd7-c1ca-4234-9561-3782dd61db10","resolution":{"observed_at":"2026-08-10T20:33:50.563399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.543276Z","title":"2025 , howpublished =","venue":null,"work_id":"618a6196-57a1-40a7-8e07-17a713eb5605","year":2025},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.624253Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:527b62134b1b9133035e5eb2a7028c1ce467b2f405a028c846a368e4005d683f","observation_id":"7f0d3155-6106-4d83-9ce5-0923beb9459a","resolution":{"observed_at":"2026-08-10T20:33:50.547764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-10T20:33:49.630253Z","title":"arXiv preprint arXiv:2311.07911 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.630253Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:32a7785420da4d7670a47d7ec5f2e131d74eec19f5d337b1427fb3aad28282f7","observation_id":"6865d6ec-680b-4ce0-9331-5383e2412a12","resolution":{"observed_at":"2026-08-10T20:33:49.630253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.635158Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.635158Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:1497824920ee5cdd041a0866bac112652d7b4ff9345996b4034ad9290ef15e12","observation_id":"ad7fc911-4566-4447-a900-f7d322d916c5","resolution":{"observed_at":"2026-08-10T20:33:49.635158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-10T20:33:49.641018Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.641018Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:ecc7d6cac31b65bb14bc04cf49c7088096096ffc9ac066782989b858786265c7","observation_id":"39f646b4-25bb-4ee1-8c9a-81637d313b08","resolution":{"observed_at":"2026-08-10T20:33:49.641018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-10T20:33:49.646014Z","title":"arXiv preprint arXiv:2406.01574 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.646014Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:7744287910e1e414e55112ea32b30f452b0eb2d881d25c0e423ad1cfaaf7d8d2","observation_id":"64427f07-89a1-4baf-ae3d-3544708b9cfb","resolution":{"observed_at":"2026-08-10T20:33:49.646014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.650598Z","title":"Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.650598Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:f669c3ee1f36dfb96a996ed54002d6adbfe427fe9c676111b80c4f87c0e8c8de","observation_id":"d219aade-8db3-4065-96d0-199091e0796c","resolution":{"observed_at":"2026-08-10T20:33:49.650598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.655139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.655139Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:10b5551733107522180e1db7dcb1e63275d37b59f4915b12c3d8f8b955cf7604","observation_id":"d8484ec6-4547-44b7-bb6b-f927e81376f8","resolution":{"observed_at":"2026-08-10T20:33:49.655139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.660971Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.660971Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b9b22a1ddddd9d63d134913e63ced144ec60f31741e56572492bdea2af92a779","observation_id":"fdfb6822-0837-42a9-9fc0-8ccce4209f75","resolution":{"observed_at":"2026-08-10T20:33:49.660971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27028","last_updated":"2026-05-26T13:49:37Z","snapshot_observed_at":"2026-08-11T15:52:54.607917Z","submitted_at":"2026-05-26T13:49:37Z","title":"Less is More: Early Stopping Rollout for On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27028","snapshot_observed_at":"2026-08-10T20:33:49.666475Z","title":"arXiv preprint arXiv:2605.27028 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.666475Z"},"links":{"cited_paper":"/paper/2605.27028","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:f7f946c600b7b35f1c0de009b4acff0ee9d27a85870314435f49bef6dbb064f6","observation_id":"2021a775-a527-44b1-bbb2-aee716cf6052","resolution":{"observed_at":"2026-08-10T20:33:49.666475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.671727Z","title":"arXiv preprint arXiv:2603.11137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.671727Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:5e006105815c6ed337e95869bdb6cb4ca4650337957778ccb36bd7d8fe610bdc","observation_id":"da8ca90e-a62b-4441-9ab1-262792531410","resolution":{"observed_at":"2026-08-10T20:33:49.671727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:50.481163Z","title":"Findings of the Association for Computational Linguistics: ACL 2026 , pages=","venue":null,"work_id":"7a956ca0-8c31-46b8-b459-7de1d075006a","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.676533Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:e6f9009be4c9a1207f4717ab05e0e14f67ed1dd8d4ffe37ffe45ed0c03a799e5","observation_id":"fabb859e-5aab-4f91-8cae-bfffed6b9535","resolution":{"observed_at":"2026-08-10T20:33:50.486209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-08-10T20:33:49.681299Z","title":"arXiv preprint arXiv:2603.24472 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.681299Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:76a8c895385b66d1c919b01a2329a7a823cc788b17d4ad4a948a53018eb8e20f","observation_id":"0b42afa9-e6c7-4f0d-9ee7-a5cc12a730c9","resolution":{"observed_at":"2026-08-10T20:33:49.681299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"cited_work":{"arxiv_id":"2607.05394","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05394","snapshot_observed_at":"2026-08-10T20:33:50.428991Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","venue":"cs.LG","work_id":"50f33129-8ca9-4d0f-86a1-affd5d374c86","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.685457Z"},"links":{"cited_paper":"/paper/2607.05394","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:71395524eee22a609d91747ae3366251ba4cc83a4be8403bd087d1b7e7121154","observation_id":"f538fc11-6f86-48e9-819b-19603f675c50","resolution":{"observed_at":"2026-08-10T20:33:50.434056Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-11T16:19:01.650188Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-10T20:33:49.690977Z","title":"arXiv preprint arXiv:2607.05184 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.690977Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:2eba994d586fb66ee3e642cb73713a69b18ffaae18d1dd379dc58dac257efb6a","observation_id":"75ab8712-8de3-4b5a-b064-92fb51e46615","resolution":{"observed_at":"2026-08-10T20:33:49.690977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.695432Z","title":"Thinking Machines Lab: Connectionism , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.695432Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:d33cbaeecde486dac3f5dc031c1cb6f26a1a6adc46002421dd64ab018df606a6","observation_id":"739fbd00-3c00-43b7-bdb2-0d14caab0d34","resolution":{"observed_at":"2026-08-10T20:33:49.695432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T20:33:49.701085Z","title":"arXiv preprint arXiv:2501.12948 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.701085Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:346b010521fbc97a230f273514789037478d4f5a56918855ec0a432904312acd","observation_id":"a4ab0f6a-96ed-46d1-afe8-a5afef35d747","resolution":{"observed_at":"2026-08-10T20:33:49.701085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17199","last_updated":"2026-06-15T18:37:51Z","snapshot_observed_at":"2026-08-08T14:44:03.594424Z","submitted_at":"2026-06-15T18:37:51Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","version":1},"cited_work":{"arxiv_id":"2606.17199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.17199","snapshot_observed_at":"2026-08-10T20:33:49.850337Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","venue":"cs.LG","work_id":"cd010048-eaaa-45b4-bc16-6309bebbc432","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.708228Z"},"links":{"cited_paper":"/paper/2606.17199","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:6b8404763140c6f96031d323cbfe9e790c250a387421bc6aca3c12254688ca32","observation_id":"c80fcf15-757e-4593-ba35-37f0e5ade828","resolution":{"observed_at":"2026-08-10T20:33:49.856399Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.715209Z","title":"arXiv preprint arXiv:2512.16649 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.715209Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:af9044439d2587a3c7bba4f92acf9c28bf73a6c6b04468dd0e49e1934bfedb39","observation_id":"161c7e63-b872-459d-a1a3-b9429805685b","resolution":{"observed_at":"2026-08-10T20:33:49.715209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.00755","last_updated":"2026-05-30T14:44:57Z","snapshot_observed_at":"2026-08-05T06:50:53.081239Z","submitted_at":"2026-05-30T14:44:57Z","title":"Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.00755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.00755","snapshot_observed_at":"2026-08-10T20:33:49.897555Z","title":"Internalize the Temperature: On-Policy Self-Distillation as Policy Reheater for Reinforcement Learning","venue":"cs.CL","work_id":"88966fde-6f7e-44e2-a474-a077b563002f","year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.720560Z"},"links":{"cited_paper":"/paper/2606.00755","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:8c3f01a3d9dbc14543f63c2b126c3fe821a6a2964780e616f1f000bdabaf2be3","observation_id":"fd50169e-ef4b-436b-9085-a55b9db48cc4","resolution":{"observed_at":"2026-08-10T20:33:49.902967Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-10T20:33:49.725936Z","title":"arXiv preprint arXiv:2601.02780 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.725936Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:b4f822c1ed4d3f3070aabaf9a98ea26c85898ea72978a8f2d27f023663bfd3bd","observation_id":"c4b0e66e-fe26-4e82-a532-d6684d3a8dcc","resolution":{"observed_at":"2026-08-10T20:33:49.725936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.731715Z","title":"arXiv preprint arXiv:2606.19348 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.731715Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:e9f748dc0365ff1ea6296161ccb349f9b1e46feb383a8b12f847150347d634c9","observation_id":"29dd08fa-36a2-40c5-94c7-2e26e0371814","resolution":{"observed_at":"2026-08-10T20:33:49.731715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:33:49.736376Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T20:33:49.736376Z"},"links":{"citing_paper":"/paper/2608.06802"},"observation_digest":"sha256:8217a985f167857248ba9ddd5004ca192982cc14aaf571e9249742d9b184e239","observation_id":"676baaa3-9a14-4f78-98ec-50d064568d12","resolution":{"observed_at":"2026-08-10T20:33:49.736376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06802","last_updated":"2026-08-07T04:47:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T20:10:25.522129Z","submitted_at":"2026-08-07T04:47:38Z","title":"Simple-OPD: Demystifying Warm-up for On-policy Distillation"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":56,"verified_exact":1,"verified_fuzzy":5},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2608.06802."}