{"as_of":"2026-08-19T03:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3d9a51b59bd50d420eda655bcbd93db16c3f898a81b3b919775330c15e09c36","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T05:51:08.345336Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09836/citation-record","integrity":"/paper/2608.09836/integrity","json":"/paper/2608.09836/citation-record.json","paper":"/paper/2608.09836"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.640233Z","title":"On-policy distillation of language models: Learning from self- generated mistakes","venue":null,"work_id":"1bc167f7-fc5a-428b-9146-7ae0bf32fde1","year":2024},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.063700Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:6e1858dece88cbb06a137819b29ca8f3b9b00297df4f23253bd673176b73f253","observation_id":"4a285c96-4459-4750-9cd0-c10263ce4091","resolution":{"observed_at":"2026-08-11T05:51:09.647925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.510862Z","title":"Thus, the value ofωat which resonance occurs is2","venue":null,"work_id":"a8ac5afb-f4e6-4942-b7b0-07840889d9c5","year":2024},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.330319Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:bbc72c297ecb5a54b582531d4d0e9f31fa049b0303b599158f25c77e464ba42b","observation_id":"6cca286c-a5e5-4271-8fdf-62a12dc97635","resolution":{"observed_at":"2026-08-11T05:51:09.519997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06387","last_updated":"2026-05-13T04:44:13Z","snapshot_observed_at":"2026-08-16T19:17:49.212702Z","submitted_at":"2026-05-07T15:02:49Z","title":"Asymmetric On-Policy Distillation: Bridging Exploitation and Imitation at the Token Level","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06387","snapshot_observed_at":"2026-08-11T05:51:08.089540Z","title":"Asymmetric on-policy distillation: Bridging exploitation and imitation at the token level.arXiv preprint arXiv:2605.06387,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.089540Z"},"links":{"cited_paper":"/paper/2605.06387","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:b408f23606207008e87a647a9983ab3f9c4edb52bdbbee71535bafc98691647d","observation_id":"75bc87cc-932b-47d2-9621-0654c9444156","resolution":{"observed_at":"2026-08-11T05:51:08.089540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.609070Z","title":"Rethinking on-policy self-distillation for thinking models","venue":null,"work_id":"21f889d8-59a8-4a40-ae01-1a4665379d09","year":2026},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.105860Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:f868595b03cc0ac1fffa7aa9c91fe960c46f4a75796b74f1f3193c8c2c1080e1","observation_id":"455550fd-7372-4dd5-9935-60e2964d1fdc","resolution":{"observed_at":"2026-08-11T05:51:09.618081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-08-14T19:39:25.088761Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13255","snapshot_observed_at":"2026-08-11T05:51:08.115933Z","title":"Respecting self-uncertainty in on-policy self-distillation for efficient llm reasoning.arXiv preprint arXiv:2605.13255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.115933Z"},"links":{"cited_paper":"/paper/2605.13255","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:238f9a8b72850c05ad28a98cbf94baeb7327467f6368b22ec734a6f17fb0179b","observation_id":"f1b484ce-64ad-4359-aa23-2a1c1621c1b0","resolution":{"observed_at":"2026-08-11T05:51:08.115933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:08.125373Z","title":"Scaling reasoning efficiently via relaxed on-policy distillation.arXiv preprint arXiv:2603.11137,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.125373Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:af624b6ee20017b96d5a1648ed85b6f5b9bec6094bdaed859a90dd23df42005a","observation_id":"2f822c1f-fcc8-4982-ad77-7bb3bbde8024","resolution":{"observed_at":"2026-08-11T05:51:08.125373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-11T05:51:08.134433Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.134433Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:9526b2c77e8ea70bf4739ee936f73d2c30b6e8f1f9f7f641f55aab83fa69107f","observation_id":"7ae8cd34-f023-46e2-b316-f29eeefae6a2","resolution":{"observed_at":"2026-08-11T05:51:08.134433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13230","last_updated":"2026-05-28T10:13:36Z","snapshot_observed_at":"2026-08-12T17:04:41.403040Z","submitted_at":"2026-05-13T09:20:03Z","title":"Teacher-Guided Policy Optimization for On-Policy Reasoning Distillation under Large Policy Divergence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13230","snapshot_observed_at":"2026-08-11T05:51:08.142840Z","title":"Teacher-guided policy optimization for on-policy reasoning distillation under large policy divergence.arXiv preprint arXiv:2605.13230, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.142840Z"},"links":{"cited_paper":"/paper/2605.13230","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:e1defa149342ea4e2feae88011aed5fdc66a0b07561577805da099f334b4acda","observation_id":"c92bd30d-e5f0-44c4-b746-ece8326b6aa3","resolution":{"observed_at":"2026-08-11T05:51:08.142840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-08-16T22:07:58.510827Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-11T05:51:08.150202Z","title":"https://thinkingmachines.ai/blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.150202Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:c7649c33ce1cf6d77b0a096070bbb86b47dcdf8975987aa20282aff0eb688ecb","observation_id":"cecc0ba3-14f5-4fa6-b960-f44e6b9a1f42","resolution":{"observed_at":"2026-08-11T05:51:08.150202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-11T05:51:08.187057Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.187057Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:4f3d20b69f46828326d11d0b71e1d7aa4a885e91784d91e59dbd86af8ebff3d6","observation_id":"7149cbe0-c2a0-4c8d-880c-1225c2c12ffe","resolution":{"observed_at":"2026-08-11T05:51:08.187057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:08.200354Z","title":"Kimi k3: Open frontier intelligence.arXiv preprint arXiv:2607.24653,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.200354Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:bac839c1ba3c1b5a836073c4bc0f0393fccaec0d7be48d1ce472f0d8b15062e0","observation_id":"393842cf-cd96-4df2-9507-1bfe0cd745ee","resolution":{"observed_at":"2026-08-11T05:51:08.200354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26844","last_updated":"2026-05-26T10:56:46Z","snapshot_observed_at":"2026-08-08T04:38:50.480074Z","submitted_at":"2026-05-26T10:56:46Z","title":"Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26844","snapshot_observed_at":"2026-08-11T05:51:08.212803Z","title":"Not all disagreement is learnable: Token teachability in on-policy distillation.arXiv preprint arXiv:2605.26844,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.212803Z"},"links":{"cited_paper":"/paper/2605.26844","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:54c6cfd81953ef7f678e0d7a107a929e27ba7a83deadacb59f8df486f9c8fbe4","observation_id":"f870c4cb-5304-47c0-9fd0-0aaf1404c4e7","resolution":{"observed_at":"2026-08-11T05:51:08.212803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-14T07:48:23.313445Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-08-11T05:51:08.223854Z","title":"Mimo-v2-flash technical report.arXiv preprint arXiv:2601.02780,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.223854Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:8e7980411b8c5debbbaa6fccbcc15047890bc1ebdcd43d37787a5e8369b49847","observation_id":"a78dac6c-aa3f-46f8-839b-841e31dd885b","resolution":{"observed_at":"2026-08-11T05:51:08.223854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09471","last_updated":"2026-06-08T13:28:54Z","snapshot_observed_at":"2026-08-13T01:57:30.297080Z","submitted_at":"2026-06-08T13:28:54Z","title":"Escaping the KL Agreement Trap in On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2606.09471","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09471","snapshot_observed_at":"2026-08-11T05:51:08.722060Z","title":"Escaping the KL Agreement Trap in On-Policy Distillation","venue":"cs.LG","work_id":"bb7938ee-3592-4170-889c-75508fcdfd10","year":2026},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.237893Z"},"links":{"cited_paper":"/paper/2606.09471","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:c370631997426f4e0ca3b1eec8f3daabf850bb3ff379983f16e514ccc6e65431","observation_id":"41878fca-c832-401b-8092-02928c28fb08","resolution":{"observed_at":"2026-08-11T05:51:08.733913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01249","snapshot_observed_at":"2026-08-11T05:51:08.246583Z","title":"Trust region on-policy distillation.arXiv preprint arXiv:2606.01249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.246583Z"},"links":{"cited_paper":"/paper/2606.01249","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:c41b2d61e567a82fda8fbc9d5cc78439bbedb0a83296e3bc67d0aa8b118a7086","observation_id":"6aeff798-6864-4f7f-b65f-dc12f92c8567","resolution":{"observed_at":"2026-08-11T05:51:08.246583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-08-12T12:04:07.125000Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-11T05:51:08.253953Z","title":"Tip: Token importance in on-policy distillation.arXiv preprint arXiv:2604.14084,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.253953Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:a2317c26c6f45dad93af1edf5056a41d3e82cb725c6b383d7cb6414eb94532cd","observation_id":"7500ed4c-24b3-476b-aee2-aa8493a9ea0e","resolution":{"observed_at":"2026-08-11T05:51:08.253953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T05:51:08.264825Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.264825Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:1ecccf016e1c2bfce569a7b6ce4895a5e6e5ca41e2d7c0964c9edbad5c566018","observation_id":"d9ace98e-74d4-4dfe-afed-96d51b694a92","resolution":{"observed_at":"2026-08-11T05:51:08.264825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06021","last_updated":"2026-06-20T15:47:56Z","snapshot_observed_at":"2026-08-13T09:15:29.100109Z","submitted_at":"2026-06-04T11:13:01Z","title":"OPRD: On-Policy Representation Distillation","version":4},"cited_work":{"arxiv_id":"2606.06021","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.06021","snapshot_observed_at":"2026-08-11T05:51:08.553594Z","title":"OPRD: On-Policy Representation Distillation","venue":"cs.LG","work_id":"b39064b5-815c-4b93-82eb-81030ff3ea29","year":2026},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.278555Z"},"links":{"cited_paper":"/paper/2606.06021","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:6d6a3e1d09f53f1f9648b6c0e4a8bc58f7639cd6029c1e146f23fd3f1310633e","observation_id":"4c60f8fe-b1aa-45ca-a74a-714979d12375","resolution":{"observed_at":"2026-08-11T05:51:08.569317Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-11T05:51:08.285450Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.285450Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:190d53b175b06735e584aa5708ca46b5c56a444328e14fd48fc25c9c166ec2f7","observation_id":"7704910e-a454-4461-b7f5-41b3b40f9d95","resolution":{"observed_at":"2026-08-11T05:51:08.285450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.577133Z","title":"Fast and effective on-policy distillation from reasoning prefixes","venue":null,"work_id":"41a723a8-cc50-4cb5-968f-5fa36ce8bfd6","year":2026},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.294078Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:a33a31853c3486c16be26ac1582a8671e34a42b76bc1f549ca19af3d1b4ef44d","observation_id":"a9182e79-4014-4b03-aa6d-9a9c639af9ad","resolution":{"observed_at":"2026-08-11T05:51:09.586258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17199","last_updated":"2026-06-15T18:37:51Z","snapshot_observed_at":"2026-08-17T07:02:04.197750Z","submitted_at":"2026-06-15T18:37:51Z","title":"PowerOPD: Stabilizing On-Policy Distillation with Bounded Power Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17199","snapshot_observed_at":"2026-08-11T05:51:08.302850Z","title":"Poweropd: Stabiliz- ing on-policy distillation with bounded power transformation.arXiv preprint arXiv:2606.17199, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.302850Z"},"links":{"cited_paper":"/paper/2606.17199","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:171b1cd432caf91abd01320962b1e77f234cf25398ac0a306e495b6e5c2d92bc","observation_id":"da7dcbb2-7539-420f-a6f2-0cb13f4b9988","resolution":{"observed_at":"2026-08-11T05:51:08.302850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.541358Z","title":"Using P v ∇θq(v) = 0, we obtain Ev∼q [−h(a(v))∇θ logq(v)] =−2 X v s p(v) q(v) −1 ! ∇θq(v) =−2 X v s p(v) q(v) ∇θq(v) = 4∇θH 2(p, q), which proves Equation (2)","venue":null,"work_id":"b6484369-2e70-490a-918a-3603a3d26958","year":2026},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.320372Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:7a88f2f3223e74b453268635b415cd536c8aa8122909ce07e5ed4faf7b16eeff","observation_id":"fd2de4d4-e136-4b87-9485-ebda9c659693","resolution":{"observed_at":"2026-08-11T05:51:09.547585Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.487715Z","title":null,"venue":null,"work_id":"48ee561f-a053-42df-93cf-39918d97172b","year":2023},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.338517Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:8105b3fbf4d6addb40da62830b2bfca32ccef3479102637d9d4d202ae53f87e1","observation_id":"693d852d-4c53-4388-bfb4-1fb9a7a21696","resolution":{"observed_at":"2026-08-11T05:51:09.494679Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:09.461154Z","title":"错” (“wrong","venue":null,"work_id":"2d6173fb-c2bd-4f8b-96ba-e777bcd447bd","year":2023},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.345336Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:0d72d0df07d23629e7376f1f0ff5d40425ed7abce6c5077523d4e4d61b679a00","observation_id":"38543c92-bf81-4dc7-aed5-8706073e1e31","resolution":{"observed_at":"2026-08-11T05:51:09.468455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07865","last_updated":"2026-05-08T15:24:51Z","snapshot_observed_at":"2026-08-15T16:24:55.947978Z","submitted_at":"2026-05-08T15:24:51Z","title":"KL for a KL: On-Policy Distillation with Control Variate Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07865","snapshot_observed_at":"2026-08-11T05:51:08.156946Z","title":"Kl for a kl: On-policy distil- lation with control variate baseline.arXiv preprint arXiv:2605.07865,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.156946Z"},"links":{"cited_paper":"/paper/2605.07865","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:6e74ffd119d6aa27cba0f2441d58dd1679446c833c774c855401360ba7bfd5e0","observation_id":"59a5bc8e-5477-43a3-b08c-05cdb77b88a4","resolution":{"observed_at":"2026-08-11T05:51:08.156946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T05:51:08.165637Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.165637Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:ea29cb3a9c20197fbca7ce6f6e16a9e472949723e6a2d9c558197acb115590ad","observation_id":"d719fe97-0e18-420b-a77c-ecbeb8d46223","resolution":{"observed_at":"2026-08-11T05:51:08.165637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T05:51:08.176291Z","title":"Deepseekmath: Pushing the limits of mathemati- cal reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.176291Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:cbf79b336425a77e12441e877a2c7b68bf1262e06dc9e3e26781c91157f5e215","observation_id":"b6ad4969-bcd1-4c7a-8696-c1ecb1549ca5","resolution":{"observed_at":"2026-08-11T05:51:08.176291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11182","last_updated":"2026-05-24T01:43:21Z","snapshot_observed_at":"2026-08-13T17:31:40.872511Z","submitted_at":"2026-05-11T19:44:59Z","title":"The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11182","snapshot_observed_at":"2026-08-11T05:51:08.310589Z","title":"The many faces of on-policy distillation: Pitfalls, mechanisms, and fixes.arXiv preprint arXiv:2605.11182,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.310589Z"},"links":{"cited_paper":"/paper/2605.11182","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:5267681ed3583dfa64fd2fc1ce32ddc1ca6144beeb6050fed3b7dcb9f78be721","observation_id":"45992377-186e-4f4d-84fd-ac90e3fded19","resolution":{"observed_at":"2026-08-11T05:51:08.310589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T05:51:08.073022Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.073022Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:b50674b451eb5c30ddc1a4fc77c7e77f6f6b0329df541b38601b418169f94de7","observation_id":"2153ce2d-4de2-4752-8376-2aea46f5c119","resolution":{"observed_at":"2026-08-11T05:51:08.073022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T05:51:08.083906Z","title":"Justrl: Scaling a 1.5 b llm with a simple rl recipe.arXiv preprint arXiv:2512.16649,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.083906Z"},"links":{"citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:683fbd308822fcc0212b72b30f88238ac85f22722290ba852b3f58b67d71606b","observation_id":"6a3d90a9-e2ad-46ca-ba95-054d87ba26ac","resolution":{"observed_at":"2026-08-11T05:51:08.083906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08432","last_updated":"2026-06-07T03:17:25Z","snapshot_observed_at":"2026-08-05T07:05:36.953114Z","submitted_at":"2026-06-07T03:17:25Z","title":"Trajectory-Refined Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08432","snapshot_observed_at":"2026-08-11T05:51:08.096586Z","title":"Trajectory-refined distillation.arXiv preprint arXiv:2606.08432,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-11T05:51:08.096586Z"},"links":{"cited_paper":"/paper/2606.08432","citing_paper":"/paper/2608.09836"},"observation_digest":"sha256:fe54c59b01af4da659761e3c48c9987f623048b234c6fd6e7cf1cb058cb9b04f","observation_id":"73ab0971-eaae-4263-9227-7bc0440ab3c5","resolution":{"observed_at":"2026-08-11T05:51:08.096586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09836","last_updated":"2026-08-10T16:53:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T02:44:42.663075Z","submitted_at":"2026-08-10T16:53:14Z","title":"Mismatch Matters: On-Policy Distillation Beyond Token Agreement"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2608.09836."}