{"as_of":"2026-08-08T03:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ac9289171f35951620b9846755ecb9b0a1c5adde280355a172d1b37a42b036a","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:45:28.754848Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03632/citation-record","integrity":"/paper/2608.03632/integrity","json":"/paper/2608.03632/citation-record.json","paper":"/paper/2608.03632"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T15:45:27.189748Z","title":"arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.189748Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:7f7ed723d3d2f90c69a35925475fc4026f8c8daf52128ef7ee93976d10e1e7fa","observation_id":"8b2a3a5d-08bf-4162-8138-f55bacf26117","resolution":{"observed_at":"2026-08-05T15:45:27.189748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07957","last_updated":"2025-04-27T07:20:02Z","snapshot_observed_at":"2026-08-07T16:06:45.226662Z","submitted_at":"2025-04-10T17:59:12Z","title":"MM-IFEngine: Towards Multimodal Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07957","snapshot_observed_at":"2026-08-05T15:45:27.304749Z","title":"arXiv:2504.07957","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.304749Z"},"links":{"cited_paper":"/paper/2504.07957","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:5da08a29cfa510cfb1a4d5f50f68e47f78468e22fb568085a92ba823b0c3b00a","observation_id":"910787fc-bc00-429a-aaf7-8146d37dff2f","resolution":{"observed_at":"2026-08-05T15:45:27.304749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-08-05T15:45:27.675508Z","title":"arXiv:2604.12002","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.675508Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:a817999fe405ee03dbe605bb15eb0166e14b15ce6aea5f1a122234a6945a1f98","observation_id":"c610e6e4-90ca-48ff-ae8e-bba1f6b0a677","resolution":{"observed_at":"2026-08-05T15:45:27.675508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-07T04:49:42.079187Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11456","snapshot_observed_at":"2026-08-05T15:45:27.876531Z","title":"arXiv:2504.11456","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.876531Z"},"links":{"cited_paper":"/paper/2504.11456","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:b34777ad500ed6d0e2ebd8384bbb47cb869e89b5548c0eb30cecc2c4489d7c9b","observation_id":"b0728898-7d08-47bf-9a44-3da066a9ef98","resolution":{"observed_at":"2026-08-05T15:45:27.876531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-03T02:52:57.588273Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-08-05T15:45:28.014761Z","title":"arXiv:2605.03677","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.014761Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:64c074eaff9bd5884419ea095a25da9c04ebc1ac9d11f93c60aaded82af566bf","observation_id":"8596dc5b-c604-4bed-8ed1-5741e6fea7c0","resolution":{"observed_at":"2026-08-05T15:45:28.014761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01577","last_updated":"2025-01-11T12:19:13Z","snapshot_observed_at":"2026-08-05T23:03:54.212188Z","submitted_at":"2024-09-03T03:23:00Z","title":"EvoChart: A Benchmark and a Self-Training Approach Towards Real-World Chart Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01577","snapshot_observed_at":"2026-08-05T15:45:28.054494Z","title":"arXiv:2409.01577","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.054494Z"},"links":{"cited_paper":"/paper/2409.01577","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:2c0d2ac5fd5152f33ce3a76a5562cf01a611b3964becd3e442dd0ca17c1bbc48","observation_id":"40b6246b-549a-4d5e-b6d9-3971ff420825","resolution":{"observed_at":"2026-08-05T15:45:28.054494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-05T15:45:28.088167Z","title":"arXiv:2603.07079","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.088167Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:cf2ce61fd9f313a4f9ea6645944e078f1ba5db6d3f4d45b73b932a091166cd69","observation_id":"a6227f7c-f675-458b-861e-bc7a0cd12455","resolution":{"observed_at":"2026-08-05T15:45:28.088167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T15:45:28.184751Z","title":"arXiv:2310.02255","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.184751Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:cae5f75f294cdaa436035ac300426e388ccf71202a70f2388cf458d265739fa4","observation_id":"512eb7c4-ccf2-44af-9c40-6f7b547500b7","resolution":{"observed_at":"2026-08-05T15:45:28.184751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-08-05T15:45:28.234751Z","title":"arXiv:2604.08527","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.234751Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:390af1f2af12d9390b17f3ae8e72e4b30658110739ee27f1313e9103bd25ed45","observation_id":"6c3e2508-4bdd-43ba-8437-be105f231caa","resolution":{"observed_at":"2026-08-05T15:45:28.234751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04917","last_updated":"2026-06-18T15:34:46Z","snapshot_observed_at":"2026-08-05T07:16:50.328179Z","submitted_at":"2026-04-06T17:56:25Z","title":"Vero: An Open RL Recipe for General Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04917","snapshot_observed_at":"2026-08-05T15:45:28.284751Z","title":"arXiv:2604.04917","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.284751Z"},"links":{"cited_paper":"/paper/2604.04917","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:f821c2c5b174aeff33b76215598dfae83ca7866c7ea43445a8fce7d226e35021","observation_id":"b4e14d95-cf2f-443c-bebb-de6a1648d054","resolution":{"observed_at":"2026-08-05T15:45:28.284751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06585","last_updated":"2025-09-09T04:46:37Z","snapshot_observed_at":"2026-08-05T23:02:46.819592Z","submitted_at":"2025-08-08T04:23:04Z","title":"CountQA: How Well Do MLLMs Count in the Wild?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06585","snapshot_observed_at":"2026-08-05T15:45:28.335239Z","title":"Wang, H.; Wang, G.; Xiao, H.; Zhou, Y.; Pan, Y.; Wang, J.; Xu, K.; Wen, Y.; Ruan, X.; Chen, X.; and Qi, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.335239Z"},"links":{"cited_paper":"/paper/2508.06585","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:159dccaef8ed30611be549360ed815a3b4e0b04c8a3445d3b7870d87b5f9c473","observation_id":"f5af9c75-f3fb-4d67-82ce-f024a5b20b60","resolution":{"observed_at":"2026-08-05T15:45:28.335239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-05T15:45:28.384750Z","title":"arXiv:2506.01939","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.384750Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:3288823ea40cd8f7fb20c388f04b318871846eee5be0902d26fe5eb382814790","observation_id":"69ccea18-88af-4abf-abbe-4669e5bb28ed","resolution":{"observed_at":"2026-08-05T15:45:28.384750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-05T15:45:28.434843Z","title":"arXiv:2604.14084","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.434843Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:85aba66031686e5628d5b47a9968901f6318157aaee69a3ece90aedc2fe1e9d3","observation_id":"d9393a8a-372b-478f-be15-25f15d60126d","resolution":{"observed_at":"2026-08-05T15:45:28.434843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-08-05T15:45:28.483499Z","title":"arXiv:2504.14945","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.483499Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:3a4d79a9efdf8311fa3c6d4ffe7e4dba329f4d2223b0d1e6583be3012beced96","observation_id":"1c304b16-3b54-43aa-a6d5-5aac31f10946","resolution":{"observed_at":"2026-08-05T15:45:28.483499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T15:45:28.509579Z","title":"arXiv:2505.09388","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.509579Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:d55327a134f2320e0cb19dc71826bf354922fee2a0aaac69301945f9fe35ad07","observation_id":"9ddf68dd-24b8-454d-899b-a73fbedfbd1c","resolution":{"observed_at":"2026-08-05T15:45:28.509579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-08-05T15:45:28.554751Z","title":"arXiv:2605.18740","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.554751Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:e3f74aac377109d409add54497b560a8a203b010a81c276cdf418ba4bad18fa4","observation_id":"f8b318d3-4929-411b-ab18-9844ee722836","resolution":{"observed_at":"2026-08-05T15:45:28.554751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-05T15:45:28.594751Z","title":"arXiv:2601.18734","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.594751Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:e6d5a6369f755bcf39fd9bdd625cf555853775591ca975474d70685eab491160","observation_id":"b814fdac-10ec-4c7c-84be-002e37a556fb","resolution":{"observed_at":"2026-08-05T15:45:28.594751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-02T07:46:19.307542Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-05T15:45:28.644839Z","title":"arXiv:2604.10688","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.644839Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:7dd72ec9adba911a3670a17a8af173968ba16ec743717bf0720fe276ea22ce9e","observation_id":"e8a5b459-86f1-410d-aaf7-61bb5b9d33a6","resolution":{"observed_at":"2026-08-05T15:45:28.644839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:28.704748Z","title":"arXiv:2508.05612","venue":null,"work_id":null,"year":2048},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.704748Z"},"links":{"citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:d5edad376c663e2ece2fa4f7002145b17199a84e70f28df1e0dc8484ac8cd108","observation_id":"afa86905-d01e-4bbc-bfba-53d6817e75e3","resolution":{"observed_at":"2026-08-05T15:45:28.704748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:45:32.592389Z","title":"Visual reasoning includes MathVision, Geo3K, and MathVistamini","venue":null,"work_id":"1323a21a-80be-48f9-acdc-8589a1d24cb8","year":2023},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.754848Z"},"links":{"citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:7f0b2994e800b1b5bc872f56a455c9e78c4004a26f9b33df46d6ad0a27bc7597","observation_id":"78ae1c43-7b0b-4b79-8379-fe648a1b8c2c","resolution":{"observed_at":"2026-08-05T15:45:32.724835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T15:45:27.981139Z","title":"arXiv:2103.03874","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.981139Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:d07534c76eaf121656775509a2a4f21954f8cffb1da67bbc2cc7812dfaf96a36","observation_id":"dadfcddc-b7d4-4ad8-880f-03dbbb04d5e4","resolution":{"observed_at":"2026-08-05T15:45:27.981139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-05T15:45:28.124748Z","title":"arXiv:2206.14858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:28.124748Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:e01b0ba868a21303fa17e7068e0323448f40276010cdf9a9ebdf6d1a83b5d252","observation_id":"62507b1a-98bb-452b-bf33-54dc3613156e","resolution":{"observed_at":"2026-08-05T15:45:28.124748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13649","last_updated":"2024-01-17T03:23:23Z","snapshot_observed_at":"2026-08-06T11:19:43.438106Z","submitted_at":"2023-06-23T17:56:26Z","title":"On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13649","snapshot_observed_at":"2026-08-05T15:45:26.903610Z","title":"arXiv:2306.13649","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:26.903610Z"},"links":{"cited_paper":"/paper/2306.13649","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:bce57e8c05baad72bffac236e07ac16bee04a10e7254e93d729cf430e8cfcc3b","observation_id":"2a957429-309c-4739-9042-ddd817202f75","resolution":{"observed_at":"2026-08-05T15:45:26.903610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-08-07T08:20:32.332400Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T15:45:27.054757Z","title":"arXiv:2505.22617","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.054757Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:eee4b71eaf083e02f42570e4e413fbf8e46175684e24a72ce484df9807058ce0","observation_id":"96f85aa7-cd70-482c-a65a-878bdf0f7f2c","resolution":{"observed_at":"2026-08-05T15:45:27.054757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-08-05T15:45:27.434932Z","title":"arXiv:2306.08543","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-05T15:45:27.434932Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2608.03632"},"observation_digest":"sha256:bdc76f4bf0e482d788468301cc51c0db1a6c00f2dc739b4519302d4e755d7d29","observation_id":"b451eb2e-28a0-4c81-9e52-f46697ee9180","resolution":{"observed_at":"2026-08-05T15:45:27.434932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03632","last_updated":"2026-08-04T13:17:30Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:12:12.704567Z","submitted_at":"2026-08-04T13:17:30Z","title":"When Teachers Mislead: Spurious-Signal-Aware On-Policy Distillation"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.03632."}