{"as_of":"2026-08-21T05:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6bf82bdc657405a104412e60c81dd993ff93be14a88c4acd8f24f0caab41ea09","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":61,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:07:21.573005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T00:26:39.270366Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T05:11:07.600760Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2602.12125"},"observation_digest":"sha256:c3b63cf3dbeaf6107e3a87b8dea048e993f6fd2645584f2faa3b292e4c288e4e","observation_id":"ffe965c4-710a-4edc-ade9-001c6692847f","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-13T14:33:35.834383Z","title":"Privileged Information Distillation for Language Models.CoRR, abs/2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.01193","last_updated":"2026-06-24T22:44:36Z","snapshot_observed_at":"2026-08-14T09:05:41.854486Z","submitted_at":"2026-04-01T17:39:50Z","title":"Embarrassingly Simple Self-Distillation Improves Code Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T14:33:35.834383Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.01193"},"observation_digest":"sha256:bd076a4a3f2c5911db18f3a23dcdfd0d63dbb7bf991226c92b4016dbac252fbf","observation_id":"0ed377c2-72a4-4294-8b83-1c2f0f9d703d","resolution":{"observed_at":"2026-07-13T14:33:35.834383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T15:28:07.981488Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.10674"},"observation_digest":"sha256:26464a9b8a2beced42214289fb995fd0e832fc5d9df0e365b4cae03b8a464b97","observation_id":"5e5dbd66-ba12-4559-bfd5-93997e57e823","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-16T21:35:51.236868Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T15:12:06.985609Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:35829a9963ab57d9232410a1a659454c4cf068a3d23e552d11399ac932eed249","observation_id":"ec78b8c4-8b51-4007-a19b-0137648ac39d","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-16T21:35:51.236868Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T01:04:12.454268Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.13010"},"observation_digest":"sha256:aba7a50f754704fe37bbed062715ecdd2c16b98a8600745efe9418877351404e","observation_id":"5ebe4292-7ac0-45c8-937f-d7f52b6f0daf","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2604.14054","last_updated":"2026-05-25T13:50:41Z","snapshot_observed_at":"2026-08-16T04:26:13.110119Z","submitted_at":"2026-04-15T16:34:39Z","title":"$\\pi$-Play: Multi-Agent Self-Play via Privileged Self-Distillation without External Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:43:09.581054Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.14054"},"observation_digest":"sha256:fb8254849d8a180b2d3f85fc383deb9345f0117121ecdd72f88671308019f37f","observation_id":"612a8927-5dae-4f46-8951-4ce08df33aaa","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2604.15577","last_updated":"2026-04-16T23:13:22Z","snapshot_observed_at":"2026-08-13T08:38:20.315603Z","submitted_at":"2026-04-16T23:13:22Z","title":"Reward Weighted Classifier-Free Guidance as Policy Improvement in Autoregressive Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T10:54:57.732141Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.15577"},"observation_digest":"sha256:a3d6611aa37e2ca15b25b2ff73bb9086f488bea544338ca2d1e3d50436ce5abc","observation_id":"bb77c09b-b739-4431-a4c2-b02badc0ce0b","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-13T09:07:17.541162Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T04:39:01.283802Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2604.24005"},"observation_digest":"sha256:3271c22c9bda07383da88f33672e0d2c7a44a8e18d8ebcffc27367d29f044d07","observation_id":"78479ed0-6f56-4576-a841-cf6bf83ae808","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.01347","last_updated":"2026-05-02T09:41:37Z","snapshot_observed_at":"2026-08-15T15:07:23.646536Z","submitted_at":"2026-05-02T09:41:37Z","title":"MAD-OPD: Breaking the Ceiling in On-Policy Distillation via Multi-Agent Debate","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:18:39.844534Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.01347"},"observation_digest":"sha256:c8533ad1fc3bb485c200b753ef92d9640a830481056b3273b429a43de81b3762","observation_id":"baaebeef-1d64-40e4-b31f-bffd6e6052f3","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.05204","last_updated":"2026-05-26T15:05:04Z","snapshot_observed_at":"2026-08-20T01:45:59.801318Z","submitted_at":"2026-05-06T17:59:34Z","title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T23:18:35.390642Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.05204"},"observation_digest":"sha256:266e431bbbcc090e5a2dd27d48d6117e0d7887e1c9fd0415c3cfdc805891175b","observation_id":"a159b673-3049-435f-b698-ce87c363e5d2","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.05204","last_updated":"2026-05-26T15:05:04Z","snapshot_observed_at":"2026-08-20T01:45:59.801318Z","submitted_at":"2026-05-06T17:59:34Z","title":"D-OPSD: On-Policy Self-Distillation for Continuously Tuning Step-Distilled Diffusion Models","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-30T23:44:10.302520Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.05204"},"observation_digest":"sha256:a2a1c5cd27ad77eb928b982b93656caf7cf9da255110868669acfd861abf409a","observation_id":"d388fb8a-6378-4287-a5fe-d4519f9ea38c","resolution":{"observed_at":"2026-06-30T23:45:07.665274Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-08-13T06:21:09.710371Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:a93615b75fc76a36e9ae611e3e9ac39ec19c5a315d5b6d3f120a2b38c8e41d3e","observation_id":"2316f8ab-056a-4058-9cdc-b4901d134cb5","resolution":{"observed_at":"2026-05-22T09:46:22.602765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.07276","last_updated":"2026-05-08T05:41:25Z","snapshot_observed_at":"2026-08-14T19:57:40.700811Z","submitted_at":"2026-05-08T05:41:25Z","title":"Signal Reshaping for GRPO in Weak-Feedback Agentic Code Repair","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T01:21:43.166304Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.07276"},"observation_digest":"sha256:319d54e4dfed5751a7825b4a4a5ef2dcf235fad12c24c195f94cbb60684f7cb0","observation_id":"d2b5a07e-82c1-4f98-9349-b4b9f16a1ed1","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-18T09:21:07Z","snapshot_observed_at":"2026-08-21T05:09:21.385639Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T02:25:59.056181Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:1fb8f46601385877f61e288302cf397ada4b1eaf0d60d825e2bdd3854ced64a3","observation_id":"b1e518f7-5015-4e73-8957-0c918aa3f206","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-04T05:20:45.197177Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-18T09:21:07Z","snapshot_observed_at":"2026-08-21T05:09:21.385639Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T05:20:45.197177Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.07725"},"observation_digest":"sha256:aa3390e22f1790951c4a1d85b85869532f4be47fef9da0d69b0de43d95f2c9bb","observation_id":"4cd43221-c830-45d1-8484-a6635327a95d","resolution":{"observed_at":"2026-08-04T05:20:45.197177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.10194","last_updated":"2026-05-11T08:45:03Z","snapshot_observed_at":"2026-08-12T12:21:34.985925Z","submitted_at":"2026-05-11T08:45:03Z","title":"TRACE: Distilling Where It Matters via Token-Routed Self On-Policy Alignment","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T02:56:09.363823Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.10194"},"observation_digest":"sha256:e96bbd48ddc4e9005e80a6c604b2b04dc4f33a0a3eee76434b77edb63f6e9bd0","observation_id":"6f6de619-4937-4576-bfe3-4636ff447e27","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.10889","last_updated":"2026-05-11T17:33:28Z","snapshot_observed_at":"2026-08-12T21:27:57.364907Z","submitted_at":"2026-05-11T17:33:28Z","title":"Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T04:28:58.679078Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.10889"},"observation_digest":"sha256:e1d3e38029a70f59ebd2f53059fe2333114a0c8bd73a7b1a43e9112a9bb60109","observation_id":"e8a69d5c-9c9b-4028-b70f-ae8d3e965e64","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.11613","last_updated":"2026-05-12T06:43:17Z","snapshot_observed_at":"2026-08-16T13:30:02.128778Z","submitted_at":"2026-05-12T06:43:17Z","title":"From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:24:34.093541Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.11613"},"observation_digest":"sha256:09a7e4490654bbe8f5d711d4ad2739c06e83432e46f40b37f7eb6b8b78037c9a","observation_id":"94e94df9-0b87-46f0-b2f4-a234f4f35026","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-11T13:23:10.571972Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-14T21:29:36.803832Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.12652"},"observation_digest":"sha256:9641c4f8d663693a20bf2f103a30e4ed3124986cb1853758db7281b585a01e79","observation_id":"2e05cd63-f5bd-4c92-b777-47e963b74fb2","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.12741","last_updated":"2026-05-12T20:46:05Z","snapshot_observed_at":"2026-08-18T01:39:18.596016Z","submitted_at":"2026-05-12T20:46:05Z","title":"Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-14T21:23:15.511083Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.12741"},"observation_digest":"sha256:ccd82d8fd6b2d25524a588451d7702dfc9dec9f778ee8cf889f1c07e193a7f99","observation_id":"d708a2ee-5b78-40ba-8e42-5ebe73006382","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.15113","last_updated":"2026-05-18T19:19:17Z","snapshot_observed_at":"2026-08-15T21:20:33.403754Z","submitted_at":"2026-05-14T17:27:34Z","title":"Learning from Language Feedback via Variational Policy Distillation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T20:34:36.764090Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.15113"},"observation_digest":"sha256:23c034bec51d8e763cab1b753387e278219e2a35005b5a866c0dce8637e2ca5f","observation_id":"30691877-32e6-43e2-9e93-e04e7e774518","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-08-14T15:45:12.246238Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T09:05:30.262601Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:c6766f20791fe72ddfa5cfa3b44270a8a29643120cde091bf68808eda7f612ab","observation_id":"c0ff8b8a-d77a-4176-9b12-ad6241303b2b","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-08-14T15:45:12.246238Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-22T09:51:52.886663Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:1d4f023470192d264ddc720cdb72643519b97c0ef4d16da422f83c912e568fb7","observation_id":"88a5c801-7be1-43af-8153-da58b2e61155","resolution":{"observed_at":"2026-05-22T09:54:46.865979Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.19354","last_updated":"2026-05-21T15:18:04Z","snapshot_observed_at":"2026-08-15T04:21:05.298769Z","submitted_at":"2026-05-19T04:40:50Z","title":"Next-Acceleration-Scale Prediction for Autoregressive MRI Reconstruction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T02:50:44.932051Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.19354"},"observation_digest":"sha256:04cf4a9c31a41428bf9747ea312506c41872d4bd55b7c445a81bcc9dda81e437","observation_id":"46a7e490-75b2-42af-83ab-17634ea31430","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.19354","last_updated":"2026-05-21T15:18:04Z","snapshot_observed_at":"2026-08-15T04:21:05.298769Z","submitted_at":"2026-05-19T04:40:50Z","title":"Next-Acceleration-Scale Prediction for Autoregressive MRI Reconstruction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-22T10:12:17.474628Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.19354"},"observation_digest":"sha256:9eb3b6cb54d5402735b584db2095eac37b60ba68037e576800073a774ec52918","observation_id":"2d2c7633-b550-4205-baa4-9fab09c1892c","resolution":{"observed_at":"2026-05-22T10:14:47.711714Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-08-15T14:09:09.630404Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T07:25:34.637803Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.19436"},"observation_digest":"sha256:72f444a1efb19c478e232b476ddd43d888690410ed2bb67e1a0e1cf48ddd0dde","observation_id":"e0793516-e4ec-483a-b45b-b9f87305e1cf","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.22217","last_updated":"2026-05-21T09:19:23Z","snapshot_observed_at":"2026-08-18T15:44:55.371346Z","submitted_at":"2026-05-21T09:19:23Z","title":"Survive or Collapse: The Asymmetric Roles of Data Gating and Reward Grounding in Self-Play RL","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-22T07:24:31.355799Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.22217"},"observation_digest":"sha256:d13dda6454b1335ae018f77ec6417d24ed331b7492c116e4f0b0ac8a50ed73bc","observation_id":"971f7dc3-1261-4dd5-b6c8-24ac4fb9a243","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.22263","last_updated":"2026-05-21T10:07:46Z","snapshot_observed_at":"2026-08-02T10:25:42.509450Z","submitted_at":"2026-05-21T10:07:46Z","title":"Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T08:06:30.862911Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.22263"},"observation_digest":"sha256:e2e4045ac366495683712d72394f8c8edce8d17926c86f339375636c833409dd","observation_id":"87490850-665c-46d0-beb9-236f9311db60","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.22675","last_updated":"2026-05-21T16:18:41Z","snapshot_observed_at":"2026-08-20T21:23:34.321743Z","submitted_at":"2026-05-21T16:18:41Z","title":"Self-Policy Distillation via Capability-Selective Subspace Projection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T05:31:42.803465Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.22675"},"observation_digest":"sha256:f651e7fa4912ef61a15303c4cac381b2f554e4034eb8da239d4a341821957c3b","observation_id":"c175ca74-6d8a-460c-925f-0d49e92dc74b","resolution":{"observed_at":"2026-05-22T08:25:38.085126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2605.27140","last_updated":"2026-05-26T15:07:03Z","snapshot_observed_at":"2026-08-16T10:18:41.906401Z","submitted_at":"2026-05-26T15:07:03Z","title":"StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T17:14:47.440914Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2605.27140"},"observation_digest":"sha256:8a02292f676cd6a71ec7d4d592374edd729b9c235237d2f95b4ad21411d0bcd4","observation_id":"6874a8a3-0c4a-4256-9ad5-2d54906575b0","resolution":{"observed_at":"2026-06-29T17:23:45.227482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.04036","last_updated":"2026-06-02T02:31:13Z","snapshot_observed_at":"2026-08-19T22:51:13.532239Z","submitted_at":"2026-06-02T02:31:13Z","title":"Self-Distilled Policy Gradient","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T11:24:11.878439Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.04036"},"observation_digest":"sha256:f184220c8ae69d7fdb817454677722dce132990511951f7a3b43eb02219f6d3a","observation_id":"cefce76c-8e83-41a4-97f6-cd994bc81952","resolution":{"observed_at":"2026-07-02T01:56:27.869924Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-08-16T00:39:17.618423Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T17:30:57.001021Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:8a124e010b1805c0cf4e7f1021fa743054dddf5dbcd0a000a8eda0efc3f68c64","observation_id":"b6790bb3-d48b-418a-adc8-bfc77713c643","resolution":{"observed_at":"2026-07-03T00:07:27.961777Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-15T10:53:37.186361Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.09076","last_updated":"2026-07-14T12:46:55Z","snapshot_observed_at":"2026-08-16T00:39:17.618423Z","submitted_at":"2026-06-08T06:20:12Z","title":"Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-15T10:53:37.186361Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.09076"},"observation_digest":"sha256:8545705741d5627cb98372ba4bb4386c99d066cf4107eb5ecced2f55625ec8ae","observation_id":"65f75f0f-f3c6-47b0-8184-50193743d983","resolution":{"observed_at":"2026-07-15T10:53:37.186361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.10334","last_updated":"2026-06-09T02:28:39Z","snapshot_observed_at":"2026-08-19T08:42:49.639066Z","submitted_at":"2026-06-09T02:28:39Z","title":"Self-Distillation Policy Optimization via Visual Feedback: Bridging Code and Visual Artifacts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:42:21.520627Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.10334"},"observation_digest":"sha256:368c293181e7b55dc7e7a17641f327f5c71831876de6e2c88a5baf9cb400693d","observation_id":"ff700a35-f8c9-424c-8087-7e019b34f4dc","resolution":{"observed_at":"2026-07-03T04:47:37.751059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.10385","last_updated":"2026-06-09T03:51:41Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:51:41Z","title":"Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T14:15:30.242783Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.10385"},"observation_digest":"sha256:4be546daab9fd89c6c56f67e55c8d4a7cafaddaecc4cd537482861cdd6682f5c","observation_id":"6d35a4cc-40f9-419a-8642-65d44bb1c2e1","resolution":{"observed_at":"2026-07-03T04:07:36.568006Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.11559","last_updated":"2026-06-10T01:35:34Z","snapshot_observed_at":"2026-08-13T12:14:59.791076Z","submitted_at":"2026-06-10T01:35:34Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T10:03:48.678510Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.11559"},"observation_digest":"sha256:05a0b3f6e27a44d3785996ea8af6a351704880927c754cad48d3d54b2ab01300","observation_id":"c3d31d0d-f718-4252-ade1-f7950cf93721","resolution":{"observed_at":"2026-07-03T10:27:56.073037Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.25800","last_updated":"2026-06-24T13:17:59Z","snapshot_observed_at":"2026-08-14T03:24:44.741435Z","submitted_at":"2026-06-24T13:17:59Z","title":"ROAD-VLA: Robust Online Adaptation via Self-Distillation for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-25T20:22:16.508280Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.25800"},"observation_digest":"sha256:3a38de9e7eaf56d69566e0b90a48dbdc08f59559815f1a9e8fe6d5b38af3a1ae","observation_id":"ec01ee55-5ce1-4f1f-a21d-dfd4df889de9","resolution":{"observed_at":"2026-07-04T20:20:07.067987Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.26091","last_updated":"2026-06-24T17:59:02Z","snapshot_observed_at":"2026-08-10T18:32:18.583804Z","submitted_at":"2026-06-24T17:59:02Z","title":"On-Policy Self-Distillation with Sampled Demonstrations Reduces Output Diversity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-25T19:23:56.452083Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.26091"},"observation_digest":"sha256:cb2859ad06459640147cdcaed764553eaee077cb9711829ca99de8510a3920df","observation_id":"2cbdfe62-ef0a-4716-a818-828af8904b68","resolution":{"observed_at":"2026-07-04T20:50:12.726056Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.30518","last_updated":"2026-06-29T16:25:13Z","snapshot_observed_at":"2026-08-08T14:31:31.250224Z","submitted_at":"2026-06-29T16:25:13Z","title":"Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T06:05:47.948367Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.30518"},"observation_digest":"sha256:77d4dd4ecbd7306e76075526ddff4031c182f6b126f55d277890635a4f777cd2","observation_id":"a22a6ef2-263b-4dd7-943d-b8651e98514e","resolution":{"observed_at":"2026-06-30T08:24:26.996081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2606.30626","last_updated":"2026-06-29T17:55:53Z","snapshot_observed_at":"2026-08-16T09:45:55.312871Z","submitted_at":"2026-06-29T17:55:53Z","title":"DOPD: Dual On-policy Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T05:51:18.037199Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2606.30626"},"observation_digest":"sha256:854f68b646f2e6ea1eedfb56b87bad1ddc68684691c442f1e682113d3bccbfc5","observation_id":"0e8a175d-d3b7-4f5b-98c5-8336b591c47d","resolution":{"observed_at":"2026-06-30T05:54:18.576890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2607.05339","last_updated":"2026-07-06T17:21:16Z","snapshot_observed_at":"2026-08-19T00:19:13.142872Z","submitted_at":"2026-07-06T17:21:16Z","title":"TREK: Distill to Explore, Reinforce to Refine","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-07T16:22:55.342495Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.05339"},"observation_digest":"sha256:8f5e8dba042478cfebea4380917f2d0b10db6b93147927a660b3be49c774a995","observation_id":"f0e7e388-ff58-4425-a764-6195cda5f8ce","resolution":{"observed_at":"2026-07-07T16:24:01.067687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":"2602.04942","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-10T00:26:39.270366Z","title":"Privileged Information Distillation for Language Models","venue":"cs.LG","work_id":"674b7199-1d6e-4f36-89f1-fe1abe5b4db1","year":2026},"citing_paper":{"arxiv_id":"2607.06855","last_updated":"2026-07-07T23:16:19Z","snapshot_observed_at":"2026-08-16T03:35:00.266484Z","submitted_at":"2026-07-07T23:16:19Z","title":"Geometric Self-Distillation for Reasoning Generalization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-10T00:23:06.432913Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.06855"},"observation_digest":"sha256:2b9a111d81a1fa870c0c7edd24864a7460a7a3b3358905445671e49e9e8712da","observation_id":"243a904d-3dc2-4e64-a5cf-e60a24035d5a","resolution":{"observed_at":"2026-07-10T00:26:39.271678Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-01T13:40:40.685025Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19046","last_updated":"2026-07-21T12:35:04Z","snapshot_observed_at":"2026-08-15T05:02:24.633151Z","submitted_at":"2026-07-21T12:35:04Z","title":"Contrastive On-Policy Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:40:40.685025Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.19046"},"observation_digest":"sha256:c0dc410e380e8c031715dab277b91e8d506b7d90af205970e8782a8d508a0fdd","observation_id":"5b3b8c12-6253-4733-8524-2de3eadc56a3","resolution":{"observed_at":"2026-08-01T13:40:40.685025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-01T08:43:21.669819Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21051","last_updated":"2026-07-23T08:34:31Z","snapshot_observed_at":"2026-08-19T20:02:38.314874Z","submitted_at":"2026-07-23T08:34:31Z","title":"Sample-Efficient Learning from Agent Experience","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:43:21.669819Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.21051"},"observation_digest":"sha256:5b7d1c5267561298418fe96c77670e9e83116817e827e91e7fc1e8e44a0afdad","observation_id":"0a9e510c-3637-4742-b0c4-f8c16dcd3e72","resolution":{"observed_at":"2026-08-01T08:43:21.669819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-31T06:59:15.167530Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24720","last_updated":"2026-07-27T17:55:03Z","snapshot_observed_at":"2026-08-06T06:30:45.988132Z","submitted_at":"2026-07-27T17:55:03Z","title":"The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T06:59:15.167530Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.24720"},"observation_digest":"sha256:d16bd9a8f628a535539381c7165465fab5cd615fec713747e281c1fd6b05c917","observation_id":"2925f4a0-efba-41b0-9bf5-0385742deb9b","resolution":{"observed_at":"2026-07-31T06:59:15.167530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-01T00:49:26.988561Z","title":"Privileged information distillation for language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26057","last_updated":"2026-07-28T17:59:46Z","snapshot_observed_at":"2026-08-19T04:11:00.535260Z","submitted_at":"2026-07-28T17:59:46Z","title":"Pass the Baton: Trajectory-Relayed On-Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T00:49:26.988561Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.26057"},"observation_digest":"sha256:75da0a4596318d47f74e40a44a8010c1809e42dc37c44986ad1a0687aff061cf","observation_id":"d81f8ef2-0add-49a1-8a84-d1e750300254","resolution":{"observed_at":"2026-08-01T00:49:26.988561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-31T23:39:13.080946Z","title":"Privileged information distillation for language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27888","last_updated":"2026-07-30T09:03:33Z","snapshot_observed_at":"2026-08-05T15:06:36.311363Z","submitted_at":"2026-07-30T09:03:33Z","title":"Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:39:13.080946Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.27888"},"observation_digest":"sha256:46a3872118df700ab57bbb45b4984fb188b7803b4f9939e1ddb94ac9c97327ce","observation_id":"b1cba096-2ea0-40f9-8879-457da848da60","resolution":{"observed_at":"2026-07-31T23:39:13.080946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-31T07:02:36.469715Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.469715Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:c7d0231349c1eec4b06612a0b05fef8a2d6c05679e2cf227ea8fa16aa9c6fba8","observation_id":"b30ab58f-eed9-4e45-8784-87573d40aa35","resolution":{"observed_at":"2026-07-31T07:02:36.469715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-05T00:37:18.978472Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01589","last_updated":"2026-08-03T01:47:25Z","snapshot_observed_at":"2026-08-16T22:13:56.948006Z","submitted_at":"2026-08-03T01:47:25Z","title":"Is More Privileged Information Better? From Solution Traces to Problem-Solving Structure in Self-Distilled Reasoning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T00:37:18.978472Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.01589"},"observation_digest":"sha256:4c84fdc71d7fe28162d5bcf3273e7fc95e19604174c5e0fe9031ea9375edc367","observation_id":"9f60ec44-9bb8-488f-b329-ee89d846c1d3","resolution":{"observed_at":"2026-08-05T00:37:18.978472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-04T22:02:31.427078Z","title":"arXiv preprint arXiv:2602.04942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-13T03:14:30Z","snapshot_observed_at":"2026-08-16T23:09:52.737951Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.427078Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:f1c0fd3e0664bad7ea93eb8167e33e3050da1ec0cb89c8deb92a0f0f2e8ef2c8","observation_id":"0affb3db-dfba-4460-8545-87dfecc7d1ae","resolution":{"observed_at":"2026-08-04T22:02:31.427078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-04T15:25:49.251304Z","title":"Privileged","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-13T23:37:34.643451Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T15:25:49.251304Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:eec3cd0cedb694519ae9a7f8558192500066ed23a2ca163fd3df972bcbf26a92","observation_id":"3b9a869b-3f76-4b13-8b96-023b04888c2d","resolution":{"observed_at":"2026-08-04T15:25:49.251304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-07T00:15:15.847567Z","title":"Privileged","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02087","last_updated":"2026-08-05T10:09:59Z","snapshot_observed_at":"2026-08-13T23:37:34.643451Z","submitted_at":"2026-08-03T11:47:52Z","title":"Instruction-Conditioned Exploration for Reinforcement Learning with Self-Distillation to an Unconditioned Policy","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T00:15:15.847567Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.02087"},"observation_digest":"sha256:71f10979e598b32c82a42a6ce60d981e42ec892bab034acb976fc18eff09aa1a","observation_id":"487ce935-df39-4d34-b567-48054be6a356","resolution":{"observed_at":"2026-08-07T00:15:15.847567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-04T13:51:12.116064Z","title":"arXiv:2602.04942","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-20T12:11:58.683020Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:12.116064Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:6056dc62507d2aa15f9fa235cd76bd5367130916898a5a2c05bdbf1fb02862ea","observation_id":"536e9971-7b0a-4e0d-87eb-1d46b5525292","resolution":{"observed_at":"2026-08-04T13:51:12.116064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-07T00:14:52.667860Z","title":"arXiv:2602.04942","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02139","last_updated":"2026-08-04T06:10:58Z","snapshot_observed_at":"2026-08-20T12:11:58.683020Z","submitted_at":"2026-08-03T12:27:32Z","title":"Self-Improving Large Language Models via Progressive Experience Evolution","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:52.667860Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.02139"},"observation_digest":"sha256:c3d135c9a4d18b776edb5db09fa5e19470150cfc553601af02a75e34aa040ce9","observation_id":"17bae05d-6cd2-4496-a84d-ee2afd62df82","resolution":{"observed_at":"2026-08-07T00:14:52.667860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-14T04:31:40.934410Z","title":"Press, O.; Zhang, M.; Min, S.; Schmidt, L.; Smith, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08764","last_updated":"2026-08-09T15:23:25Z","snapshot_observed_at":"2026-08-19T11:43:15.697444Z","submitted_at":"2026-08-09T15:23:25Z","title":"Learning from Consensus and Disagreement: Unsupervised On-Policy Self-Distillation with Minority-Trajectory Contrast","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:31:40.934410Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.08764"},"observation_digest":"sha256:758e80fe2924ef6048dfcfc42e83ad380c4d72ad7c0412c320986fa3102b89ab","observation_id":"5d0201ab-a43f-49dd-9762-5644e0729f83","resolution":{"observed_at":"2026-08-14T04:31:40.934410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-14T04:29:30.562391Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08768","last_updated":"2026-08-09T15:32:16Z","snapshot_observed_at":"2026-08-18T17:08:19.848626Z","submitted_at":"2026-08-09T15:32:16Z","title":"BOUND: Brief-Guided Corrective Preference Distillation at Search-Control Boundaries","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:30.562391Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.08768"},"observation_digest":"sha256:0418dbb9307ac19d6f4e2a49fa87a0aea957cd7ded44777e5117dd6d8308db67","observation_id":"13844ce5-9c4b-45f4-a5a6-165b9150862c","resolution":{"observed_at":"2026-08-14T04:29:30.562391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-11T21:15:10.334200Z","title":"Privileged Information Distillation for Language Models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09228","last_updated":"2026-08-10T07:51:45Z","snapshot_observed_at":"2026-08-17T12:25:01.237741Z","submitted_at":"2026-08-10T07:51:45Z","title":"Privileged Solutions or Context-Induced Teacher Behavior? Dissecting On-Policy Self-Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T21:15:10.334200Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.09228"},"observation_digest":"sha256:827e16864b246f487b5fb49ec8137a299fa7162e6b9aa3c2ad1753f5682b9fa1","observation_id":"c974849f-93cb-4426-bf4e-9ba3419b14f9","resolution":{"observed_at":"2026-08-11T21:15:10.334200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-11T11:37:45.743478Z","title":"arXiv preprint arXiv:2602.04942 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09745","last_updated":"2026-08-10T15:40:07Z","snapshot_observed_at":"2026-08-17T20:32:11.376024Z","submitted_at":"2026-08-10T15:40:07Z","title":"SR-OPSD: Self-Referenced On-Policy Self-Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T11:37:45.743478Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.09745"},"observation_digest":"sha256:5f65e124c96fffc7a9fb746630cc7a441d320a88a2e279da40195d61bd21334b","observation_id":"cf81325e-f6c6-49b4-98f6-d0a18497a1a4","resolution":{"observed_at":"2026-08-11T11:37:45.743478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-11T10:50:50.695524Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09789","last_updated":"2026-08-10T16:12:39Z","snapshot_observed_at":"2026-08-20T07:06:27.087313Z","submitted_at":"2026-08-10T16:12:39Z","title":"ADOPD: Reference-Privileged On-Policy Distillation for MLLM-Based Industrial Anomaly Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T10:50:50.695524Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.09789"},"observation_digest":"sha256:017b717edf4fd73ce742aaaa92c214425ceb54c890cf2a55eefff505938697df","observation_id":"9d7f7437-2607-476f-be08-137d76aed4b9","resolution":{"observed_at":"2026-08-11T10:50:50.695524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-15T18:07:21.573005Z","title":"Privileged information distillation for language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.573005Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:9a1d243cef12c64fa676836fdfac4f597c8dd4a9144f103d4f9c4f118ccabf65","observation_id":"681049ca-33c3-44f4-b910-6864eea1494a","resolution":{"observed_at":"2026-08-15T18:07:21.573005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-15T15:03:54.136223Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13179","last_updated":"2026-08-13T12:44:37Z","snapshot_observed_at":"2026-08-18T18:51:57.677614Z","submitted_at":"2026-08-13T12:44:37Z","title":"Teach the Magnitude, Not the Direction: Verifier-Bounded Credit Assignment for Multi-Turn Multi-step LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:03:54.136223Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.13179"},"observation_digest":"sha256:6b396048144af85cd462386dcbb01f58d5f8e85cfdade2991dceeb3009cdfa82","observation_id":"c0d6e633-0499-4ac2-b14a-8fe661d1ea9b","resolution":{"observed_at":"2026-08-15T15:03:54.136223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.04942/citation-record","integrity":"/paper/2602.04942/integrity","json":"/paper/2602.04942/citation-record.json","paper":"/paper/2602.04942"},"outbound":[],"paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 61 inbound Pith citation observations for arXiv:2602.04942."}