{"as_of":"2026-07-29T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ff3e507f9e44ab0396322017236fa55e3f2ab38a03b9f06a5fd9af2ffff09e4","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T17:27:37.161657Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-28T06:31:03.373048+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T11:44:54.717393Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T16:09:56.995110Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T09:57:17.662754Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:fc2403f672d27c7a49a85c1190a73f8b7d6c61077d5fc17ca137b33b9f53cdf3","observation_id":"bffb3a39-fc4f-4bc8-aa3d-0a6d1dc7315e","resolution":{"observed_at":"2026-05-11T20:11:12.902477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2605.06597","last_updated":"2026-05-21T16:25:55Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:22:11Z","title":"UniSD: Towards a Unified Self-Distillation Framework for Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-22T09:44:55.200796Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2605.06597"},"observation_digest":"sha256:d4191fe1be30a22414776432699d0e3599fe4c30a44af8a55b71c49b4859944a","observation_id":"5789fdb2-a335-4cac-a115-a4d4bcef9fb3","resolution":{"observed_at":"2026-05-22T09:46:22.544088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2605.11182","last_updated":"2026-05-24T01:43:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T19:44:59Z","title":"The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T02:18:29.486408Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2605.11182"},"observation_digest":"sha256:bf28802e7880a16693a5a0fda8f463456e5b42faecdcc366544431c3bad99cb1","observation_id":"9d78977c-c3e9-4d74-a39f-68247d4e9259","resolution":{"observed_at":"2026-05-13T02:22:06.953324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2605.11182","last_updated":"2026-05-24T01:43:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-11T19:44:59Z","title":"The Many Faces of On-Policy Distillation: Pitfalls, Mechanisms, and Fixes","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T22:14:50.636752Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2605.11182"},"observation_digest":"sha256:de91eaaaa6de0374ca9466a9ca9e4dbdf41cc91ee00ae4b165ffe4d8c373b0ea","observation_id":"f1800a1b-5e5e-485b-a988-6c6fbb5b4e6c","resolution":{"observed_at":"2026-07-01T14:15:46.400937Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2605.16826","last_updated":"2026-05-16T06:05:27Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T06:05:27Z","title":"Decoupling KL and Trajectories: A Unified Perspective for SFT, DAgger, Offline RL, and OPD in LLM Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-19T20:49:15.724896Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2605.16826"},"observation_digest":"sha256:ce912232c2dd4e0562e7fb2b757fe9a240af682def0d90464fecf4e486d4fb4a","observation_id":"8e3ab833-e9bd-4aca-809f-72e9b236ea08","resolution":{"observed_at":"2026-05-19T20:52:46.201324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.01476","last_updated":"2026-05-31T22:31:15Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T22:31:15Z","title":"OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.01476"},"observation_digest":"sha256:a6da0f27a196701b4a6d629e663d8e02829f5a5cb8f6c3c7f54a7df3f86b25e0","observation_id":"93ef7496-5ceb-4dbe-b906-15219d6078a4","resolution":{"observed_at":"2026-06-28T17:12:24.145017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.02684","last_updated":"2026-06-04T15:52:50Z","snapshot_observed_at":"2026-07-06T23:43:02.654629Z","submitted_at":"2026-06-01T17:58:22Z","title":"Filter, Then Reweight: Rethinking Optimization Granularity in On-Policy Distillation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-28T15:14:42.489647Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.02684"},"observation_digest":"sha256:a1642accc830907baa47531764fbac74009bfe67babeb2cff50907ab8ee506a0","observation_id":"d74c0cfe-4275-404a-b72d-b72efe45aa59","resolution":{"observed_at":"2026-07-01T22:36:17.360936Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.05718","last_updated":"2026-06-04T05:18:13Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:18:13Z","title":"ViCuR: Visual Cues as Recoverable Privilege for Multimodal On-Policy Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T01:59:15.154873Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.05718"},"observation_digest":"sha256:4adc7f3d7e10ea1addc461a389fba02ccc6abd4133e1d02dddbe5ac1b8b76689","observation_id":"0047499b-cde7-48d1-8bcc-2310a655b21d","resolution":{"observed_at":"2026-07-02T12:36:57.003582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.19659","last_updated":"2026-06-17T23:58:14Z","snapshot_observed_at":"2026-07-06T23:54:56.685241Z","submitted_at":"2026-06-17T23:58:14Z","title":"SAGE-OPD: Selective Agent-Guided Intervention for Multi-Turn On-Policy Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.19659"},"observation_digest":"sha256:d8f3d7efc64f39c660f630efb29145166e39ad2f6aa29f1b0b8863dd4ad2223c","observation_id":"9d842b35-1215-49f0-af28-22c9e37cf14e","resolution":{"observed_at":"2026-06-26T20:29:57.859170Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.22305","last_updated":"2026-06-21T02:19:17Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T02:19:17Z","title":"Learning at the Right Pace: Adaptive Data Scheduling Improves LLM Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T11:08:54.744334Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.22305"},"observation_digest":"sha256:e4ee01e3abeedaf4404d99daf534faf4c4d623333a51ad4f4fb394209ea3a83a","observation_id":"9a7e96b4-03d0-4a8d-bf88-d2c65942ea5b","resolution":{"observed_at":"2026-07-04T08:39:42.400353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.22793","last_updated":"2026-06-22T03:09:21Z","snapshot_observed_at":"2026-07-06T23:57:38.036151Z","submitted_at":"2026-06-22T03:09:21Z","title":"A Formula-Driven Survey and Research Agenda for On-Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T09:02:13.340365Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.22793"},"observation_digest":"sha256:d4eda4bf470890e62a4076453b8fe646d26d0f7673a4c55c4cd01cd36f6921ae","observation_id":"4eef3ad0-b655-400e-9bbd-3ac125455005","resolution":{"observed_at":"2026-07-04T10:19:47.147150Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.22830","last_updated":"2026-06-22T04:13:14Z","snapshot_observed_at":"2026-07-06T23:57:38.036151Z","submitted_at":"2026-06-22T04:13:14Z","title":"Finding the Evidence: Discovering Decision-Supporting Tokens for On-Policy Reasoning Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T08:49:58.735297Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.22830"},"observation_digest":"sha256:7222cb52571dc435df92236d5bd4c612adaaf5c7b103598d6360376d58cf88fb","observation_id":"7e5ca99a-2617-4633-93af-f0db5377a306","resolution":{"observed_at":"2026-07-04T10:29:44.957887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.24084","last_updated":"2026-06-23T02:58:16Z","snapshot_observed_at":"2026-07-06T23:58:44.541819Z","submitted_at":"2026-06-23T02:58:16Z","title":"Blockwise Policy-Drift Gating for On-Policy Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T00:57:05.042921Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.24084"},"observation_digest":"sha256:d73f026c5271b228cef262ee84cb03ccd969c1af39fe4dce69fcac3946a7bf87","observation_id":"be204bb8-3062-423f-84b3-3ce60c6f1b02","resolution":{"observed_at":"2026-07-04T16:09:56.996729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-07-12T11:44:53.084477Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-26T04:55:42.018348Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:6248de36f7debbb4ddfed837de3bace2d24343d73c172980fa5a72e798641c2b","observation_id":"8501e135-1f97-47cf-b856-bfe3bf3fd30f","resolution":{"observed_at":"2026-07-04T13:49:51.441439Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-12T11:44:54.717393Z","title":"Demystifying OPD: Length inflation and stabilization strategies for large language models.arXiv preprint arXiv:2604.08527, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27377","last_updated":"2026-07-07T04:28:57Z","snapshot_observed_at":"2026-07-12T11:44:53.084477Z","submitted_at":"2026-06-25T17:59:58Z","title":"DanceOPD: On-Policy Generative Field Distillation","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T11:44:54.717393Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.27377"},"observation_digest":"sha256:7de594fa6a352d153a1de5f0be1a23828d9550853af0791c116afe80571fffc5","observation_id":"0eb77a78-3ce9-4d3a-a886-f0c4d2bc17b8","resolution":{"observed_at":"2026-07-12T11:44:54.717393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"cited_work":{"arxiv_id":"2604.08527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.08527","snapshot_observed_at":"2026-07-04T16:09:56.995110Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","venue":"cs.CL","work_id":"514bb542-92d7-4c33-957b-126674d65983","year":2026},"citing_paper":{"arxiv_id":"2606.30518","last_updated":"2026-06-29T16:25:13Z","snapshot_observed_at":"2026-07-07T00:04:20.023800Z","submitted_at":"2026-06-29T16:25:13Z","title":"Regime-Aware Peer Specialization for Robust RAG under Heterogeneous Knowledge Conflicts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T06:05:47.948367Z"},"links":{"cited_paper":"/paper/2604.08527","citing_paper":"/paper/2606.30518"},"observation_digest":"sha256:909d27598491d87ab768b014dc8e98eea1c106934b383f201aa14d6d5a8cfccc","observation_id":"c825d042-3a3b-469e-a29b-82aeaefddc21","resolution":{"observed_at":"2026-06-30T08:24:27.013111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.08527/citation-record","integrity":"/paper/2604.08527/integrity","json":"/paper/2604.08527/citation-record.json","paper":"/paper/2604.08527"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":"2502.01456","doi":"10.48550/arxiv.2502.01456","metadata_source":"pith","pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Process Reinforcement through Implicit Rewards","venue":"cs.LG","work_id":"c31a2126-86f9-44f3-91f3-208d0fc1463a","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:23a32f2fbb46bf8a9eb87d7af550071f2c41e4beb87938d63365822c74ce6491","observation_id":"b8abbb58-5eb4-4361-9904-10ebfe911eac","resolution":{"observed_at":"2026-05-11T20:23:31.624298Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"cited_work":{"arxiv_id":"2306.08543","doi":"10.48550/arxiv.2306.08543","metadata_source":"pith","pith_arxiv_id":"2306.08543","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","venue":"cs.CL","work_id":"16edb291-dd18-41c5-8486-c6c715ec5311","year":2023},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2306.08543","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:6a61797417be985cb4a358c22acc469cbd97d1ce4b775cf72c52ffab2f4e8c6b","observation_id":"c04e973e-a9d1-491a-ac75-c8ed7a09058b","resolution":{"observed_at":"2026-05-12T17:40:27.990750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:cf3362937c5607ba07c0f2525aafd1a226ddac2ea5a4fa4017d56e2ff9c3f0d4","observation_id":"2276962d-227c-4e08-842e-ec06895aab23","resolution":{"observed_at":"2026-05-11T06:46:25.498353Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-07-06T17:33:33.812898Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:6949f5c6d2ddd20e9d6d1ed2c8ada49ff4ccb12044ce3c37749c463e292f16b3","observation_id":"81e6947b-18df-4a56-a94d-6cd63946a289","resolution":{"observed_at":"2026-05-11T08:38:21.105975Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-10T16:57:24.565388Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:3857a5008bff7113218bcc8ee8bcda0bccb7940d79ad30d9b50e848d9c5f6eb5","observation_id":"40ac80b8-9e99-4fe2-986d-fe1ded2cef6d","resolution":{"observed_at":"2026-05-11T06:46:27.172350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:0b4dd543b23883c1bf66376f4de9ee1eb27f08a0b30ee9eefec8acb8b12c6430","observation_id":"59c794f9-6257-4678-b11f-b01ad56c2cf5","resolution":{"observed_at":"2026-05-11T06:46:25.096749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":"2503.24290","doi":"10.48550/arxiv.2503.24290","metadata_source":"pith","pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","venue":"cs.LG","work_id":"763e0e44-40dd-4bdd-8414-21f8f9ce6d10","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:ea6cfea9f8d9a2b011f84e57b6efd7e9f5351161380432f75d1be70caa0fe5aa","observation_id":"bd51b5a3-88d4-451f-849e-2be9eec2343c","resolution":{"observed_at":"2026-05-12T21:59:02.400889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-10T16:57:24.584548Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:6a9f4af9596aa2438d5185cff02f6a73cd1fe1729ca7d5896db440ff1c53ddd6","observation_id":"e9156fda-705c-4af2-8f32-7511be2ed81c","resolution":{"observed_at":"2026-05-12T04:29:18.795354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-07-06T22:50:32.832499Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":"2603.24472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-10T00:26:39.269322Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","venue":"cs.CL","work_id":"8df6a2d1-d890-48ae-af85-c11643a91097","year":2026},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:33c1a41794cf149e8dc9742560d28c843251aedd276ebc4013201bcc3aae6689","observation_id":"c1fcf864-8175-41a4-87a5-4721055c6e48","resolution":{"observed_at":"2026-05-11T06:46:25.667356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Rush, A","venue":null,"work_id":"22e82816-9411-415e-aeb2-d5d2a21fc978","year":2016},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:cf26f562749547da73a4a3b5d09db5c98d9dccc723c09ecffab67cd8c34d3fd5","observation_id":"fc0f537e-63d8-4d7b-a27e-e65b487925ae","resolution":{"observed_at":"2026-05-17T10:21:45.409000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04061","last_updated":"2020-06-07T06:49:47Z","snapshot_observed_at":"2026-07-06T09:26:41.108280Z","submitted_at":"2020-06-07T06:49:47Z","title":"Dual Policy Distillation","version":1},"cited_work":{"arxiv_id":"2006.04061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.04061","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dual policy distilla- tion.arXiv preprint arXiv:2006.04061","venue":null,"work_id":"c1519432-808b-459f-820f-f3e1ecffff3e","year":2006},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2006.04061","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:105b0086e6373f1f3be4c617a342ba9567e9300cd21d9f58feede9a109d6c1b6","observation_id":"881ca87b-091f-45a8-ab42-cd3a3ff62932","resolution":{"observed_at":"2026-05-11T06:46:26.062388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-07-06T13:26:06.337115Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":"2206.14858","doi":"10.48550/arxiv.2206.14858","metadata_source":"pith","pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":"cs.CL","work_id":"17214d12-1ca8-4186-806d-53c6715383a0","year":2022},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:5e94e5cc4d42de27bf69c708f4cbca091afa3a1ea3d3fbf40fb75121125e2129","observation_id":"8181b803-58df-495b-bc2e-104fe803fa31","resolution":{"observed_at":"2026-05-12T22:43:59.458883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:28.356363+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":"2305.20050","doi":"10.1007/bf00262952","metadata_source":"pith","pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Let's Verify Step by Step","venue":"cs.LG","work_id":"6d05b790-04c5-4fd2-91b2-ba1dfdd5770f","year":2023},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:80485ba3bed2cff5e98ee5d36de119a7b8d1baa4cc4408b8e75387019f011c43","observation_id":"881f9d32-a398-4993-b33f-c78f028855dd","resolution":{"observed_at":"2026-05-11T06:46:27.346609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:bad295cfdf770f9703b768a0013c6a4dceca1139f1f2175d77446de799cb9f0c","observation_id":"2970a45c-60c2-4bf4-b696-e486ed827aa7","resolution":{"observed_at":"2026-05-11T06:46:24.521350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.64434/tml","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:54:19.899514Z","title":"20251026","venue":null,"work_id":"47dbfacb-ba1e-4993-a8cb-0a77adc5933c","year":2020},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:61fd6e277808cc2140c169637e663f23c54ead59893d25ed7aca27c2926dddbd","observation_id":"1c730f72-9819-4b20-b8a5-faa1acdf2f9e","resolution":{"observed_at":"2026-05-10T17:30:39.818743Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":"1511.06295","doi":"10.48550/arxiv.1511.06295","metadata_source":"pith","pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Policy Distillation","venue":"cs.LG","work_id":"19e844ce-da43-4244-b2fd-0cef95384b68","year":2015},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:034c7c71cf0b67ba2a9d2d77f149957fc3e8666cff5f19a0ed95e4339c6969ce","observation_id":"9cc87e02-f16b-4500-b8e8-8fe9f02b7009","resolution":{"observed_at":"2026-05-11T06:46:28.044908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":"1910.01108","doi":"10.48550/arxiv.1910.01108","metadata_source":"pith","pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-07-11T02:57:46.620845Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","venue":"cs.CL","work_id":"756f9764-ecd6-4672-8043-b37c698c7ad2","year":2019},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:9f46517e2f2aede24e56de7aa1d3218983dce8af9e0ce1ba02e3974083773ddf","observation_id":"eb0047b6-7d34-41bb-8d84-d375a8a67b2c","resolution":{"observed_at":"2026-05-11T06:46:24.677843Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:d2da8ec4a00ee8c5c48a1f37371f9345cfdc1461c157aa6c08cb98d00e4669b2","observation_id":"ca188012-58ae-4272-8959-49e766c006ec","resolution":{"observed_at":"2026-05-11T06:46:28.199747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:43af1fbe7a4f836a1a803f30998250edb9d038175dbefa4b0487e4f30fcf8adf","observation_id":"b5f0a30a-7d66-4bde-9199-c3c70396ac03","resolution":{"observed_at":"2026-05-11T06:46:25.326349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":"2601.02780","doi":"10.48550/arxiv.2601.02780","metadata_source":"pith","pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"MiMo-V2-Flash Technical Report","venue":"cs.CL","work_id":"1f3df90c-4bc3-49b1-ad9b-7f3b34e4ffba","year":2026},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:3f8d5a3478fa74f5f11b3c61e4190a6bd5d50298525d2337884fd6cd9760664b","observation_id":"6dc57683-d61d-453f-a22a-1cc743f085d3","resolution":{"observed_at":"2026-05-12T11:33:32.947936Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:49.766877+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":"2504.14945","doi":"10.48550/arxiv.2504.14945","metadata_source":"pith","pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Learning to Reason under Off-Policy Guidance","venue":"cs.LG","work_id":"4ebcdbe2-5000-4f58-a7e0-aa9ae381b684","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:14a37e20d9fdf6f702753011a6fb210fb33043a25fdc91968feac5411d199ffd","observation_id":"2be2d9c2-6261-4c1e-bdfe-9d85220e63c8","resolution":{"observed_at":"2026-05-15T23:17:03.075876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:928da0f43632837ed2a61ad0513f8b5165ac8755a0ea8cfbb0a0b5af985a8e1c","observation_id":"76a7a0f5-5d7e-4777-b998-045d16356060","resolution":{"observed_at":"2026-05-11T10:15:55.036587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:15033051e3a7794bf196b77296d78a15b02526bc67e66c6b92b2a31e2bc81b49","observation_id":"c134a4ce-be53-4262-8b9f-e6cdc509d312","resolution":{"observed_at":"2026-05-11T06:46:28.180751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.10643","doi":"10.48550/arxiv.2511.10643","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Black-box on-policy distillation of large language models.arXiv preprint","venue":null,"work_id":"1e58a1be-9294-4bd3-8040-3516dcebcd4a","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:64639adfa9a4e2f7341a3a68a5b11641c6b742cf7fa1a1baedd3c27625d422f5","observation_id":"702bf885-7308-45e7-b79b-bde35918684c","resolution":{"observed_at":"2026-05-11T06:46:26.859445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-11T03:07:50.815080Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:ccaabe19086d7930a8758cf2664943e80c3e2beecca730b2d416980ee7308632","observation_id":"deb75af3-a730-4bbb-910a-c7712e56e9db","resolution":{"observed_at":"2026-05-11T06:46:27.522343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":"2503.18892","doi":"10.48550/arxiv.2503.18892","metadata_source":"pith","pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","venue":"cs.LG","work_id":"94a68437-02e7-425a-91b2-5846ddcbd38c","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:4ccbde3774009fd4416ad046af86ac389d78b04fa5b79633e223b418cc31cd95","observation_id":"930f1c66-095d-4c67-a699-e775291e48e7","resolution":{"observed_at":"2026-05-13T08:21:05.971096Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":"2509.08827","doi":"10.48550/arxiv.2509.08827","metadata_source":"pith","pith_arxiv_id":"2509.08827","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","venue":"cs.CL","work_id":"7618c14b-e527-4268-9926-d4f462ea9925","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2509.08827","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:e193e47d655bb4ef93c25a61e1d135ab57ff7c3e33d3e08ffb0f04bf59d47779","observation_id":"94c4fcd5-d4e2-4e3e-b450-c0537958cc2c","resolution":{"observed_at":"2026-05-18T00:02:25.511734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:c3f9e95974fa9c33e60d981a03fd55f04f1854309b545cbf2fced3e2d4a630cd","observation_id":"a6f8d663-b49c-4d2f-8e24-bc00a140300f","resolution":{"observed_at":"2026-05-12T03:54:31.187112Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Appendix B","venue":null,"work_id":"b0e6a935-744f-4a82-84ae-d5965a3f87b7","year":2024},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:4bec499586a0490fe870acb2b0d1438a6980c12a363dbb1b07155340c4b13830","observation_id":"936e03b1-0802-4aba-8450-526f25379efd","resolution":{"observed_at":"2026-05-17T10:21:45.417635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"aef20a9d-d870-4ce3-a171-6d54352bcb86","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:ad2f32fa6c3473953bb00ca08b4b0365d60578e1daa8f35d2810193e1127278e","observation_id":"36e8de24-1349-4f57-8d75-c720b8018423","resolution":{"observed_at":"2026-05-17T10:21:45.411892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"afb6ec60-7f3c-4cde-96b9-41a2d13eb932","year":2025},"citing_paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:37.161657Z"},"links":{"citing_paper":"/paper/2604.08527"},"observation_digest":"sha256:ec9c35103b1ebad836de3d8d3406c335427f855ccdd31e1ecbf45b9ae2087032","observation_id":"f8b954ce-30bb-46e4-bf29-10df51c99bcf","resolution":{"observed_at":"2026-05-17T10:21:45.414892Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-28T06:31:03.373048+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.08527","last_updated":"2026-04-09T17:58:02Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:58:02Z","title":"Demystifying OPD: Length Inflation and Stabilization Strategies for Large Language Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":24,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-28T06:31:03.373048+00:00","source":"crossref"},{"observed_at":"2026-07-28T06:30:57.601408+00:00","source":"retraction_watch"}],"thesis":"As of 29 July 2026, this Paper Citation Record lists 31 of 31 outbound references and 16 inbound Pith citation observations for arXiv:2604.08527."}