{"as_of":"2026-08-05T23:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:058e112d8c11aa1cab2eb7eb5cf8aa3eef3a56fc2b98bbfdf37ccd8ead04b525","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T04:20:19.940462Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:15:50.767987Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T09:07:48.371751Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":"2605.10781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-07-03T09:07:48.371751Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":"cs.LG","work_id":"ebe24520-6fe1-4491-a9ac-ee808766d795","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T09:05:30.262601Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:bafb944eb2fec48b5b3f3d9370930b8a89dc49c6eddb91e91d9b5ee22a74dd91","observation_id":"da622c26-1105-4028-9666-30f98f602728","resolution":{"observed_at":"2026-05-20T09:08:10.001047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":"2605.10781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-07-03T09:07:48.371751Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":"cs.LG","work_id":"ebe24520-6fe1-4491-a9ac-ee808766d795","year":2026},"citing_paper":{"arxiv_id":"2605.18141","last_updated":"2026-05-21T15:38:11Z","snapshot_observed_at":"2026-07-06T23:29:04.241654Z","submitted_at":"2026-05-18T09:47:53Z","title":"A Brief Overview: On-Policy Self-Distillation In Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T09:51:52.886663Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2605.18141"},"observation_digest":"sha256:a81e043a9e1d8fb4323fce21f28ffac115e158234c10fcd7d5345d6b3fdffcad","observation_id":"22b40ec6-eaf0-49cf-8d18-de10ffbe0479","resolution":{"observed_at":"2026-05-22T09:54:47.024463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":"2605.10781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-07-03T09:07:48.371751Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":"cs.LG","work_id":"ebe24520-6fe1-4491-a9ac-ee808766d795","year":2026},"citing_paper":{"arxiv_id":"2606.00172","last_updated":"2026-05-29T13:21:30Z","snapshot_observed_at":"2026-08-03T13:58:16.997854Z","submitted_at":"2026-05-29T13:21:30Z","title":"CAST: Non-Privileged Clipped Asymmetric Self-Teaching with Advantage Flipping for GRPO","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T22:25:04.067339Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2606.00172"},"observation_digest":"sha256:75355bf974fed805740343aed5a2b0a7f79b815f178f8204bede8f73d699aa1e","observation_id":"83c53ce3-d5ce-427a-80ef-693339f060f2","resolution":{"observed_at":"2026-07-01T19:26:01.075423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":"2605.10781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-07-03T09:07:48.371751Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":"cs.LG","work_id":"ebe24520-6fe1-4491-a9ac-ee808766d795","year":2026},"citing_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T10:28:18.490452Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2606.11709"},"observation_digest":"sha256:b05b4a6004f4596cbae8063301c2a6cb97664d26d4383f9ed0db2b4de5d54b80","observation_id":"14c82400-5449-413d-aabe-a7f9e0864b7e","resolution":{"observed_at":"2026-07-03T09:07:48.373003Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":"2605.10781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-07-03T09:07:48.371751Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":"cs.LG","work_id":"ebe24520-6fe1-4491-a9ac-ee808766d795","year":2026},"citing_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-03T00:43:32.504636Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-30T07:15:44.387347Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2606.29502"},"observation_digest":"sha256:f35a31b75ac9610064923a1d9c65cf507fd69f2bbfff980cde4a2e237ba30917","observation_id":"d2401d52-7387-44be-98fa-11b6596a74ac","resolution":{"observed_at":"2026-06-30T07:24:21.994570Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-07-14T09:08:42.969885Z","title":"arXiv preprint arXiv:2605.10781 , url=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10805","last_updated":"2026-07-12T15:24:25Z","snapshot_observed_at":"2026-08-05T11:47:23.535326Z","submitted_at":"2026-07-12T15:24:25Z","title":"Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-14T09:08:42.969885Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2607.10805"},"observation_digest":"sha256:d482562b4030c340b4ef0f256df91092e742d2d68fb9a4f38c6bc09dffe93bc6","observation_id":"3648714b-4cc3-4d6f-9b40-dd8d5d9759e5","resolution":{"observed_at":"2026-07-14T09:08:42.969885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-08-01T16:14:24.250799Z","title":"Rebellious student: Reversing teacher signals for reasoning exploration with self-distilled RLVR.CoRR, abs/2605.10781, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18082","last_updated":"2026-08-03T04:07:59Z","snapshot_observed_at":"2026-08-05T23:26:27.472036Z","submitted_at":"2026-07-20T15:50:02Z","title":"CriPO: Enhancing Rubric-based RL via Self-Distillation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T16:14:24.250799Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2607.18082"},"observation_digest":"sha256:9633cee3ed3d6dfad93cefd329b2b4bf8961b11fdfafbf24a262514cccb213ab","observation_id":"1bfa63be-856f-48aa-9bee-a8b619557631","resolution":{"observed_at":"2026-08-01T16:14:24.250799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-08-04T04:13:29.068490Z","title":"Rebellious student: Reversing teacher signals for reasoning exploration with self-distilled RLVR.CoRR, abs/2605.10781, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18082","last_updated":"2026-08-03T04:07:59Z","snapshot_observed_at":"2026-08-05T23:26:27.472036Z","submitted_at":"2026-07-20T15:50:02Z","title":"CriPO: Enhancing Rubric-based RL via Self-Distillation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T04:13:29.068490Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2607.18082"},"observation_digest":"sha256:6111b3dd6622b959b9a5c86a82d2cc4f1dadc3cbf59a7af68b1140b910b100f6","observation_id":"09e9f91c-b592-4930-a6e2-15ef02a5b423","resolution":{"observed_at":"2026-08-04T04:13:29.068490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-08-01T16:07:59.655967Z","title":"arXiv preprint arXiv:2605.10781 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18110","last_updated":"2026-07-20T16:08:49Z","snapshot_observed_at":"2026-08-05T10:41:27.894489Z","submitted_at":"2026-07-20T16:08:49Z","title":"LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:59.655967Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2607.18110"},"observation_digest":"sha256:ee26680f61ad71edba8e3c0007abb1be39faa9165434f09592eacb623c185028","observation_id":"4c2a502f-0aea-4f6b-b807-7a21c373f0f5","resolution":{"observed_at":"2026-08-01T16:07:59.655967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-08-05T23:15:50.767987Z","title":"RebelliousStu- dent: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-05T23:32:55.822129Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.767987Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:fbba874fe19ce951fe6cbf809dc4a13e19028dfd37b69ac4e8f090f272ff8f01","observation_id":"d37c7dd3-f9be-4136-8c78-68c3880e9b1d","resolution":{"observed_at":"2026-08-05T23:15:50.767987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.10781/citation-record","integrity":"/paper/2605.10781/integrity","json":"/paper/2605.10781/citation-record.json","paper":"/paper/2605.10781"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:99bff0b37419bea620952f7f5995ac07cec2e8a7cc16e76da5a1181c5ecbb3a6","observation_id":"40413594-1191-4c95-90c6-05c7e2125c11","resolution":{"observed_at":"2026-05-12T04:21:22.432836Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-05T20:21:02.654739Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:94d221a8097f55bbcc76b48b9cb4470128633d95bc9e2e741cc452cf1266eca6","observation_id":"a6579577-05d4-4a44-a098-bf48c50f0bf6","resolution":{"observed_at":"2026-05-12T04:21:22.408581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:34:27.167130Z","title":"Reasoning with exploration: An entropy perspective","venue":null,"work_id":"6916d85e-5257-4119-a33d-0c0c6c56cb34","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:ba0fe753c61c234a94a2fe113cab1dffcbc32b3b93cf54f6e697e1cb320d46d6","observation_id":"787862a4-87a9-4fb8-be27-4a27dd5daae7","resolution":{"observed_at":"2026-05-12T15:36:39.744841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22617","last_updated":"2025-05-28T17:38:45Z","snapshot_observed_at":"2026-07-06T21:32:23.537939Z","submitted_at":"2025-05-28T17:38:45Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":"2505.22617","doi":"10.48550/arxiv.2505.22617","metadata_source":"pith","pith_arxiv_id":"2505.22617","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Entropy Mechanism of Reinforcement Learning for Reasoning Language Models","venue":"cs.LG","work_id":"d4b4aee4-d20f-4572-886a-4ba9ea6c9b81","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2505.22617","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:08d43c3938b1c760d78a2d55859f1cf5a50224ddadd53eedd9de8a57402ecac9","observation_id":"3e8d6b83-a83c-44ff-9c65-09d5159c3fb7","resolution":{"observed_at":"2026-05-12T12:31:34.026635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving rl exploration for llm reasoning through retrospective replay","venue":null,"work_id":"cfd3bf9a-bbf0-40e6-81d8-2000ef3ef31e","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:cf1cb8070b2f65c39912b5b31abb923875ac4bfdc9aecd5c8dcee7b84fe7ef2a","observation_id":"c2b54c09-ad9a-4653-8e53-a8fa3a7e11df","resolution":{"observed_at":"2026-05-12T15:36:39.748064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:dc57733fd7c04e01fe5c46b3ca7065d33912a4819103d4c5bd5230056e02a9b3","observation_id":"53bc1824-b14b-441b-a67d-e0d5ba1b610b","resolution":{"observed_at":"2026-05-12T04:21:22.426152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10150","last_updated":"2026-04-29T10:02:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-11T10:17:38Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","version":4},"cited_work":{"arxiv_id":"2510.10150","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.10150","snapshot_observed_at":"2026-07-04T08:29:41.999322Z","title":"Rethinking Entropy Interventions in RLVR: An Entropy Change Perspective","venue":"cs.LG","work_id":"32e0712a-e9d7-451f-8c18-f895f13eab70","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2510.10150","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:623ad2d4dc68d0f81dc0a43859ecaad58719dfe546363089e4b1a66e1d4011df","observation_id":"d1709089-fb85-4a3b-975d-f7c060c4a330","resolution":{"observed_at":"2026-05-12T04:21:22.421664Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26209","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T18:43:50.477082Z","title":"Diversity-incentivized exploration for versatile reasoning","venue":null,"work_id":"846fe449-c3cf-44da-a88e-6acd249d801b","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:3d76ce61464961e188b228fad3949f340646bb9145f76dcfb34dd4584a532308","observation_id":"5074bb95-ae66-47c5-acf7-e5d60ab7decd","resolution":{"observed_at":"2026-05-12T04:21:22.400659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":"2601.20802","doi":"10.48550/arxiv.2601.20802","metadata_source":"pith","pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforcement Learning via Self-Distillation","venue":"cs.LG","work_id":"b193541d-5853-4ea4-8e4b-8e4c08617eb6","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:8cb4a4c292fb0325fa05eb2c7faef1a4c33a6d9d397e6359a097c9f8f2e3b8b1","observation_id":"97f269f9-68c5-4c0c-81c2-051aabfa3216","resolution":{"observed_at":"2026-05-12T04:29:18.795354Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:23:12.649775+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05993","last_updated":"2026-04-19T11:25:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-08T12:50:41Z","title":"Revisiting Entropy in Reinforcement Learning for Large Reasoning Models","version":3},"cited_work":{"arxiv_id":"2511.05993","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.05993","snapshot_observed_at":"2026-07-04T03:49:30.169449Z","title":"Revisiting Entropy in Reinforcement Learning for Large Reasoning Models","venue":"cs.CL","work_id":"80adc027-2a49-4795-af10-381a8bf9557c","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2511.05993","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:5366e7f0eecd82d8b77db409df29b0ec6ca5341732cfe4aa9691f2da19df712c","observation_id":"4824a536-d164-45ab-b032-e2b0e7132d6a","resolution":{"observed_at":"2026-05-12T04:21:22.581915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.24472","last_updated":"2026-05-20T15:19:39Z","snapshot_observed_at":"2026-08-02T12:51:54.532525Z","submitted_at":"2026-03-25T16:14:52Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","version":3},"cited_work":{"arxiv_id":"2603.24472","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.24472","snapshot_observed_at":"2026-07-10T00:26:39.269322Z","title":"Why Does Self-Distillation (Sometimes) Degrade the Reasoning Capability of LLMs?","venue":"cs.CL","work_id":"8df6a2d1-d890-48ae-af85-c11643a91097","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2603.24472","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:482c18947b1cf562b7ce953757d7de2e661d017ab7625f9dcdb43442a4f61098","observation_id":"38c14afe-d670-4d9a-b719-93cf3d30400e","resolution":{"observed_at":"2026-05-12T04:21:22.561357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2604.02288","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:01.050266Z","title":"Unifying group-relative and self-distillation policy optimization via sample routing","venue":null,"work_id":"6dea6cb7-a4e5-478a-ab3c-eeeb335abd51","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:d6e5eab9a6318a3f56f2cc6df661102a5b12e80b9aebd5db86e28bd3d73754ea","observation_id":"9048021f-686b-4274-97fa-80bb9d3544c5","resolution":{"observed_at":"2026-05-12T04:21:22.530633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploratory memory-augmented LLM agent via hybrid on- and off-policy optimization","venue":null,"work_id":"01a61d2f-e967-4dd3-a9b3-ee886c24e634","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:955fc44e29af9b869bf24300a559ce9922d0caf72d2bba93ee3bb2fa6f3516a3","observation_id":"6761fb64-1cde-421d-af1b-53fe8db4d361","resolution":{"observed_at":"2026-05-12T15:36:39.750999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Understanding r1-zero-like training: A critical perspective","venue":null,"work_id":"1c674ad0-90ff-45a4-b04a-2eb26769fa68","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:f65e43c1389daf8087a1a07412ad1e6728e6b6146c0fc7f551985246d467a88e","observation_id":"ca70ce8b-6d95-4af4-b2f7-4f8b63a971f3","resolution":{"observed_at":"2026-05-12T15:36:39.755353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.22446","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:49:30.140816Z","title":"Sparse but critical: A token-level analysis of distributional shifts in rlvr fine-tuning of llms","venue":null,"work_id":"fb448c11-a1b6-4d2c-a2cb-51dac670c22e","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:5347426186b6ec7d9dff3877933eee120ac56b615feb8e7909113fa5c14a14bc","observation_id":"50442307-3d06-4151-8e2a-febfdc15df2a","resolution":{"observed_at":"2026-05-12T04:21:22.556249Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fightin’words: Lexical feature selection and evaluation for identifying the content of political conflict.Political Analysis, 16 (4):372–403","venue":null,"work_id":"303c3ec2-853d-4125-a010-7f59218aba54","year":2008},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:badfd44060393938e2b2b7809bdf80ca47a4179fed72a858d34c639896819f86","observation_id":"a4a13f01-28d1-4714-bdd5-7a4dc296a789","resolution":{"observed_at":"2026-05-12T15:36:39.758265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02230","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T14:08:21.726286Z","title":"arXiv:2510.02230 , year=","venue":null,"work_id":"e2341e92-b50a-4a12-8921-71eae11f5da5","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:d93bb418a8c7b1f38a8118a117d25172d6e715b1a8f92ee6f11ab0ac240bcbd9","observation_id":"6c42a37a-6815-4f75-b397-29c11480c2f4","resolution":{"observed_at":"2026-05-12T04:21:22.545861Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26114","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:08:57.729702Z","title":"Clip-low increases entropy and clip-high decreases entropy in reinforcement learning of large language models","venue":null,"work_id":"49332f43-a13a-4089-bc48-bd18ab1f3451","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:e8e7aa2f1506eee441b2292aba8ffd9aeccda8e213435219f7a8789c5e2d1f5e","observation_id":"81a7bed7-b543-475d-b62b-a9fae62b5b12","resolution":{"observed_at":"2026-05-12T04:21:22.476543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:433999c369cd41df988cb78d73bb5fdb1686abfba3fb3c78aa6705eba4ae3f25","observation_id":"a886ae07-ac25-4491-9d2d-fbaa23a784c7","resolution":{"observed_at":"2026-05-12T04:21:22.491218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":"2601.19897","doi":"10.48550/arxiv.2601.19897","metadata_source":"pith","pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Distillation Enables Continual Learning","venue":"cs.LG","work_id":"e9aa25e3-870c-46c8-8270-e4e5948d09f0","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:c5d01d1a62f8ee706b067008889704db9ef9ccb11c4863c47a5f84d9d336c1b2","observation_id":"b9c49be3-95d3-43e3-a9b0-f9fc007a2373","resolution":{"observed_at":"2026-05-12T05:31:52.723793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:50.091537+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-04T22:59:12.129500Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2509.06941","doi":"10.48550/arxiv.2509.06941","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.06941","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outcome-based exploration for llm reasoning","venue":"ArXiv.org","work_id":"0352fa2c-5813-4d42-bbe9-307d16146d13","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2509.06941","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:8be01fae186bf74ae84e98546909a60515330a8ce5a2e93f2a79c0a04222b57b","observation_id":"3a0da2d4-b844-4ad7-966f-e3e171b50b9c","resolution":{"observed_at":"2026-05-12T04:21:22.471904Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02482","doi":"10.48550/arxiv.2602.02482","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2602.02482 , year=","venue":"Open MIND","work_id":"c9552e44-1e80-45df-b599-f8554214e923","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:6235369e99533e87b643fdc3d3cf46598fe8807fc62ddde42591e6298c428c34","observation_id":"7633ff53-f2bd-4ca5-bed0-7c9458b0f803","resolution":{"observed_at":"2026-05-12T04:21:22.438495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.19895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T02:26:27.263812Z","title":"DSDR: Dual-scale diversity regularization for exploration in LLM reasoning.arXiv preprint arXiv:2602.19895","venue":null,"work_id":"a23817e2-7676-45ea-8373-632338a54bc6","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:031b65eeaebccccaa6ec7a414d8b0d5a5ada80d597154436fd60972cf997423c","observation_id":"534b2987-ec12-4f09-8e94-1421a2318905","resolution":{"observed_at":"2026-05-12T04:21:22.464592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08141","last_updated":"2026-05-18T14:17:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-09T12:24:08Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","version":7},"cited_work":{"arxiv_id":"2510.08141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.08141","snapshot_observed_at":"2026-07-03T20:48:56.103707Z","title":"SCOPE-RL: Stable and Quantitative Control of Policy Entropy in RL Post-Training","venue":"cs.LG","work_id":"2f46a012-7c98-4bac-ba71-c90d6b4b7fc5","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2510.08141","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:fe007f7610cc66e20fd529e4b95759a58c0914e40ad1120e1de0c2850247980c","observation_id":"83783fba-31ff-496f-9dee-c05295e34c33","resolution":{"observed_at":"2026-05-20T00:05:34.479506Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":"2604.03128","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-07-07T12:33:45.187943Z","title":"Self-Distilled RLVR","venue":"cs.LG","work_id":"935a34f3-b83d-4214-b6a0-ae2395b3d107","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:0ffe534e4fe0f25c49ae436b513ad2a4fcb19a27c87917a4fdbdea4095e9edd6","observation_id":"64dcb783-2730-420a-a05b-c05026d81050","resolution":{"observed_at":"2026-05-12T04:21:22.536857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04028","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The debate on rlvr reasoning capability boundary: Shrinkage, expansion, or both? a two-stage dynamic view","venue":null,"work_id":"366dfc52-b56c-457c-a41a-a3dc99251646","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:a58b4cf3a1d547d283bb670788d29d424e595d49435e36959c68188f9da02084","observation_id":"de6ef254-7b89-450a-ae72-e740d0c0774f","resolution":{"observed_at":"2026-05-12T04:21:22.516189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":"2602.12275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-07-10T00:26:39.252472Z","title":"On-Policy Context Distillation for Language Models","venue":"cs.CL","work_id":"b56a7e15-d864-43f4-9212-59bc7ec70d21","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:a461a5223f4d4d78f31d0a0ed7bf6c26ab6e9ea68f4bbac3336cce70bace7fe0","observation_id":"3ba93bfc-cbed-4bcc-95f8-7b9e32c1eeb2","resolution":{"observed_at":"2026-05-13T20:48:41.492604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:6778f67a736aa57af7f5075a1e304614c6ea1b93057cf5e3c6a65197c817b063","observation_id":"e40e8aba-ea15-4627-9908-61ed7fe4b6bc","resolution":{"observed_at":"2026-05-12T04:21:22.448956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:16:17.496047Z","title":"Does reinforcement learning really incentivize reasoning capacity in LLMs beyond the base model? InThe Thirty-ninth Annual Conference on Neural Information Processing Systems","venue":null,"work_id":"65aef5f9-6da8-49a8-8054-3da923aa4b74","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:44e3d8013c0670a46f413c6f67f68d1a96356a5c304ffeadfab7b330b30c7f1b","observation_id":"62754914-43b4-40c2-91bc-45e4a2ab91b6","resolution":{"observed_at":"2026-05-12T15:36:39.761025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.07783","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T21:00:08.493261Z","title":"On the interplay of pre-training, mid-training, and rl on reasoning language models, 2025 a","venue":null,"work_id":"0e148fc4-dd1f-4b6f-946d-385c5883da2b","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:0f022309a9d3ab6f5e455909cd390e3121daf85337ab52b4ef92a8925b68f5b4","observation_id":"12be5d22-6e51-4c80-9d1e-e88a68e85fff","resolution":{"observed_at":"2026-05-12T04:21:22.572306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07912","last_updated":"2025-08-07T23:50:47Z","snapshot_observed_at":"2026-08-05T04:01:25.961804Z","submitted_at":"2025-04-10T17:15:53Z","title":"Echo Chamber: RL Post-training Amplifies Behaviors Learned in Pretraining","version":2},"cited_work":{"arxiv_id":"2504.07912","doi":"10.48550/arxiv.2504.07912","metadata_source":"pith","pith_arxiv_id":"2504.07912","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Echo chamber: Rl post-training amplifies behaviors learned in pretraining","venue":"cs.LG","work_id":"5ca0b346-f1f3-430a-8dda-43f29a289a08","year":2025},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2504.07912","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:bcf4a6dc59bbe85eddfcad0447737c5837c66382811108d8f1eb3c36026332a0","observation_id":"a8ae377b-f8f8-4fa1-9e10-a451ea56ac09","resolution":{"observed_at":"2026-05-12T04:21:22.445555Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-05T07:13:28.092224Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":"2601.18734","doi":"10.18653/v1/2025.emnlp-main.125.https://aclanthology.org/2025.emnlp-main.125/","metadata_source":"pith","pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","venue":"cs.LG","work_id":"bae00e84-9b0d-433d-a066-20b951f0b4d0","year":2026},"citing_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T04:20:19.940462Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2605.10781"},"observation_digest":"sha256:2469b60c07e3da44bdda9bb01a081ae62d8399e854b21b9252659f6551a3b588","observation_id":"24103ca4-07c8-4bc4-b7e9-6782130182a4","resolution":{"observed_at":"2026-05-12T04:21:22.566603Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":1,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":0,"verified_exact":23,"verified_fuzzy":6},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 10 inbound Pith citation observations for arXiv:2605.10781."}