{"as_of":"2026-08-23T09:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:59d0e2bcc46896174301b87c96a5e9fb27b5b1b483255acbe56ed2cd1e4dbc7d","coverage":[{"denominator":14,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T04:22:10.826939Z","state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.17686/citation-record","integrity":"/paper/2602.17686/integrity","json":"/paper/2602.17686/citation-record.json","paper":"/paper/2602.17686"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:22:09.466073Z","title":"Mcc-kd: Multi-cot consis- tent knowledge distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:09.466073Z"},"links":{"citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:6141b0bc825bc338aa89bc1a5a260606fb17d14632d936d4f9161633304c0751","observation_id":"0d734869-655f-483c-ba19-07bf6b1aae8b","resolution":{"observed_at":"2026-08-03T04:22:09.466073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01887","last_updated":"2025-07-02T16:57:01Z","snapshot_observed_at":"2026-08-14T13:08:06.376797Z","submitted_at":"2025-07-02T16:57:01Z","title":"MiCoTA: Bridging the Learnability Gap with Intermediate CoT and Teacher Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01887","snapshot_observed_at":"2026-08-03T04:22:09.812983Z","title":"Micota: Bridging the learnability gap with intermediate cot and teacher assistants.arXiv preprint arXiv:2507.01887,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:09.812983Z"},"links":{"cited_paper":"/paper/2507.01887","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:9699aae7b644495a3292f7126a4754804ebeea237a3f25712912de0bd0d6d3a7","observation_id":"11f4e598-4146-4909-aaa0-23a0b8ddf05f","resolution":{"observed_at":"2026-08-03T04:22:09.812983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:22:10.071077Z","title":"Distilling step-by-step! outperforming larger language mod- els with less training data and smaller model sizes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.071077Z"},"links":{"citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:246bfadbfd24e1262c81796a7cbf14a35fa85451fe6d61d2b853c7c58f0cbc0d","observation_id":"8466175b-991c-4576-9db0-f5ce4d5952b6","resolution":{"observed_at":"2026-08-03T04:22:10.071077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02350","last_updated":"2025-09-02T14:16:02Z","snapshot_observed_at":"2026-08-16T00:20:00.216356Z","submitted_at":"2025-09-02T14:16:02Z","title":"Implicit Reasoning in Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02350","snapshot_observed_at":"2026-08-03T04:22:10.213699Z","title":"Implicit reasoning in large language models: A comprehensive survey.arXiv preprint arXiv:2509.02350, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.213699Z"},"links":{"cited_paper":"/paper/2509.02350","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:79a742c138251f7f22265e35782b7f0538c73b656c92b5d900068c03ccba6168","observation_id":"d2faa3d1-e98a-4da1-86b6-48af6ce1137f","resolution":{"observed_at":"2026-08-03T04:22:10.213699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01096","last_updated":"2025-08-08T08:03:03Z","snapshot_observed_at":"2026-08-14T12:14:39.178923Z","submitted_at":"2025-06-01T17:43:54Z","title":"SuperRL: Reinforcement Learning with Supervision to Boost Language Model Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01096","snapshot_observed_at":"2026-08-03T04:22:10.295612Z","title":"Superrl: Reinforcement learning with supervision to boost language model reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.295612Z"},"links":{"cited_paper":"/paper/2506.01096","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:3135d20ea25f5ea103a09b56cc289a35f9700793b90284ee5251b3c6146770fa","observation_id":"a2667e53-be8e-46f9-981c-14079b6fe28c","resolution":{"observed_at":"2026-08-03T04:22:10.295612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-03T04:22:10.495797Z","title":"21 Zhihong Shao, Peiyi Wang, Qihao Zhu, Runxin Xu, Junxiao Song, Xiao Bi, Haowei Zhang, Mingchuan Zhang, YK Li, Yang Wu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.495797Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:2132d78246da35065ad6d7dcd0053de9e8aef88487a389c3bf9e4d767b88e70a","observation_id":"d4b873ae-18e6-42a4-8222-0d1f42210444","resolution":{"observed_at":"2026-08-03T04:22:10.495797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:22:10.744393Z","title":"Masked-and-reordered self-supervision for reinforcement learn- ing from verifiable rewards.arXiv preprint arXiv:2511.17473,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.744393Z"},"links":{"citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:336dee758612bc76119fd9653f430dba5f4320d2ac7f07f3e1578d36c65daa76","observation_id":"9cd351bf-69f6-4c5a-86d7-067d9115c77d","resolution":{"observed_at":"2026-08-03T04:22:10.744393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:22:10.826939Z","title":"Tokenskip: Controllable chain-of- thought compression in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.826939Z"},"links":{"citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:db1f8cc1b95176091f651874e6d43d5e49ad562892c1d9971344917f833f26c8","observation_id":"b77da9d4-cbbc-40b2-831f-1360c70b88e5","resolution":{"observed_at":"2026-08-03T04:22:10.826939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10730","last_updated":"2024-02-25T07:43:00Z","snapshot_observed_at":"2026-08-16T14:34:01.136959Z","submitted_at":"2023-12-17T14:28:28Z","title":"Mixed Distillation Helps Smaller Language Model Better Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10730","snapshot_observed_at":"2026-08-03T04:22:10.152312Z","title":"Mixed distillation helps smaller language model better reasoning.arXiv preprint arXiv:2312.10730,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.152312Z"},"links":{"cited_paper":"/paper/2312.10730","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:f1f4c87f097e37eafbc5f7ed279c793c74d71668520dd52056a1abb2a4ab0376","observation_id":"7d74edbc-3bb0-44fd-93cd-4bd10ff76d40","resolution":{"observed_at":"2026-08-03T04:22:10.152312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01460","last_updated":"2023-11-02T17:59:49Z","snapshot_observed_at":"2026-08-19T20:10:00.657591Z","submitted_at":"2023-11-02T17:59:49Z","title":"Implicit Chain of Thought Reasoning via Knowledge Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01460","snapshot_observed_at":"2026-08-03T04:22:09.720279Z","title":"Implicit chain of thought reasoning via knowledge distillation.arXiv preprint arXiv:2311.01460,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:09.720279Z"},"links":{"cited_paper":"/paper/2311.01460","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:c7a8b6b2837c132d54b49ee529948cf6bdf6c70f43c44db9dfa3f49b9b675f60","observation_id":"95ee30c0-11ab-4f82-a1d1-3615c9943127","resolution":{"observed_at":"2026-08-03T04:22:09.720279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:22:10.378043Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.378043Z"},"links":{"citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:d5ef8fa28c7d59441150273bd9715d8f632e35734b17936894fd02f33856ccf4","observation_id":"ebd6edff-21bb-44aa-ac5c-f3407636046c","resolution":{"observed_at":"2026-08-03T04:22:10.378043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T04:22:09.581991Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:09.581991Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:dad54506e1a38d40b0a0a699b7411c807a707f5a6febc33707c1d4a995162ca2","observation_id":"479937a8-3623-4c43-9bf5-592299ad9f5a","resolution":{"observed_at":"2026-08-03T04:22:09.581991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T04:22:10.636869Z","title":"Codi: Compressing chain-of- thought into continuous space via self-distillation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:10.636869Z"},"links":{"citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:89150c44e17c0bcc08c47f56470aa359b8090759b6bddee51fe9d6853566b9b1","observation_id":"8333095e-d9a6-48d0-be76-cc7115c8e034","resolution":{"observed_at":"2026-08-03T04:22:10.636869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T04:22:09.986203Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T04:22:09.986203Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.17686"},"observation_digest":"sha256:dadaac2bdf097e7d02a42ff90ca035920549efea941a52f80a35d90da99645ad","observation_id":"e8be5630-6f60-48a6-8ba5-83962c57fced","resolution":{"observed_at":"2026-08-03T04:22:09.986203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.17686","last_updated":"2026-07-09T12:59:25Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T13:08:51.142996Z","submitted_at":"2026-02-05T05:27:11Z","title":"Curriculum Learning for Efficient Chain-of-Thought Distillation via Structure-Aware Masking and GRPO"},"reference_resolution":{"displayed":14,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":14},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 14 of 14 outbound references and 0 inbound Pith citation observations for arXiv:2602.17686."}