{"as_of":"2026-08-17T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:782b67ddfbd7cc69a41a10d2c567da6f802447e8b570a689d0b5edb6504f7839","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T07:02:36.752153Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28449/citation-record","integrity":"/paper/2607.28449/integrity","json":"/paper/2607.28449/citation-record.json","paper":"/paper/2607.28449"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.180458Z","title":"AIME 2024.https://huggingface.co/datasets/AI-MO/aimo-validation-aime,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.180458Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:a3dad75c72428cfb435e285c99dab59ff08ba40ae3c481cee11c632957da9cdc","observation_id":"ddd7fc9e-a4d0-4546-a811-6f358c73364b","resolution":{"observed_at":"2026-07-31T07:02:36.180458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10889","last_updated":"2026-05-11T17:33:28Z","snapshot_observed_at":"2026-08-12T21:27:57.364907Z","submitted_at":"2026-05-11T17:33:28Z","title":"Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10889","snapshot_observed_at":"2026-07-31T07:02:36.204746Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.204746Z"},"links":{"cited_paper":"/paper/2605.10889","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:a2653ce7fb305885e018530ff51e3872b16081d6abb899878ffffd43ed6ce033","observation_id":"0bd79266-7d44-432b-ad48-0a6dd58fc69f","resolution":{"observed_at":"2026-07-31T07:02:36.204746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-17T02:17:22.510859Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-07-31T07:02:36.269245Z","title":"Openthoughts: Data recipes for reasoning models.arXiv preprint arXiv:2506.04178,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.269245Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:abb144db2bd69eabe77ae777c693c9ba8cf04396eb58147a281ffddd87221242","observation_id":"cc5aab60-667a-4dd0-b780-aea286a13b4c","resolution":{"observed_at":"2026-07-31T07:02:36.269245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T07:02:36.281808Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.281808Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:0812d094e04738401e90ca24bcc85c36488d38ac756823d017b4a406c690215a","observation_id":"2cc1a036-9424-4bbf-b503-033469dd48cb","resolution":{"observed_at":"2026-07-31T07:02:36.281808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-08-12T18:49:18.486177Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-07-31T07:02:36.299150Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.299150Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:8efbd320f3943dfb83dc96bab48492b186c6983e2ec2ea1178cd74f95c7dd15d","observation_id":"5909f497-0756-4b3b-ad21-d3661e934ae0","resolution":{"observed_at":"2026-07-31T07:02:36.299150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01679","last_updated":"2026-05-15T06:56:26Z","snapshot_observed_at":"2026-08-15T15:20:51.338738Z","submitted_at":"2025-07-02T13:04:09Z","title":"Blending Supervised and Reinforcement Fine-Tuning with Prefix Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01679","snapshot_observed_at":"2026-07-31T07:02:36.307359Z","title":"Ponti, and Ivan Titov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.307359Z"},"links":{"cited_paper":"/paper/2507.01679","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:cb0d29fffe0e20e128cabeaa782ecaf35b266b2ed0f121579564ac261d9683f6","observation_id":"f0d5da68-1923-4559-a563-0905637bbfdc","resolution":{"observed_at":"2026-07-31T07:02:36.307359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-07-31T07:02:36.316638Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.316638Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:273a4b7c29427bdf80d5ebeca1bec965fc0676e0bf3abd3c59f607f510851ff5","observation_id":"975bbc5e-7d34-4bef-8d83-7775c76450b1","resolution":{"observed_at":"2026-07-31T07:02:36.316638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-31T07:02:36.323569Z","title":"LiveCodeBench: Holistic and contamination free evaluation of large language models for code.arXiv preprint arXiv:2403.07974,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.323569Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:8ef363f9d3ddd54e9e24a435c9833e973a4f5c9b607ce375249b829c38ea3263","observation_id":"2084da83-caa3-4c49-941a-7d1e56ac3087","resolution":{"observed_at":"2026-07-31T07:02:36.323569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-07-31T07:02:36.329502Z","title":"Entropy-aware on-policy distillation of language models.arXiv preprint arXiv:2603.07079,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.329502Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:950a933737c1cf1e2222d1868688774479c8da1b8c0eb185dcf50c10da9ff96a","observation_id":"d38dd32c-7209-41ae-af75-6a61e6b03265","resolution":{"observed_at":"2026-07-31T07:02:36.329502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-16T16:55:23.982163Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-31T07:02:36.338599Z","title":"VinePPO: Refining credit assignment in RL training of LLMs.arXiv preprint arXiv:2410.01679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.338599Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:003f9463c2df9b0367a24c7495f772d5aea758225f3a2ccf29cd16864084e8ec","observation_id":"ee7c5b74-6577-4cb7-87cc-c9ea7e5aa1ab","resolution":{"observed_at":"2026-07-31T07:02:36.338599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-08-14T19:39:25.088761Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13255","snapshot_observed_at":"2026-07-31T07:02:36.350495Z","title":"Respecting self-uncertainty in on-policy self-distillation for efficient LLM reasoning.arXiv preprint arXiv:2605.13255,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.350495Z"},"links":{"cited_paper":"/paper/2605.13255","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:ddd1a6f174496c6fab4890586d8c0956254020a44ab70bc34a6a987845307de8","observation_id":"42a823f1-4c4c-42f4-a412-dc775f6283bb","resolution":{"observed_at":"2026-07-31T07:02:36.350495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.358142Z","title":"Sequence-level knowledge distillation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.358142Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:8e997c34045f990a46cb739aa0733f872a8afcfbadfa27e3cc190e63fa4617b0","observation_id":"45b670b4-ea02-4b7d-afb4-9d72cc8f7a99","resolution":{"observed_at":"2026-07-31T07:02:36.358142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-07-31T07:02:36.364735Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe.arXiv preprint arXiv:2604.13016,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.364735Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:eeaae7fbb2552971b4a8a9bb2e516df4639b0823fe611fa050cf905168d4224b","observation_id":"7862e934-f55d-4afc-820c-8cc32614c136","resolution":{"observed_at":"2026-07-31T07:02:36.364735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-16T14:51:42.615061Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-07-31T07:02:36.374494Z","title":"ReMax: A simple, effective, and efficient reinforcement learning method for aligning large language models.arXiv preprint arXiv:2310.10505,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.374494Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:53d89644d79568744e198648c909769acf3de43d5fb7c5dcb1b92b329739deb0","observation_id":"807dbbc4-4eec-4054-bdb4-cf5469ab7aff","resolution":{"observed_at":"2026-07-31T07:02:36.374494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08310","last_updated":"2026-04-16T14:12:28Z","snapshot_observed_at":"2026-08-16T04:31:31.493497Z","submitted_at":"2026-01-13T07:57:48Z","title":"ORBIT: On-policy Exploration-Exploitation for Controllable Multi-Budget Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08310","snapshot_observed_at":"2026-07-31T07:02:36.381009Z","title":"Orbit: On-policy exploration-exploitation for controllable multi-budget reasoning.arXiv preprint arXiv:2601.08310,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.381009Z"},"links":{"cited_paper":"/paper/2601.08310","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:e82b6269541a751c05f9c060dca27198e26624d517b8fbfa881c640a4da1f28b","observation_id":"03ae4232-676a-4c37-96ab-9431c39276a7","resolution":{"observed_at":"2026-07-31T07:02:36.381009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-31T07:02:36.397596Z","title":"DeepSeek-V3 technical report.arXiv preprint arXiv:2412.19437,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.397596Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:ba9b34eb313c22358a8108dbbed7a71293f02f762743e049e88a5b5b152ef269","observation_id":"bbb182fe-34e0-412a-a434-eec9270291e4","resolution":{"observed_at":"2026-07-31T07:02:36.397596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.405842Z","title":"UFT: Unifying supervised and reinforcement fine-tuning.arXiv preprint arXiv:2505.16984, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.405842Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:20187ff6559218f5a765122da3d85cc7562be48446e45a5abeb300fd9831fdcd","observation_id":"3ff7c33b-6005-4a1b-b8ee-c1adfba11976","resolution":{"observed_at":"2026-07-31T07:02:36.405842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.413600Z","title":"https://thinkingmachines.ai/blog/on-policy-distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.413600Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:d7f4fcc9fafc98cf207afb1e1341e6c46f5afc88c923758ec6af9a86a2fd3fd2","observation_id":"b203fea0-f5bf-4942-a61e-1442a19c46d1","resolution":{"observed_at":"2026-07-31T07:02:36.413600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-13T22:06:45.477681Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-07-31T07:02:36.435051Z","title":"MiniMax-M1: Scaling test-time compute efficiently with lightning attention.arXiv preprint arXiv:2506.13585,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.435051Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:e8c890dd7e2e5515f999c85bf70e5f928a752801a824527e50c5829af7d59686","observation_id":"25a087ab-2523-4016-a877-a14e7cf84415","resolution":{"observed_at":"2026-07-31T07:02:36.435051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.20856","last_updated":"2025-12-24T00:24:05Z","snapshot_observed_at":"2026-08-13T13:01:14.159027Z","submitted_at":"2025-12-24T00:24:05Z","title":"NVIDIA Nemotron 3: Efficient and Open Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.20856","snapshot_observed_at":"2026-07-31T07:02:36.447129Z","title":"Nvidia nemotron 3: Efficient and open intelligence.arXiv preprint arXiv:2512.20856,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.447129Z"},"links":{"cited_paper":"/paper/2512.20856","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:b3dcc8da92ae4ba38f0f78e8c1c3b41659ed04f71c8bc1a1bddc8c6e2d2f585b","observation_id":"ae4651e4-33f5-43b2-9cd1-451b62bcc1d0","resolution":{"observed_at":"2026-07-31T07:02:36.447129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.457390Z","title":"AIME 2025.https://github.com/open-compass/opencompass,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.457390Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:0cfeb8dda24b6543bb4ab3ee705f0531303bdf0ceff23414956f89c6da731a69","observation_id":"f19ca90c-1a11-44d1-8095-362418d35de6","resolution":{"observed_at":"2026-07-31T07:02:36.457390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.476557Z","title":"Revealing the power of post-training for small language models via knowledge distillation.arXiv preprint arXiv:2509.26497,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.476557Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:3d4207cf0e1fa1032bda11ce717144456a5edbfc9ffd14e67098f7f5bc5f08a1","observation_id":"89a053cc-c1f2-4931-8fd0-2c31e75c0ac3","resolution":{"observed_at":"2026-07-31T07:02:36.476557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-31T07:02:36.483077Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.483077Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:89fc01c5abec4d33fe61d2dca38786968a51c63cf30f4608baae8b7aa8663e12","observation_id":"9cfac691-02da-416c-82de-29742d00f830","resolution":{"observed_at":"2026-07-31T07:02:36.483077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04259","last_updated":"2025-09-04T14:38:08Z","snapshot_observed_at":"2026-08-16T22:58:22.322439Z","submitted_at":"2025-09-04T14:38:08Z","title":"RL's Razor: Why Online Reinforcement Learning Forgets Less","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04259","snapshot_observed_at":"2026-07-31T07:02:36.508401Z","title":"Rl’s razor: Why online reinforcement learning forgets less.arXiv preprint arXiv:2509.04259,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.508401Z"},"links":{"cited_paper":"/paper/2509.04259","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:a0a97220f8a27b2d7b536d8f18cf08db9c60dab27e2737d7ecb48994074b4a6a","observation_id":"49ee137f-c17f-450c-9951-754fbe620e4d","resolution":{"observed_at":"2026-07-31T07:02:36.508401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-15T04:42:50.651833Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-07-31T07:02:36.515784Z","title":"Self-distillation enables continual learning.arXiv preprint arXiv:2601.19897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.515784Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:1d141d81298602397c2ba741162b72759b0415b07bb054557aaa757945b3d867","observation_id":"8cccce64-d684-4371-acfd-817a38490354","resolution":{"observed_at":"2026-07-31T07:02:36.515784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-31T07:02:36.526619Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.526619Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:641fae463434741f3e43525dee92cf9348b07c32653bbde0bf3a9a4a2fbe41e1","observation_id":"deef98bc-7504-47bb-a9d0-3f9df3ab35df","resolution":{"observed_at":"2026-07-31T07:02:36.526619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-07-31T07:02:36.537240Z","title":"A survey of on-policy distillation for large language models.arXiv preprint arXiv:2604.00626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.537240Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:fd1336da74f262ea272d4c013bdc09b573fb77ba6d8a46a06992c427b58b8078","observation_id":"a5d7d686-12d0-4d27-a4c7-8346910dee3b","resolution":{"observed_at":"2026-07-31T07:02:36.537240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17497","last_updated":"2026-05-17T15:14:24Z","snapshot_observed_at":"2026-08-15T19:35:05.302488Z","submitted_at":"2026-05-17T15:14:24Z","title":"Self-Supervised On-Policy Distillation for Reasoning Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17497","snapshot_observed_at":"2026-07-31T07:02:36.563876Z","title":"Self-supervised on-policy distillation for reasoning language models.arXiv preprint arXiv:2605.17497,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.563876Z"},"links":{"cited_paper":"/paper/2605.17497","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:2033fe2e8b3657f1745cafb2c410edb184fd5796038e14c020beccf5ead9c8ad","observation_id":"7dc31d68-6bdc-4893-bc14-e94e6b49a585","resolution":{"observed_at":"2026-07-31T07:02:36.563876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-08-15T22:38:53.825110Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-07-31T07:02:36.571677Z","title":"Kimi k1.5: Scaling reinforcement learning with LLMs.arXiv preprint arXiv:2501.12599,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.571677Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:08051c7db2e991438fa1d5e2da990392f301e9679f1bc6448382812c98bd3006","observation_id":"3e67e821-e832-4136-961d-3518d6577db3","resolution":{"observed_at":"2026-07-31T07:02:36.571677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-07-31T07:02:36.581125Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.581125Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:537d6d6b2a654e94577375a7c6821616d93be32ae72e1b6561159da7154cae8e","observation_id":"b99a255f-b801-4986-9efa-96857d746678","resolution":{"observed_at":"2026-07-31T07:02:36.581125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.26844","last_updated":"2026-05-26T10:56:46Z","snapshot_observed_at":"2026-08-08T04:38:50.480074Z","submitted_at":"2026-05-26T10:56:46Z","title":"Not All Disagreement Is Learnable: Token Teachability in On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.26844","snapshot_observed_at":"2026-07-31T07:02:36.592457Z","title":"Not all disagreement is learnable: Token teachability in on-policy distillation.arXiv preprint arXiv:2605.26844,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.592457Z"},"links":{"cited_paper":"/paper/2605.26844","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:aea1c9ee3071e3ac26b3a8530abf44c042c16684b21d4a62823d0344bde3e108","observation_id":"0d7ae3d3-3481-46ce-831b-d24f80758b7a","resolution":{"observed_at":"2026-07-31T07:02:36.592457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-16T21:35:51.236868Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-07-31T07:02:36.604808Z","title":"Yecheng Wu, Song Han, and Han Cai","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.604808Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:d827ba152cad2a3e03f525d96a2ca3c3b0c2e83f055194df5e0204772732cfcd","observation_id":"6c910826-67b5-4b69-8fe3-5f187761628a","resolution":{"observed_at":"2026-07-31T07:02:36.604808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02780","last_updated":"2026-01-08T05:52:17Z","snapshot_observed_at":"2026-08-14T07:48:23.313445Z","submitted_at":"2026-01-06T07:31:47Z","title":"MiMo-V2-Flash Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02780","snapshot_observed_at":"2026-07-31T07:02:36.615441Z","title":"Mimo-v2-flash technical report.arXiv preprint arXiv:2601.02780,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.615441Z"},"links":{"cited_paper":"/paper/2601.02780","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:be5cdedb2431a6da3170be5bed300dc966f487a58341f0d38cf847392dbe5a2c","observation_id":"a39875db-6500-42a1-a564-561822931b6d","resolution":{"observed_at":"2026-07-31T07:02:36.615441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22600","last_updated":"2026-06-26T02:45:32Z","snapshot_observed_at":"2026-08-08T07:09:29.965305Z","submitted_at":"2026-06-21T17:20:21Z","title":"On the Position Bias of On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22600","snapshot_observed_at":"2026-07-31T07:02:36.635289Z","title":"On the position bias of on-policy distillation.arXiv preprint arXiv:2606.22600,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.635289Z"},"links":{"cited_paper":"/paper/2606.22600","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:a941c73f5833194d93d9ad67a3822696507cd19666f0ecc26e2df185946273d7","observation_id":"a7ab9de9-2145-472b-89ed-1c45fef0917f","resolution":{"observed_at":"2026-07-31T07:02:36.635289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09304","last_updated":"2026-06-08T10:11:58Z","snapshot_observed_at":"2026-08-12T23:31:46.629708Z","submitted_at":"2026-06-08T10:11:58Z","title":"SG-OPD: Sign-Gated On-Policy Distillation via Sign-Consistency Gating and Phased Teacher Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09304","snapshot_observed_at":"2026-07-31T07:02:36.646126Z","title":"SG-OPD: Sign-gated on-policy distillation via sign-consistency gating and phased teacher sampling.arXiv preprint arXiv:2606.09304,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.646126Z"},"links":{"cited_paper":"/paper/2606.09304","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:356f663d26169611144efb273b2160b7027ee4fb3a7bb1c6d8b20cb8a9b477f5","observation_id":"77ac798f-70e1-4acb-a73f-48793c51da64","resolution":{"observed_at":"2026-07-31T07:02:36.646126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14945","snapshot_observed_at":"2026-07-31T07:02:36.654879Z","title":"Learning to reason under off-policy guidance.arXiv preprint arXiv:2504.14945,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.654879Z"},"links":{"cited_paper":"/paper/2504.14945","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:b7ef90761bbceb05cb2909088d821a575e49e5b85c2b66d699ec29b0eed2b8ae","observation_id":"afa89616-2045-4e00-a665-2d49fae5c1eb","resolution":{"observed_at":"2026-07-31T07:02:36.654879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-08-14T16:00:41.902820Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-07-31T07:02:36.667873Z","title":"Qwen2.5-Math technical report: Toward mathematical expert model via self-improvement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.667873Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:af47b365b3602d6578a22f5b759fdf4d686df9716fdebf20d20c37e7678b4aa8","observation_id":"588ac625-7646-4f1a-b16a-6753604ab89f","resolution":{"observed_at":"2026-07-31T07:02:36.667873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-31T07:02:36.677529Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.677529Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:ceb4e61e562c4c3194f5752bdd35396d2eff922d283f30d355a53fe91a0af21c","observation_id":"20c6b745-2daf-498b-9e44-a798cab22edd","resolution":{"observed_at":"2026-07-31T07:02:36.677529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-08-16T08:35:41.330991Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-07-31T07:02:36.688543Z","title":"Learning beyond teacher: Generalized on-policy distillation with reward extrapolation.arXiv preprint arXiv:2602.12125, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.688543Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:03e0cbbfd4f83c9ca940f5170b988e8a05f9525270ad563f1d511d81242ed876","observation_id":"185ee781-bb66-4b78-bd75-72e87e492e14","resolution":{"observed_at":"2026-07-31T07:02:36.688543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-07-31T07:02:36.698238Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.698238Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:e68573ef8e9c327542101ce5a4f2b0df471abe7a61af22888b0df692799bb633","observation_id":"6dbe2b1a-9005-4219-86c6-c9868c18dbe1","resolution":{"observed_at":"2026-07-31T07:02:36.698238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01491","last_updated":"2025-03-03T12:59:25Z","snapshot_observed_at":"2026-08-16T12:53:36.977953Z","submitted_at":"2025-03-03T12:59:25Z","title":"What's Behind PPO's Collapse in Long-CoT? Value Optimization Holds the Secret","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01491","snapshot_observed_at":"2026-07-31T07:02:36.706606Z","title":"What’s behind PPO’s collapse in long-CoT? value optimization holds the secret.arXiv preprint arXiv:2503.01491,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.706606Z"},"links":{"cited_paper":"/paper/2503.01491","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:6c81a55e5385b03f08898de68c6de6065cf463b57fc7703cb38937ab72a7bf66","observation_id":"eef9deb5-9289-4a84-8567-56f20e255c95","resolution":{"observed_at":"2026-07-31T07:02:36.706606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-08-14T14:03:15.178702Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-07-31T07:02:36.717884Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.717884Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:6cd324d4e01f519d6b36b424dbf4fc1d22d26bbb685cd7f78a8bbfd389023c3e","observation_id":"01e5a407-f9da-4655-ae0e-699014a21359","resolution":{"observed_at":"2026-07-31T07:02:36.717884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T07:02:36.725703Z","title":"On-policy RL meets off-policy experts: Harmonizing supervised fine-tuning and reinforcement learning via dynamic weighting.arXiv preprint arXiv:2508.11408,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.725703Z"},"links":{"citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:4a3f474bdb3606c03a681cb8995d3afec4d20ab0a254149d22076a07a8c0fb9c","observation_id":"cc9009ee-bca9-460e-8e6a-5dcf8a00d7c2","resolution":{"observed_at":"2026-07-31T07:02:36.725703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22495","last_updated":"2026-06-17T23:32:06Z","snapshot_observed_at":"2026-08-14T08:55:14.515646Z","submitted_at":"2026-02-26T00:20:39Z","title":"Reinforcement-aware Knowledge Distillation for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22495","snapshot_observed_at":"2026-07-31T07:02:36.733843Z","title":"Reinforcement-aware knowledge distillation for LLM reasoning.arXiv preprint arXiv:2602.22495,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.733843Z"},"links":{"cited_paper":"/paper/2602.22495","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:2f0ceaf6639013145cf8f375d5493ab03dd65f191dcce7132a1ea9b7a7e1f7d3","observation_id":"6fb05be9-1614-43c3-8c22-408743b5e0a0","resolution":{"observed_at":"2026-07-31T07:02:36.733843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-07-31T07:02:36.741652Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models.arXiv preprint arXiv:2601.18734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.741652Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:5534e2e3ad74ce35b5c080523f4b67f126b77f0473fb626b2caf30fc2929ccb1","observation_id":"c92d4674-260a-4c38-99d5-528589902195","resolution":{"observed_at":"2026-07-31T07:02:36.741652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-15T00:49:38.146652Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-07-31T07:02:36.752153Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.752153Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:630f7f8d3a216f3d3858f529eac1c3e8bfa37dfed237c877afa2dfa71b59a392","observation_id":"911d5221-e152-47a5-a0ad-af83f2ee42b4","resolution":{"observed_at":"2026-07-31T07:02:36.752153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-16T04:57:30.418363Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-31T07:02:36.290410Z","title":"REINFORCE++: A simple and efficient approach for aligning large language models.arXiv preprint arXiv:2501.03262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.290410Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:ebd45692320615c3499cff0749a0d65bb9362cf48163e2ea45e63f42ef88e9c8","observation_id":"05df5b25-d605-4c24-803e-01617e1caa9e","resolution":{"observed_at":"2026-07-31T07:02:36.290410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T07:02:36.494758Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.494758Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:b0ea78f61cf01eb4d9ec860328d08544cfa707c5a9153dfebff3e8e7955d4467","observation_id":"7ee3de70-d338-4fa4-8329-73a1ae80d57c","resolution":{"observed_at":"2026-07-31T07:02:36.494758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-08-17T04:59:59.434643Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-07-31T07:02:36.247026Z","title":"Ganqu Cui, Lifan Yuan, Zefan Wang, Hanbin Wang, Yuchen Zhang, Jiacheng Chen, Wendi Li, Bingxiang He, Yuchen Fan, Tianyu Yu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.247026Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:4aa4d7654c075ca13d642f75df9e81597fd119e4e8d10fa939b1723eae6c2af7","observation_id":"fcc3823e-a6b5-41ca-ae76-9a21050b90c0","resolution":{"observed_at":"2026-07-31T07:02:36.247026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-07-31T07:02:36.469715Z","title":"Privileged information distillation for language models.arXiv preprint arXiv:2602.04942,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.469715Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:c7d0231349c1eec4b06612a0b05fef8a2d6c05679e2cf227ea8fa16aa9c6fba8","observation_id":"b30ab58f-eed9-4e45-8784-87573d40aa35","resolution":{"observed_at":"2026-07-31T07:02:36.469715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-07-31T07:02:36.260317Z","title":"Revisiting on-policy distillation: Empirical failure modes and simple fixes.arXiv preprint arXiv:2603.25562,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.260317Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:be6e0e977406e55e684940b4932bdf28670d65be4fd098df5a4a50edacfd5f16","observation_id":"41570081-83f2-4aaf-b8ca-184ecb71579d","resolution":{"observed_at":"2026-07-31T07:02:36.260317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-31T07:02:36.170111Z","title":"Back to basics: Revisiting REINFORCE-style optimization for learning from human feedback in LLMs.arXiv preprint arXiv:2402.14740,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.170111Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:26ac970ec90637cbeae6b45a7d62e3c9a7d97af9a94de87871e5c2c44cb91cd0","observation_id":"8c070f38-ab33-438f-a32f-01cbf65e2b24","resolution":{"observed_at":"2026-07-31T07:02:36.170111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06948","last_updated":"2026-05-30T09:01:09Z","snapshot_observed_at":"2026-08-17T09:50:58.992945Z","submitted_at":"2025-09-08T17:58:02Z","title":"Beyond Two-Stage Training: Cooperative SFT and RL for LLM Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06948","snapshot_observed_at":"2026-07-31T07:02:36.233742Z","title":"Beyond two-stage training: Cooperative SFT and RL for LLM reasoning.arXiv preprint arXiv:2509.06948, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.233742Z"},"links":{"cited_paper":"/paper/2509.06948","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:ee3020badc882736cd76bde9b5dc14e8235a11d58b93241be1937d7f5b54a179","observation_id":"4395ab5a-1095-460b-ab01-5d9f6faca5e6","resolution":{"observed_at":"2026-07-31T07:02:36.233742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-07-31T07:02:36.224134Z","title":"MathArena: Evaluating LLMs on uncontaminated math competitions.arXiv preprint arXiv:2505.23281,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-07-31T07:02:36.224134Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2607.28449"},"observation_digest":"sha256:79aec2878734049437455737869f20e2afb763e6edff7d41ce7aac1577aff370","observation_id":"9884baaf-7536-45d6-9bb8-5a78833016be","resolution":{"observed_at":"2026-07-31T07:02:36.224134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28449","last_updated":"2026-07-30T16:17:15Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T10:47:03.640978Z","submitted_at":"2026-07-30T16:17:15Z","title":"Lightning OPD 2.0: Mitigating Style Bias in Cross-Teacher On-Policy Distillation for Large Reasoning Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2607.28449."}