{"as_of":"2026-08-09T01:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91afd1ee142f0c253cd01de6e30f722cb98a6f1cd9040c12ae737f6901bb346e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:52:50.045977Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18955/citation-record","integrity":"/paper/2607.18955/integrity","json":"/paper/2607.18955/citation-record.json","paper":"/paper/2607.18955"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:48.502400Z","title":"On-policy distillation of language models: Learning from self-generated mistakes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.502400Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:64364502b38b4686c45f7190933927114f366cd832f2b396762c7763c539bfe7","observation_id":"d5131dbe-76b6-47fe-a677-00b40c88e99e","resolution":{"observed_at":"2026-08-01T13:52:48.502400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:48.586186Z","title":"Minillm: Knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.586186Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:5df385919532a57450d2580111871fc3e99906aab7ed9b9f3c2ba8fdb951c67c","observation_id":"5a9cbc1d-26df-44ba-8a7a-86e97f0ec656","resolution":{"observed_at":"2026-08-01T13:52:48.586186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T13:52:48.656676Z","title":"Deepseek- r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.656676Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:d519f5f4c003950120e1c1fe8c35cbea9ed0de6f38c64a7061a00b7e9e3c9ab3","observation_id":"e1095d9a-0cba-48d4-b4c0-834c5cf64475","resolution":{"observed_at":"2026-08-01T13:52:48.656676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-07-12T21:38:13.191362Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-08-01T13:52:48.709950Z","title":"Self-distillation zero: Self-revision turns binary rewards into dense supervision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.709950Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:b18e75ef31e1c57f4ae8443cefa4bc426172e5d570b4903e254d240b1fa1281b","observation_id":"2d092b8c-e32a-409c-9677-9f0c6d42335d","resolution":{"observed_at":"2026-08-01T13:52:48.709950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19436","last_updated":"2026-05-19T06:46:19Z","snapshot_observed_at":"2026-07-06T23:30:11.337726Z","submitted_at":"2026-05-19T06:46:19Z","title":"CEPO: RLVR Self-Distillation using Contrastive Evidence Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19436","snapshot_observed_at":"2026-08-01T13:52:48.791895Z","title":"Cepo: Rlvr self-distillation using contrastive evi- dence policy optimization.arXiv preprint arXiv:2605.19436, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.791895Z"},"links":{"cited_paper":"/paper/2605.19436","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:29e5bad4db098f44bcc201f34cf87a7bf4d59bb284f1cf1be7996a869b4c87e5","observation_id":"e331cbeb-d053-4a43-b835-8a72ecaea650","resolution":{"observed_at":"2026-08-01T13:52:48.791895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-01T13:52:48.853688Z","title":"Reinforcement learning via self-distillation.arXiv preprint arXiv:2601.20802, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.853688Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:4d80f1e04d7127e894b0f2b875029a829f4bf4f04bb60ddad7546e535fc0d78d","observation_id":"e3442edd-2be9-4665-8dcb-2fe9340600af","resolution":{"observed_at":"2026-08-01T13:52:48.853688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13255","last_updated":"2026-05-13T09:38:20Z","snapshot_observed_at":"2026-07-06T23:24:52.373554Z","submitted_at":"2026-05-13T09:38:20Z","title":"Respecting Self-Uncertainty in On-Policy Self-Distillation for Efficient LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13255","snapshot_observed_at":"2026-08-01T13:52:48.945546Z","title":"Respecting self-uncertainty in on-policy self-distillation for efficient llm rea- soning.arXiv preprint arXiv:2605.13255, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:48.945546Z"},"links":{"cited_paper":"/paper/2605.13255","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:68e0919606746021f95101502c14474187cf6a01d2ad175f137fb80496a6fc7e","observation_id":"15a11971-8ffd-48eb-b8f1-98751d0ce6e1","resolution":{"observed_at":"2026-08-01T13:52:48.945546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:49.029539Z","title":"Uni- fying group-relative and self-distillation policy optimization via sample routing.arXiv preprint arXiv:2604.02288, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.029539Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:2f32faba6e110e482539950389aef3c99f49dd48a54487d4e702c86e73c17f68","observation_id":"f0c3f777-8e39-45b3-890d-6ff742a3fd0f","resolution":{"observed_at":"2026-08-01T13:52:49.029539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23383","last_updated":"2025-03-30T10:16:25Z","snapshot_observed_at":"2026-08-07T20:40:27.882593Z","submitted_at":"2025-03-30T10:16:25Z","title":"ToRL: Scaling Tool-Integrated RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23383","snapshot_observed_at":"2026-08-01T13:52:49.091047Z","title":"Torl: Scaling tool-integrated rl.arXiv preprint arXiv:2503.23383, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.091047Z"},"links":{"cited_paper":"/paper/2503.23383","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:bfc4164aa6ac9d581f5d0b50167941f57eda9ff25dec1c6e0dd8f52d3d015f34","observation_id":"e8d2fc97-d1e1-45c2-985b-edf2ec06025b","resolution":{"observed_at":"2026-08-01T13:52:49.091047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:49.183145Z","title":"On-policy distillation.Think- ing Machines Lab: Connectionism, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.183145Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:1ba6e3380193aad15a3567b2ffa67bbf371b9c28196c958b57f7e1b66f1efc36","observation_id":"9a5b09ea-f996-4709-8787-75471d4942ff","resolution":{"observed_at":"2026-08-01T13:52:49.183145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:49.233869Z","title":"Toolrl: Reward is all tool learning needs.Advances in Neural Information Processing Systems, 38:105523–105553, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.233869Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:e310b978c25227fc347aaf26d470580f2983d72ee1fc499efaf164155a3071cb","observation_id":"e4e98353-b766-4dd7-8341-bfd0eca2f839","resolution":{"observed_at":"2026-08-01T13:52:49.233869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T13:52:49.318427Z","title":"Deepseekmath: Pushing the limits of mathemat- ical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.318427Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:ef50e9b4b6e586170fa4055fa5a49ee9a9251d9811e10005823a73d22f016e11","observation_id":"05194f46-f4da-41c5-ae84-c648e00c0791","resolution":{"observed_at":"2026-08-01T13:52:49.318427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-01T13:52:49.395605Z","title":"Self-distillation enables con- tinuallearning.arXiv preprint arXiv:2601.19897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.395605Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:e715ef3c8b88edbaf8c010e177cb33db0f3e9b02781a39cf7195214695b80592","observation_id":"00595e38-4215-4897-b4ac-3cb8dcc77764","resolution":{"observed_at":"2026-08-01T13:52:49.395605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:49.453792Z","title":"Gates: Self-distillation under privileged con- text with consensus gating.arXiv preprint arXiv:2602.20574, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.453792Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:377ccf63541fd504cfa9696b555153afda1a17e4b26538fa8b572f1f1b65739d","observation_id":"e6cc269f-a96a-49f0-aa29-8cb4a4eb6e09","resolution":{"observed_at":"2026-08-01T13:52:49.453792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-01T13:52:49.510810Z","title":"Kimi k2.5: Visual agentic intelligence.arXiv preprint arXiv:2602.02276, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.510810Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:7275481ada0acbc070880a4b4682a95189c5c6e3630becd3e265b5ae0e43a143","observation_id":"95dbc2be-45c0-4d47-97c8-211ed39a0326","resolution":{"observed_at":"2026-08-01T13:52:49.510810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T13:52:49.566182Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.566182Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:d481aad5ff1b1774c75d18741fd4453c4fdc13299d00f04fa181dbe78f22c9d7","observation_id":"929a727b-311c-497e-b7a1-c790f0df8aa9","resolution":{"observed_at":"2026-08-01T13:52:49.566182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-01T13:52:49.623987Z","title":"Self- distilled rlvr.arXiv preprint arXiv:2604.03128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.623987Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:3dc2cda596fd528697f648114cc8ba2de15e57e28e1ad0fca27701af05bcf303","observation_id":"6e4a0a7f-1a28-4f09-a16c-fb786e6c38b0","resolution":{"observed_at":"2026-08-01T13:52:49.623987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-08T15:46:07.719139Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-01T13:52:49.709438Z","title":"On-policy context distilla- tion for language models.arXiv preprint arXiv:2602.12275, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.709438Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:19690892c0a320d7568a88bf69c2df0fe0bd2f6d0de50e40e4f1905b047a7e73","observation_id":"ca8b193c-0077-4fd7-8d9b-838b11680538","resolution":{"observed_at":"2026-08-01T13:52:49.709438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:49.775645Z","title":"Dapo: An open-source llm reinforcement learn- ing system at scale.Advances in Neural Infor- mation Processing Systems, 38:113222–113244,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.775645Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:843779464f0a0bf566a4b4cd7ad035ccd71971d05a88397918112f4436d86bf6","observation_id":"3ba5e344-b0ff-4942-a3ce-979918ae3cec","resolution":{"observed_at":"2026-08-01T13:52:49.775645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-01T13:52:49.879899Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.879899Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:c226fdab97842a07aa51eabc703124a7374200a9eaa9a9871acf1a9f2a85fe02","observation_id":"6fc3b204-c45f-4fd7-96b2-303a9cc1f675","resolution":{"observed_at":"2026-08-01T13:52:49.879899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-01T13:52:49.965863Z","title":"Self-distilled reasoner: On-policy self- distillation for large language models.arXiv preprint arXiv:2601.18734, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.965863Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:4cf25f66b123b96de13b80848d48a63f47686b785817a21d08de9f23fb3b008f","observation_id":"448d18c9-babe-4802-9c75-3608a7354dcc","resolution":{"observed_at":"2026-08-01T13:52:49.965863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-06T04:31:03.113409Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T13:52:50.045977Z","title":"Group sequence policy optimization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:50.045977Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:aeda6c978f44cda948e1b2a7e92aff4c443d412cfeb7be162459eb32c90ae991","observation_id":"6905abb9-786c-4a81-ad23-4e3281f4dd3f","resolution":{"observed_at":"2026-08-01T13:52:50.045977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T13:52:49.826967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:49.826967Z"},"links":{"citing_paper":"/paper/2607.18955"},"observation_digest":"sha256:377b3dd9b5c25aa9607a46f976cc749a07f1f98dbcaf244d691c88b642fe525a","observation_id":"0697a77c-2766-41f0-8637-356a0838c149","resolution":{"observed_at":"2026-08-01T13:52:49.826967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18955","last_updated":"2026-07-21T10:47:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T21:39:44.303785Z","submitted_at":"2026-07-21T10:47:27Z","title":"H$^2$SD: Hybrid Hindsight Self-Distillation"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.18955."}