{"as_of":"2026-08-20T11:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9831f51487ad9b67b00cece72d5335d32332a38130aca13d0efcca298490bf43","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:07:21.979088Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13040/citation-record","integrity":"/paper/2608.13040/integrity","json":"/paper/2608.13040/citation-record.json","paper":"/paper/2608.13040"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.460667Z","title":"Latent reasoning with supervised thinking states, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.460667Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:1106fd182c8e8f7bfbae1a0301b4aaec96e5958f87b1bd020ed2452bd1b39f6c","observation_id":"7c7190f5-cfda-4ea1-b4b1-2391a5de0d17","resolution":{"observed_at":"2026-08-15T18:07:21.460667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.472778Z","title":"Acebench: Who wins the match point in tool usage?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.472778Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:440c0cee4f5014739e5e75f3cc3352082aa7b31f218a30c200e26c4cad179a88","observation_id":"deb161a0-facb-49b1-b0b1-69237642df89","resolution":{"observed_at":"2026-08-15T18:07:21.472778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.478507Z","title":"Llm latent reasoning as chain of superposition, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.478507Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:7b4ef9690761d04c9f06d732bf55498ce68f6dc02c087df5f683ef5eb7792e8b","observation_id":"b44c165d-5467-4ed5-b584-74c38a557627","resolution":{"observed_at":"2026-08-15T18:07:21.478507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30690","last_updated":"2026-05-29T00:34:40Z","snapshot_observed_at":"2026-08-13T04:37:48.557947Z","submitted_at":"2026-05-29T00:34:40Z","title":"ElasticMem: Latent Memory as a Learnable Resource for LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30690","snapshot_observed_at":"2026-08-15T18:07:21.485094Z","title":"Elasticmem: Latent memory as a learnable resource for llm agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.485094Z"},"links":{"cited_paper":"/paper/2605.30690","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:66f7f423ac3e1e2abae53f139b980f567f61630fcafa57cb6ce5003187d6e168","observation_id":"a0666c69-8cde-4948-abee-bd57ecef85a6","resolution":{"observed_at":"2026-08-15T18:07:21.485094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-17T06:12:37.525438Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-15T18:07:21.497406Z","title":"Training large language models to reason in a continuous latent space, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.497406Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:b338d21aeba58296fb9032462d3b96e91e88e5e3ab2671e461392ad1594b7cd2","observation_id":"632ed565-5478-41e4-bca2-bbea65a24f61","resolution":{"observed_at":"2026-08-15T18:07:21.497406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05505","last_updated":"2026-04-13T08:16:25Z","snapshot_observed_at":"2026-08-19T16:52:42.637302Z","submitted_at":"2026-01-09T03:27:43Z","title":"FlashMem: Distilling Intrinsic Latent Memory via Computation Reuse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05505","snapshot_observed_at":"2026-08-15T18:07:21.508763Z","title":"Flashmem: Distilling intrinsic latent memory via computation reuse, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.508763Z"},"links":{"cited_paper":"/paper/2601.05505","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:5351cc4860a60b0c34e215364fc125a509ac3a3c263b069a7d41d61b283a8d83","observation_id":"4c0370fa-4d2f-4e26-91c1-5b04e3e5ded8","resolution":{"observed_at":"2026-08-15T18:07:21.508763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-08-13T15:28:29.238641Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-15T18:07:21.514324Z","title":"u botter, Frederike L \\","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.514324Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4c9b3b0e548b2b72c826e27cb7bad8171f8883ac38313465314d668c9cedc08f","observation_id":"b9fda6a6-52d6-4c86-8f64-9c9143bfbcc3","resolution":{"observed_at":"2026-08-15T18:07:21.514324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-15T18:07:21.520218Z","title":"LiveCodeBench : Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.520218Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:f27497dca53a6323a8a4527119a6e4ad0864691edb326a1fbc09810d2bc4ed10","observation_id":"88f86fe1-9af1-41a4-bf00-16f281cbc4a8","resolution":{"observed_at":"2026-08-15T18:07:21.520218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23493","last_updated":"2026-05-22T10:55:15Z","snapshot_observed_at":"2026-08-19T01:16:11.902400Z","submitted_at":"2026-05-22T10:55:15Z","title":"EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23493","snapshot_observed_at":"2026-08-15T18:07:21.530418Z","title":"Edge-opd: Internalizing privileged context with evidence guided on-policy distillation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.530418Z"},"links":{"cited_paper":"/paper/2605.23493","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:1d9e5936ab0ac61af1e8367af420401a3085a35783746d53494192af4378e227","observation_id":"8fe77def-2f5b-469d-a5c9-11fc68fe76bb","resolution":{"observed_at":"2026-08-15T18:07:21.530418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-08-16T00:27:04.851196Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-15T18:07:21.542087Z","title":"Rethinking on-policy distillation of large language models: Phenomenology, mechanism, and recipe, 2026 b","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.542087Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:9c8f6aa0c41af22d13d35f26df60ee00c1c0dbf395acfcc64019786996762cfb","observation_id":"d099fe60-f380-4e9c-bafa-27f611dbe907","resolution":{"observed_at":"2026-08-15T18:07:21.542087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-08-15T18:07:21.547240Z","title":"Is your code generated by chatgpt really correct? rigorous evaluation of large language models for code generation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.547240Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:1e37db3dd8453e75f5a8a7071ae20f25d9e46ee18a3c354f9ca2dea468ed7a16","observation_id":"b582c7e7-387c-4ec0-90dc-fbd34e2a40f8","resolution":{"observed_at":"2026-08-15T18:07:21.547240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-16T16:18:35.731432Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-15T18:07:21.558060Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.558060Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:c61a7530ebdfdc4e95ac2ce9ad14508d741fe58b0c9a0528b4abb8ac84a61d9c","observation_id":"05d11c56-495f-4f76-9816-61606b5768c9","resolution":{"observed_at":"2026-08-15T18:07:21.558060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.568162Z","title":"Gonzalez","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.568162Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:8523825c87f4bcccef97fc44855cf59796cb55d86f621883ab887f4b3552a26e","observation_id":"c8616d9e-aa72-42e6-a8d4-dd001e688224","resolution":{"observed_at":"2026-08-15T18:07:21.568162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-08-17T15:29:31.991495Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-15T18:07:21.573005Z","title":"Privileged information distillation for language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.573005Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:9a1d243cef12c64fa676836fdfac4f597c8dd4a9144f103d4f9c4f118ccabf65","observation_id":"681049ca-33c3-44f4-b910-6864eea1494a","resolution":{"observed_at":"2026-08-15T18:07:21.573005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-08-07T16:19:50Z","snapshot_observed_at":"2026-08-15T04:42:50.651833Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-15T18:07:21.584037Z","title":"Self-distillation enables continual learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.584037Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:aec6d51efcfdaa06817ea1514bcc001d5f0c9d8024972b62c2305e658199723d","observation_id":"9148529a-6a28-4441-9acc-56dd2123517e","resolution":{"observed_at":"2026-08-15T18:07:21.584037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00626","last_updated":"2026-06-18T17:00:51Z","snapshot_observed_at":"2026-08-15T00:53:33.148301Z","submitted_at":"2026-04-01T08:32:34Z","title":"A Survey of On-Policy Distillation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00626","snapshot_observed_at":"2026-08-15T18:07:21.589316Z","title":"A survey of on-policy distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.589316Z"},"links":{"cited_paper":"/paper/2604.00626","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:9d5ac447444846c56fc4157e65a01e4ffd174b1efe3c422fd421390c3f5a6224","observation_id":"4b1e072d-a4e0-443e-b19b-b1c2319bf39c","resolution":{"observed_at":"2026-08-15T18:07:21.589316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05808","last_updated":"2026-04-17T17:24:06Z","snapshot_observed_at":"2026-08-11T23:34:58.792221Z","submitted_at":"2026-01-09T14:32:06Z","title":"EnvScaler: Scaling Tool-Interactive Environments for LLM Agent via Programmatic Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05808","snapshot_observed_at":"2026-08-15T18:07:21.594840Z","title":"Envscaler: Scaling tool-interactive environments for llm agent via programmatic synthesis, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.594840Z"},"links":{"cited_paper":"/paper/2601.05808","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:525a20584261e69b745f2eaf02879fdde254e70fd41989081199d47f82929c55","observation_id":"abfda3ad-d7e8-49b2-80d4-ed360b20facc","resolution":{"observed_at":"2026-08-15T18:07:21.594840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.657571Z","title":"D eep C oder: A F ully O pen- S ource 14 B C oder at O 3-mini L evel --- together.ai","venue":null,"work_id":"7fdb02b2-44a7-4d4b-8242-39dd50c5ccc1","year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.600923Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:5f65f6ccd1ec9ee3a74b2c66a5ed49b9f32a9bfe422d12d17963e1326ee662c9","observation_id":"d323f50b-5254-4894-9d0d-6eacf9502abc","resolution":{"observed_at":"2026-08-15T18:07:23.662520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-15T18:07:21.606443Z","title":"Skill-sd: Skill-conditioned self-distillation for multi-turn llm agents, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.606443Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:cf07b13a370ab74cf668a974365073a0e86de954ba7bccba5d05272387628148","observation_id":"5ebc81cd-bf68-4db3-b4fb-d4241175d214","resolution":{"observed_at":"2026-08-15T18:07:21.606443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04624","last_updated":"2024-05-26T23:06:32Z","snapshot_observed_at":"2026-08-19T21:39:52.844100Z","submitted_at":"2024-02-07T07:14:11Z","title":"MEMORYLLM: Towards Self-Updatable Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04624","snapshot_observed_at":"2026-08-15T18:07:21.612655Z","title":"Memoryllm: Towards self-updatable large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.612655Z"},"links":{"cited_paper":"/paper/2402.04624","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:80740692f213e4b4de653d7f91ea55b41efbf874ba23c9a1c3ecdd83e32cf3d0","observation_id":"eb62a44d-f869-49f3-bc43-97b453818a0d","resolution":{"observed_at":"2026-08-15T18:07:21.612655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.623945Z","title":"Tokmem: One-token procedural memory for large language models, 2026 b","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.623945Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:194ade07f91c62adab2cc8618a102aab93cf50e71c6401a5b07fe74bd8aee8ea","observation_id":"c6eed949-21c4-40f9-b396-913a4986448e","resolution":{"observed_at":"2026-08-15T18:07:21.623945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-15T18:07:21.636275Z","title":"Self-distilled rlvr, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.636275Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4a082f711388402b4093577a56accc4e361eb93c1a36288b0df3fa76827fdca1","observation_id":"c4b4ac0d-3354-4214-b22d-88d64287c1e3","resolution":{"observed_at":"2026-08-15T18:07:21.636275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-13T16:28:18.700523Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-15T18:07:21.642141Z","title":"On-policy context distillation for language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.642141Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:14d608927597ed1aced4e2407b82a2214e41a484ee14b4387bfea7cf50df068f","observation_id":"0b96b3e6-7de1-4c24-88f2-e608275d1ef6","resolution":{"observed_at":"2026-08-15T18:07:21.642141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02029","snapshot_observed_at":"2026-08-15T18:07:21.653914Z","title":"The latent space: Foundation, evolution, mechanism, ability, and outlook, 2026 b","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.653914Z"},"links":{"cited_paper":"/paper/2604.02029","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4e9141b841ef3a0acd8a3a9e6bdcb34a7210f2b2348ff48fbea2da323233f418","observation_id":"e3dbc145-0210-4665-a83f-d883e8813c77","resolution":{"observed_at":"2026-08-15T18:07:21.653914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.664916Z","title":"Vismem: Latent vision memory unlocks potential of vision-language models, 2026 d","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.664916Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:6428bb9bd938b2403804687586b6718918f4b1ec06ac11838fecb8c198814a29","observation_id":"5bf8fd67-b42b-4da3-b6ec-de171ad23170","resolution":{"observed_at":"2026-08-15T18:07:21.664916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.677774Z","title":"Memgen: Weaving generative latent memory for self-evolving agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.677774Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:68fc286625e35fe2358016f8edcd3d520bd1483e1340d4e7177907aefd9a1675","observation_id":"d4c77b88-1ca7-429d-8ec6-9ff6e8172638","resolution":{"observed_at":"2026-08-15T18:07:21.677774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-13T14:47:47.249767Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-15T18:07:21.700974Z","title":"Self-distilled reasoner: On-policy self-distillation for large language models, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.700974Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:6ad9d56beb0be4a90c92398493952d2fc3c62a51d9664319e147c2f4f4c33487","observation_id":"316b2f0b-3465-4c01-80b6-7578421c2868","resolution":{"observed_at":"2026-08-15T18:07:21.700974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06203","last_updated":"2025-07-10T16:43:36Z","snapshot_observed_at":"2026-08-20T00:45:07.405584Z","submitted_at":"2025-07-08T17:29:07Z","title":"A Survey on Latent Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06203","snapshot_observed_at":"2026-08-15T18:07:21.706831Z","title":"A survey on latent reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.706831Z"},"links":{"cited_paper":"/paper/2507.06203","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:e8a56cb5e62eb08217bf24e826aa096a1ddf2ef762cd0a7700ae4149c2ab15fa","observation_id":"8695f39d-a451-4966-8ab9-7ef66d48dcac","resolution":{"observed_at":"2026-08-15T18:07:21.706831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.712104Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.712104Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:ae3ccea8c4180647c7f40805ceb9a30ed118655ee9347a6514b41b70e8a42dc7","observation_id":"8d06b17e-9b6e-4b8f-8441-fa7cc49b3323","resolution":{"observed_at":"2026-08-15T18:07:21.712104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.717389Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.717389Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:e61a9a8726c5577f47e42458f532eccf665aa78712864546b61f0c3dc9a842e1","observation_id":"1fc7ecbf-4a30-422e-b0cc-9388558da8d0","resolution":{"observed_at":"2026-08-15T18:07:21.717389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.620141Z","title":null,"venue":null,"work_id":"e9d43c95-a819-421c-9b09-3c634723cb9c","year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.723454Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4296df16872adc0190ced65ea6de00eebc102a8ce3a153efc8063c7c56a37cd5","observation_id":"e6b1e417-6fc9-44cd-9c53-a39e03578b0d","resolution":{"observed_at":"2026-08-15T18:07:23.625254Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.728580Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.728580Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:92f8a9f2ea80e11b2b415f3329b640d79e76dd072b5eb40c151259565713be8e","observation_id":"e1d10a14-f50e-494b-b6aa-42b8e5b9d981","resolution":{"observed_at":"2026-08-15T18:07:21.728580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.733151Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.733151Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:915337b77c8609c18c4bdee7c23d0f2a8ec5331310fa887fc0194fca19606a6b","observation_id":"446c0a45-9304-48fc-8f55-1091acf1c330","resolution":{"observed_at":"2026-08-15T18:07:21.733151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.737778Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.737778Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:7c2842e11438f2f2df8d775cacaefbeef67c6777ba8c3926e22815e54ac491b1","observation_id":"bca2b803-0431-4e52-b2ec-f72e92a1dcfb","resolution":{"observed_at":"2026-08-15T18:07:21.737778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.742410Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.742410Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:1a1e146474c6c73fb811b7b5289b6a25feae4e0cf0e2bc31f9d3483720abeb7a","observation_id":"ffcd1402-9211-45ce-8030-deb9062786a2","resolution":{"observed_at":"2026-08-15T18:07:21.742410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.747111Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.747111Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:1d462fcf0c95c14ce33796f3a7b70124e1e71a7f54a94031e9645279ad92b691","observation_id":"9f411879-0b97-4036-97e3-f56aa5412a4b","resolution":{"observed_at":"2026-08-15T18:07:21.747111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.751588Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.751588Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:9a02c94f2baef42ce0599f40968ff6ced8de6a39759a850735dd176ff2c7a9f6","observation_id":"091ebfb3-7f57-46b1-afbd-de55670df824","resolution":{"observed_at":"2026-08-15T18:07:21.751588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.756017Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.756017Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:f42a3a866f5643dd5eeec1dd42f35e5478c3917a3185ac18e7180af5365e7fcc","observation_id":"26a7dcff-8c77-41ec-a5cf-2338795ca6bd","resolution":{"observed_at":"2026-08-15T18:07:21.756017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.760825Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.760825Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:b64f9491ac63fc2e0468f52461d336289c8402ad82f9670e22b58c28c1009ef2","observation_id":"4b221a8a-7f03-4e4d-b995-6bd2ed720218","resolution":{"observed_at":"2026-08-15T18:07:21.760825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.765454Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.765454Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:d380bd93c3d16bda5dad028eb74254d2066d846cf194d464fbd26d54e4f2d97e","observation_id":"c046bd6d-3f7e-4826-af23-f3549dbf39e1","resolution":{"observed_at":"2026-08-15T18:07:21.765454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.783110Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.783110Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:acd71238124862ab94ee32a2a401216b4f80f0e3efafe5f4bfca4e49664ef003","observation_id":"feb67bf5-bfd6-40cf-af7f-4e7398b0098a","resolution":{"observed_at":"2026-08-15T18:07:21.783110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.788449Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.788449Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:f3edc75a2c67d96264d9b99278f44f067d9d2e25767a96acd5b2bf4d63fc107e","observation_id":"16e94d81-814b-4b58-a9c7-0fef7b625779","resolution":{"observed_at":"2026-08-15T18:07:21.788449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.794886Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.794886Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:2e069765ced12e6fb36986950f0f4b3957077297bb29111f4cebb38103d0fa0f","observation_id":"152db719-a30c-4fe3-9d5b-9938f9856128","resolution":{"observed_at":"2026-08-15T18:07:21.794886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.799866Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.799866Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:1913af48756e6d26586ae8197085b219a183382e62da1e45e8c972d4c15780fc","observation_id":"66b3d4dd-2a26-41bf-b233-1179d3222b6a","resolution":{"observed_at":"2026-08-15T18:07:21.799866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.460244Z","title":"2026 , eprint=","venue":null,"work_id":"06e9c9dc-d8d0-41ea-b179-ce10bffcf0e3","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.805528Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4f4e1893906ccac792eb0697823e70b13d9fedec06716e2e4848adc8dcb5a071","observation_id":"fca86b7a-11a9-4147-ae2e-246943d02ecf","resolution":{"observed_at":"2026-08-15T18:07:23.465205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-08-14T14:46:28.605827Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-15T18:07:21.810701Z","title":"arXiv preprint arXiv:2603.07079 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.810701Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:2880e36bf8e4ce0d50be1aaba1e80e73d18666576dec436d5db276586b06d636","observation_id":"f42e7fea-f9c0-42af-80e4-97ff48aca1b5","resolution":{"observed_at":"2026-08-15T18:07:21.810701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25562","last_updated":"2026-04-27T06:21:52Z","snapshot_observed_at":"2026-08-14T04:24:49.664082Z","submitted_at":"2026-03-26T15:35:59Z","title":"Revisiting On-Policy Distillation: Empirical Failure Modes and Simple Fixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25562","snapshot_observed_at":"2026-08-15T18:07:21.816121Z","title":"arXiv preprint arXiv:2603.25562 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.816121Z"},"links":{"cited_paper":"/paper/2603.25562","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:baf59842abbabb712202783cc27996bf595257e3f0d556a016d3df346089c2c1","observation_id":"f5e3c3a1-1706-47ec-b172-f70f34b665dd","resolution":{"observed_at":"2026-08-15T18:07:21.816121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13010","last_updated":"2026-05-08T06:38:25Z","snapshot_observed_at":"2026-08-16T21:35:51.236868Z","submitted_at":"2026-04-14T17:44:50Z","title":"Lightning OPD: Efficient Post-Training for Large Reasoning Models with Offline On-Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13010","snapshot_observed_at":"2026-08-15T18:07:21.820751Z","title":"arXiv preprint arXiv:2604.13010 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.820751Z"},"links":{"cited_paper":"/paper/2604.13010","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:0f67b887fb2328457e6745f3c45066b07c70e552c6c3b514e6e1cdfe5be5a248","observation_id":"5f530970-3078-43bb-9e64-f6d124a338e6","resolution":{"observed_at":"2026-08-15T18:07:21.820751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17535","last_updated":"2026-04-19T16:53:56Z","snapshot_observed_at":"2026-08-13T17:23:59.909337Z","submitted_at":"2026-04-19T16:53:56Z","title":"OPSDL: On-Policy Self-Distillation for Long-Context Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17535","snapshot_observed_at":"2026-08-15T18:07:21.826152Z","title":"arXiv preprint arXiv:2604.17535 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.826152Z"},"links":{"cited_paper":"/paper/2604.17535","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:e98674fb803eb5cf5253aabf0c93b1cffee107f14c6a0aacada18fa89e59c02c","observation_id":"4aa680a4-3038-4841-b923-894701ff9aaf","resolution":{"observed_at":"2026-08-15T18:07:21.826152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02994","last_updated":"2026-06-02T08:33:06Z","snapshot_observed_at":"2026-08-14T12:19:00.856841Z","submitted_at":"2026-02-03T02:05:48Z","title":"Video-OPD: Efficient Post-Training of Multimodal Large Language Models for Temporal Video Grounding via On-Policy Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.02994","snapshot_observed_at":"2026-08-15T18:07:21.831197Z","title":"arXiv preprint arXiv:2602.02994 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.831197Z"},"links":{"cited_paper":"/paper/2602.02994","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:92471a026f9025cb981bca73941047b2eac6174470b4260d3f134962e263b1bf","observation_id":"34efa2fa-6ef4-4f29-9177-e46eb2f72010","resolution":{"observed_at":"2026-08-15T18:07:21.831197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.836252Z","title":"arXiv preprint arXiv:2603.24596 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.836252Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:05c0e9b369c75f710432d8ae07ce11b152ca6df31301897ff78c9dd07c8f689a","observation_id":"0a4db570-06b4-4195-a57b-49af745ef65a","resolution":{"observed_at":"2026-08-15T18:07:21.836252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00642","last_updated":"2026-05-10T03:40:15Z","snapshot_observed_at":"2026-08-13T08:42:33.074946Z","submitted_at":"2026-05-01T13:23:26Z","title":"Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00642","snapshot_observed_at":"2026-08-15T18:07:21.841055Z","title":"arXiv preprint arXiv:2605.00642 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.841055Z"},"links":{"cited_paper":"/paper/2605.00642","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:13005321ac2da1b241dba06d949e6bd1e02cb6e000cf0460c0ebd9c4066f174d","observation_id":"33ec4a57-dec0-455e-b047-2664f7e109bb","resolution":{"observed_at":"2026-08-15T18:07:21.841055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-08-18T02:42:18.339617Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18740","snapshot_observed_at":"2026-08-15T18:07:21.845683Z","title":"arXiv preprint arXiv:2605.18740 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.845683Z"},"links":{"cited_paper":"/paper/2605.18740","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:ed94f513db953406778a6b4e7b20f83833c528c938405b3664de0abef642687c","observation_id":"e9a6246d-f1e4-44ed-b679-28e597b1f8aa","resolution":{"observed_at":"2026-08-15T18:07:21.845683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21924","last_updated":"2026-05-21T02:48:36Z","snapshot_observed_at":"2026-08-16T21:45:56.892632Z","submitted_at":"2026-05-21T02:48:36Z","title":"Visual-Advantage On-Policy Distillation for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21924","snapshot_observed_at":"2026-08-15T18:07:21.850549Z","title":"arXiv preprint arXiv:2605.21924 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.850549Z"},"links":{"cited_paper":"/paper/2605.21924","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:89572573a27fd989e5c91ae8d3b93b5afdecb1e042edfddee720f4eccbd639d6","observation_id":"27e522e6-8441-479a-9648-e3fb528a320e","resolution":{"observed_at":"2026-08-15T18:07:21.850549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12002","last_updated":"2026-06-11T04:21:23Z","snapshot_observed_at":"2026-08-11T06:47:39.541564Z","submitted_at":"2026-04-13T19:46:55Z","title":"Self-Distillation Zero: Self-Revision Turns Binary Rewards into Dense Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12002","snapshot_observed_at":"2026-08-15T18:07:21.855844Z","title":"arXiv preprint arXiv:2604.12002 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.855844Z"},"links":{"cited_paper":"/paper/2604.12002","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:6ccd59478fdd55a0b602bb375eeaef6130782e7142fbd7fa84c6e2a660730907","observation_id":"67afc5a3-6c56-4506-aac7-f9c4a8ac3f70","resolution":{"observed_at":"2026-08-15T18:07:21.855844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12652","last_updated":"2026-06-01T07:33:52Z","snapshot_observed_at":"2026-08-11T13:23:10.571972Z","submitted_at":"2026-05-12T18:57:44Z","title":"Multi-Rollout On-Policy Distillation via Peer Successes and Failures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12652","snapshot_observed_at":"2026-08-15T18:07:21.861040Z","title":"arXiv preprint arXiv:2605.12652 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.861040Z"},"links":{"cited_paper":"/paper/2605.12652","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:ae1f700b35ddb8979822e9722916e9e69d761d4426f3ea2219519d70ec8699db","observation_id":"5e22f332-eca7-4131-a3fe-ac7514400094","resolution":{"observed_at":"2026-08-15T18:07:21.861040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12741","last_updated":"2026-05-12T20:46:05Z","snapshot_observed_at":"2026-08-18T01:39:18.596016Z","submitted_at":"2026-05-12T20:46:05Z","title":"Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation","version":1},"cited_work":{"arxiv_id":"2605.12741","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12741","snapshot_observed_at":"2026-08-15T18:07:22.163555Z","title":"Learning with Rare Success but Rich Feedback via Reflection-Enhanced Self-Distillation","venue":"cs.LG","work_id":"ce745dda-aab5-482d-b26d-717a5e5c8df2","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.865865Z"},"links":{"cited_paper":"/paper/2605.12741","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:bac60afb1f316f1a3c6038e732badbde370f21464112383935736a6bee2a187f","observation_id":"1f48a089-2137-4844-a432-c1c4db65606b","resolution":{"observed_at":"2026-08-15T18:07:22.170875Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-08-16T02:55:53.932381Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-08-15T18:07:21.870502Z","title":"arXiv preprint arXiv:2606.11709 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.870502Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:f3c1d3afbcfb1dccada8defef0fd912b5435b65cadfc1721d8f4fc48f26d144d","observation_id":"f4511da0-9899-4955-af61-4cf92f00311f","resolution":{"observed_at":"2026-08-15T18:07:21.870502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.874880Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.874880Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:33649feff81bb5a459db1d8fb0b9e6beadd39fac703fadec40deedce9564d3e6","observation_id":"f566d7c0-d957-49c0-8dd9-589c7629376d","resolution":{"observed_at":"2026-08-15T18:07:21.874880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.433572Z","title":"2025 , eprint=","venue":null,"work_id":"eb0f5c66-4764-4a3a-b7ce-299a618af502","year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.879391Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:d38c256a033f26ffed70203df8f24193b41f84e627f4a9e65605a502c083bf8d","observation_id":"8faf9fd2-7dd4-4d2f-a7ed-bb7b917b8fdc","resolution":{"observed_at":"2026-08-15T18:07:23.438341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.417250Z","title":"2026 , eprint=","venue":null,"work_id":"7585481f-80c0-4cbb-ba65-3539d00c8055","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.883934Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:e629bbb2614434c00b64e44553e1e45d49861eec906765c7b65fd4068271ce6c","observation_id":"566583cc-550e-437a-8da8-73421a4209b8","resolution":{"observed_at":"2026-08-15T18:07:23.422551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.400337Z","title":"2026 , eprint=","venue":null,"work_id":"d51fc128-e553-4f8b-951b-47bdfd68a85c","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.888671Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:e3761366cc80bf8c8024133705c11d537c5e9645059fda9329e236736940a527","observation_id":"c70ac836-a4c4-4bda-b268-9f7148fddd11","resolution":{"observed_at":"2026-08-15T18:07:23.405118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30626","last_updated":"2026-06-29T17:55:53Z","snapshot_observed_at":"2026-08-16T09:45:55.312871Z","submitted_at":"2026-06-29T17:55:53Z","title":"DOPD: Dual On-policy Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30626","snapshot_observed_at":"2026-08-15T18:07:21.893408Z","title":"arXiv preprint arXiv:2606.30626 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.893408Z"},"links":{"cited_paper":"/paper/2606.30626","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:0ccd190765a00d42961e3ba6abde0b2b30e0236be5bd141494a4466fde86b35b","observation_id":"817d1874-e60f-4f92-ba85-0080d8336015","resolution":{"observed_at":"2026-08-15T18:07:21.893408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.384472Z","title":"2026 , eprint=","venue":null,"work_id":"754a7f6c-8729-4788-8034-c218a3215643","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.897543Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:02b1dc6fdc6227e932959aa3b816d2f5428f379cbcbcc112b8e28c64521d9e9b","observation_id":"62866f68-35c7-4478-8827-aa584541b72b","resolution":{"observed_at":"2026-08-15T18:07:23.389558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.367768Z","title":"2024 , eprint=","venue":null,"work_id":"2477a19e-8ff3-4e68-960b-8d36f1d49699","year":2024},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.902093Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:a25e10456baa8aa6ba8cedad4af8e62f4cef0d3d68c975682fdef556f98efdce","observation_id":"af0a38cb-b555-4be5-aded-b99ec3e44ae4","resolution":{"observed_at":"2026-08-15T18:07:23.373297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.352315Z","title":"2026 , eprint=","venue":null,"work_id":"388f5102-11e0-4278-9278-10780664fcc0","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.906724Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:8355878f6eccd3699ff448e5e5bb1f3946bbafcef9a9914d6d727c9c5585956d","observation_id":"c2293f26-6eee-4c3f-b8a5-1a9212b32891","resolution":{"observed_at":"2026-08-15T18:07:23.356926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.336937Z","title":"2026 , eprint=","venue":null,"work_id":"52ce7fae-6c4c-48a9-8b2b-3396c0b8e8b7","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.911910Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:31f56f01b465da4e2facf975225bac0a5580b6fb74c4ff69e6822678d30119bc","observation_id":"97122e2c-3592-4dd8-b8e9-ca8b833310e3","resolution":{"observed_at":"2026-08-15T18:07:23.341576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.916569Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.916569Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:eaa812d7fae52132f8158378c9bf8552b7c401b8b0a2005a1c6eb1fc079f7640","observation_id":"063b8297-5572-4acd-b68b-f76027969009","resolution":{"observed_at":"2026-08-15T18:07:21.916569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.310865Z","title":"2026 , eprint=","venue":null,"work_id":"eee4cafa-485b-4425-a427-02513565bca7","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.921068Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:cd770fd876e4ea163048f7a807457ebf88a17e233f60b7c02f5475a728c1ee85","observation_id":"e35a98a1-f92b-4c50-b368-e41c0e2dfeee","resolution":{"observed_at":"2026-08-15T18:07:23.315619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.294687Z","title":"2026 , eprint=","venue":null,"work_id":"c7c622d9-cef8-4283-bd5b-b3ba001fbb2d","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.925615Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:9bf2ef7ad85f0adcae78863e870de34d9433ee5321ba7f20f197651788bc104b","observation_id":"2a88b7c2-f921-457c-9839-f00e1ff957db","resolution":{"observed_at":"2026-08-15T18:07:23.299600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:23.277846Z","title":"2026 , eprint=","venue":null,"work_id":"0b6ca15b-a09f-4d5b-acd7-c983f7bf47d0","year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.930782Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4c7b5b87d21a05544d03d207c88cb11ca4e2bf203c57be298be76c109a91b987","observation_id":"b2b3ef92-fd87-49eb-85be-6fd00a33d1ae","resolution":{"observed_at":"2026-08-15T18:07:23.283365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T18:07:21.935508Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.935508Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:37db91e9e58ca5511be045dff88b5b30a60c4f7a1aece925cb019e7d00f60ef9","observation_id":"86d0cee2-2d77-4093-8102-1d1c74ea6464","resolution":{"observed_at":"2026-08-15T18:07:21.935508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-15T18:07:21.939997Z","title":"arXiv preprint arXiv:2503.19786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.939997Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:2fbad0c1623cd48d304cece6f2520a31815be12d6a1c85c86f4e15350be0ecf4","observation_id":"8ef90602-035c-47c1-ba0a-22bd6d595f9c","resolution":{"observed_at":"2026-08-15T18:07:21.939997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.945225Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.945225Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:314ea28719bd027c3389d6419d154b546248744b813ca6694e9ecbe4fc7b7428","observation_id":"3a215819-3b5f-4015-873c-3cd153853a11","resolution":{"observed_at":"2026-08-15T18:07:21.945225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.949886Z","title":"arXiv preprint arXiv:2501.04694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.949886Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:4d563bbd80b58c112c1ee7600ead43f1424641588dfd019061e28d711b1b01b3","observation_id":"d4fefc7e-a2ef-422c-93f1-008d212a2703","resolution":{"observed_at":"2026-08-15T18:07:21.949886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.954649Z","title":"Gonzalez , booktitle=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.954649Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:8328a8fdb33d6c9adf1a41e66bc5333c7328761acd6e0e476b06cee701f08f93","observation_id":"7f281739-d204-4932-92e7-399dc1dca2f5","resolution":{"observed_at":"2026-08-15T18:07:21.954649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-15T18:07:21.959678Z","title":"arXiv preprint arXiv:2406.12045 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.959678Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:57b18296095c91ac913bc502d7862dc865f4fbd73374fc878275cf98e12b7be5","observation_id":"0f0f3112-9a21-496e-aaf6-5b669f19b6de","resolution":{"observed_at":"2026-08-15T18:07:21.959678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.964766Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.964766Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:913192ca17faf007aef227f4c538e02fc838c0d1429333792f26561a800ee2cd","observation_id":"f3b9d670-7d7b-4513-8373-846089671d1f","resolution":{"observed_at":"2026-08-15T18:07:21.964766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.969464Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.969464Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:5d52bc1c8eb0705c87149295e8495fddade48e523f8fe84b10731da0afda112d","observation_id":"af48c75a-5e48-4da6-9c00-1d94253e0ce4","resolution":{"observed_at":"2026-08-15T18:07:21.969464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:07:21.974039Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.974039Z"},"links":{"citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:0329274e3fc7ae9d8b57f54977f02e171ac706f784ff55e3d3dbf7782af44593","observation_id":"90e0f0fd-a739-4a6f-90ec-0e8e52ac4e49","resolution":{"observed_at":"2026-08-15T18:07:21.974039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T18:07:21.979088Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-15T18:07:21.979088Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.13040"},"observation_digest":"sha256:6b76d22edc2f72fcc928d298b1032eedfc8b136bca50c639be0531b3d396ad7f","observation_id":"8b5d37eb-a51b-4830-97b6-8a7846185f6b","resolution":{"observed_at":"2026-08-15T18:07:21.979088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.13040","last_updated":"2026-08-13T10:05:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T23:46:32.809495Z","submitted_at":"2026-08-13T10:05:51Z","title":"Latent On-Policy Self-Distillation"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":1,"unresolved":67,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 0 inbound Pith citation observations for arXiv:2608.13040."}