{"as_of":"2026-08-07T00:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a6daacb1813963218abb51dd40c03b157aa7bd77b4ed12a37a44efaff319e27a","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T22:02:34.908623Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01735/citation-record","integrity":"/paper/2608.01735/integrity","json":"/paper/2608.01735/citation-record.json","paper":"/paper/2608.01735"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:41.381411Z","title":null,"venue":null,"work_id":"6e759486-2324-4986-8545-7302ad0f7920","year":2024},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.520379Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:339ad060f630c43513933c593a07159b20d866180c475324589ff299096575ca","observation_id":"fd9ee138-0d6d-4801-8735-16500a80df30","resolution":{"observed_at":"2026-08-04T22:02:41.463301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-03T02:41:13.331563Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-04T22:02:27.661096Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.661096Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:36fce07e02912cfa2bdf406b7b7a2b06356a3a68132b3d84b96469a84f0e402f","observation_id":"2c280d55-603b-4ef7-a510-eb3ac9752d14","resolution":{"observed_at":"2026-08-04T22:02:27.661096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:41.107554Z","title":null,"venue":null,"work_id":"356f3f55-f77a-4a8b-a965-208e17944dc8","year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.734983Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:0a148aad2c243f36a1b0bdc3c0568336831e1983ca761601c0144e97abfb7049","observation_id":"1fd93afb-c245-41ce-a782-c4c11764b513","resolution":{"observed_at":"2026-08-04T22:02:41.191873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:40.823958Z","title":null,"venue":null,"work_id":"09c9243f-e7ad-44dc-bf2c-12c535fc4eed","year":2021},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.809293Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:ef355a6dea400c55c0891b99b9507b45fa29eb9ca866bc4fbc70dad06fcd3e9c","observation_id":"99620350-7146-46e6-a388-6691595a143a","resolution":{"observed_at":"2026-08-04T22:02:40.953248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:40.654208Z","title":null,"venue":null,"work_id":"17560cdd-38b8-490c-a7d6-2d6b9a8b6a9c","year":2015},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.846252Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:0ce21c90278713579151ea1f5bdd69a2a9098b1bb2c6bf879fa693302160491a","observation_id":"079e1e07-5e97-4f4d-a06d-1b30daf4ed10","resolution":{"observed_at":"2026-08-04T22:02:40.708377Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.03677","last_updated":"2026-07-06T06:34:16Z","snapshot_observed_at":"2026-08-03T02:52:57.588273Z","submitted_at":"2026-05-05T12:15:21Z","title":"Uni-OPD: Unifying On-Policy Distillation with a Dual-Perspective Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.03677","snapshot_observed_at":"2026-08-04T22:02:27.919976Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.919976Z"},"links":{"cited_paper":"/paper/2605.03677","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:2a6b415b0008de22343a95b59a88fa5ba4643d041d8eec9df072370b3627454d","observation_id":"6d2ee75e-7bb1-4c06-8001-c79f56ba967a","resolution":{"observed_at":"2026-08-04T22:02:27.919976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:27.993990Z","title":"J.; Shen, Y.; Wallis, P.; Allen-Zhu, Z.; Li, Y.; Wang, S.; Wang, L.; and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:27.993990Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:8205fc12011284cea8df4f238a723589e2182c00d54b3e77b7b0c7d14696e980","observation_id":"634ac850-3a53-4e88-b0f9-1189e3846743","resolution":{"observed_at":"2026-08-04T22:02:27.993990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:40.423974Z","title":null,"venue":null,"work_id":"c7585969-cfb4-42be-a00c-e6f1850b7a67","year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:28.099892Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:c835d47df2ada8846818511dc5570620c6b630f76c0433e5d53d66ba71b09b8d","observation_id":"a7d882ba-a048-4dc8-836e-abb61205b8ba","resolution":{"observed_at":"2026-08-04T22:02:40.574175Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:40.211828Z","title":null,"venue":null,"work_id":"b90a71e7-8e8f-4903-8102-97d7ea408531","year":2016},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:28.318717Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:f78ef7832bcaaad1bd3dda1d11f97a7729d0daaab9b8b3cc26f92472e940a287","observation_id":"91dcce87-bd1c-4d5e-b10d-84d8bd1b70d8","resolution":{"observed_at":"2026-08-04T22:02:40.306911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:40.029806Z","title":"S.; Reid, M.; Matsuo, Y.; and Iwasawa, Y","venue":null,"work_id":"e73708ac-ab15-4fe5-bb10-ef165c8e58d6","year":2022},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:28.539058Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:a778ccd60079f6fc25f55c172bcc4ec7054cfcddcfe1e4c502ae457d319024cc","observation_id":"f7200dbd-f284-4954-9ed8-03a1358e079f","resolution":{"observed_at":"2026-08-04T22:02:40.098265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:39.878984Z","title":"H.; Gonzalez, J","venue":null,"work_id":"374ae75f-1789-4407-a0e1-14f252212506","year":2023},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:28.652127Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:f1dcd600753562b3fa5d188759aeed1c6f0cd2aeacf1b94fa8dadb532901b77e","observation_id":"9734eba2-2d8e-4d72-aed4-2dccc9265636","resolution":{"observed_at":"2026-08-04T22:02:39.961158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:39.592755Z","title":"J.; Dohan, D.; Dyer, E.; Michalewski, H.; Ramasesh, V","venue":null,"work_id":"36d47407-c7d3-40e2-ad39-0c81377641a2","year":2022},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:28.759707Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:01f4f368fdd02b5ca713f68b1148c415e26619b0360b0d90843674ecf769eea9","observation_id":"3076f9b2-5cdb-4267-97d6-da3bf3b5cd40","resolution":{"observed_at":"2026-08-04T22:02:39.731282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:39.249771Z","title":null,"venue":null,"work_id":"3d4d2f7c-c6d1-419e-acc9-2214f66c7309","year":2024},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:28.943805Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:e0c05fc796c3136953059f532f369541436797f94107be5e03d6efc30a71172d","observation_id":"bd4e0252-1444-43bd-9550-dac75b4b4be0","resolution":{"observed_at":"2026-08-04T22:02:39.372093Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:39.001835Z","title":null,"venue":null,"work_id":"7eeedcd7-f3a9-4c44-9b15-e5a32ccce2b2","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.039718Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:3a7172e8805abc779b7182e68fbfea4130beee142a5225940d1a39172092d25d","observation_id":"8560401b-3655-4cee-ab62-e2aa4a0d155d","resolution":{"observed_at":"2026-08-04T22:02:39.143252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.20643","last_updated":"2026-05-20T03:06:36Z","snapshot_observed_at":"2026-08-03T05:02:30.649585Z","submitted_at":"2026-05-20T03:06:36Z","title":"AVSD: Adaptive-View Self-Distillation by Balancing Consensus and Teacher-Specific Privileged Signals","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.20643","snapshot_observed_at":"2026-08-04T22:02:29.125904Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.125904Z"},"links":{"cited_paper":"/paper/2605.20643","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:d96ac66afd4ec46ffde36c4e7193aee7ed4d7e4b51c5862f8c2c84fa1844fa57","observation_id":"a0128aa3-3600-458a-a733-72b9c87dd52c","resolution":{"observed_at":"2026-08-04T22:02:29.125904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:38.809742Z","title":"G.; Mao, H.; Yan, F.; Ji, C","venue":null,"work_id":"b56df718-e4cf-46bd-8a1d-fecdc47e7fc1","year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.183633Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:35fb2921cc95f174c2750c4a59af2fa8027349f574937562eb305dd1f31e13df","observation_id":"bd715f1d-cbd3-44ec-b1e4-2583716bae93","resolution":{"observed_at":"2026-08-04T22:02:38.850830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:38.586776Z","title":null,"venue":null,"work_id":"a75d42e5-a33a-4b26-a496-f93392dde671","year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.333047Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:381c7b11e273716ae39e7dd586ebc2a1eea785c4a5226c6ffd7de6b30565c7d2","observation_id":"3b5ccb88-f7b0-4e01-8d14-6f93e176c422","resolution":{"observed_at":"2026-08-04T22:02:38.674311Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T22:02:29.394451Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.394451Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:63f9c1c7efeceb84ae50c71d890bf79239e4e099420106936f707056ca0f1cab","observation_id":"46d518ca-8aa5-4e2c-9b3d-0e4031c96637","resolution":{"observed_at":"2026-08-04T22:02:29.394451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02234","last_updated":"2026-07-02T14:33:07Z","snapshot_observed_at":"2026-07-07T00:07:42.752664Z","submitted_at":"2026-07-02T14:33:07Z","title":"Purified OPSD: On-Policy Self-Distillation Without Losing How to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02234","snapshot_observed_at":"2026-08-04T22:02:29.479711Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.479711Z"},"links":{"cited_paper":"/paper/2607.02234","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:d43b4a597223d010512de587e1d75597d2003b90811c9d9de9941b7dbd0b1ad8","observation_id":"0b451118-6a16-4752-bbe6-a925d28cbd0e","resolution":{"observed_at":"2026-08-04T22:02:29.479711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:38.427753Z","title":null,"venue":null,"work_id":"14bc2faa-a948-4f99-b738-7202d60b0aff","year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.633249Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:48925d30728f1e7c1b4996328f5ecce9101fcc25626f1d88ab3908d076591e4e","observation_id":"624d31b5-d5cd-44e7-acce-bc74b08c6f2b","resolution":{"observed_at":"2026-08-04T22:02:38.501279Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29502","last_updated":"2026-07-17T09:23:58Z","snapshot_observed_at":"2026-08-03T00:43:32.504636Z","submitted_at":"2026-06-28T17:02:18Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","version":2},"cited_work":{"arxiv_id":"2606.29502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.29502","snapshot_observed_at":"2026-08-04T22:02:35.274398Z","title":"UCOB: Learning to Utilize and Evolve Agentic Skills via Credit-Aware On-Policy Bidirectional Self-Distillation","venue":"cs.AI","work_id":"9355fc5a-b81b-4539-9cba-2caac453cc1a","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.716042Z"},"links":{"cited_paper":"/paper/2606.29502","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:8a3e670d0a46e18e50988ae8e25657b8caffb68538b4f82d9acb0966342395ed","observation_id":"82a2aaa3-0902-4fa4-84de-5902a066b89b","resolution":{"observed_at":"2026-08-04T22:02:35.366748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:38.194652Z","title":null,"venue":null,"work_id":"ebb72ddc-660c-4f69-84fc-f1fde1755e3e","year":2023},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.802350Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:3ed2ddd70837cfe9c74b0e4fde64b95b271952ff0b651c6e6c4551c867920eb0","observation_id":"ff6ce479-8210-4b90-924a-a950295ca9a6","resolution":{"observed_at":"2026-08-04T22:02:38.291858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:38.010871Z","title":"V.; and Zhou, D","venue":null,"work_id":"b4c83ea5-7cd8-46d1-9a79-d565fde5cf25","year":2022},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.856367Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:2c0927e7d7f1d98841d2dc99299dd5d45561b19fe63cd493a74430913b0934db","observation_id":"2ca2e629-80d2-40f9-b7b0-5bb83f656b6b","resolution":{"observed_at":"2026-08-04T22:02:38.088627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-04T22:02:29.941520Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:29.941520Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:07a5f11b195404f734edd4f4d33c4954dfa55a83e642f37de6725f2d60744ecc","observation_id":"d17628d7-cf85-4e44-8fa9-bcd974b127d5","resolution":{"observed_at":"2026-08-04T22:02:29.941520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T22:02:30.028809Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.028809Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:a9a471f359574ad7f146a47afd16014a9922c9e967902d11469becf5ef198b92","observation_id":"1c3c6761-65ec-48b5-b088-bc6b564a2885","resolution":{"observed_at":"2026-08-04T22:02:30.028809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30626","last_updated":"2026-06-29T17:55:53Z","snapshot_observed_at":"2026-08-04T05:52:55.612701Z","submitted_at":"2026-06-29T17:55:53Z","title":"DOPD: Dual On-policy Distillation","version":1},"cited_work":{"arxiv_id":"2606.30626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.30626","snapshot_observed_at":"2026-08-04T22:02:35.082177Z","title":"DOPD: Dual On-policy Distillation","venue":"cs.AI","work_id":"79843fe7-3f18-41bd-a0a9-c9365a1f209d","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.291643Z"},"links":{"cited_paper":"/paper/2606.30626","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:7d90417e6e26d048879cb77821fc212fca18e22754cdbf94b6febc36ea4bc422","observation_id":"ecfdc1a1-e945-4c0d-bb1b-4cfba3ec899c","resolution":{"observed_at":"2026-08-04T22:02:35.175788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.884390Z","title":null,"venue":null,"work_id":"ab6b97bd-7b9b-4a95-a800-027daeeb9e31","year":2022},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.364340Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:5a865188a0f10f28f35c5bcd1eef3eb374ded782928a077b324ee955d3d11263","observation_id":"6a0718f8-ad46-4335-8be3-53b8da921d01","resolution":{"observed_at":"2026-08-04T22:02:37.928779Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28014","last_updated":"2026-05-27T06:09:29Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T06:09:29Z","title":"ROSD: Reflective On-Policy Self-Distillation for Language Model Reasoning across Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28014","snapshot_observed_at":"2026-08-04T22:02:30.513908Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.513908Z"},"links":{"cited_paper":"/paper/2605.28014","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:1911ac7735c4e2bb1e59d892dd248cd62086491ee3aea09bb9ceb5554940d093","observation_id":"83bc18b7-8f62-4c40-8af9-570efdef245b","resolution":{"observed_at":"2026-08-04T22:02:30.513908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-02T07:46:19.307542Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-04T22:02:30.600069Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.600069Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:4bfb598c0db2c57c784a9f12a486dd4421a8e4e54a57588994aede530b2b6fae","observation_id":"c985242a-0018-4a91-9f62-9429bcbf18ca","resolution":{"observed_at":"2026-08-04T22:02:30.600069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:30.689720Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.689720Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:abaeb1fd790c22adf25944729ef5816736d00517e75fad9c776bc9d8e1f0b549","observation_id":"19773883-04d4-4227-a888-926878a2aff6","resolution":{"observed_at":"2026-08-04T22:02:30.689720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T22:02:30.770433Z","title":"arXiv preprint arXiv:2108.07732 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.770433Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:c97eafa3271bdf6d4ce699192e476f656d1365b4d72bc3f5df33fee322431cde","observation_id":"3d5fc68f-02d0-40b3-94b5-4d4ce0160526","resolution":{"observed_at":"2026-08-04T22:02:30.770433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-04T22:02:30.847653Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.847653Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:377bb210d412080d79e46fe146d36b03e5dfc30a47c77a0dbc58e3268be3cf84","observation_id":"c031cbd2-d4cd-482b-b0c3-84d682cd4022","resolution":{"observed_at":"2026-08-04T22:02:30.847653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-04T22:02:30.931258Z","title":"arXiv preprint arXiv:2107.03374 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:30.931258Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:298996176fdfb7b367c3007c7650ae3a3f09e5df86aa0450b755aeac32653eb1","observation_id":"dfebc8c1-6e4c-4113-9f33-e4a8e0837978","resolution":{"observed_at":"2026-08-04T22:02:30.931258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T22:02:31.016284Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.016284Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:fa52362a06ae82018d76cbc988935732862a27b313389e6006b8d9acc3b45e65","observation_id":"834693ff-d51f-4992-bb37-a278f662713a","resolution":{"observed_at":"2026-08-04T22:02:31.016284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:31.101115Z","title":"Thinking Machines Lab: Connectionism , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.101115Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:a9e97ecd81feb18d5befbbb60154a9c64b2ba36088abbe457f990f786037f925","observation_id":"6b988170-bb5a-48a7-a1cd-81988be8e08e","resolution":{"observed_at":"2026-08-04T22:02:31.101115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-06T08:49:57.295985Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-04T22:02:31.184412Z","title":"arXiv preprint arXiv:2601.18734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.184412Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:fae80c1e9b444f2d00d619d4043e245acccbe69630e8cb87f4bb4b701d335741","observation_id":"8531ec6a-7f32-41aa-a393-2027cbbcadb1","resolution":{"observed_at":"2026-08-04T22:02:31.184412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.705420Z","title":null,"venue":null,"work_id":"7d09a26f-6a3c-4fe0-b7eb-9bcad030799a","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.240090Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:5dccba0a5dba48571997c0e7f3866554b7dc19b23beab0563f56717733481c35","observation_id":"d2bf1540-8fa5-4fab-92bc-667e417b2a11","resolution":{"observed_at":"2026-08-04T22:02:37.761611Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.613044Z","title":"Purified","venue":null,"work_id":"f1f07bb0-4371-4ef1-9e21-086656513e44","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.316917Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:894464c06dbef49b38c9ff2811f9d363cecea56c239cf47ff3df8013038d0969","observation_id":"f9d9c44a-6649-4c7f-8ddd-dc65ab1a2ca1","resolution":{"observed_at":"2026-08-04T22:02:37.651000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04942","last_updated":"2026-02-16T18:57:38Z","snapshot_observed_at":"2026-07-06T22:44:37.993093Z","submitted_at":"2026-02-04T18:46:17Z","title":"Privileged Information Distillation for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04942","snapshot_observed_at":"2026-08-04T22:02:31.427078Z","title":"arXiv preprint arXiv:2602.04942 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.427078Z"},"links":{"cited_paper":"/paper/2602.04942","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:a90a4f4eea56a4721192fc09ced10faef3fbe1656b72479c2c9e4b48db417dfd","observation_id":"0affb3db-dfba-4460-8545-87dfecc7d1ae","resolution":{"observed_at":"2026-08-04T22:02:31.427078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:31.512146Z","title":"NIPS Deep Learning and Representation Learning Workshop , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.512146Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:61869173e624435119e7b623b5071319f2540e5313c1da44e0d0c0b5d80c59b2","observation_id":"56db23c8-e9c8-46b3-8bac-7fbe9a571eee","resolution":{"observed_at":"2026-08-04T22:02:31.512146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:31.569078Z","title":"Measuring Mathematical Problem Solving With the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.569078Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:4893963f7a898fd374d2e74506dbb012924a92ff27085ea5b0fc8dbe1343ced1","observation_id":"01580975-d518-44f8-b7eb-543abff74959","resolution":{"observed_at":"2026-08-04T22:02:31.569078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:31.647147Z","title":"Proceedings of the 2016 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.647147Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:9b9cde86bd791839576dcd6856ba220381b1b7c88c71d94b2912144fa66fce5d","observation_id":"7f04b9e4-5892-4eb6-b209-51a9d2c4c98b","resolution":{"observed_at":"2026-08-04T22:02:31.647147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:31.756879Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.756879Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:5d092ca4832709ddfba46a7d1d0bf2f7033845aabcdeb6f1fc0ce5550548d233","observation_id":"74ec6c5c-7b46-4e17-a160-88cb93d564e6","resolution":{"observed_at":"2026-08-04T22:02:31.756879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.447335Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"122d2337-818d-422f-9fed-f96232eb7ca6","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.842998Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:d34373e657a3334b66c02020f1391b4b7f2393bb6cff274670d81b87d599e722","observation_id":"46387fec-4ad6-4b0f-b2f3-5a14e7a8fdd7","resolution":{"observed_at":"2026-08-04T22:02:37.481599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.339211Z","title":", booktitle=","venue":null,"work_id":"6b3260f6-0ba3-401b-b134-6fcd7f840b6a","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:31.923606Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:3bddd1eabea3fdb869e8840a58e1de7b1dfa518b797cb383100e389d60b87e5e","observation_id":"39071a2c-a850-4629-9ccc-ae605d8ddabe","resolution":{"observed_at":"2026-08-04T22:02:37.385447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.204214Z","title":null,"venue":null,"work_id":"875082f4-d704-49a9-af29-09e267e42733","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.000117Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:0b1cffb9f1862af935887da80189eddaf9151919b5f9739329e11d13a54a12e7","observation_id":"bbb93372-0a1b-4cf8-ac7e-68a789d59564","resolution":{"observed_at":"2026-08-04T22:02:37.272618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-04T22:02:32.133475Z","title":"arXiv preprint arXiv:2602.12275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.133475Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:bd652e4893241a77a7527288e1effbd1736b95c35697ccf68f4a8d2b63840730","observation_id":"0f26a9db-a39c-4497-b64d-040bf25b57d4","resolution":{"observed_at":"2026-08-04T22:02:32.133475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12125","last_updated":"2026-02-26T13:26:22Z","snapshot_observed_at":"2026-07-31T18:08:52.441829Z","submitted_at":"2026-02-12T16:14:29Z","title":"Learning beyond Teacher: Generalized On-Policy Distillation with Reward Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12125","snapshot_observed_at":"2026-08-04T22:02:32.237436Z","title":"arXiv preprint arXiv:2602.12125 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.237436Z"},"links":{"cited_paper":"/paper/2602.12125","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:66719515c5adbe2974b421c5db7100f861353266f537dedd01a8ada62c184ddb","observation_id":"3f6a8f41-d291-43dd-9a7f-a66e265913cd","resolution":{"observed_at":"2026-08-04T22:02:32.237436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:37.082398Z","title":null,"venue":null,"work_id":"4d65d1da-718a-4039-9f92-9394a3583659","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.324527Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:ee30672b7e7ef205b4bec3a037852bbccc0a8321066be0e9ea3bed5d285331d7","observation_id":"0b1adcc6-129e-475e-bf27-65dab7e88c80","resolution":{"observed_at":"2026-08-04T22:02:37.122711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.19897","last_updated":"2026-01-27T18:59:08Z","snapshot_observed_at":"2026-07-06T22:43:12.468415Z","submitted_at":"2026-01-27T18:59:08Z","title":"Self-Distillation Enables Continual Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.19897","snapshot_observed_at":"2026-08-04T22:02:32.428056Z","title":"arXiv preprint arXiv:2601.19897 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.428056Z"},"links":{"cited_paper":"/paper/2601.19897","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:5aca0f7a01e6f73599dca9d2ffdc51d892947192c669d82a9106caf3ebcbfb5b","observation_id":"8679f6c7-5585-4009-86aa-9c4c44666971","resolution":{"observed_at":"2026-08-04T22:02:32.428056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:32.561260Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.561260Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:f81f37a1bfc9594d45ba2e9ac9018aaa8b988b85e676af73c18ab7326c377875","observation_id":"455a463d-ae41-4224-9bd3-ccac8c883d70","resolution":{"observed_at":"2026-08-04T22:02:32.561260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:32.641474Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.641474Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:ec8d57b7e3c7adf87f59eedace1f9fcfe43dd394cd12ef749621732aa94d9e0b","observation_id":"1ce926cb-fc97-4b76-92dc-c97b304b4bb7","resolution":{"observed_at":"2026-08-04T22:02:32.641474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:32.737500Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.737500Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:0666514e1729ca681b7688497265d639561f8fea3db16c7a737348e897b12c87","observation_id":"f9ed43ba-65b7-4abe-9b8b-f84016d87d4f","resolution":{"observed_at":"2026-08-04T22:02:32.737500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T22:02:32.840069Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.840069Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:caf78876b4bac91fc7b774c61ccce0cad54d49efff5a26fb7dc51ee679650758","observation_id":"6d08b82d-eb61-44cc-8971-4ff914c39aea","resolution":{"observed_at":"2026-08-04T22:02:32.840069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-04T22:02:32.967856Z","title":"arXiv preprint arXiv:2601.20802 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:32.967856Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:8078fe4f38db88b72b16731ff29dffc505a7edd05de51d36fe4df52e1b858239","observation_id":"cf695887-098d-45d6-8143-383b83170d6a","resolution":{"observed_at":"2026-08-04T22:02:32.967856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07079","last_updated":"2026-05-22T17:34:18Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T07:26:18Z","title":"Entropy-Aware On-Policy Distillation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07079","snapshot_observed_at":"2026-08-04T22:02:33.054629Z","title":"arXiv preprint arXiv:2603.07079 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.054629Z"},"links":{"cited_paper":"/paper/2603.07079","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:e1a1617f3aa795ad4b0f1bfdcb21e5a8b83faeb5ed3d79af1b16e2e882aac151","observation_id":"ddac4f63-d16d-4407-a9e9-906da8e09832","resolution":{"observed_at":"2026-08-04T22:02:33.054629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.933689Z","title":null,"venue":null,"work_id":"7ade4cc6-52d4-4858-a43a-ab6d36ae2176","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.130990Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:1298d1f94f43f76e7cfd91646d20e8bdfe33797f9ddf159ee38be9fff7563381","observation_id":"7ef75b47-e0b1-4523-a564-5fba7570ba00","resolution":{"observed_at":"2026-08-04T22:02:36.985062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.794010Z","title":null,"venue":null,"work_id":"3b312d04-5f1c-4a8f-b751-db67a3442c61","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.208456Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:bb4459944658495d52c84ed20115f261c2b44f641d7be9660180a7a7420839b1","observation_id":"fcbf0f7d-aedc-489c-8366-2c3edc9a8845","resolution":{"observed_at":"2026-08-04T22:02:36.885086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.634071Z","title":null,"venue":null,"work_id":"14da945b-63fd-416b-bd91-89484357aead","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.282404Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:0491c0ca278d8559240f6aa5c503bef8fefa330630c34ca39e96d5d6c999e5ad","observation_id":"9e2548c7-2be0-448a-a86d-157322459eb9","resolution":{"observed_at":"2026-08-04T22:02:36.685947Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-04T22:02:33.380937Z","title":"arXiv preprint arXiv:2211.14275 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.380937Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:53f4653bba2e14eb267167f37efce5c3a10e22e964ea3ac84654935f65847317","observation_id":"2214aecb-7369-4e27-9a13-8099ad834b7f","resolution":{"observed_at":"2026-08-04T22:02:33.380937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:33.470723Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.470723Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:aceb5f542a00b79c1e5ea3709c093293950da839cf05e7b2a894d25ecb47ac83","observation_id":"0bb93eb4-0277-4bb3-8cef-f3e5735b04fd","resolution":{"observed_at":"2026-08-04T22:02:33.470723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:33.574737Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.574737Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:6cc9c172ac1f519f63e62271b13ace82022b595853ef264607d3b7bf334b8ee2","observation_id":"a3862243-ba84-4864-9377-34cf000f70f3","resolution":{"observed_at":"2026-08-04T22:02:33.574737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.455295Z","title":null,"venue":null,"work_id":"68cd11e2-2c68-41e2-8d6d-61807bcee292","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.713516Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:4e68758d50b364b840335c422c89e5d3242763a2e7453a0591ab93421472e237","observation_id":"cad6a2ed-a785-46f5-9e1e-ac0a9985e401","resolution":{"observed_at":"2026-08-04T22:02:36.529223Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":"2607.05184","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-04T22:02:35.499158Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","venue":"cs.AI","work_id":"2f6b90cc-5e59-4697-87dc-c78d3f7eedd5","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.791583Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:56445da682815713af5e7e6ba2ae56a18b619fcf3677fbebcd2eeaf611e8899b","observation_id":"713f8264-9954-41ac-9f95-00c226482406","resolution":{"observed_at":"2026-08-04T22:02:35.540632Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13016","last_updated":"2026-04-15T17:48:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T17:54:28Z","title":"Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13016","snapshot_observed_at":"2026-08-04T22:02:33.883775Z","title":"arXiv preprint arXiv:2604.13016 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:33.883775Z"},"links":{"cited_paper":"/paper/2604.13016","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:d9e3f8c544fc80befd6fbdf420ced4ff94d21279048879889c0d76735d9c7ec0","observation_id":"3c9fe0b0-4e5d-44fe-8069-f07637ebe1ca","resolution":{"observed_at":"2026-08-04T22:02:33.883775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:34.004083Z","title":"arXiv preprint arXiv:2603.11137 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.004083Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:7b7abcf63696f5ef15c8815e5df307dba410126a7e864e98ab81d474356f79c0","observation_id":"8a7c3878-0604-4d25-9bdc-8a1e2ae25bd8","resolution":{"observed_at":"2026-08-04T22:02:34.004083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:34.073738Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.073738Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:91a6870aefc87c3ac494875bad014ad742282e54592708f54aa9ae0057b67137","observation_id":"2fc518b1-4300-42f6-be8e-994f1f0e473e","resolution":{"observed_at":"2026-08-04T22:02:34.073738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:34.154274Z","title":"and Shen, Yelong and Wallis, Phillip and Allen-Zhu, Zeyuan and Li, Yuanzhi and Wang, Shean and Wang, Lu and Chen, Weizhu , booktitle=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.154274Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:4a42380ae1087a17e64b219ce08b03928b01f52b842b5b3884fae4d45698b0e6","observation_id":"78eee6ec-74cc-4594-8701-e80e0a524777","resolution":{"observed_at":"2026-08-04T22:02:34.154274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.297075Z","title":"Proceedings of the ACM Symposium on Operating Systems Principles , year=","venue":null,"work_id":"d8eb2553-2ed6-4b1f-bcde-bbb171f114c8","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.264888Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:9f3f954574205f3ec09c85ba3deb67ef6820d747f98f9b4e56bcba27d60d5531","observation_id":"fa516aa2-c6e4-452f-8184-9119ab8dd549","resolution":{"observed_at":"2026-08-04T22:02:36.357335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.171663Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"9e47a6ab-6a1c-419a-bd34-0ed4da2910aa","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.384050Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:29321d3bef3e57c36ac3957924da0b9e151a8045ec105aa07a890017c1564df4","observation_id":"e2f25521-ffc3-4ba9-9c42-b88c01eec879","resolution":{"observed_at":"2026-08-04T22:02:36.231778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:36.021165Z","title":"and Mao, Huanzhi and Yan, Fanjia and Ji, Charlie Cheng-Jie and Suresh, Vishnu and Stoica, Ion and Gonzalez, Joseph E","venue":null,"work_id":"4b5e3407-7eba-406e-8ccf-b69df7fb8b87","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.468950Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:06c75b354bf24b5f53bb70a52884fd2b789231a5f33909c4cc054914fc0249b8","observation_id":"d7d8e6ec-41ca-479b-b2a2-627a2f16478c","resolution":{"observed_at":"2026-08-04T22:02:36.080438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:35.915940Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"a4362d3f-5bb4-46d4-bc18-c83719c9d28c","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.539578Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:9c69fbc69d45ff7fea0625b15627c773f578009dbb26f5da25340cae75c4d271","observation_id":"def2fb51-d62c-44fa-96fa-dc065599d940","resolution":{"observed_at":"2026-08-04T22:02:35.976959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:35.761976Z","title":"2026 , url=","venue":null,"work_id":"2b5d3f77-7ee0-4ca4-82f3-6cb36ce60e45","year":2026},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.601655Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:0a1a273b9ac07f14dc560a52a051a6919ec9a15d420759bfad0c82da82ba1216","observation_id":"c5eef41b-8b62-4e8f-b566-9b5f0a7afc1e","resolution":{"observed_at":"2026-08-04T22:02:35.856187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:35.624724Z","title":null,"venue":null,"work_id":"b5f05c89-8b0d-436d-b1cb-39abd0117322","year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.694997Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:67fd472b4fe3ecb08b4231c4219c6d9ad48f42e0ebe57d5705a04128aa6f1235","observation_id":"3d24d28a-de3e-4abf-be75-0b487319789b","resolution":{"observed_at":"2026-08-04T22:02:35.672458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T22:02:34.823593Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.823593Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:3a3dec358fe8bc6682bdb34eac77ac07e3f1ac4515f2151c56f18ec24b63c88e","observation_id":"d8179d8d-7e65-4d89-90b1-da24e708b4d9","resolution":{"observed_at":"2026-08-04T22:02:34.823593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T22:02:34.908623Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-04T22:02:34.908623Z"},"links":{"citing_paper":"/paper/2608.01735"},"observation_digest":"sha256:9d5b4bece84fc19e5ad74d8a9378c2035a911c8d89f8ff4151bc29f9adac6778","observation_id":"769238b0-eba9-4e47-a35c-110719e2a61b","resolution":{"observed_at":"2026-08-04T22:02:34.908623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01735","last_updated":"2026-08-03T06:00:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T23:32:59.071048Z","submitted_at":"2026-08-03T06:00:44Z","title":"DAPD: Dual-Anchored Policy Distillation"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":60,"verified_exact":2,"verified_fuzzy":13},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2608.01735."}