{"as_of":"2026-08-08T15:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a847dbd48947dba0c6e9050c076eef3cdf116bd5d48756e7eabe998aa11549c8","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:39:07.147879Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.04788/citation-record","integrity":"/paper/2608.04788/integrity","json":"/paper/2608.04788/citation-record.json","paper":"/paper/2608.04788"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.15161","last_updated":"2026-07-16T16:07:19Z","snapshot_observed_at":"2026-08-07T11:34:47.380530Z","submitted_at":"2026-07-16T16:07:19Z","title":"On-Policy Delta Distillation","version":1},"cited_work":{"arxiv_id":"2607.15161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.15161","snapshot_observed_at":"2026-08-06T16:39:08.591248Z","title":"On-Policy Delta Distillation","venue":"cs.LG","work_id":"a629dfd4-6553-47b3-8b6d-a54c34e81e1a","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.523794Z"},"links":{"cited_paper":"/paper/2607.15161","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:ddf60d6219a012062bf89c3288a0418fad8767581acd9ea0e94740577ae533f2","observation_id":"c1ad2c2e-7897-4a58-936b-c7abc4d9cffe","resolution":{"observed_at":"2026-08-06T16:39:08.666528Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05184","last_updated":"2026-07-06T15:01:35Z","snapshot_observed_at":"2026-08-06T12:43:37.187292Z","submitted_at":"2026-07-06T15:01:35Z","title":"Rethinking On-Policy Self-Distillation for Thinking Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05184","snapshot_observed_at":"2026-08-06T16:39:05.711475Z","title":"arXiv preprint arXiv:2607.05184","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.711475Z"},"links":{"cited_paper":"/paper/2607.05184","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:7d6bed4bb01a24f3a23648f21d55d67d6a5d689469a00a17a7b1db8bbfcf1e8d","observation_id":"de8a8bae-340f-406b-b2b5-d2ebd0a6a75e","resolution":{"observed_at":"2026-08-06T16:39:05.711475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19447","last_updated":"2026-05-19T07:00:55Z","snapshot_observed_at":"2026-08-02T09:08:33.207894Z","submitted_at":"2026-05-19T07:00:55Z","title":"What and When to Distill: Selective Hindsight Distillation for Multi-Turn Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19447","snapshot_observed_at":"2026-08-06T16:39:05.901164Z","title":"Liu, H.; Zhang, Y.; Li, X.; Lyu, B.; and Shang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.901164Z"},"links":{"cited_paper":"/paper/2605.19447","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:1b5c9974337ea7f8688ce8ded5955ffe492d37e3c76d360e59ce1425e33efdc7","observation_id":"c0342944-478a-44d2-bb1f-10c5d83b5640","resolution":{"observed_at":"2026-08-06T16:39:05.901164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-06T01:14:44.790846Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-08-06T16:39:05.959982Z","title":"InInternational Conference on Learning Representations, volume 2024, 52989–53046","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.959982Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:ec7596ec544a358e9cb2aaa0291dff33f3eed316caff884cdbb66147cd1ff532","observation_id":"e7417754-ad18-4cea-89c2-5e37ef6c84f9","resolution":{"observed_at":"2026-08-06T16:39:05.959982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-08-06T16:39:06.084807Z","title":"Penaloza,E.;Vattikonda,D.;Gontier,N.;Lacoste,A.;Char- lin,L.;andCaccia,M.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.084807Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:5b965a381653cb103c1a8cfc2216572d83517e18e6c996688385bb50e8450f66","observation_id":"99fa61dd-c8d5-467b-9b10-929fafded276","resolution":{"observed_at":"2026-08-06T16:39:06.084807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.10805","last_updated":"2026-07-12T15:24:25Z","snapshot_observed_at":"2026-08-05T11:47:23.535326Z","submitted_at":"2026-07-12T15:24:25Z","title":"Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":"2607.10805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.10805","snapshot_observed_at":"2026-08-06T16:39:08.373699Z","title":"Diagnosing and Mitigating Thinking Collapse in On-Policy Self-Distillation","venue":"cs.CL","work_id":"3010412b-a09e-4160-8866-2a59d8584c2c","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.198738Z"},"links":{"cited_paper":"/paper/2607.10805","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:7008752eaec8048d4ef96ecf4c6c9ea84db2c031fb490641af47267b799ebced","observation_id":"580e6fef-625d-424c-bd32-c7274ac12b97","resolution":{"observed_at":"2026-08-06T16:39:08.431166Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T16:39:06.275961Z","title":"Shen, Z.; Tong, J.; Yan, S.; Shen, C.; Chen, H.; Ye, W.; Hu, X.;Miao,R.;Wang,H.;Zhao,J.;etal.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.275961Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:9dd106dd22b0de8067b0800cdf52259910e45a28a6acb421438596ede83ab4dc","observation_id":"59af0db5-903e-4c9c-9a80-4faba569bfca","resolution":{"observed_at":"2026-08-06T16:39:06.275961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:39:08.966440Z","title":"InInternational Conference on Learning Representations, volume 2025, 89490–89520","venue":null,"work_id":"8e72f3e0-c906-4918-9b23-d9d4b2c63c48","year":2025},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.491333Z"},"links":{"citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:0fb15a90d22e95d9f8bd9237942faaee0397507faa3594bb0388ee64afe5f4d4","observation_id":"ce75a16e-460f-4b37-89c4-a00d3130759c","resolution":{"observed_at":"2026-08-06T16:39:09.119131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09348","last_updated":"2026-07-06T08:44:01Z","snapshot_observed_at":"2026-08-06T19:49:04.152420Z","submitted_at":"2026-06-08T11:20:58Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","version":2},"cited_work":{"arxiv_id":"2606.09348","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.09348","snapshot_observed_at":"2026-08-06T16:39:08.145196Z","title":"PBSD: Privileged Bayesian Self-Distillation for Long-Horizon Credit Assignment","venue":"cs.LG","work_id":"6ce41a0f-002a-43b0-bcdb-01b1f55b0c17","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.584525Z"},"links":{"cited_paper":"/paper/2606.09348","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:b403ea9d02bf3b96c0e4cb435d36e9bf0938a8291d3c372e66d555e252097448","observation_id":"38de8315-b88a-46a4-82dc-19a2ec9350d9","resolution":{"observed_at":"2026-08-06T16:39:08.247916Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-07T17:12:01.826191Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2607.14777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-06T16:39:07.928445Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","venue":"cs.CL","work_id":"c0647c25-9e3b-48a6-b87c-477f63756d60","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.711304Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:10e00bb61a4427ce19bb3c7e794e544f693cc7f9115a976dd37b4d0df781aa3b","observation_id":"a54fa22c-d4a9-4e5c-b091-7fcec56b98e6","resolution":{"observed_at":"2026-08-06T16:39:08.054402Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22600","last_updated":"2026-06-26T02:45:32Z","snapshot_observed_at":"2026-08-08T07:09:29.965305Z","submitted_at":"2026-06-21T17:20:21Z","title":"On the Position Bias of On-Policy Distillation","version":3},"cited_work":{"arxiv_id":"2606.22600","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.22600","snapshot_observed_at":"2026-08-06T16:39:07.758543Z","title":"On the Position Bias of On-Policy Distillation","venue":"cs.LG","work_id":"ccd4b8f7-fc0d-4840-a9d6-965cecd54b1c","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.783612Z"},"links":{"cited_paper":"/paper/2606.22600","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:52ced4ff747e77e9a75c5b2278d3e2cfee304e23b73b3808424bd378b574228b","observation_id":"1b4eb0f6-4658-4a91-9f08-3b6b2855efc0","resolution":{"observed_at":"2026-08-06T16:39:07.816552Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22263","last_updated":"2026-05-21T10:07:46Z","snapshot_observed_at":"2026-08-02T10:25:42.509450Z","submitted_at":"2026-05-21T10:07:46Z","title":"Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning","version":1},"cited_work":{"arxiv_id":"2605.22263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.22263","snapshot_observed_at":"2026-08-06T16:39:07.483662Z","title":"Tailoring Teaching to Aptitude: Direction-Adaptive Self-Distillation for LLM Reasoning","venue":"cs.LG","work_id":"5d9ef4ab-bea9-4a22-9b2c-3ec4330a8756","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.851794Z"},"links":{"cited_paper":"/paper/2605.22263","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:10263846737a63b320f4b9a29dfbd7e7536002d554da33fa0e6e570ffc814ef7","observation_id":"7533a37c-84f9-42ba-ace3-070ad07a3177","resolution":{"observed_at":"2026-08-06T16:39:07.586658Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10385","last_updated":"2026-06-09T03:51:41Z","snapshot_observed_at":"2026-07-06T23:49:37.345711Z","submitted_at":"2026-06-09T03:51:41Z","title":"Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2606.10385","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.10385","snapshot_observed_at":"2026-08-06T16:39:07.258364Z","title":"Beyond Absolute Imitation: Anchored Residual Guidance for Privileged On-Policy Distillation","venue":"cs.LG","work_id":"a0e05d48-aa22-420b-a7fd-3925793d2375","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.947603Z"},"links":{"cited_paper":"/paper/2606.10385","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:49067cbb95ecbb209deb8f10129483922f1ed161244aef8d0d3f25cdc662be92","observation_id":"0bb6da02-090c-412b-b582-0e459ef46997","resolution":{"observed_at":"2026-08-06T16:39:07.350446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27140","last_updated":"2026-05-26T15:07:03Z","snapshot_observed_at":"2026-08-02T02:39:25.917076Z","submitted_at":"2026-05-26T15:07:03Z","title":"StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27140","snapshot_observed_at":"2026-08-06T16:39:07.025064Z","title":"Zhang, Y.; Zhu, Y.; Chong, W.; Tu, S.; Zhang, Q.; Chai, J.; Wang, X.; Lin, W.; Yin, G.; and Zhao, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.025064Z"},"links":{"cited_paper":"/paper/2605.27140","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:43aeacd648e06d3027887e407c7b04f4e1a1c9266c9f1992c7b662590721e6c5","observation_id":"5f0a1dd7-5d11-46a4-a987-f8e4f6439289","resolution":{"observed_at":"2026-08-06T16:39:07.025064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-06T16:39:07.147879Z","title":"Zhou, S.; Xu, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:07.147879Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:7b23f8501449ca48419a09d68dfb458177e1af6ca32376678d1881b74d9014f0","observation_id":"ff4914d2-bbe1-4cef-8ac5-defa24f6e7f9","resolution":{"observed_at":"2026-08-06T16:39:07.147879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-06T16:39:06.391541Z","title":"Sow,D.;Woisetschläger,H.;Bulusu,S.;Wang,S.;Jacobsen, H","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:06.391541Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:192eba7da3b311040e8bfc5c58f7dae6c3adf6047815fdfc35b8ccd927969a07","observation_id":"50411b58-ae63-4659-8875-6ab149674276","resolution":{"observed_at":"2026-08-06T16:39:06.391541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T16:39:05.816250Z","title":"Li, X.; Lyu, T.; Li, Y.; Ma, Y.; Li, P.; Li, L.; Guo, Q.; Lin, D.; and Chen, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.816250Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:5a7f78156e6ed3f886034129f86254357cdf5ecd9d65011f3bccab02f71cea6b","observation_id":"70e865c4-6f3f-409b-8835-4cdeb391d57d","resolution":{"observed_at":"2026-08-06T16:39:05.816250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-06T16:39:05.647351Z","title":"Kaur, S.; Ri, N.; He, Y.; Fowl, L.; and Arora, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.647351Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:3a4ca30b6b0147d780a3e385e80727055e4a780185bd857c9213027b713c7c14","observation_id":"a89a410f-ac14-4e8c-a089-12281d578d34","resolution":{"observed_at":"2026-08-06T16:39:05.647351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.14558","last_updated":"2026-05-14T08:33:02Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:33:02Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","version":1},"cited_work":{"arxiv_id":"2605.14558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.14558","snapshot_observed_at":"2026-08-06T16:39:08.729183Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","venue":"cs.LG","work_id":"6b7efbe5-2eac-402f-b1b7-294381901262","year":2026},"citing_paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T16:39:05.412903Z"},"links":{"cited_paper":"/paper/2605.14558","citing_paper":"/paper/2608.04788"},"observation_digest":"sha256:262325692502c5753d503506f4804a4a282de056f3f73fadafb963075fca0da3","observation_id":"51b017bc-e9e1-47fc-b9ac-05e60814ae8a","resolution":{"observed_at":"2026-08-06T16:39:08.874780Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.04788","last_updated":"2026-08-05T12:52:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T15:14:20.171734Z","submitted_at":"2026-08-05T12:52:14Z","title":"Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2608.04788."}