{"as_of":"2026-08-08T21:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c9ca72a53d46f7f737cd6f51b968202a45242964ba18e7e5865acba87e5b77e","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:59:00.345669Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01837/citation-record","integrity":"/paper/2608.01837/integrity","json":"/paper/2608.01837/citation-record.json","paper":"/paper/2608.01837"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-07-06T19:26:38.002071Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-04T19:59:00.219331Z","title":"arXiv preprint arXiv:2410.02089","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.219331Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:4a3390a1506384f26b0da9eb673fd5320317781d5ba66a83b95fe40a3b1f302d","observation_id":"6b017c0d-f03d-4ccb-8932-104c8caa8a47","resolution":{"observed_at":"2026-08-04T19:59:00.219331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T19:59:00.227017Z","title":"Hübotter,J.;Lübeck,F.;Behric,L.;Baumann,A.;Bagatella, M.; Marta, D.; Hakimi, I.; Shenfeld, I.; Buening, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.227017Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:96ed6c1a72c4e6e69a4ee8c30d904e6cf4debb0eb1cdab6ba879f88ed8f49647","observation_id":"c9af2218-9e07-49e4-892c-592fd98de37b","resolution":{"observed_at":"2026-08-04T19:59:00.227017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:00.239132Z","title":"Jin, B.; Zeng, H.; Yue, Z.; Yoon, J.; Arik, S.; Wang, D.; Zamani, H.; and Han, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.239132Z"},"links":{"citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:334425129570edc508cef1d47375d89fe6fbea9cd451ccbfdb747a020fc1a775","observation_id":"7cb6a7a2-acd4-4b33-ba4b-13c49ecc31be","resolution":{"observed_at":"2026-08-04T19:59:00.239132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-04T19:59:00.244103Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.244103Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:abdd690549e5f040a0ba2626b5bcdfda15eed9bc7f5a8351a88dd48c9fb5d802","observation_id":"c151a5c0-e625-44b6-983b-3893a5ec2401","resolution":{"observed_at":"2026-08-04T19:59:00.244103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-08-04T19:59:00.250021Z","title":"2:Pushingthefrontierofopenlargelanguagemodels.arXiv preprint arXiv:2512.02556","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.250021Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:83eb353dc68468214d6a135c330c14701328bd55d9d0bd541d5dd0ace21d6110","observation_id":"9ad32867-622b-4d20-b0d3-4c43daf4cd8a","resolution":{"observed_at":"2026-08-04T19:59:00.250021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08688","last_updated":"2026-06-07T15:42:56Z","snapshot_observed_at":"2026-08-03T12:10:14.668956Z","submitted_at":"2026-06-07T15:42:56Z","title":"PhysAgent: Automating Physics-Based 4D Synthesis via Trajectory-Grounded Multi-Agent Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08688","snapshot_observed_at":"2026-08-04T19:59:00.257672Z","title":"Mallen, A.; Asai, A.; Zhong, V.; Das, R.; Khashabi, D.; andHajishirzi,H.2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.257672Z"},"links":{"cited_paper":"/paper/2606.08688","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:c4f8d1a9591c0a3df8bced98f5c399f95f71e0cfa3cb7212c499756b623f5c67","observation_id":"87a09415-9b73-4196-9249-06d9fd5abf17","resolution":{"observed_at":"2026-08-04T19:59:00.257672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:00.262943Z","title":"InInternational Conference on Learning Representations, volume 2025, 79791–79821","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.262943Z"},"links":{"citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:87c386924afda99b965db1ae01a3824b66411c40d8cddb1d2a19d681028c57ed","observation_id":"4320ecfa-9e30-413f-87b0-d8c6f7065087","resolution":{"observed_at":"2026-08-04T19:59:00.262943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:00.269190Z","title":"InInternational Conference on Learning Representations, volume 2025, 406–441","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.269190Z"},"links":{"citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:8629c1e0dd9d5ec1d13908eb87c7a8566ad88cd9e18a28a8de82bc1c6e638abd","observation_id":"360a4500-963f-4a8b-8e26-ab48d2e3b0d2","resolution":{"observed_at":"2026-08-04T19:59:00.269190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T19:59:00.281220Z","title":"Shinn, N.; Cassano, F.; Gopinath, A.; Narasimhan, K.; and Yao, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.281220Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:8b4b35c6e508f3750e4d97120849f69005cc5b4863b78e46197f1c7f7af78db3","observation_id":"eb569ea2-68d2-473b-9230-e9ff688e6a94","resolution":{"observed_at":"2026-08-04T19:59:00.281220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-04T19:59:00.295295Z","title":"Tan, H.; Wang, Z.; Pan, J.; Lin, J.; Wang, H.; Wu, Y.; Chen, T.;Zheng,Z.;Tang,Z.;andYang,H.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.295295Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:252207bef96a5c162be13cbb0a6831da26b286fd0d2729accf4e81415e002c66","observation_id":"f5e41371-9c31-437b-8c28-1f4276d127cf","resolution":{"observed_at":"2026-08-04T19:59:00.295295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:00.302769Z","title":"Wu, J.; Yang, S.; Lu, Z.; Zhang, F.; Shen, Y.; Feng, L.; Luo, H.; Lian, Z.; Zhang, S.; Wen, Z.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.302769Z"},"links":{"citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:7b02837d202fab986a10177e2743844fda03763f2927ae6bf4a4cf2246bb7f35","observation_id":"f0ae667c-bd3b-4388-85ab-f70d5e94d9c3","resolution":{"observed_at":"2026-08-04T19:59:00.302769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.14777","last_updated":"2026-07-16T09:57:18Z","snapshot_observed_at":"2026-08-08T20:51:39.714931Z","submitted_at":"2026-07-16T09:57:18Z","title":"SEED: Self-Evolving On-Policy Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14777","snapshot_observed_at":"2026-08-04T19:59:00.309548Z","title":"Yang,A.;Li,A.;Yang,B.;Zhang,B.;Hui,B.;Zheng,B.;Yu, B.;Gao,C.;Huang,C.;Lv,C.;etal.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.309548Z"},"links":{"cited_paper":"/paper/2607.14777","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:f4ff4fada80d317a74ac5c827a04e881f8114ed466a9c22b4b3dd114f6abcf84","observation_id":"ae6bd321-e27e-454b-8cf6-342a6b55124e","resolution":{"observed_at":"2026-08-04T19:59:00.309548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-08T21:08:39.676079Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-04T19:59:00.315255Z","title":"Yao,S.;Zhao,J.;Yu,D.;Du,N.;Shafran,I.;Narasimhan,K.; andCao,Y.2022b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.315255Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:f9054e10e67a8848e2e68ad457ee2bac163be38ecbea1b136ade5a66701fed6c","observation_id":"0dd09122-7844-423c-aa64-af12f6a62a2b","resolution":{"observed_at":"2026-08-04T19:59:00.315255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-08-08T15:46:07.719139Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-04T19:59:00.321172Z","title":"Yu, Q.; Zhang, Z.; Zhu, R.; Yuan, Y.; Zuo, X.; Yue, Y.; Dai, W.; Fan, T.; Liu, G.; Liu, L.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.321172Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:d0ce84654eca5806956cd838033a7dd928d3d2ee3768c88a511c40d2fc247b78","observation_id":"e9a70feb-d516-40b4-a4bc-04fc0db54f72","resolution":{"observed_at":"2026-08-04T19:59:00.321172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-08-04T19:59:00.326323Z","title":"arXiv preprint arXiv:2508.06471","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.326323Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:8627bcd7dd6e790c89a214cd94b01fa59c8b9beb112cc57be4f5d57e7c8a4f28","observation_id":"cce752fe-1a0a-4975-9c80-710fe81be3db","resolution":{"observed_at":"2026-08-04T19:59:00.326323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27140","last_updated":"2026-05-26T15:07:03Z","snapshot_observed_at":"2026-08-02T02:39:25.917076Z","submitted_at":"2026-05-26T15:07:03Z","title":"StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27140","snapshot_observed_at":"2026-08-04T19:59:00.333551Z","title":"Zhao, S.; Xie, Z.; Liu, M.; Huang, J.; Pang, G.; Chen, F.; and Grover, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.333551Z"},"links":{"cited_paper":"/paper/2605.27140","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:ed3f1ceee5363d0b59ec095dc86da7f986a684a10d725874aa6f0bf51602bf09","observation_id":"05c7914f-cb14-4254-a500-48cadc48c2bf","resolution":{"observed_at":"2026-08-04T19:59:00.333551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-04T19:59:00.340360Z","title":"Zhong, Q.; Zheng, M.; Song, M.; Lin, X.; Sun, J.; Jiang, H.; Wang, X.; and Fang, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.340360Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:17a66e66a5f9209573c174ea79252d778d0fa2487285045e09f7bd6ac4ea09a9","observation_id":"fc182e4b-37fb-4bd3-946e-c13e12c1800f","resolution":{"observed_at":"2026-08-04T19:59:00.340360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-08T05:34:18.754195Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-08-04T19:59:00.345669Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.345669Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:6e7589e8e2ab6d3488f2aca298d072d9cb64ee091975b542b6d096401295f1a2","observation_id":"b79249ad-8e10-426f-b83a-aaa012a91ea5","resolution":{"observed_at":"2026-08-04T19:59:00.345669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-04T19:59:00.275824Z","title":"arXiv preprint arXiv:1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.275824Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:176617be49493c3a9d9df9d263b5cc888f17ab19da4049eedd60234063f44b8e","observation_id":"92065c53-55e6-4066-8cbb-b3939c8ddb52","resolution":{"observed_at":"2026-08-04T19:59:00.275824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-08T17:40:47.037804Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-04T19:59:00.287378Z","title":"Singh, A.; Fry, A.; Perelman, A.; Tart, A.; Ganesh, A.; El- Kishky, A.; McLaughlin, A.; Low, A.; Ostrow, A.; Anan- thram, A.; et al","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.287378Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:6386ebcca683c6d2dfabd94306b88454c7130d44e79576ca31bb71c97aa56fc2","observation_id":"3041e6d0-9ab0-4bea-8acd-83e95392c18d","resolution":{"observed_at":"2026-08-04T19:59:00.287378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:59:00.205690Z","title":"Comanici, G.; Bieber, E.; Schaekermann, M.; Pasupat, I.; Sachdeva, N.; Dhillon, I.; Blistein, M.; Ram, O.; Zhang, D.; Rosen, E.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.205690Z"},"links":{"citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:eb104016bf4a4651e1bfbc22c39340815d110590434d2964ab15260639663663","observation_id":"509ab239-d545-477e-8445-3c7f3fd7cc1a","resolution":{"observed_at":"2026-08-04T19:59:00.205690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T19:59:00.212946Z","title":"DeepSeek-AI.2026.DeepSeek-V4:TowardsHighlyEfficient Million-Token Context Intelligence","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.212946Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:832b96d9b46192c22d288c689c546d6b35cc945e07940c2bff127bd75cf27f3f","observation_id":"17be89a9-46cb-4218-8e82-85cde710ba52","resolution":{"observed_at":"2026-08-04T19:59:00.212946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-04T19:59:00.232410Z","title":"Jimenez, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T19:59:00.232410Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.01837"},"observation_digest":"sha256:43f7f57e9a032b661b63fae35ddcda36d1786b26c3cbf606438750146317865d","observation_id":"702c1795-5fd7-4e5e-b1b0-0791da9e6b4c","resolution":{"observed_at":"2026-08-04T19:59:00.232410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01837","last_updated":"2026-08-03T07:47:59Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T00:50:34.440180Z","submitted_at":"2026-08-03T07:47:59Z","title":"PCSD: Persistent Consistency for Self-Distillation in Agentic Reinforcement Learning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2608.01837."}