{"as_of":"2026-08-08T14:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:630124585a9a318e6ea2b7d25275a1f36f67cd9d137294f8b0fed897a532a0e6","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:15:50.932630Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03223/citation-record","integrity":"/paper/2608.03223/integrity","json":"/paper/2608.03223/citation-record.json","paper":"/paper/2608.03223"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.856594Z","title":null,"venue":null,"work_id":"1b0197ee-714f-4ff2-b7cc-761b3ec08a7a","year":2024},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.697103Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:17d93237eabbb75a80fd8f613d00b4f257410a37d64d093e7e4ceb59621b37be","observation_id":"8675798f-b798-4d3f-8c9c-fdb46028c21f","resolution":{"observed_at":"2026-08-05T23:15:51.861115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.842065Z","title":null,"venue":null,"work_id":"6d07b800-7250-448b-8125-c9a2930b6bfc","year":2019},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.718401Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:854419047087f41d0218738aaba88c08c673eea4c51dbc1e3c809461b8f43ce2","observation_id":"ff4f27e9-3352-42d5-86aa-a439fd126d03","resolution":{"observed_at":"2026-08-05T23:15:51.846448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-07-06T20:30:26.881629Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-05T23:15:50.724043Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.724043Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:fd88517b8432566fd5a983a97799fcd90e7dcc874729e79ad6feaa3c47aebde2","observation_id":"9adefe45-cc4b-402a-a50d-2d780189b19a","resolution":{"observed_at":"2026-08-05T23:15:50.724043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.729905Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.729905Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:90041bbd275ee7035792e3e297ea5fdf282426ea2ffe2b27d4fa72ed46785976","observation_id":"92a3e15b-408b-41b7-aaf8-4ee8842f5ce9","resolution":{"observed_at":"2026-08-05T23:15:50.729905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.825464Z","title":null,"venue":null,"work_id":"1682e057-a4c5-442c-b8d6-c6582aba2089","year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.737402Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2cb7250c34389e1ffb74b8390ce7c7772e8d402459c8af8801e5857e22eb7d01","observation_id":"13156ec5-b935-4634-b9ce-a745c9ddf324","resolution":{"observed_at":"2026-08-05T23:15:51.830528Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T23:15:50.742839Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.742839Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:30ef7e56db90ca09caa9b5700810fd806dc994e2e238decc54707b4312cab1d2","observation_id":"b138fd6e-ac23-4e3d-87a5-68837a7b8bbb","resolution":{"observed_at":"2026-08-05T23:15:50.742839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.749272Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.749272Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:3eb7f5e535ea7f3d762bca5d45c774734c367833c9a660c8eef45ab8e599be5d","observation_id":"71826fd6-80ac-44a6-9ed0-dd1d21f9e9ef","resolution":{"observed_at":"2026-08-05T23:15:50.749272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.20802","last_updated":"2026-02-16T14:49:34Z","snapshot_observed_at":"2026-07-29T19:52:32.104228Z","submitted_at":"2026-01-28T17:45:12Z","title":"Reinforcement Learning via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.20802","snapshot_observed_at":"2026-08-05T23:15:50.754062Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.754062Z"},"links":{"cited_paper":"/paper/2601.20802","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2aaa684f52e996d4cd9938e0f199ac8109e18b00b118a758de61f6b04a2b10b3","observation_id":"baa0c435-e836-4b37-91fd-d4d9b6e538de","resolution":{"observed_at":"2026-08-05T23:15:50.754062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-05T23:15:50.758886Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.758886Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:ec757eaa69dde2af5245890cd74e25fa172ef9ca5c7d266edf94d664d7980f2a","observation_id":"fab17f2f-af4e-492e-8d1e-40c658fa80bc","resolution":{"observed_at":"2026-08-05T23:15:50.758886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.799787Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":"f3559152-75b5-420d-80d2-391e482f0db1","year":2017},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.763497Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:fdd45336f23d5735cf1762068751438415eba1fb86cec1ed59d24a0ff471c123","observation_id":"7ebed2cd-4208-4aa5-bc04-7de91ad3f08c","resolution":{"observed_at":"2026-08-05T23:15:51.804385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10781","last_updated":"2026-05-11T16:16:00Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:16:00Z","title":"Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10781","snapshot_observed_at":"2026-08-05T23:15:50.767987Z","title":"RebelliousStu- dent: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.767987Z"},"links":{"cited_paper":"/paper/2605.10781","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:65a9f4b6cad948bb62edbff140fc07133945cf025535763bf7e1a45f04aa8ec7","observation_id":"d37c7dd3-f9be-4136-8c78-68c3880e9b1d","resolution":{"observed_at":"2026-08-05T23:15:50.767987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.783555Z","title":"Naturalquestions:abenchmarkforquestionansweringresearch","venue":null,"work_id":"7ac71897-2d57-41f8-834a-1aa06d621675","year":2019},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.773613Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:8cf66157b9033351647cdc0256e7263e228bfaecaeac47fa75a457ee99c749d4","observation_id":"cb700ff0-c4a3-41e1-926a-7527f6a98784","resolution":{"observed_at":"2026-08-05T23:15:51.788550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.767213Z","title":null,"venue":null,"work_id":"52b042b5-70fd-486c-8460-cda1f6cf9f94","year":2024},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.778337Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:845586591e0682745c78767731f781cf86e9dee3f144b959a354cd02a1679e2d","observation_id":"4bd96b65-717d-43ab-8852-d01b4c418612","resolution":{"observed_at":"2026-08-05T23:15:51.771787Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04036","last_updated":"2026-06-02T02:31:13Z","snapshot_observed_at":"2026-08-05T09:50:41.075111Z","submitted_at":"2026-06-02T02:31:13Z","title":"Self-Distilled Policy Gradient","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04036","snapshot_observed_at":"2026-08-05T23:15:50.786116Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.786116Z"},"links":{"cited_paper":"/paper/2606.04036","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:9913713948d55a5fbcd9024a9fd875896a9ea6dff80d7efcf7c69839c5276f08","observation_id":"e3be0fea-2032-4c84-8e10-cf1b97b8d851","resolution":{"observed_at":"2026-08-05T23:15:50.786116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-06T01:14:44.790846Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-08-05T23:15:50.790996Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.790996Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2726d2fc5eacc9e58f1706eab0461bcfcca5fe22feffbb14e62faf007653fdd1","observation_id":"508bf451-91ee-42c2-ab64-7fdc6610c639","resolution":{"observed_at":"2026-08-05T23:15:50.790996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03680","last_updated":"2025-08-05T17:50:13Z","snapshot_observed_at":"2026-08-06T04:17:53.374156Z","submitted_at":"2025-08-05T17:50:13Z","title":"Agent Lightning: Train ANY AI Agents with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03680","snapshot_observed_at":"2026-08-05T23:15:50.795278Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.795278Z"},"links":{"cited_paper":"/paper/2508.03680","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:3ac69503f515ed14d1cf50280d96ffa1184db7f758c71cc4bd111c6c87765215","observation_id":"525c4e31-9b8a-4ab2-8e01-d00e5e1783af","resolution":{"observed_at":"2026-08-05T23:15:50.795278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.743526Z","title":null,"venue":null,"work_id":"3ca4990c-0d00-450b-b62e-22006e959e87","year":2023},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.800345Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:98b3b0cde9edbd60be1242e00be40b78a64ea8fa6dbaabb62e27e46a7468b53f","observation_id":"5b79254f-3fc5-400c-8af9-09f6132a4b10","resolution":{"observed_at":"2026-08-05T23:15:51.750157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29476","last_updated":"2026-06-28T16:11:47Z","snapshot_observed_at":"2026-08-07T04:17:33.533880Z","submitted_at":"2026-06-28T16:11:47Z","title":"CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2606.29476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.29476","snapshot_observed_at":"2026-08-05T23:15:51.308108Z","title":"CRAFT: Counterfactual Credit Assignment from Free Sibling Rollouts for Self-Distilled Agentic Reinforcement Learning","venue":"cs.LG","work_id":"cfccfd73-246c-4411-8341-3f6f37cb0132","year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.804723Z"},"links":{"cited_paper":"/paper/2606.29476","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:f43bffb169ad6d5ca9a5f3956dcde6a2b064c5c506d49ed65fcf2c868789d892","observation_id":"b605da9c-739d-4e15-9d83-ecdac7487221","resolution":{"observed_at":"2026-08-05T23:15:51.319505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.725443Z","title":null,"venue":null,"work_id":"192ca86f-c7b0-4497-8ada-7b6600ca2002","year":1999},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.809974Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:e5e84a645851a3ef2aa640c2d441507924d5786363871868ef7465847cdf0531","observation_id":"1011db5f-b902-4973-b2a2-3ad1da50d45d","resolution":{"observed_at":"2026-08-05T23:15:51.730575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.708138Z","title":null,"venue":null,"work_id":"edb7f263-30f2-419e-a9be-22e626aafbe3","year":2023},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.814148Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:3b66e3200862689a14f3aa835272be3d0518fe786b405fb11fb4f1eeb205773b","observation_id":"ecdbda85-cc2f-4523-a3cc-f02fe3097b57","resolution":{"observed_at":"2026-08-05T23:15:51.713178Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T23:15:50.818627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.818627Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:fe58f0b72f989e89090bca42aac2427f17640462c8b1e77ba49da9ff138c0265","observation_id":"5dfa644a-6dee-4f8e-a030-92755311a9dc","resolution":{"observed_at":"2026-08-05T23:15:50.818627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.689318Z","title":null,"venue":null,"work_id":"7cb6c4e1-6aa9-4649-9ffd-a74bd4aceea9","year":2011},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.823637Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:c1ff031f540244f3abcfb9270756751d9a9edef15f713c6c1067aad7612bde26","observation_id":"fd82cd44-8337-4a08-8b01-2c0467438122","resolution":{"observed_at":"2026-08-05T23:15:51.693931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.827697Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.827697Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:177e90779e1a30f2c439c74f68038eb17b1c072a730df0ae2f5a4a55b7abca12","observation_id":"035ec4cb-5dc6-43fc-bbd5-e08891a2cefe","resolution":{"observed_at":"2026-08-05T23:15:50.827697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T23:15:50.837192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.837192Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:2b2a10caacae2cd965c41cdb72be07cc1cb98afe35637bb4f6f64458c997cd13","observation_id":"c6d0de95-b5ef-4323-9231-c65a20275e07","resolution":{"observed_at":"2026-08-05T23:15:50.837192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-05T23:15:50.843229Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.843229Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:26efe4cf6a4104a20bd09a1d74cb462de875bdf781b2d64aea0bb8e358bd2b37","observation_id":"81c9f18d-99bd-4bcc-adde-d2766986be77","resolution":{"observed_at":"2026-08-05T23:15:50.843229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15189","last_updated":"2022-09-30T02:30:15Z","snapshot_observed_at":"2026-08-04T09:41:45.042008Z","submitted_at":"2022-09-30T02:30:15Z","title":"Learning by Distilling Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15189","snapshot_observed_at":"2026-08-05T23:15:50.848819Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.848819Z"},"links":{"cited_paper":"/paper/2209.15189","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:e7a0f77eacb53585db8d7ec2262e28dd2d8aad0c2ac27ef0388b0c50c2c6ec41","observation_id":"ff8d01c5-2bd5-42d1-9e20-50c0d9be4d9a","resolution":{"observed_at":"2026-08-05T23:15:50.848819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.853031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.853031Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:5ab8e0ed7967909bd91766f13f9625eecb61acae9d586f3fa1235781b8a5a209","observation_id":"f9fb4306-7ed0-4c05-affa-c6e28e54c521","resolution":{"observed_at":"2026-08-05T23:15:50.853031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.631452Z","title":null,"venue":null,"work_id":"918619d9-c0c1-4598-a41b-e53520d2cc18","year":2009},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.862402Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:09c90eb77fbf7363af972179bd63e330fcd3c5af056fb3783d65c27b666819ca","observation_id":"5cceeed0-e3aa-4b6f-bc35-7df47754fbee","resolution":{"observed_at":"2026-08-05T23:15:51.636021Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-05T23:15:50.866749Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.866749Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:14a1f36ee8b5a94b8a024cf37d550f4fa0abf3df8c62e752db891e94c76a20b1","observation_id":"38069836-2da3-4d8a-a6ed-bf13e7a964df","resolution":{"observed_at":"2026-08-05T23:15:50.866749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-07-06T23:10:07.178566Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-08-05T23:15:50.870908Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.870908Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:3c4ac53d9771a4965962e72edb9719a82a523c8d1ade8dc3dd81e74c2f45258c","observation_id":"332f1b5f-613f-4323-b26f-5a8389fb2d4c","resolution":{"observed_at":"2026-08-05T23:15:50.870908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.613446Z","title":null,"venue":null,"work_id":"c3be8a5e-eeff-49e7-b7bf-7577fb3aba83","year":null},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.875491Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:ee72a10e987dad707681750471ed4300dbde643a801f167aec997a8533eec4de","observation_id":"b747ed9c-5279-4141-b5e1-09f56823bc86","resolution":{"observed_at":"2026-08-05T23:15:51.619372Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.08234","last_updated":"2026-02-09T03:17:17Z","snapshot_observed_at":"2026-07-06T22:45:05.823859Z","submitted_at":"2026-02-09T03:17:17Z","title":"SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.08234","snapshot_observed_at":"2026-08-05T23:15:50.886657Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.886657Z"},"links":{"cited_paper":"/paper/2602.08234","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:9a585db017054c4625e0b62cefc438035e5a61402d414198f191deb072811e6f","observation_id":"5e49090d-7305-422a-9c4d-dbb8011c04bb","resolution":{"observed_at":"2026-08-05T23:15:50.886657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02208","last_updated":"2025-06-02T19:46:41Z","snapshot_observed_at":"2026-08-07T11:26:16.590771Z","submitted_at":"2025-06-02T19:46:41Z","title":"KDRL: Post-Training Reasoning LLMs via Unified Knowledge Distillation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02208","snapshot_observed_at":"2026-08-05T23:15:50.891014Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.891014Z"},"links":{"cited_paper":"/paper/2506.02208","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:0187e79ed0aa16a61a963ed1ceafcab31f6569c3d8a1fd683db720fc24df8466","observation_id":"f8857167-3609-4823-94d3-4c04bdb123df","resolution":{"observed_at":"2026-08-05T23:15:50.891014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14084","last_updated":"2026-05-21T05:36:13Z","snapshot_observed_at":"2026-07-06T23:01:55.698452Z","submitted_at":"2026-04-15T16:58:24Z","title":"TIP: Token Importance in On-Policy Distillation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14084","snapshot_observed_at":"2026-08-05T23:15:50.895596Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.895596Z"},"links":{"cited_paper":"/paper/2604.14084","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:113b8e5e51e70a5adbdd808d1a4da74258c476dc047563bf5437ca22239ab7b4","observation_id":"580e16ac-39d3-4085-96fb-0f8cca1a2119","resolution":{"observed_at":"2026-08-05T23:15:50.895596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T23:15:50.901475Z","title":"Qwen3technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.901475Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:69d497d3a51bf9c404e394e6279774b3a7363eab67e9c8aab22eeb075dfd40b9","observation_id":"62ec70ad-3164-4a3f-86b3-0c610941cba0","resolution":{"observed_at":"2026-08-05T23:15:50.901475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-05T23:15:50.907312Z","title":"Self-DistilledRLVR","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.907312Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:8d8d08389a8d6485cddf1a0a49ca46bf65655fb46dc04effdc76d0ad54ecc2a7","observation_id":"e73c43fc-446a-46e9-bf20-de450cbf756f","resolution":{"observed_at":"2026-08-05T23:15:50.907312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:50.913796Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.913796Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:18e84111d1c00a5d1de46d229cbf8ac9af0a6b7daa5f3f8522af2516c160d96b","observation_id":"fd9b2f95-9564-4cf8-badd-dd4a3e8e1e6f","resolution":{"observed_at":"2026-08-05T23:15:50.913796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.585175Z","title":"WebShop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"d0660c85-d499-42cf-af85-fe89b29018f5","year":2022},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.921335Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:40c179c4cc12b2551a641a726816e38c681d59e76d23df0efeeb6eb554b8fef1","observation_id":"cce0ed66-ec96-4eae-b737-28ed9bc82c38","resolution":{"observed_at":"2026-08-05T23:15:51.590013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12275","last_updated":"2026-03-23T13:11:10Z","snapshot_observed_at":"2026-07-06T22:45:39.557598Z","submitted_at":"2026-02-12T18:58:28Z","title":"On-Policy Context Distillation for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12275","snapshot_observed_at":"2026-08-05T23:15:50.925900Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.925900Z"},"links":{"cited_paper":"/paper/2602.12275","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:4d3aa95d6e41d76215d841e2bbe52871f25bed7df80625064075725c15edb1da","observation_id":"b3da775b-c531-4833-81db-c3208aff0302","resolution":{"observed_at":"2026-08-05T23:15:50.925900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18734","last_updated":"2026-03-20T15:40:19Z","snapshot_observed_at":"2026-08-07T20:24:25.671681Z","submitted_at":"2026-01-26T17:56:50Z","title":"Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18734","snapshot_observed_at":"2026-08-05T23:15:50.932630Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.932630Z"},"links":{"cited_paper":"/paper/2601.18734","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:a5e6aec8fd15f7752d6152c3da3ee981e7ddadfbf3ffb720e0be48e87775585b","observation_id":"e5ec1a51-7670-44cb-ae15-62522eb0765f","resolution":{"observed_at":"2026-08-05T23:15:50.932630Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T23:15:50.832775Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.832775Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:b26c6fa1de17efd4779b9c113aaca52f37864d63879cf00112417c0d1d4234e3","observation_id":"24d858c6-4fac-43ac-9b1d-6f58d24bf818","resolution":{"observed_at":"2026-08-05T23:15:50.832775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:15:51.648639Z","title":"Transactions of the Association for Computational Linguistics10 (2022), 539–554","venue":null,"work_id":"372e8cea-0678-44af-ad2c-399a381cabe2","year":2022},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.857722Z"},"links":{"citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:af48f0dc710da829f168ab92ddbe4dc6e6d056f226b6e8334506645caf1fe614","observation_id":"73286c70-c049-4d27-ad0f-0f428c56a001","resolution":{"observed_at":"2026-08-05T23:15:51.654412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T23:15:50.881548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T23:15:50.881548Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2608.03223"},"observation_digest":"sha256:bf527c569661b2317cd822e970b2ca3e0f0155d3d650539393bd230f1e9f4334","observation_id":"d9033018-4208-4139-a8c5-f5fe7d1a2488","resolution":{"observed_at":"2026-08-05T23:15:50.881548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03223","last_updated":"2026-08-04T06:56:47Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T07:33:01.760880Z","submitted_at":"2026-08-04T06:56:47Z","title":"Agentic Reinforcement Learning with Self-Distilled Reward Shaping"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2608.03223."}