{"as_of":"2026-08-12T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb844c9a8001210ae264047052ff163d3c9397abc91418b02e73200374cbfa94","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:14:31.352194Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09555/citation-record","integrity":"/paper/2608.09555/integrity","json":"/paper/2608.09555/citation-record.json","paper":"/paper/2608.09555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.976180Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.976180Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:888b9296e364fe5a501f666c8e52d7d958f3fd258515477885260add22afc7c8","observation_id":"507b7d8a-38a2-42b3-b2b6-0acf7a468d1a","resolution":{"observed_at":"2026-08-11T15:14:30.976180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.980248Z","title":"2022 , url =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.980248Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:0d03bba66845800a0ccb49e58ef6e21d012092c75929e443c9950a435e819e23","observation_id":"ec0e4c63-4d3c-49c9-9246-db7a4424b54a","resolution":{"observed_at":"2026-08-11T15:14:30.980248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.983543Z","title":"2017 , eprint =","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.983543Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a4e11a43e39bd5fe707cd133fb4953d371732c8b9b6d3b74e418591450e2e00d","observation_id":"f414b360-34f2-4511-a4ab-4ad9c7342747","resolution":{"observed_at":"2026-08-11T15:14:30.983543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.987646Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.987646Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:7ee09d9a3ef1801a05e1e5ce29432fbf67b3d47084e4775254696d970896d325","observation_id":"9f3f7cbb-3c51-4871-9536-6cd3e0f3067a","resolution":{"observed_at":"2026-08-11T15:14:30.987646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.154452Z","title":"2025 , url =","venue":null,"work_id":"f74ce2e4-876b-4138-a480-023321ea7335","year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.996013Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:56d34d637d70100bf84f0aff252679c3870dd6c675278610712755adfd62b8dc","observation_id":"3efc714c-d80d-41c1-91f0-89e9c2ece75e","resolution":{"observed_at":"2026-08-11T15:14:32.157380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:30.999591Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:30.999591Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:0940e43830ee1472ac4bb37c1fd212f6a40d30868f15630ebcd4ee18e7c2a676","observation_id":"b4e1fdf8-05e5-4121-bce1-fb5acde55492","resolution":{"observed_at":"2026-08-11T15:14:30.999591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.003152Z","title":"2023 , url =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.003152Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:021693339ba15eee3160f3ac351048c270c0eceafaf9e2e92c4c333e198034a5","observation_id":"92734b7a-db07-4d6d-9659-552b77650e4b","resolution":{"observed_at":"2026-08-11T15:14:31.003152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.006428Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.006428Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:6558f37cdcb73e8190cdadbc169dfc4a5aac8ed2ee915f112c014430ef2f84ec","observation_id":"3bece669-2d40-414f-bb49-228eee50de32","resolution":{"observed_at":"2026-08-11T15:14:31.006428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.125441Z","title":"International Conference on Learning Representations (ICLR) , year =","venue":null,"work_id":"6dd7d507-91c2-48dd-b764-92628549460e","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.010594Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:6a6086aa1fe23d418310d1f888642e71aec04853b0653a9718c1cc5f462f9909","observation_id":"99017870-c196-4656-8f59-c359729bf9e7","resolution":{"observed_at":"2026-08-11T15:14:32.129503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.115382Z","title":"Second Conference on Language Modeling , year =","venue":null,"work_id":"533b821a-2b10-4163-8941-abb611f7ee4d","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.015953Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:128799c7bf075dba2134e5fd50109fdc1cf8cde16acd3db62d598cc4b34390c5","observation_id":"e40c3af5-00e0-48ec-bc7a-d4b0a9fe2f33","resolution":{"observed_at":"2026-08-11T15:14:32.118597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.106066Z","title":"2026 , eprint =","venue":null,"work_id":"0bc80631-65f7-4c9d-805d-c7d545b3723d","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.020099Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a32883e5f0a5c8e44ddad753452f900b060a46214745f00d9c42ddff5ac98ad7","observation_id":"6dd801f0-3f9e-4817-8d7e-3e1cfa13d9cb","resolution":{"observed_at":"2026-08-11T15:14:32.109156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.054296Z","title":"2026 , eprint =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.054296Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3923f267aef8ebfac45c8b42f1bd8f418a87912e44f5c96b5dc10bc3d9333e89","observation_id":"735f970c-752e-4b13-9537-801c6497fb0e","resolution":{"observed_at":"2026-08-11T15:14:31.054296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11853","last_updated":"2026-05-14T10:19:32Z","snapshot_observed_at":"2026-08-11T13:15:20.785983Z","submitted_at":"2026-05-12T09:38:38Z","title":"GEAR: Granularity-Adaptive Advantage Reweighting for LLM Agents via Self-Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11853","snapshot_observed_at":"2026-08-11T15:14:31.058179Z","title":"2605.11853 , archivePrefix =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.058179Z"},"links":{"cited_paper":"/paper/2605.11853","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a6a11ed9c3028e7954af4c7512328e580d2c4a7c980766070f19a04653452c37","observation_id":"d178ae83-6349-47c7-9064-aaad55c6bdf3","resolution":{"observed_at":"2026-08-11T15:14:31.058179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.089118Z","title":"2023 , url =","venue":null,"work_id":"c47314ec-9eab-463e-baf5-9735e3277513","year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.073931Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:95d89f52152c5e358841dece692e9490f87aa27a1ecdd2fd81ac26756f7889a6","observation_id":"77e13218-f9ee-42fb-94a6-63aad1b95416","resolution":{"observed_at":"2026-08-11T15:14:32.092993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.078645Z","title":"2026 , month = may, eprint =","venue":null,"work_id":"9968a327-5adc-40a4-9b66-22850e1e728c","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.078010Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:0a3674da22c60996f4d64091a982adb1d98b0c5f812f3d44b46a66f930fc997b","observation_id":"ea3cc6d0-a8f2-415a-8700-49c02817f0e3","resolution":{"observed_at":"2026-08-11T15:14:32.082071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.067932Z","title":"Proceedings of the 43rd International Conference on Machine Learning , volume =","venue":null,"work_id":"75548c63-1312-45c0-adcc-018ddbc23d86","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.093811Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f0165a541a598a020d573093a7251324f27b2822f4ae7da43cbc18febb1240c4","observation_id":"afb1506b-0360-48a2-b815-4fcbb778c4b2","resolution":{"observed_at":"2026-08-11T15:14:32.071353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.057257Z","title":"Proceedings of the 43rd International Conference on Machine Learning , volume =","venue":null,"work_id":"1ccc88b0-bf30-4b9f-ab40-0763fdcb950a","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.099335Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:309298fb7cfbecd8ca6bf477b0d6fb99d4c173c7823123de6f08716435cb95c5","observation_id":"9625b209-5e08-4a6b-9e98-aa3ff18ffc87","resolution":{"observed_at":"2026-08-11T15:14:32.060992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.125179Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.125179Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:da212dc0cf9167f80f429de9f6c83182bcd401dbc78d0a5271b92a6618aadac6","observation_id":"ec4464c1-269d-46b5-87f9-ef545c6507cb","resolution":{"observed_at":"2026-08-11T15:14:31.125179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.139246Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.139246Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4e628ce71c7a761122e815b5c15d14ec77df0d4f55bfb557c597ff828a1d0354","observation_id":"c3291273-6664-455b-8734-e00f2be9b645","resolution":{"observed_at":"2026-08-11T15:14:31.139246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.021801Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":"a8c05843-f3c5-4fbe-97d4-5bd6c241a666","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.142247Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:611816887145d52ee5f190eb2422d149acc84cac7b105807ef7b2bd2a1006aad","observation_id":"2fadadc6-3f06-4d56-bdb6-f4c7f8fafa4a","resolution":{"observed_at":"2026-08-11T15:14:32.026672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:32.010590Z","title":"Findings of the Association for Computational Linguistics: EACL 2026 , pages=","venue":null,"work_id":"d3554620-e5a4-41d1-abf5-6ed812c18d1a","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.145122Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3dc2bcec98386cc1ef81ba3048c9375741b4f551b407130549584f599bb3ee25","observation_id":"94c8467a-5574-4b64-b110-113fa04877b1","resolution":{"observed_at":"2026-08-11T15:14:32.014141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.998612Z","title":"Findings of the Association for Computational Linguistics: EACL 2026 , pages=","venue":null,"work_id":"8c6b0f06-0542-457c-a9fd-8d570b7547c4","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.162221Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:5157eb0bfc555fc65237eb78d3f67b06ea3a993a094c115a7e63426642d18b70","observation_id":"e3d8046d-db4a-4506-925d-baf8001abceb","resolution":{"observed_at":"2026-08-11T15:14:32.003465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.988564Z","title":null,"venue":null,"work_id":"2f135faa-4366-402c-8358-4f34498354a6","year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.173862Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:2b881d92e7f246ae8fb16bf66047798d7a390d6970e294709d1d18a9669dea9b","observation_id":"c2e3fe46-1ea6-4bd7-a256-7a6315a69c4d","resolution":{"observed_at":"2026-08-11T15:14:31.992407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.177934Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.177934Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:26c15ecceea6ed75ea3eac33559a0eeb4a17a3d01f71062c8d4ca7e7048b4587","observation_id":"0fb8bede-4e9f-4bf5-80ef-f88c3eefe78c","resolution":{"observed_at":"2026-08-11T15:14:31.177934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.968894Z","title":null,"venue":null,"work_id":"11a3c55f-d981-4fdb-aa43-fb38e0e9acce","year":2024},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.183855Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:8a2aa174d1b7d8029a6bea5f83250f1bf80350a3c52cc7a5f6b624346edcfe78","observation_id":"b1f247c1-3cb1-4910-83e1-40bf05a79537","resolution":{"observed_at":"2026-08-11T15:14:31.973251Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01600","last_updated":"2025-03-08T05:23:57Z","snapshot_observed_at":"2026-08-11T20:02:47.955306Z","submitted_at":"2025-02-03T18:35:42Z","title":"Reinforcement Learning for Long-Horizon Interactive LLM Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01600","snapshot_observed_at":"2026-08-11T15:14:31.186850Z","title":"a henb \\","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.186850Z"},"links":{"cited_paper":"/paper/2502.01600","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3566049bd2aa058bbb1314d733142c43220a2d11190f1188e415132e68754b7a","observation_id":"7903429c-8806-47f5-980f-186ef96cb48c","resolution":{"observed_at":"2026-08-11T15:14:31.186850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.189966Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.189966Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:04b823e30a4dcbed67b4fa4d51702a4d4da00b43b569bfe1b2b463d6170b5bfe","observation_id":"4593b1e1-e865-42c5-80b1-38575037517d","resolution":{"observed_at":"2026-08-11T15:14:31.189966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.193019Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.193019Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f2878d03321b640556f74878f5314b773ce2e2f8b15e3c018239b34071847079","observation_id":"9f45d545-e925-4af2-bfa7-27ec2a10c16d","resolution":{"observed_at":"2026-08-11T15:14:31.193019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.949925Z","title":null,"venue":null,"work_id":"5a7deec5-76e2-491f-b94d-c2b157abca4f","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.196233Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3125cab91b4de6a546aaa74abb98533d06fa7d45003abf1e13ee562a53fcec95","observation_id":"71d40a3b-ce9c-42d6-80d4-a5be85594e34","resolution":{"observed_at":"2026-08-11T15:14:31.953664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-11T15:14:31.199401Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.199401Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f3d92c2fc95d9a7fba54633c6279424ce2cd513b9d98dd51a98d904c224bca46","observation_id":"6fa0560f-0a04-4218-8b47-06a2655faad2","resolution":{"observed_at":"2026-08-11T15:14:31.199401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02355","last_updated":"2026-06-01T15:02:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-01T15:02:59Z","title":"SIRI: Self-Internalizing Reinforcement Learning with Intrinsic Skills for LLM Agent Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02355","snapshot_observed_at":"2026-08-11T15:14:31.203282Z","title":"H.; Liu, X.; Wei, L.; Pan, L.; Zeng, K.; and Cai, X","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.203282Z"},"links":{"cited_paper":"/paper/2606.02355","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:b8a58f52bb3f144f3aaa7ab06a4514eec6d64c55b056bcd25953bc0f92883f61","observation_id":"ba50a996-3829-4f31-aa03-7ad9e382394e","resolution":{"observed_at":"2026-08-11T15:14:31.203282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.937775Z","title":"u botter, J.; L \\","venue":null,"work_id":"63eb5473-b4ff-4dba-ba43-61f067948d9d","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.207650Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:611dad39fae0b4cbd211961bb3bda521d3f6b3928e1702e0a7d5bfdd7e87e6d0","observation_id":"1a5adf60-4924-4522-bbdc-8762f73a4f17","resolution":{"observed_at":"2026-08-11T15:14:31.941921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20867","last_updated":"2026-02-24T13:11:38Z","snapshot_observed_at":"2026-08-07T21:03:43.270322Z","submitted_at":"2026-02-24T13:11:38Z","title":"SoK: Agentic Skills -- Beyond Tool Use in LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.20867","snapshot_observed_at":"2026-08-11T15:14:31.212116Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.212116Z"},"links":{"cited_paper":"/paper/2602.20867","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:0e21b7a955b82147ea2a7995c6a600150ec52c8f830c53f3214c9d29ad6d16d9","observation_id":"332ac8d8-a995-4f21-9355-a4f861712fe7","resolution":{"observed_at":"2026-08-11T15:14:31.212116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23493","last_updated":"2026-05-22T10:55:15Z","snapshot_observed_at":"2026-08-06T03:34:33.212532Z","submitted_at":"2026-05-22T10:55:15Z","title":"EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation","version":1},"cited_work":{"arxiv_id":"2605.23493","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.23493","snapshot_observed_at":"2026-08-11T15:14:31.549613Z","title":"EDGE-OPD: Internalizing Privileged Context with Evidence Guided On-Policy Distillation","venue":"cs.AI","work_id":"28f1b8aa-be82-4da4-abee-905a7325fbea","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.217336Z"},"links":{"cited_paper":"/paper/2605.23493","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:703d7c6fd3b6bab333d590bdb87b86a5cebb26795a97c2eee869f52a15824b31","observation_id":"2aab8971-1b3e-4fcf-8d37-b6971394b381","resolution":{"observed_at":"2026-08-11T15:14:31.556314Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.925171Z","title":null,"venue":null,"work_id":"1967d289-f44e-4945-8f29-aa6ad7caf916","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.221025Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a80dc051adc2c16da5a234103d1f13b13c669882cb57ade318cc4deaa8d02037","observation_id":"ebec9a3e-062a-4e55-a20f-6ed588e00157","resolution":{"observed_at":"2026-08-11T15:14:31.929641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.915203Z","title":"P.; Li, L.; and Li, Y","venue":null,"work_id":"77976229-1f6b-4a94-9680-8b2e2a9519e9","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.225101Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:d21c04107081c0ab91cd68fb231e7b10466a6337af36899bd0e539b23e363e70","observation_id":"7609e894-bf27-43ad-9b10-a3b69843474f","resolution":{"observed_at":"2026-08-11T15:14:31.918665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12670","last_updated":"2026-03-13T07:33:01Z","snapshot_observed_at":"2026-08-12T09:12:28.700231Z","submitted_at":"2026-02-13T07:06:06Z","title":"SkillsBench: Benchmarking How Well Agent Skills Work Across Diverse Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12670","snapshot_observed_at":"2026-08-11T15:14:31.229838Z","title":"W.; Sun, J.; Wang, S.; et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.229838Z"},"links":{"cited_paper":"/paper/2602.12670","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:b8731e12aafd5739dc1f7465901fcb08793dca27874f51918074c57d2d52e33f","observation_id":"503145b6-beff-4139-ba22-c6a09da9dca3","resolution":{"observed_at":"2026-08-11T15:14:31.229838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.08671","last_updated":"2026-07-06T18:50:16Z","snapshot_observed_at":"2026-08-05T17:50:36.183050Z","submitted_at":"2026-06-07T15:21:08Z","title":"SkillHone: A Harness for Continual Agent Skill Evolution Through Persistent Decision History","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.08671","snapshot_observed_at":"2026-08-11T15:14:31.233000Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.233000Z"},"links":{"cited_paper":"/paper/2606.08671","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4a3f588e6788bd9647bf49e463369d832a631e30def840a48164cc441648cf31","observation_id":"6a4ff8dd-f86f-4355-890f-0676403ec2fb","resolution":{"observed_at":"2026-08-11T15:14:31.233000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11559","last_updated":"2026-06-10T01:35:34Z","snapshot_observed_at":"2026-08-09T19:16:39.411102Z","submitted_at":"2026-06-10T01:35:34Z","title":"HERO: Hindsight-Enhanced Reflection from Environment Observations for Agentic Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11559","snapshot_observed_at":"2026-08-11T15:14:31.236567Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.236567Z"},"links":{"cited_paper":"/paper/2606.11559","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:c047aab90051395a88734ff20929930a92ae0f7cc91eea97bec227213616a6e9","observation_id":"b2730c46-5290-4f27-89a8-d2e32580b505","resolution":{"observed_at":"2026-08-11T15:14:31.236567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04323","last_updated":"2026-04-06T00:10:30Z","snapshot_observed_at":"2026-07-06T22:53:20.122451Z","submitted_at":"2026-04-06T00:10:30Z","title":"How Well Do Agentic Skills Work in the Wild: Benchmarking LLM Skill Usage in Realistic Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04323","snapshot_observed_at":"2026-08-11T15:14:31.241692Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.241692Z"},"links":{"cited_paper":"/paper/2604.04323","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a25497c2a019d397a58280eb48acb5026809bbeafcfa9e73195107b4617484c4","observation_id":"f0c112e7-467d-4bfd-ba97-f50e376d4d6d","resolution":{"observed_at":"2026-08-11T15:14:31.241692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15155","last_updated":"2026-05-14T17:51:26Z","snapshot_observed_at":"2026-08-06T01:14:44.790846Z","submitted_at":"2026-05-14T17:51:26Z","title":"Self-Distilled Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15155","snapshot_observed_at":"2026-08-11T15:14:31.246337Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.246337Z"},"links":{"cited_paper":"/paper/2605.15155","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:2f99bff943416dfd38c4d249c9e59c1786f980fad7f55ce0ac786bc501c49939","observation_id":"6bc7b0b5-192d-4e4c-bbdf-54a7ffb1cbc1","resolution":{"observed_at":"2026-08-11T15:14:31.246337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30406","last_updated":"2026-06-29T14:51:28Z","snapshot_observed_at":"2026-08-10T09:37:40.339025Z","submitted_at":"2026-06-29T14:51:28Z","title":"MOPD: Multi-Teacher On-Policy Distillation for Capability Integration in LLM Post-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30406","snapshot_observed_at":"2026-08-11T15:14:31.251390Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.251390Z"},"links":{"cited_paper":"/paper/2606.30406","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:2536621b63a8312a0a2b02ea49aeea95c4cdd6951c3cba7d7eb24f3061007dfe","observation_id":"5921ee81-82c8-4cdc-b881-177b858037a4","resolution":{"observed_at":"2026-08-11T15:14:31.251390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08377","last_updated":"2026-08-10T11:40:00Z","snapshot_observed_at":"2026-08-12T11:19:51.451103Z","submitted_at":"2026-04-09T15:38:27Z","title":"SkillClaw: Let Skills Evolve Collectively with Agentic Evolver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08377","snapshot_observed_at":"2026-08-11T15:14:31.255877Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.255877Z"},"links":{"cited_paper":"/paper/2604.08377","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:7bd191f7e7b1242176799724e5a73b0449affa5bdada732e0ce77e7ceb73a7be","observation_id":"acaa1adb-a251-4f1e-9c7a-a594570efc28","resolution":{"observed_at":"2026-08-11T15:14:31.255877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25158","last_updated":"2026-06-04T12:51:52Z","snapshot_observed_at":"2026-08-06T10:33:38.415457Z","submitted_at":"2026-03-26T08:26:38Z","title":"Trace2Skill: Distill Trajectory-Local Lessons into Transferable Agent Skills","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25158","snapshot_observed_at":"2026-08-11T15:14:31.259533Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.259533Z"},"links":{"cited_paper":"/paper/2603.25158","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:e1f1628dd26cc13b3081275bc4440195b50bda161631ab923bfe8a82390bd29d","observation_id":"2fd1d420-36c9-458a-b1cc-3269af44cfce","resolution":{"observed_at":"2026-08-11T15:14:31.259533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.264307Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.264307Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:c3e088a3ecfe6b55a1a0fa3870358a4a9fa469b73623e5fb3f6bed915e03a6f6","observation_id":"cc3f5913-16a2-4ea7-bcb1-91dc3ab8e900","resolution":{"observed_at":"2026-08-11T15:14:31.264307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11709","last_updated":"2026-06-10T06:31:59Z","snapshot_observed_at":"2026-07-06T23:50:44.713490Z","submitted_at":"2026-06-10T06:31:59Z","title":"RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11709","snapshot_observed_at":"2026-08-11T15:14:31.268830Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.268830Z"},"links":{"cited_paper":"/paper/2606.11709","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:98ed97da0ab667fbd19b312e674e65796224ff784deb5c69f4152d8b49baa072","observation_id":"9135da0c-edf4-4732-9c47-80ad2c89eb9a","resolution":{"observed_at":"2026-08-11T15:14:31.268830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05433","last_updated":"2026-07-03T04:38:21Z","snapshot_observed_at":"2026-08-10T22:36:17.106659Z","submitted_at":"2026-03-05T17:54:40Z","title":"CRISP: Compressed Reasoning via Iterative Self-Policy Distillation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05433","snapshot_observed_at":"2026-08-11T15:14:31.273003Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.273003Z"},"links":{"cited_paper":"/paper/2603.05433","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:40585e4047d2908c7ef2d29677df72ff9860aeb2a326aacd84317116d1bda96a","observation_id":"1943922d-9eaf-45a5-892e-17d2320a0630","resolution":{"observed_at":"2026-08-11T15:14:31.273003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-11T15:14:31.276375Z","title":"K.; Wu, Y.; and Guo, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.276375Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f7d791086e39cddfdb575cd5d89603859fa069ee68c9d47cee68ae7b0e869650","observation_id":"af4d37ac-b3d8-42e5-b92e-e11cc2b8acb3","resolution":{"observed_at":"2026-08-11T15:14:31.276375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.11609","last_updated":"2026-05-12T06:40:43Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:40:43Z","title":"Anti-Self-Distillation for Reasoning RL via Pointwise Mutual Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.11609","snapshot_observed_at":"2026-08-11T15:14:31.279791Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.279791Z"},"links":{"cited_paper":"/paper/2605.11609","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:2350ca4cae489f3f9b8c249568a8d1325619065b3cf52916cf237ffe9a47ac4e","observation_id":"f55933d3-ef4f-4477-af85-e6428f2678e7","resolution":{"observed_at":"2026-08-11T15:14:31.279791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-11T07:53:51.847466Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06130","snapshot_observed_at":"2026-08-11T15:14:31.282967Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.282967Z"},"links":{"cited_paper":"/paper/2605.06130","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:8dcba3ec6bbf1e98041b3d633dbe81563a742b49819de7656919934c5f48bc83","observation_id":"79d3ff01-bf7c-4ee0-8f10-d36bb43efd3a","resolution":{"observed_at":"2026-08-11T15:14:31.282967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.897987Z","title":null,"venue":null,"work_id":"7f2229fd-9e18-4e92-b709-fad022aaf424","year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.285811Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3ddf5454c624a540a246ff8cba2f443a43ea94f1ad93e06fa6a72613e7fca6df","observation_id":"5925ede0-620e-408d-85f7-5ffcc4a6cd17","resolution":{"observed_at":"2026-08-11T15:14:31.900861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.289006Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.289006Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f9754a17eae0d604ca0c380a7e1f91f06601fbfedf93da2d18b5cd362a577acd","observation_id":"03d315e8-672a-4aaf-9c97-5582db8c0e50","resolution":{"observed_at":"2026-08-11T15:14:31.289006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10674","snapshot_observed_at":"2026-08-11T15:14:31.293116Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.293116Z"},"links":{"cited_paper":"/paper/2604.10674","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:d3466d68e93f75ade7600e48a8e5e8300ee1dc739f1e964d7354c9a9341f80b7","observation_id":"65f63379-d7dc-45ae-a4dd-85fe6f5ba98a","resolution":{"observed_at":"2026-08-11T15:14:31.293116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24005","last_updated":"2026-04-29T03:05:32Z","snapshot_observed_at":"2026-08-10T23:56:18.365834Z","submitted_at":"2026-04-27T03:38:27Z","title":"TCOD: Exploring Temporal Curriculum in On-Policy Distillation for Multi-turn Autonomous Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24005","snapshot_observed_at":"2026-08-11T15:14:31.296243Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.296243Z"},"links":{"cited_paper":"/paper/2604.24005","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:9f09ce124858369d7fdcf0c4369c86651aa62c5f1bf1e680fb207f892eddfc25","observation_id":"4a6e1d17-bafa-4b86-896e-574f0074307b","resolution":{"observed_at":"2026-08-11T15:14:31.296243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.880050Z","title":null,"venue":null,"work_id":"0d2c6d8e-b88b-4581-9da7-778ffd2d8ec0","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.299306Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:81e488def919ed9799220f9f4287abb616a8f8aa49a7861f33334f2b417a2085","observation_id":"696b4123-bccf-47e3-9afe-e2687846f7ec","resolution":{"observed_at":"2026-08-11T15:14:31.883537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12430","last_updated":"2026-06-02T16:14:54Z","snapshot_observed_at":"2026-08-06T11:11:16.632352Z","submitted_at":"2026-02-12T21:33:25Z","title":"Agent Skills for Large Language Models: Architecture, Acquisition, Security, and the Path Forward","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12430","snapshot_observed_at":"2026-08-11T15:14:31.302274Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.302274Z"},"links":{"cited_paper":"/paper/2602.12430","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:795972ac58f73ab4109c850fc468054601cce3f3ec964cd1f1082b93837a4d24","observation_id":"a6f46b7f-6602-40b4-bc82-886745447927","resolution":{"observed_at":"2026-08-11T15:14:31.302274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-11T15:14:31.305540Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.305540Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4050cf84c9cac0666252cb0ea6802cdd72f1e17c92ad1c5195e31fda7e8e3b6b","observation_id":"f746a172-24c2-4525-ab6c-2d609408231b","resolution":{"observed_at":"2026-08-11T15:14:31.305540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-11T15:14:31.309205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.309205Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:0a20362e542ceba5f60e59f696ea2dd1465a9bd015ca6c246ce0c374df160101","observation_id":"c4a4b54e-0ca0-4b12-9818-4f47142fabfa","resolution":{"observed_at":"2026-08-11T15:14:31.309205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-11T15:14:31.312419Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.312419Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f25d680ad08f0dae515f5218a383ee433de327b39eb1b9691962fd73eaed2314","observation_id":"53025679-a086-473e-8a08-d6103d765c5c","resolution":{"observed_at":"2026-08-11T15:14:31.312419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.26790","last_updated":"2026-06-25T09:24:09Z","snapshot_observed_at":"2026-08-07T13:00:04.957958Z","submitted_at":"2026-06-25T09:24:09Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.26790","snapshot_observed_at":"2026-08-11T15:14:31.316254Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.316254Z"},"links":{"cited_paper":"/paper/2606.26790","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:3d6fdb81cb6d5e5abd459b6fbf26071a7682fffd533a9643c6dbf12483eb3ee0","observation_id":"f5ef13e7-1098-48c1-96ef-4159d503cbcd","resolution":{"observed_at":"2026-08-11T15:14:31.316254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12400","last_updated":"2026-05-29T21:49:52Z","snapshot_observed_at":"2026-08-11T02:55:09.334858Z","submitted_at":"2026-05-12T17:00:53Z","title":"OGLS-SD: On-Policy Self-Distillation with Outcome-Guided Logit Steering for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12400","snapshot_observed_at":"2026-08-11T15:14:31.319381Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.319381Z"},"links":{"cited_paper":"/paper/2605.12400","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:4c19d92ba3f9fe19287a458dbb7e2bae1bb98643ae434a09f3f38c8fb2d26625","observation_id":"406e0b03-90a7-46b6-93ee-5ce3060a1db3","resolution":{"observed_at":"2026-08-11T15:14:31.319381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.868594Z","title":null,"venue":null,"work_id":"641acf8b-eff2-43f2-920e-7f3f851ea762","year":2022},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.323263Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:b100ba6f3d4fc66d7361f5e51cdd0c290f1997365301b8e5ca3d74611972b8ab","observation_id":"f08f7ea4-21a0-4269-b632-0ab9f03f23e1","resolution":{"observed_at":"2026-08-11T15:14:31.872955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.856686Z","title":null,"venue":null,"work_id":"d7e39046-c0d4-4dcc-b23f-98126e0c2080","year":2023},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.328269Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a98e57190771eab2021a93611548515f0b1c44f89ec99b2a322e4d772b241bef","observation_id":"88209d9f-c0b7-47df-a118-3fe92ac2f159","resolution":{"observed_at":"2026-08-11T15:14:31.860620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.10500","last_updated":"2026-05-11T12:58:25Z","snapshot_observed_at":"2026-08-05T13:34:21.296589Z","submitted_at":"2026-05-11T12:58:25Z","title":"SkillEvolver: Skill Learning as a Meta-Skill","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.10500","snapshot_observed_at":"2026-08-11T15:14:31.332594Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.332594Z"},"links":{"cited_paper":"/paper/2605.10500","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f72f9d0c025e035d0cd10760073ef06fdfef60633c082a11084a35ce1288b2aa","observation_id":"a9b215d6-3d46-4fa7-bae0-17f50f5065f8","resolution":{"observed_at":"2026-08-11T15:14:31.332594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17535","last_updated":"2026-04-19T16:53:56Z","snapshot_observed_at":"2026-08-11T18:52:03.718702Z","submitted_at":"2026-04-19T16:53:56Z","title":"OPSDL: On-Policy Self-Distillation for Long-Context Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17535","snapshot_observed_at":"2026-08-11T15:14:31.336027Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.336027Z"},"links":{"cited_paper":"/paper/2604.17535","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:32ff930ca8eb072f5e911c523473b25ad014d549b9d16ec39be11e87cd3a4427","observation_id":"0be07b05-d407-4886-b3e9-ad59563e7207","resolution":{"observed_at":"2026-08-11T15:14:31.336027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27140","last_updated":"2026-05-26T15:07:03Z","snapshot_observed_at":"2026-08-02T02:39:25.917076Z","submitted_at":"2026-05-26T15:07:03Z","title":"StepOPSD: Step-Aware Online Preference Distillation for Agent Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27140","snapshot_observed_at":"2026-08-11T15:14:31.339899Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.339899Z"},"links":{"cited_paper":"/paper/2605.27140","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:a4698019eac3890ce16a4e8be316ad181dbab9df14f650b75ddfe07640a01346","observation_id":"09ad5cc2-8a49-43e4-9f4d-fdf361eb19f7","resolution":{"observed_at":"2026-08-11T15:14:31.339899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:14:31.844119Z","title":null,"venue":null,"work_id":"f5484703-cc08-4cdb-b5e8-6bb5dadf17c9","year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.343797Z"},"links":{"citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:35d088c5b1e61d2d095abf596b34ff6e8dc52ad2c0f2f7636296e389b495dc79","observation_id":"2a11cf51-f63a-403c-aa6c-549e0cf300b3","resolution":{"observed_at":"2026-08-11T15:14:31.848387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.10688","last_updated":"2026-05-30T16:08:24Z","snapshot_observed_at":"2026-08-02T07:46:19.307542Z","submitted_at":"2026-04-12T15:26:14Z","title":"SCOPE: Signal-Calibrated On-Policy Distillation Enhancement with Dual-Path Adaptive Weighting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10688","snapshot_observed_at":"2026-08-11T15:14:31.348326Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.348326Z"},"links":{"cited_paper":"/paper/2604.10688","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:f60c508386835e2ccc573cd9528fe7b12b6ea66776ab61b24f7812b2fda5c67b","observation_id":"2782d5f9-46e7-437d-90e8-8929a3f50b8b","resolution":{"observed_at":"2026-08-11T15:14:31.348326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.07725","last_updated":"2026-08-03T03:33:59Z","snapshot_observed_at":"2026-08-12T00:11:13.784256Z","submitted_at":"2026-05-08T13:30:42Z","title":"SOD: Step-wise On-policy Distillation for Small Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.07725","snapshot_observed_at":"2026-08-11T15:14:31.352194Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-11T15:14:31.352194Z"},"links":{"cited_paper":"/paper/2605.07725","citing_paper":"/paper/2608.09555"},"observation_digest":"sha256:ee5d9642348340c2211786f9b1e8010328104a1e12f89168bd63029c4ee7e865","observation_id":"599e9b4b-7b41-4dfb-b197-fbe4ed3e0544","resolution":{"observed_at":"2026-08-11T15:14:31.352194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09555","last_updated":"2026-08-10T12:53:06Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T11:22:41.516262Z","submitted_at":"2026-08-10T12:53:06Z","title":"Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.09555."}