{"as_of":"2026-08-10T06:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7171ee8d37accc2ea0551614012b7be8846369bb5591a0778fe359bac782e632","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:17:44.662944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2510.13727","last_updated":"2026-05-19T04:39:26Z","snapshot_observed_at":"2026-08-02T19:37:00.796741Z","submitted_at":"2025-10-15T16:30:57Z","title":"From Refusal to Recovery: A Control-Theoretic Approach to Generative AI Guardrails","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-21T20:42:40.823721Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2510.13727"},"observation_digest":"sha256:e543b5a60e58594c4ef3902e8e5fd04c58934e94a752ad34d01cb29475d7c065","observation_id":"ab033493-353e-4c3c-86e5-a01590349bc5","resolution":{"observed_at":"2026-05-21T20:44:22.032163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-04T07:17:44.662944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26270","last_updated":"2026-05-28T11:04:33Z","snapshot_observed_at":"2026-08-10T01:18:05.688661Z","submitted_at":"2025-10-30T08:53:41Z","title":"Graph-Enhanced Policy Optimization in LLM Agent Training","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T07:17:44.662944Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2510.26270"},"observation_digest":"sha256:2ef246daca982e4122bcf8d95c2f9812913ee67882df451d0710cc4b57d46de4","observation_id":"1bac4949-4614-4099-84cb-bf272862a396","resolution":{"observed_at":"2026-08-04T07:17:44.662944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2601.06794","last_updated":"2026-04-14T15:14:10Z","snapshot_observed_at":"2026-08-02T16:11:51.558737Z","submitted_at":"2026-01-11T07:29:08Z","title":"No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T16:01:48.789986Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2601.06794"},"observation_digest":"sha256:84e9fa145e0e635c276ff8ea1232a09cdcac8eaf1429c14d4147aaed27dd1425","observation_id":"65ecc095-b3c4-4c04-8fd5-45bd71d0c2f1","resolution":{"observed_at":"2026-05-16T16:03:04.350165Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T23:41:44.971735Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-08T22:51:28.920174Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:44.971735Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:b9d029b7ea1a80e7994be4641bc7d61430e9f73ac2852eeecc4701ffe186f356","observation_id":"521c8bd2-31d2-4ddf-bc5f-0bfa840077e2","resolution":{"observed_at":"2026-08-02T23:41:44.971735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2603.00977","last_updated":"2026-05-05T03:37:16Z","snapshot_observed_at":"2026-08-02T14:44:32.701926Z","submitted_at":"2026-03-01T08:09:03Z","title":"HiMAC: Hierarchical Macro-Micro Learning for Long-Horizon LLM Agents","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T18:35:45.900606Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2603.00977"},"observation_digest":"sha256:49fd60b6df7212340240dbcc4bca2efc2fa5a7b098e513b47de61581813a54f8","observation_id":"62076d23-5f87-47e3-b40e-a118ffdc1d62","resolution":{"observed_at":"2026-05-15T18:36:28.302124Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2604.18133","last_updated":"2026-04-20T12:00:31Z","snapshot_observed_at":"2026-08-03T09:21:05.928583Z","submitted_at":"2026-04-20T12:00:31Z","title":"Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-10T04:31:28.242097Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2604.18133"},"observation_digest":"sha256:e1e1d281134d490fefa1e91f3575cdb25be90c971f3c9f1e099d7a646ef467c6","observation_id":"80e94209-9660-4f03-9d68-3a17f887eee7","resolution":{"observed_at":"2026-05-11T11:51:04.003863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2604.18975","last_updated":"2026-04-21T01:58:02Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T01:58:02Z","title":"Gated Coordination for Efficient Multi-Agent Collaboration in Minecraft Game","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T02:03:01.533652Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2604.18975"},"observation_digest":"sha256:08993411290b197bb5b5c8985055087bcfeafe1c82380468d941f20662ca9841","observation_id":"a0a00fb7-0848-4b85-af89-ff144e01af2a","resolution":{"observed_at":"2026-05-11T13:16:10.668460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2604.20572","last_updated":"2026-06-04T08:43:34Z","snapshot_observed_at":"2026-07-12T18:42:36.160780Z","submitted_at":"2026-04-22T13:50:55Z","title":"Ask Only When Needed: Proactive Retrieval from Memory and Skills for Experience-Driven Lifelong Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T00:07:50.798934Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2604.20572"},"observation_digest":"sha256:85647d99e5f7c9aab8e66e73ecd6f1636213dbfb4291cbe6e86d1b084b492811","observation_id":"3f2fe3ee-5043-4fd1-86a5-ce7f9e1e0052","resolution":{"observed_at":"2026-05-10T00:24:47.266164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.02572","last_updated":"2026-05-04T13:25:05Z","snapshot_observed_at":"2026-07-06T23:15:37.099197Z","submitted_at":"2026-05-04T13:25:05Z","title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-08T18:13:25.735085Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.02572"},"observation_digest":"sha256:7d30853f19a4e3ff4586bc3e30f099d4358dbcc103b8bbbcfb84726ee8cbd46c","observation_id":"d56ae31f-1127-4d63-8d06-b6f79feefa8a","resolution":{"observed_at":"2026-05-09T06:40:40.777758Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:962df6656db0ce9c0d140b4577960beffe6debe12466ad90941175540b1565fc","observation_id":"62f24da8-3e94-423f-9baa-ad1e2f5b43ee","resolution":{"observed_at":"2026-05-11T20:11:12.218032Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.06761","last_updated":"2026-05-07T17:17:10Z","snapshot_observed_at":"2026-07-06T23:19:10.574595Z","submitted_at":"2026-05-07T17:17:10Z","title":"Weblica: Scalable and Reproducible Training Environments for Visual Web Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T01:25:44.578007Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.06761"},"observation_digest":"sha256:043b34eb25bf803bd24b7224e7a5242d2b87b4c36118e2afd00a82c55a90f5ee","observation_id":"1e85163d-8550-442e-9751-e64bd6830b91","resolution":{"observed_at":"2026-05-11T04:25:56.957645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.08715","last_updated":"2026-05-13T23:06:48Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:55:19Z","title":"AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-12T01:19:49.062330Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.08715"},"observation_digest":"sha256:486b495da60b960d67596cd46de9d6b334be631350961eff6d983b3ea67dfa01","observation_id":"8088afa4-dd0d-4fa3-8c33-a1292a4c46b5","resolution":{"observed_at":"2026-05-12T08:06:27.547132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.08715","last_updated":"2026-05-13T23:06:48Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T05:55:19Z","title":"AgentForesight: Online Auditing for Early Failure Prediction in Multi-Agent Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-15T05:24:54.265411Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.08715"},"observation_digest":"sha256:e81111257db23529d891fbb37c2aee1ce93d09a4f544d06a6ad9ec0c8ef5a78e","observation_id":"a6a7d221-1648-47b6-aefe-2964ec339729","resolution":{"observed_at":"2026-05-15T05:25:03.885299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11706","last_updated":"2026-05-12T07:59:41Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T07:59:41Z","title":"GRAFT: Graph-Tokenized LLMs for Tool Planning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T07:22:03.560420Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11706"},"observation_digest":"sha256:303c9e7122081f9f7e3e482d32857a2bc74904b24e55e50fac7c20d3cccacf8f","observation_id":"f9d5f345-c44a-4e88-8985-0fe8803df340","resolution":{"observed_at":"2026-05-13T07:22:28.269254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T07:30:41.399083Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:db1042cdd4ba01f468336a89692c559d5c459e3a50a23bb3414f733eda171042","observation_id":"d857d5c2-67c7-46cb-a55c-bc15d944de6b","resolution":{"observed_at":"2026-05-13T07:32:28.836944Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.11775","last_updated":"2026-05-14T14:02:12Z","snapshot_observed_at":"2026-08-02T16:41:29.324903Z","submitted_at":"2026-05-12T08:47:05Z","title":"Entropy Polarity in Reinforcement Fine-Tuning: Direction, Asymmetry, and Control","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:32.640299Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.11775"},"observation_digest":"sha256:1c6a91656bbbe995dd3e0732b0627310db4589465e6187683fef1be34833e1cc","observation_id":"199a2e9b-eb9a-4a3a-940b-4e6a27353c78","resolution":{"observed_at":"2026-05-15T06:05:05.669079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.12289","last_updated":"2026-05-12T15:47:18Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:47:18Z","title":"PriorZero: Bridging Language Priors and World Models for Decision Making","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T05:25:05.907123Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.12289"},"observation_digest":"sha256:bfd354f536f1854e50b13cb27646146cd1d6f19466cb31eb258f3152f0cfefe1","observation_id":"72827b3b-f976-4a54-9e0e-970c19d50e4d","resolution":{"observed_at":"2026-05-13T05:27:18.624132Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.14558","last_updated":"2026-05-14T08:33:02Z","snapshot_observed_at":"2026-07-06T23:25:58.895612Z","submitted_at":"2026-05-14T08:33:02Z","title":"Resolving Action Bottleneck: Agentic Reinforcement Learning Informed by Token-Level Energy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-15T01:46:24.724553Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.14558"},"observation_digest":"sha256:7e6f00f93914de0eb899054a7a032c1a50a2b0fd372e127e90dea854f1b35258","observation_id":"468889c8-af3e-4213-baa3-d9b4c468334a","resolution":{"observed_at":"2026-05-15T01:48:28.618421Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-08T09:54:59.992034Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:2b99eec480867d738dd1b494236c51ff1b115f684f80e4c84d5bf625ff2eeaec","observation_id":"e1ac94f0-db25-4541-9ebc-593bb43dfd4e","resolution":{"observed_at":"2026-05-19T18:02:42.395542Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.20061","last_updated":"2026-05-19T16:19:29Z","snapshot_observed_at":"2026-08-07T09:15:12.932880Z","submitted_at":"2026-05-19T16:19:29Z","title":"Rewarding Beliefs, Not Actions: Consistency-Guided Credit Assignment for Long-Horizon Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:35:45.084011Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.20061"},"observation_digest":"sha256:0a25e2248c4ce1b698a6861a570e914d8c51fc526a7fa5d905f81b7b571ee0bf","observation_id":"b59c1e80-b311-4087-a119-9dbbe090a57a","resolution":{"observed_at":"2026-05-20T05:38:05.470067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2509.08755","doi":"10.48550/arxiv.2509.08755","metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning","venue":"ArXiv.org","work_id":"acf16fe3-7cbe-4d5f-a8f8-24f6c14fb557","year":2025},"citing_paper":{"arxiv_id":"2605.27760","last_updated":"2026-05-26T23:18:43Z","snapshot_observed_at":"2026-07-06T23:37:27.309837Z","submitted_at":"2026-05-26T23:18:43Z","title":"SkillGrad: Optimizing Agent Skills Like Gradient Descent","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T16:46:09.930635Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2605.27760"},"observation_digest":"sha256:1d282591a47984be03e9d892a6b90112b9400734423661e40871a3180595d8e3","observation_id":"8d583fbf-e3c7-403d-b117-3b59177e3305","resolution":{"observed_at":"2026-06-29T16:53:41.304135Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-08-06T23:48:50.589215Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:00af689f31138a7173242721fb6508a6bb69b140efe95e0f0d32af1b84545498","observation_id":"6b1e739c-bb86-4664-9402-992f048bad50","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T09:45:49.609534Z","title":"Agentgym- rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-09T16:36:39.554256Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.609534Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:b662e366ddd78adfcde7a70ce6c205f9bf9ce01c198220c08ab59f7e1c406a50","observation_id":"763e6f28-3062-4056-96fa-b9052d9b42fb","resolution":{"observed_at":"2026-08-02T09:45:49.609534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-02T08:56:35.257327Z","title":"(2025).AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning.CoRR, abs/2509.08755.https://doi.org/10.48550/arXiv.2509.08755","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19395","last_updated":"2026-07-03T05:07:22Z","snapshot_observed_at":"2026-08-07T06:27:15.086404Z","submitted_at":"2026-07-03T05:07:22Z","title":"From Trajectories to Prefixes: Reusing Teacher Trajectories via Replayed Prefixes and Online Continuation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:35.257327Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.19395"},"observation_digest":"sha256:5a35a66a7b662ade81d12d1af9a269f54f82578a840c9de11dc577cf005eedeb","observation_id":"1a45e017-0649-429c-b45c-3054a1e94154","resolution":{"observed_at":"2026-08-02T08:56:35.257327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-08-01T12:36:12.420962Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19523","last_updated":"2026-07-21T19:10:38Z","snapshot_observed_at":"2026-08-06T11:26:29.786981Z","submitted_at":"2026-07-21T19:10:38Z","title":"When Reasoning Narrows the Move: Diversity Collapse in LLM Game Play","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T12:36:12.420962Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.19523"},"observation_digest":"sha256:7db67e1a1cdd7eda7e9d75f8e695b2d26d67c51ca1927557efa265ff40f885f5","observation_id":"1934517f-cac9-4a64-9ac3-74851e6dce68","resolution":{"observed_at":"2026-08-01T12:36:12.420962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08755","snapshot_observed_at":"2026-07-30T21:12:59.428554Z","title":"Agentgym-rl: Training llm agents for long-horizon decision making through multi-turn reinforcement learning.arXiv preprint arXiv:2509.08755,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26784","last_updated":"2026-07-29T11:26:33Z","snapshot_observed_at":"2026-08-09T01:01:14.362201Z","submitted_at":"2026-07-29T11:26:33Z","title":"SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T21:12:59.428554Z"},"links":{"cited_paper":"/paper/2509.08755","citing_paper":"/paper/2607.26784"},"observation_digest":"sha256:07e3c24107a0f9fed94e5ecf1e3a05b118998b85aab304219fddf97924dfae2b","observation_id":"4e2c48f9-e951-48b3-8d4a-71238d638059","resolution":{"observed_at":"2026-07-30T21:12:59.428554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08755/citation-record","integrity":"/paper/2509.08755/integrity","json":"/paper/2509.08755/citation-record.json","paper":"/paper/2509.08755"},"outbound":[],"paper":{"arxiv_id":"2509.08755","last_updated":"2025-09-10T16:46:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-04T20:10:08.337431Z","submitted_at":"2025-09-10T16:46:11Z","title":"AgentGym-RL: Training LLM Agents for Long-Horizon Decision Making through Multi-Turn Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2509.08755."}