{"as_of":"2026-08-05T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5be83b60172d6056ba1a1f800b0b8ab5c4c0eff2877c53c9099e323e1713da2","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T19:19:36.427337Z","state":"measured"},{"denominator":164,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":164,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":64,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T13:31:24.753889Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2507.08339","last_updated":"2026-04-12T15:21:28Z","snapshot_observed_at":"2026-08-03T04:47:14.414076Z","submitted_at":"2025-07-11T06:37:44Z","title":"What Factors Affect LLMs and RLLMs in Financial Question Answering?","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-19T05:06:43.406540Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2507.08339"},"observation_digest":"sha256:1a2bdb26b687bcd4b01a704924a9fa6557fd14b0eb2573f9ccc29a456ad706ce","observation_id":"d0843f26-55b0-4b87-80d1-6ab94b23f010","resolution":{"observed_at":"2026-05-19T05:07:04.507042Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2510.07794","last_updated":"2026-04-11T16:18:46Z","snapshot_observed_at":"2026-08-02T18:15:50.626896Z","submitted_at":"2025-10-09T05:13:10Z","title":"HiPRAG: Hierarchical Process Rewards for Efficient Agentic Retrieval Augmented Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T09:27:17.760078Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2510.07794"},"observation_digest":"sha256:72446083999982c4dc8fb3bb73886285e3393e14d46ba2b78e91e45182b26dfc","observation_id":"c2a11b12-6c43-47a2-a4f2-f527bcfd31f6","resolution":{"observed_at":"2026-05-18T09:31:11.965415Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-04T07:17:44.680792Z","title":"structural blindness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.26270","last_updated":"2026-05-28T11:04:33Z","snapshot_observed_at":"2026-08-04T16:18:16.535621Z","submitted_at":"2025-10-30T08:53:41Z","title":"Graph-Enhanced Policy Optimization in LLM Agent Training","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T07:17:44.680792Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2510.26270"},"observation_digest":"sha256:6b8f3468788d22e175c6c84c24d2ef4fe4aeeb7f237b214cd60beed024811118","observation_id":"8bdd12ed-b601-491c-adce-b6b0c8e02f79","resolution":{"observed_at":"2026-08-04T07:17:44.680792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2511.21678","last_updated":"2026-05-02T09:08:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-26T18:55:08Z","title":"Agentic Learner with Grow-and-Refine Multimodal Semantic Memory","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T04:27:40.232015Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2511.21678"},"observation_digest":"sha256:bfa879d1cd9c720a3a13ffa92147fc6076e4356c98decfd0afbb7e769c3340be","observation_id":"23833c0c-2daa-4777-bb4e-3bbb44933c9d","resolution":{"observed_at":"2026-05-17T04:29:01.636424Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2512.08980","last_updated":"2026-04-03T08:53:56Z","snapshot_observed_at":"2026-07-06T22:38:13.359449Z","submitted_at":"2025-12-05T10:02:38Z","title":"Training Multi-Image Vision Agents via End2End Reinforcement Learning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-17T00:59:28.618477Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2512.08980"},"observation_digest":"sha256:6957fb89b80a233e6f5aeb0bc582c7a8b71869239b11eb51525b30b227337fe4","observation_id":"92811bb6-2bb7-4dc7-a1f5-a1d8d3323824","resolution":{"observed_at":"2026-05-17T01:01:24.314958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2601.12538","last_updated":"2026-01-18T18:58:23Z","snapshot_observed_at":"2026-08-04T22:42:23.171653Z","submitted_at":"2026-01-18T18:58:23Z","title":"Agentic Reasoning for Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-17T15:14:25.558878Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2601.12538"},"observation_digest":"sha256:c94db69b19ecf6a86d86a3fef107a27e89b3a9a2e958fb6a578ab55c7ef1d807","observation_id":"c1ee493e-32f3-4ecb-b41d-38c9b4c1c565","resolution":{"observed_at":"2026-05-17T15:14:25.827351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2601.18664","last_updated":"2026-05-18T05:37:00Z","snapshot_observed_at":"2026-08-02T19:20:47.252158Z","submitted_at":"2026-01-26T16:40:37Z","title":"S$^2$GR: Stepwise Semantic-Guided Reasoning in Latent Space for Generative Recommendation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T14:23:44.856958Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2601.18664"},"observation_digest":"sha256:0c6e73bf3d93f140e7c773d4b62e4f35ef450ac08023c9c67facdce7ba5f5330","observation_id":"beb3b442-90aa-4ef1-9b55-b1494c07e1e6","resolution":{"observed_at":"2026-05-21T14:24:12.918784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2602.09514","last_updated":"2026-05-09T05:05:58Z","snapshot_observed_at":"2026-07-06T22:45:15.978102Z","submitted_at":"2026-02-10T08:12:23Z","title":"EcoGym: Evaluating LLMs for Long-Horizon Plan-and-Execute in Interactive Economies","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T05:53:29.860037Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2602.09514"},"observation_digest":"sha256:fde9d564b8da360b06f7eaa89cef61afe6f57ec6be7493f674181314c68ee81d","observation_id":"d1b03946-a403-41ed-a954-c463b59934b3","resolution":{"observed_at":"2026-05-16T05:57:24.560026Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T23:41:45.930272Z","title":"The landscape of agentic reinforcement learning for llms: A survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12984","last_updated":"2026-05-30T12:51:16Z","snapshot_observed_at":"2026-08-02T23:41:39.933162Z","submitted_at":"2026-02-13T14:58:18Z","title":"SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T23:41:45.930272Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2602.12984"},"observation_digest":"sha256:6f42fafac17940be3231c85856e6b0d90249c8273f8ab01a01c1fbc97745acac","observation_id":"a3a7ae48-876a-4096-9503-ade0391bc9f1","resolution":{"observed_at":"2026-08-02T23:41:45.930272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.06111","last_updated":"2026-04-10T03:07:44Z","snapshot_observed_at":"2026-08-02T21:04:18.191344Z","submitted_at":"2026-04-07T17:21:28Z","title":"AgentCE-Bench: Agent Configurable Evaluation with Scalable Horizons and Controllable Difficulty under Lightweight Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:46.077831Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.06111"},"observation_digest":"sha256:57a567eb8db0a14276be6236150e8837744445c6bc9609ca2cc34fc4b196d603","observation_id":"adcc7487-9bed-42e4-b1cd-e7fca77e05a9","resolution":{"observed_at":"2026-05-10T23:30:49.538465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.07720","last_updated":"2026-04-10T16:24:42Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T02:06:27Z","title":"Towards Knowledgeable Deep Research: Framework and Benchmark","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:17:35.879705Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.07720"},"observation_digest":"sha256:ad5064cfda37ceda29c694b58f05545ad83b07ead4d2e466c6f0ebf6755cbdca","observation_id":"8edec5fe-a6ba-4813-ad89-71f80131a018","resolution":{"observed_at":"2026-05-11T05:10:54.620416Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:33de5d697d82367b43caa038849d9960f4830184f0325cc694006fd3263d6c1b","observation_id":"0fdc4e7b-aceb-41ba-a193-4fd9624d5aea","resolution":{"observed_at":"2026-05-11T05:21:00.050350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.09455","last_updated":"2026-04-10T16:14:48Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:14:48Z","title":"E3-TIR: Enhanced Experience Exploitation for Tool-Integrated Reasoning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T18:08:18.056525Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.09455"},"observation_digest":"sha256:b995ad56f4a9534a208e3c75d72317a8fb3b61e8083ed78c2ff1405da038c6d6","observation_id":"4a6fd09a-7f0f-4c66-888e-bfd364676651","resolution":{"observed_at":"2026-05-11T05:25:59.858348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.09459","last_updated":"2026-04-13T12:08:22Z","snapshot_observed_at":"2026-07-06T22:58:21.624968Z","submitted_at":"2026-04-10T16:17:44Z","title":"From Reasoning to Agentic: Credit Assignment in Reinforcement Learning for Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:36.341574Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.09459"},"observation_digest":"sha256:bc98443bef5ee5c8902968bcb637db1fc0b7ff2868754b1953f051995655df07","observation_id":"e20370d8-dd87-4dfd-a222-7e82f415063a","resolution":{"observed_at":"2026-05-11T07:30:58.534608Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.17989","last_updated":"2026-04-20T09:12:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:12:47Z","title":"AIT Academy: Cultivating the Complete Agent with a Confucian Three-Domain Curriculum","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T05:08:54.560648Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.17989"},"observation_digest":"sha256:fe5320138a6d168c3bc0e3f2072603d647092b49c7717bb834c92013a5c1e7d1","observation_id":"c0add783-059e-4a77-b22d-44111e535a31","resolution":{"observed_at":"2026-05-10T09:43:49.907062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.18133","last_updated":"2026-04-20T12:00:31Z","snapshot_observed_at":"2026-08-03T09:21:05.928583Z","submitted_at":"2026-04-20T12:00:31Z","title":"Multi-Agent Systems: From Classical Paradigms to Large Foundation Model-Enabled Futures","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T04:31:28.242097Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.18133"},"observation_digest":"sha256:de644e7fd5efcf3efa915bbd3e56f0e3fa73b4d8bada8ef649bf5efeb3b1a397","observation_id":"2e0677ef-c984-4342-91ac-3cc70a947423","resolution":{"observed_at":"2026-05-11T11:51:03.843942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.18292","last_updated":"2026-04-20T14:01:10Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:01:10Z","title":"Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-10T05:24:00.503836Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.18292"},"observation_digest":"sha256:ef814b3271b58d79eb632623dc0572ae8c90a66d0280801ddae8fba4a21538db","observation_id":"1a0a8b86-ff0b-471a-bd3b-9e16118db1ff","resolution":{"observed_at":"2026-05-10T05:25:54.680633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.18401","last_updated":"2026-06-21T13:04:23Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:22:39Z","title":"StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T04:26:59.781416Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.18401"},"observation_digest":"sha256:18b814cc13eeafa40e52147a1abd3d57790b5f33b4cf789885d9f7b0dd759cd4","observation_id":"307ac012-d529-4d07-9023-23f6f40fd6f5","resolution":{"observed_at":"2026-05-11T11:56:29.963355Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.18401","last_updated":"2026-06-21T13:04:23Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T15:22:39Z","title":"StepPO: Step-Aligned Policy Optimization for Agentic Reinforcement Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-05T12:23:00.487399Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.18401"},"observation_digest":"sha256:f2766dbd0e6148d3a00805cc4087fa8148338555d9677ec82139960384a805a0","observation_id":"6001819a-e57f-4286-a0be-10e7bb80ca33","resolution":{"observed_at":"2026-07-05T12:30:59.985134Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.19907","last_updated":"2026-04-21T18:33:15Z","snapshot_observed_at":"2026-07-06T23:06:26.596990Z","submitted_at":"2026-04-21T18:33:15Z","title":"SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T03:22:30.012610Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.19907"},"observation_digest":"sha256:eb778a3373623a2979d0295647435e320f4956cdb749f11ac9c674c20875e794","observation_id":"29c2dcb9-8346-4ef4-accb-b9041e761ea6","resolution":{"observed_at":"2026-05-11T12:31:06.624691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:6f718f25ce62c2c928597d52aea1578f0aeaa857b5e17238672989c94a6c2ab7","observation_id":"ad6aa5a1-a4cd-48c8-9a86-ba8445237e5e","resolution":{"observed_at":"2026-05-12T10:21:29.931588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:7ef1d8587063794027f2d5e3874f637c104dbabb1e8bd999e3d61e0aa767d1cd","observation_id":"6c2b1663-d5d3-46db-ac4d-2db269f4bc6b","resolution":{"observed_at":"2026-05-11T22:11:17.477480Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:72875eba0509585733f4e98736b4282d6c1187e58ea12da411eee273afef2e07","observation_id":"9000084b-0722-4fd9-a29f-22b7c57b3e1e","resolution":{"observed_at":"2026-05-19T17:02:40.867075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.00702","last_updated":"2026-05-01T14:45:20Z","snapshot_observed_at":"2026-07-06T23:14:06.327027Z","submitted_at":"2026-05-01T14:45:20Z","title":"Learning How and What to Memorize: Cognition-Inspired Two-Stage Optimization for Evolving Memory","version":1},"reference_index":178,"source":"arxiv_source","source_observed_at":"2026-05-09T19:10:30.849963Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.00702"},"observation_digest":"sha256:bec29f65be23eb85213996c9ffb8e6deb8a0a61bcd859676a9e402da07d9f7d7","observation_id":"c0cece03-ef9f-4792-972c-2e16d5fd7362","resolution":{"observed_at":"2026-05-11T15:51:34.365503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.02913","last_updated":"2026-04-08T00:53:29Z","snapshot_observed_at":"2026-07-06T23:15:55.848885Z","submitted_at":"2026-04-08T00:53:29Z","title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","version":1},"reference_index":165,"source":"arxiv_source","source_observed_at":"2026-05-10T19:15:27.406778Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.02913"},"observation_digest":"sha256:ad873463323196e98d4622c4177714e8870236dfe023f3bea0e7ea8de96f4cee","observation_id":"e92c6fc1-7400-4258-afee-285011440b5e","resolution":{"observed_at":"2026-05-10T23:15:49.622476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:7a25a96403460d4a288a7cac9c5ba2bcf813c59caf5af39d8718e3b3cf06a8f7","observation_id":"f0194b7a-1933-48bb-86ef-b2fecd5e8553","resolution":{"observed_at":"2026-05-11T20:01:12.713998Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:0f15709def7b588ac118db3997b2ee64f8c8b2131c06202b0ba1ef2c1cdfb0ff","observation_id":"32f7ce1b-c029-47aa-bd4a-5b64f5302d08","resolution":{"observed_at":"2026-05-11T04:00:56.870208Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:26b3ee75201ae2965494866f6507b0a6f3f832e2dae6fc8cce22553b1a09cd5f","observation_id":"8917f524-9daa-4a54-8631-31c83540d360","resolution":{"observed_at":"2026-05-13T07:17:28.188774Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:7acf58411d3c30ef5ffea1fc5b48657b6f5ce2f698df1a0abdcf8a186f688e23","observation_id":"6705439e-9314-460b-ae08-4e24b5a2f304","resolution":{"observed_at":"2026-05-11T20:11:12.262776Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.10043","last_updated":"2026-05-11T06:12:24Z","snapshot_observed_at":"2026-07-06T23:22:03.830881Z","submitted_at":"2026-05-11T06:12:24Z","title":"Personalizing LLMs with Binary Feedback: A Preference-Corrected Optimization Framework","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T02:38:55.639568Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.10043"},"observation_digest":"sha256:816322a8ceff4c9ce711c456b1897b6fc0da65fce71e312597098767694313a2","observation_id":"6411ce64-b1ed-4acf-a284-d52677013cc2","resolution":{"observed_at":"2026-05-12T02:41:17.572918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.12004","last_updated":"2026-05-12T11:54:23Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:54:23Z","title":"Learning Agentic Policy from Action Guidance","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-13T05:02:49.206053Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.12004"},"observation_digest":"sha256:3da6e5b9de17c36951940519a103ec5c21a6efcafa6e527d31e0eeb0ac4883c4","observation_id":"ff787be5-ad14-4556-bcbd-6f07b151209e","resolution":{"observed_at":"2026-05-13T05:07:17.608879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.12943","last_updated":"2026-05-13T03:26:07Z","snapshot_observed_at":"2026-08-02T16:54:34.012559Z","submitted_at":"2026-05-13T03:26:07Z","title":"Reinforced Collaboration in Multi-Agent Flow Networks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-14T20:42:48.438057Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.12943"},"observation_digest":"sha256:186dc658fb4bd784481ff64ffa8b69f13e8aab4e15affd76fa6b0b8587c9ccb0","observation_id":"592ecb5c-3926-42e0-9019-97984e70e84f","resolution":{"observed_at":"2026-05-14T20:42:57.113425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.18396","last_updated":"2026-05-19T06:23:43Z","snapshot_observed_at":"2026-07-06T23:29:14.916114Z","submitted_at":"2026-05-18T13:42:24Z","title":"NEWTON: Agentic Planning for Physically Grounded Video Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T10:56:22.343333Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.18396"},"observation_digest":"sha256:8e3a068052e0cc823e275027b7f3775f962af6067a222fe793eb4cca3df0e3af","observation_id":"1c3ca816-0b82-4621-8982-83c43c5c1428","resolution":{"observed_at":"2026-05-20T10:58:13.729421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.19035","last_updated":"2026-05-18T18:57:54Z","snapshot_observed_at":"2026-08-01T06:09:25.717434Z","submitted_at":"2026-05-18T18:57:54Z","title":"Trustworthy Agent Network: Trust in Agent Networks Must Be Baked In, Not Bolted On","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-20T10:31:16.368065Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.19035"},"observation_digest":"sha256:65189ebe0bd1ec8b9d479068c327818afef4f167a2c25a1e026dc534440e073a","observation_id":"e6690489-b4a0-4ba0-a2f6-f1c670648b1f","resolution":{"observed_at":"2026-05-20T10:33:12.352568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.21984","last_updated":"2026-05-21T04:34:00Z","snapshot_observed_at":"2026-08-02T23:47:40.908968Z","submitted_at":"2026-05-21T04:34:00Z","title":"Echo: Learning from Experience Data via User-Driven Refinement","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-22T06:37:34.840129Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.21984"},"observation_digest":"sha256:502725f5cfb30a6ea289ede02876ae154f1411c5f7c74cc5f1a09d535c43ce79","observation_id":"279c5188-7d12-4d1c-8ec6-32364f4b2214","resolution":{"observed_at":"2026-05-22T06:41:10.745267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.27209","last_updated":"2026-05-26T16:02:00Z","snapshot_observed_at":"2026-08-03T11:00:10.339186Z","submitted_at":"2026-05-26T16:02:00Z","title":"Learning to Act under Noise: Enhancing Agent Robustness via Noisy Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T16:51:36.524194Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.27209"},"observation_digest":"sha256:e4d4cfab24b8aceeac5a2c3fbe60ab87b56f8460759add52d0b53ec18aced068","observation_id":"5a28c917-b334-4e04-b1b9-1c306c65e98e","resolution":{"observed_at":"2026-06-29T16:53:40.551897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2605.27960","last_updated":"2026-05-27T04:54:07Z","snapshot_observed_at":"2026-08-03T00:24:19.442122Z","submitted_at":"2026-05-27T04:54:07Z","title":"Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-29T13:38:01.819121Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2605.27960"},"observation_digest":"sha256:362623138bd8ce56a0a57f5bd5e30eb15679e047d4da046d887eff10ec2bf3a5","observation_id":"bca960fa-fcc1-4ee5-9170-aad48d307215","resolution":{"observed_at":"2026-06-29T13:43:28.975560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.03077","last_updated":"2026-06-10T06:28:18Z","snapshot_observed_at":"2026-07-06T23:43:22.513369Z","submitted_at":"2026-06-02T03:09:13Z","title":"Libra: Efficient Resource Management for Agentic RL Post-Training","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T11:02:00.385932Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.03077"},"observation_digest":"sha256:67f1135ce46751c4d58709d977d1f21c34a6c7e1c7e3aa81135a66b37858cda1","observation_id":"c9994a9a-d795-4eca-88b9-8282b8dc8293","resolution":{"observed_at":"2026-07-02T02:16:27.165537Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.03841","last_updated":"2026-06-02T16:20:58Z","snapshot_observed_at":"2026-08-02T08:17:48.137196Z","submitted_at":"2026-06-02T16:20:58Z","title":"EvoDS: Self-Evolving Autonomous Data Science Agent with Skill Learning and Context Management","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T09:32:51.765633Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.03841"},"observation_digest":"sha256:856b5ecfbcba5c41b6065badaae998e75419d0ab12dd73c283ef00138a1bccb5","observation_id":"a486bd6a-57e1-454c-b174-7cc35e28dbef","resolution":{"observed_at":"2026-07-02T03:56:35.113117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.08755","last_updated":"2026-06-07T17:55:55Z","snapshot_observed_at":"2026-08-01T04:11:26.349236Z","submitted_at":"2026-06-07T17:55:55Z","title":"Co-Evolving Skill Generation and Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T18:37:00.015083Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.08755"},"observation_digest":"sha256:bb8655fc8bf7972a563664c3118204929613ffe054fb4d7a6e04ee019748492a","observation_id":"f5b1c40d-9b05-4f54-b95d-ebeb54d0a35e","resolution":{"observed_at":"2026-07-02T22:47:26.427426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.09138","last_updated":"2026-06-08T07:35:18Z","snapshot_observed_at":"2026-07-06T23:48:30.569726Z","submitted_at":"2026-06-08T07:35:18Z","title":"Claw-R1: A Step-Level Data Middleware System for Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T17:28:58.574865Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.09138"},"observation_digest":"sha256:99a38e31100fae7286af9acc712e35901901a3403a4cba67ad11b3a27be5c2ef","observation_id":"ad6b1f5b-7f82-42e4-b3b8-027497a35524","resolution":{"observed_at":"2026-07-03T00:07:28.226428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T06:12:38.757738Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T10:21:55.485624Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:f5d6d73e6ab948af7e316160045e443e3ff5bde1f4c2dc588912a0526534cd6d","observation_id":"ffe115d7-9925-48de-b56e-50e4915e100e","resolution":{"observed_at":"2026-07-03T09:37:49.371227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-03T02:12:35.232674Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.12384","last_updated":"2026-07-31T08:54:09Z","snapshot_observed_at":"2026-08-05T06:12:38.757738Z","submitted_at":"2026-06-10T17:47:07Z","title":"APPO: Agentic Procedural Policy Optimization","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-03T02:12:35.232674Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.12384"},"observation_digest":"sha256:af5b49ac4c35f1369433ff6d70bb2d7aae6407a71044bd3d11faa86b26db26e8","observation_id":"8e5d4caa-6992-4673-bb21-e69135855cd3","resolution":{"observed_at":"2026-08-03T02:12:35.232674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.17253","last_updated":"2026-06-15T19:54:57Z","snapshot_observed_at":"2026-08-04T10:16:04.732210Z","submitted_at":"2026-06-15T19:54:57Z","title":"PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM Agents for VLSI Physical Design","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T02:11:34.174504Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.17253"},"observation_digest":"sha256:e7b5d7c7269d1c0a7ec418bf283d1f45efa92be9a494e4d2cd60e340a1679529","observation_id":"0cd33109-5bc7-416d-907d-560d5cd9e59c","resolution":{"observed_at":"2026-07-03T19:08:49.836672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":260,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:f1fffc92f4333ba14fea0124e2b9965b9602eb8c8d9f4ed9e238dcc26bbc1af3","observation_id":"eb877cd0-e9f2-47e4-85a9-9a7e727956d7","resolution":{"observed_at":"2026-07-04T08:09:40.470466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.23678","last_updated":"2026-06-22T17:58:54Z","snapshot_observed_at":"2026-07-06T23:58:20.975630Z","submitted_at":"2026-06-22T17:58:54Z","title":"AIR: Adaptive Interleaved Reasoning with Code in MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T09:06:38.001604Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.23678"},"observation_digest":"sha256:e3a1c2453e79d67bc737c3c6f130a55cd326ce72c3c0edd37bf6f0ff6030f298","observation_id":"13eb0052-5713-4b22-84b9-572d6b235405","resolution":{"observed_at":"2026-07-04T10:09:45.005873Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.26790","last_updated":"2026-06-25T09:24:09Z","snapshot_observed_at":"2026-08-02T14:45:34.730114Z","submitted_at":"2026-06-25T09:24:09Z","title":"OPID: On-Policy Skill Distillation for Agentic Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-26T05:07:16.926615Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.26790"},"observation_digest":"sha256:18000b59660b3891d931f657b8a3df1833f73453ce4d585a99e1ae845e05ad7e","observation_id":"94344ad7-f12f-49de-9845-958e838cddb3","resolution":{"observed_at":"2026-07-04T13:29:52.131453Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2606.27330","last_updated":"2026-06-25T17:44:48Z","snapshot_observed_at":"2026-08-03T00:40:31.745653Z","submitted_at":"2026-06-25T17:44:48Z","title":"Empowering GUI Agents via Autonomous Experience Exploration and Hindsight Experience Utilization for Task Planning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T03:51:51.827622Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2606.27330"},"observation_digest":"sha256:b5ce2031c14636affde9a6a2137ad002ca12352f9182eab71a8794e2935be53f","observation_id":"cc852ecd-9b9d-426e-bbbb-4bc1701b7652","resolution":{"observed_at":"2026-07-04T14:29:53.373940Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.00038","last_updated":"2026-06-28T18:30:46Z","snapshot_observed_at":"2026-08-01T16:40:43.486088Z","submitted_at":"2026-06-28T18:30:46Z","title":"Stop Hand-Holding Your Coding Agent: Engineering the Loops that Replace Step-by-Step Prompting","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-02T20:40:11.059493Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.00038"},"observation_digest":"sha256:9c78c2c2bc6f44bafdc5675c2a2dcaf3700d76c37fb02aa4dee4e0664ad31f8f","observation_id":"9879578b-5bcb-4dc6-ae8e-5dfd175261ba","resolution":{"observed_at":"2026-07-02T20:47:22.214005Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.01120","last_updated":"2026-07-02T14:02:28Z","snapshot_observed_at":"2026-07-07T00:06:44.379624Z","submitted_at":"2026-07-01T16:08:02Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T05:58:39.107614Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.01120"},"observation_digest":"sha256:cefd397db470fe6f0651da1a72a531967ace8b9f072f231d293613c1824ed0bd","observation_id":"33657ff9-1549-4848-9780-49c8acfa3dd4","resolution":{"observed_at":"2026-07-02T06:06:40.599975Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.01120","last_updated":"2026-07-02T14:02:28Z","snapshot_observed_at":"2026-07-07T00:06:44.379624Z","submitted_at":"2026-07-01T16:08:02Z","title":"Next-Generation Agentic Reinforcement Learning Systems Enable Self-Evolving Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-03T18:47:46.719344Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.01120"},"observation_digest":"sha256:a5ab2c1daac045f89734c54895a85dff8bbc528d9f3426b569f7449fb713370f","observation_id":"76af6b6d-0be3-4282-b302-959eb43ce550","resolution":{"observed_at":"2026-07-03T18:48:49.516258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.06223","last_updated":"2026-07-07T12:47:23Z","snapshot_observed_at":"2026-07-10T23:18:22.383935Z","submitted_at":"2026-07-07T12:47:23Z","title":"Information Gain-based Rollout Policy Optimization: An Adaptive Tree-Structured Rollout Approach for Multi-Turn LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T13:01:45.049174Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.06223"},"observation_digest":"sha256:56646d27e2e9db00136df8428a97e26e8ff16d091d7901894cccfbfb24550044","observation_id":"59fbeac2-527b-467f-85be-ae71a3a1a923","resolution":{"observed_at":"2026-07-08T13:04:56.742129Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.06935","last_updated":"2026-07-08T02:57:22Z","snapshot_observed_at":"2026-08-04T14:08:21.374754Z","submitted_at":"2026-07-08T02:57:22Z","title":"Mathematical methods of reinforcement learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-09T22:47:51.676289Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.06935"},"observation_digest":"sha256:c9e6788f7a27c9efdd5b1d8bf97f7367e9158a40cd39f0d50a7f84625cfe7524","observation_id":"3840bc46-ce83-427a-8711-a6671b20ec41","resolution":{"observed_at":"2026-07-09T22:56:37.774476Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":"2509.02547","doi":"10.48550/arxiv.2509.02547","metadata_source":"pith","pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","venue":"cs.AI","work_id":"87909127-da20-4ccc-8ae3-4a4a20ef81b7","year":2025},"citing_paper":{"arxiv_id":"2607.07178","last_updated":"2026-07-08T09:13:05Z","snapshot_observed_at":"2026-08-02T00:05:27.374641Z","submitted_at":"2026-07-08T09:13:05Z","title":"Entropy Pacing Policy Optimization for Multi-Task Agentic Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-09T18:19:12.180499Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.07178"},"observation_digest":"sha256:0875d08c4f31ad3ef6e636364ca1196615a99de653f74b1b12f1f88989decc47","observation_id":"fd6df471-3b24-4d47-9423-2a9a6012f5b4","resolution":{"observed_at":"2026-07-09T18:26:26.279667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-07-14T06:30:16.612345Z","title":"The landscape of agentic reinforcement learning for llms: A survey.arXiv preprint arXiv:2509.02547, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11175","last_updated":"2026-07-13T07:16:50Z","snapshot_observed_at":"2026-07-16T23:19:14.481825Z","submitted_at":"2026-07-13T07:16:50Z","title":"The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy","version":1},"reference_index":300,"source":"pdf_text","source_observed_at":"2026-07-14T06:30:16.612345Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.11175"},"observation_digest":"sha256:163a51d399c33ab63908bfc2c2fed7fdbbf1a772b9c2393764c66788ddfdfaf0","observation_id":"ddc527bd-8339-4e66-ade0-586f28941835","resolution":{"observed_at":"2026-07-14T06:30:16.612345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T04:54:14.134572Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13558","last_updated":"2026-07-15T08:01:42Z","snapshot_observed_at":"2026-08-02T04:54:07.699248Z","submitted_at":"2026-07-15T08:01:42Z","title":"Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T04:54:14.134572Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.13558"},"observation_digest":"sha256:9a41ceec0ff9043aa937e8c8323950a7e64053a043d6d9877ebac94aae122c8e","observation_id":"ac28d4f5-fac1-44ee-887f-b466e24e46be","resolution":{"observed_at":"2026-08-02T04:54:14.134572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T06:36:47.629823Z","title":"The landscape of agentic reinforcement learning for llms: A survey.arXiv preprint arXiv:2509.02547, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14145","last_updated":"2026-07-14T06:03:39Z","snapshot_observed_at":"2026-08-03T20:40:08.483403Z","submitted_at":"2026-07-14T06:03:39Z","title":"ToolAnchor: Anchoring Counterfactual Context to Boost Agentic Tool-use Capability","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T06:36:47.629823Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.14145"},"observation_digest":"sha256:78287a82892f0f35dd683c4280c009b62f7fc34fdcc955a32af445c14a24c9a2","observation_id":"93df52ba-fc98-4581-b12a-702612842bfc","resolution":{"observed_at":"2026-08-02T06:36:47.629823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T14:50:18.593672Z","title":"The landscape of agentic reinforcement learning for llms: A survey.ArXiv, abs/2509.02547, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16204","last_updated":"2026-05-07T00:40:32Z","snapshot_observed_at":"2026-08-02T14:50:06.224987Z","submitted_at":"2026-05-07T00:40:32Z","title":"Masked Diffusion Language Models are Strong and Steerable Text-Based World Models for Agentic RL","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-02T14:50:18.593672Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.16204"},"observation_digest":"sha256:4cb1fff6453dd02033cc4bfe4657b878a979d78d660be8fd2d591a360c1f312f","observation_id":"fdcfbaf5-e0f4-40e0-ac83-ece8e809376b","resolution":{"observed_at":"2026-08-02T14:50:18.593672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-02T09:45:49.621635Z","title":"The landscape of agentic reinforcement learning for llms: A survey.arXiv preprint arXiv:2509.02547,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16257","last_updated":"2026-06-28T08:35:47Z","snapshot_observed_at":"2026-08-02T09:45:48.181244Z","submitted_at":"2026-06-28T08:35:47Z","title":"From Outcomes to Actions: Leveraging Hindsight for Long-Horizon Language Agent Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T09:45:49.621635Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.16257"},"observation_digest":"sha256:fca35b3bf929e1c2dd26d938ae59cc528d0d112519c9f817aea2b1fe312b356b","observation_id":"6477b146-22e0-4b29-84b7-91020de15fca","resolution":{"observed_at":"2026-08-02T09:45:49.621635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-01T03:38:25.752951Z","title":"The landscape of agentic reinforcement learning for llms: A survey, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-01T21:13:06.083655Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:25.752951Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:ece2e24a97e65c13cf360afb6d1caf9708ae8ff6aa6f3b3f0f6ad5fb6bc57ac8","observation_id":"64f52e8b-3915-41ba-a444-7e1ec7a8b90b","resolution":{"observed_at":"2026-08-01T03:38:25.752951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-01T01:20:49.101238Z","title":"Zhang, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25865","last_updated":"2026-07-28T15:31:26Z","snapshot_observed_at":"2026-08-03T03:26:50.763218Z","submitted_at":"2026-07-28T15:31:26Z","title":"OmniQEC: discovering practical quantum error-correcting codes by an AI scientist","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T01:20:49.101238Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.25865"},"observation_digest":"sha256:e1f5a003ea576ed182d99632e8984deacfafc988473c79e332afcd030db2fbe8","observation_id":"4478aa35-c581-4ddd-9bf5-6208b2bf3672","resolution":{"observed_at":"2026-08-01T01:20:49.101238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-07-30T21:12:59.446937Z","title":"The landscape of agentic reinforcement learning for llms: A survey.arXiv preprint arXiv:2509.02547,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26784","last_updated":"2026-07-29T11:26:33Z","snapshot_observed_at":"2026-08-04T02:54:12.127480Z","submitted_at":"2026-07-29T11:26:33Z","title":"SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T21:12:59.446937Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2607.26784"},"observation_digest":"sha256:775f5c40057c9e3f822d5849733bdd8c5af05fe5dcda92cab25b65b5212d66a2","observation_id":"7a145b9c-9181-430b-acfa-2b13de815d79","resolution":{"observed_at":"2026-07-30T21:12:59.446937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-04T01:16:05.118218Z","title":"Zhang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-05T06:20:51.316639Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:05.118218Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:f48055b26b10731ff352948bf6730794965b540fddf49d9f9555a1f4be530ef1","observation_id":"48e765bb-755c-4a4d-b144-67fca8c8c5da","resolution":{"observed_at":"2026-08-04T01:16:05.118218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-04T13:31:24.753889Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02163","last_updated":"2026-08-03T12:43:00Z","snapshot_observed_at":"2026-08-05T06:35:28.075902Z","submitted_at":"2026-08-03T12:43:00Z","title":"From Simple QA to Deep Research: A Verifiable Benchmark Constructed through Iterative Task Evolution","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T13:31:24.753889Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2608.02163"},"observation_digest":"sha256:7483ab433c395b4010860fb00b126849793ec0641603d168c68deb00b99f245f","observation_id":"27ca895f-cc55-44a1-8c62-003964f5102b","resolution":{"observed_at":"2026-08-04T13:31:24.753889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.02547/citation-record","integrity":"/paper/2509.02547/integrity","json":"/paper/2509.02547/citation-record.json","paper":"/paper/2509.02547"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:3da2275022937ebea99f5eea67d721170ecf6c49ffc8b81c04390dc19f55e359","observation_id":"2396945c-eabb-4b66-8703-39135f8b1aa8","resolution":{"observed_at":"2026-05-18T19:21:48.870824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e9a44792237b74051f8da8c0eacf4abc71b37523e06ceea51d103833c19c99fd","observation_id":"4bcdb4dc-b734-4cba-943e-6a221710b7ae","resolution":{"observed_at":"2026-05-18T19:21:48.884172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1312.5602","doi":"10.48550/arxiv.1312.5602","metadata_source":"pith","pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Playing Atari with Deep Reinforcement Learning","venue":"cs.LG","work_id":"736a8ddf-e365-4940-ad58-4699fddedb86","year":2013},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:6316361ec99785ffce81a0117efb7756faa1e776c5413d35c47edd27ae5af0c9","observation_id":"f7ec9216-8168-4138-9a66-00fde475356e","resolution":{"observed_at":"2026-05-18T19:21:48.866403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-03T09:01:09.893540Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.04136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04136","snapshot_observed_at":"2026-07-07T02:18:25.553364Z","title":"A technical survey of reinforcement learning techniques for large language models","venue":null,"work_id":"b5d76691-645d-4749-8916-53eb4e8764f4","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.04136","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:62eb47382a6c2ec0f52b7ac5a3b1dd6db444d840ee575a9f16af542e9886a709","observation_id":"51a38e8c-fdb4-48a4-8ea7-c7a11221d4f4","resolution":{"observed_at":"2026-07-07T02:18:25.553364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10400","last_updated":"2025-02-24T08:57:10Z","snapshot_observed_at":"2026-07-06T20:06:43.917795Z","submitted_at":"2024-12-05T16:10:42Z","title":"Reinforcement Learning Enhanced LLMs: A Survey","version":3},"cited_work":{"arxiv_id":"2412.10400","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10400","snapshot_observed_at":"2026-07-04T07:59:40.174737Z","title":"Reinforcement learning enhanced llms: A survey","venue":null,"work_id":"81448dee-72a5-4658-8776-d20e964902b8","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2412.10400","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f8ac8bb552a5d970201c36822fffd75c8258b80637fa63960855c56a5195d367","observation_id":"c802a854-f512-4e56-88f1-ed39a82c88db","resolution":{"observed_at":"2026-05-18T19:21:48.875324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20367","last_updated":"2025-08-07T08:34:03Z","snapshot_observed_at":"2026-08-01T21:54:39.941118Z","submitted_at":"2024-12-29T06:15:41Z","title":"Enhancing Code LLMs with Reinforcement Learning in Code Generation: A Survey","version":5},"cited_work":{"arxiv_id":"2412.20367","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.20367","snapshot_observed_at":"2026-07-11T03:57:46.638644Z","title":"Enhancing code llms with reinforcement learning in code generation: A survey","venue":"cs.SE","work_id":"de0ce633-d3af-4711-b0eb-ba6dc92ce4b5","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2412.20367","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:a2a2c18fa157ec970f72f5fb9e9e0332ae36f40a7f2fff2db8a62c0ff9d1710d","observation_id":"445e3597-d01a-4a9f-a365-cb6b197d9ec1","resolution":{"observed_at":"2026-05-18T19:21:48.880055Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.349799","doi":"10.1109/tnnls.2024.3497992","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Survey on large language model-enhanced reinforcement learning: Concept, taxonomy, and methods.IEEE Transactions on Neural Networks and Learning Systems, 36(6):9737–9757, June 2025","venue":"IEEE Transactions on Neural Networks and Learning Systems","work_id":"a3f827ba-0663-4cf3-968e-ee754b06b93a","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:93abdfc9c23a6d2ca598ac45453f76f3abce7ab1b6bf354d164d6ffe990a836d","observation_id":"dd1c919c-db40-48e9-bcb8-04eb7bfcfba3","resolution":{"observed_at":"2026-05-18T19:21:46.766902Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17063","last_updated":"2025-05-18T05:35:13Z","snapshot_observed_at":"2026-07-06T21:28:48.206779Z","submitted_at":"2025-05-18T05:35:13Z","title":"Synthetic Data RL: Task Definition Is All You Need","version":1},"cited_work":{"arxiv_id":"2505.17063","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17063","snapshot_observed_at":"2026-07-01T20:56:13.361747Z","title":"Synthetic data rl: Task definition is all you need","venue":null,"work_id":"73704596-4394-43a1-98e7-403ed211ca20","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.17063","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e00f8e1b171c7172e587d49f8dfb7c2cb7f28d771fe731b0f117b794cf68ffd2","observation_id":"974982fd-1f54-4684-bc3f-518d10cee338","resolution":{"observed_at":"2026-05-18T19:21:48.858237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Let large language models find the data to train themselves","venue":null,"work_id":"9b97c9fa-4ea1-40f3-98e5-a84cf8487873","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9125749d432500f6d0021524b2de4ebdb8b454b65fbfa39c4c9cd5faeb655038","observation_id":"8f97174b-0ea6-4fa5-8474-fd875a94a3fb","resolution":{"observed_at":"2026-05-18T19:22:50.164052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"cited_work":{"arxiv_id":"2506.08007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08007","snapshot_observed_at":"2026-07-03T23:49:02.979112Z","title":"arXiv preprint arXiv:2506.08007 , year=","venue":null,"work_id":"9aea0749-2851-4adc-81d0-8b3c73fd2486","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.08007","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d2d845b72d98310f7e73e06f70155504c5e31d7621171f4d2518a22530cbe8e0","observation_id":"df887682-effa-49cc-926f-47e4e88480b0","resolution":{"observed_at":"2026-05-18T19:21:48.478904Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inference-aware fine-tuning for best- of-n sampling in large language models","venue":null,"work_id":"932cd507-d96a-41f6-90cc-5ab0e58a03bd","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:b2077f3f249df891dfa8068c837a8ab5ea59a62e62caafda7999c54370fd1251","observation_id":"82991100-669e-4fa7-8439-456414022799","resolution":{"observed_at":"2026-05-18T19:22:50.439072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey of reinforcement learning in large language models: From data generation to test-time inference.Available at SSRN 5128927","venue":null,"work_id":"4972d486-015f-4f07-a51c-b3293326f354","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:1eecb52a7e23b85bdb6791642cd6e3228a4fa91eb6622d5b048b080d2dcc4d74","observation_id":"520c1980-21ef-4703-a46c-c65d147549b2","resolution":{"observed_at":"2026-05-18T19:22:50.442376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"e4a9466c-886f-48e3-bcc4-f8b301bb27ad","year":2022},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:2187f9f2ba94d891fd02b883a4a380d4ed64e15d8d43ccfcf752d4fe2972e60b","observation_id":"38cb5da6-4859-467e-ba09-a95700d73bad","resolution":{"observed_at":"2026-05-18T19:22:50.445626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":"2407.16216","doi":"10.48550/arxiv.2407.16216","metadata_source":"pith","pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","venue":"cs.CL","work_id":"5a18c49c-8379-484a-86ba-d4d3e3061e87","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:555bb71e2d54402d74eaaae0bd1870f091d109438bac843f689df588a5aba968","observation_id":"fd962b78-169e-4c63-8873-44cb2333d49d","resolution":{"observed_at":"2026-05-18T19:21:48.376249Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15595","last_updated":"2026-06-09T05:48:30Z","snapshot_observed_at":"2026-07-06T19:36:45.701678Z","submitted_at":"2024-10-21T02:27:24Z","title":"A Comprehensive Survey of Direct Preference Optimization: Datasets, Theories, Variants, and Applications","version":4},"cited_work":{"arxiv_id":"2410.15595","doi":"10.48550/arxiv.2410.15595","metadata_source":"pith","pith_arxiv_id":"2410.15595","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"A comprehensive survey of datasets, theories, variants, and applications in direct preference optimization","venue":"cs.AI","work_id":"fbcda931-44f5-4714-9437-c62403696afb","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2410.15595","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:49d2e0017f1fb387965abad1c68a4b7c41ee577184892c660f54cceef468bbc4","observation_id":"53a7ab6b-16a0-4246-bd5b-83e320dda34c","resolution":{"observed_at":"2026-06-10T02:11:10.714292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14987","last_updated":"2022-03-28T18:00:51Z","snapshot_observed_at":"2026-07-06T12:53:50.496350Z","submitted_at":"2022-03-28T18:00:51Z","title":"Multilingual Knowledge Graph Completion with Self-Supervised Adaptive Graph Alignment","version":1},"cited_work":{"arxiv_id":"2203.14987","doi":"10.48550/arxiv","metadata_source":"doi_reference","pith_arxiv_id":"2203.14987","snapshot_observed_at":"2026-07-09T21:46:34.506658Z","title":"Dickerson","venue":"cs.AI","work_id":"5c2060c6-427c-4321-be22-49ccae439d80","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2203.14987","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:cfc58ef80d05fc5f9f38b19bea27f429c7f19411a20f71da09905d014e7da776","observation_id":"30828b37-65b1-424b-8307-cf32756ce4e1","resolution":{"observed_at":"2026-05-18T19:21:46.662487Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00886","last_updated":"2026-05-08T17:19:33Z","snapshot_observed_at":"2026-07-06T21:34:29.773814Z","submitted_at":"2025-06-01T07:52:16Z","title":"Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary","version":4},"cited_work":{"arxiv_id":"2506.00886","doi":"10.48550/arxiv.2506.00886","metadata_source":"pith","pith_arxiv_id":"2506.00886","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary","venue":"cs.AI","work_id":"149ad468-5a11-4d71-882c-120fb0edcc93","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.00886","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:693cbd5784a7dd87eb714fd45305d4fc9c3accbcaf1762f7996198838b2b6541","observation_id":"6fd84143-8792-4eaa-9dc3-3467e62e2971","resolution":{"observed_at":"2026-05-18T19:21:48.390112Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17419","last_updated":"2025-06-25T02:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-24T18:50:52Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","version":6},"cited_work":{"arxiv_id":"2502.17419","doi":"10.48550/arxiv.2502.17419","metadata_source":"pith","pith_arxiv_id":"2502.17419","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From System 1 to System 2: A Survey of Reasoning Large Language Models","venue":"cs.AI","work_id":"67495af7-38a4-40b1-bd10-fd9d939c7abd","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2502.17419","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:91736876410726b5abbbe1201ebf9953dc2990b371ebe2ef848d38c4abf5f81b","observation_id":"be03dfa9-3240-45d1-952c-b28b3cf9a009","resolution":{"observed_at":"2026-05-18T19:21:48.426898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21460","last_updated":"2025-03-27T12:50:17Z","snapshot_observed_at":"2026-07-06T20:59:35.694800Z","submitted_at":"2025-03-27T12:50:17Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","version":1},"cited_work":{"arxiv_id":"2503.21460","doi":"10.1145/3573051.3596191","metadata_source":"pith","pith_arxiv_id":"2503.21460","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model Agent: A Survey on Methodology, Applications and Challenges","venue":"cs.CL","work_id":"4aff48d9-c46d-41d9-904b-52251e559596","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.21460","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:779681de611196a7cb8d13c68900312e657c04aa173a4d262bc9df6533b7d3af","observation_id":"cc284fdc-decd-4222-9ecd-6c6fd5b7dd91","resolution":{"observed_at":"2026-05-18T19:21:46.673527Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.23037","doi":"10.48550/arxiv.2503.23037","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"van Duijn, Niki Stein, Mike Preuss, Peter van der Putten, and Kees Joost Batenburg","venue":null,"work_id":"2ef68cac-3e16-425a-8584-a656156a326c","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:602b20900baf3d39f472a2daad77a5012879d2759a35c1d355dccc714eb77c33","observation_id":"22dfb8e0-5607-4f3f-b478-cba99185768d","resolution":{"observed_at":"2026-05-18T19:21:46.743137Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review of prominent paradigms for LLM-based agents: Tool use, planning (including RAG), and feedback learning","venue":null,"work_id":"1bbc695c-1abb-44b8-9ee8-6399d399b057","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f263cba47dda2ac20b11276ef8289a4d5137a710971ec28a75315e96ae6a2d0b","observation_id":"7908cbc2-eb3d-4f6d-9e2a-f0bbce367f94","resolution":{"observed_at":"2026-05-18T19:22:50.429687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What are tools anyway? a survey from the language model perspective","venue":null,"work_id":"789e3de6-5dc6-4290-a034-15f237d5ad8a","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:4bf1bfdf7a6161c7a1b055b8e8596f746a1a3d659e6750428402956d55632a54","observation_id":"96eb9ba1-e214-48e8-b858-4b0597943900","resolution":{"observed_at":"2026-05-18T19:22:50.423529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11584","last_updated":"2024-04-17T17:32:41Z","snapshot_observed_at":"2026-08-04T23:37:27.678120Z","submitted_at":"2024-04-17T17:32:41Z","title":"The Landscape of Emerging AI Agent Architectures for Reasoning, Planning, and Tool Calling: A Survey","version":1},"cited_work":{"arxiv_id":"2404.11584","doi":"10.48550/arxiv.2404.11584","metadata_source":"pith","pith_arxiv_id":"2404.11584","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Landscape of Emerging AI Agent Architectures for Reasoning, Planning, and Tool Calling: A Survey","venue":"cs.AI","work_id":"d41cecd0-887c-48d8-a3b1-bdd1b68c7053","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2404.11584","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:30ebdab442766cff7c80cad62cd2d2f0b0feede913386ce5b43fb84d7221294b","observation_id":"a7d74a82-9516-472f-be0d-43028de24e20","resolution":{"observed_at":"2026-05-18T19:21:48.613347Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c45bef11-f72f-4d1d-bf80-d318151ea0ba","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f475db8b2ceaf114c5a85ecb14b2f2486b70ab0f0297c83e2d39ee4b2a2a4a36","observation_id":"8de79810-8874-492d-9ce7-aa077060f9c8","resolution":{"observed_at":"2026-05-18T19:22:50.420467Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14387","last_updated":"2024-06-03T17:47:30Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:43:23Z","title":"A Survey on Self-Evolution of Large Language Models","version":2},"cited_work":{"arxiv_id":"2404.14387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.14387","snapshot_observed_at":"2026-07-04T10:59:47.067283Z","title":"arXiv preprint arXiv:2404.14387 , year=","venue":null,"work_id":"ffd0559d-37d0-4858-8aaa-84dc7e4a3541","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2404.14387","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e593ed01515be7c29b5649b9c8e4f9180b78093ca609dd3bd53c00b71c2e8362","observation_id":"01aa4e0f-97c6-45a0-87d8-ecb1612155ec","resolution":{"observed_at":"2026-05-18T19:21:48.350622Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01963","last_updated":"2025-03-13T06:17:50Z","snapshot_observed_at":"2026-07-06T21:03:16.692742Z","submitted_at":"2025-03-13T06:17:50Z","title":"LLMs Working in Harmony: A Survey on the Technological Aspects of Building Effective LLM-Based Multi Agent Systems","version":1},"cited_work":{"arxiv_id":"2504.01963","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.01963","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wmks Ilmini","venue":null,"work_id":"be35772c-a44e-47c1-ae2e-4024f9bf8823","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.01963","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:bfb3a528dbcf478a124d5ffee04a72833849c777e939a74f6e108d78b8e44c34","observation_id":"b2532011-c579-4698-82fe-57b4dcb69540","resolution":{"observed_at":"2026-05-18T19:21:48.246164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"cited_work":{"arxiv_id":"2401.03568","doi":"10.48550/arxiv.2401.03568","metadata_source":"pith","pith_arxiv_id":"2401.03568","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","venue":"cs.AI","work_id":"7469e3ce-613c-4298-9d5f-ab2526320c8a","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2401.03568","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:134f535233e2d91223b3ccb86838a50e2fafef1c1ea80730f71036fa884ace74","observation_id":"9ec266e8-7f25-4a82-b1e8-27c581965ef1","resolution":{"observed_at":"2026-05-18T19:21:46.719040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"cited_work":{"arxiv_id":"2504.01990","doi":"10.48550/arxiv.2504.01990","metadata_source":"pith","pith_arxiv_id":"2504.01990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","venue":"cs.AI","work_id":"984dfe5e-1c5c-4b65-920e-15121a85ee7e","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.01990","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9e0927665976617c1c95def32628294551df3278ad3aea8d3a9065fc088ddcec","observation_id":"4876a34b-7f0a-4df9-9596-17a9f86843cb","resolution":{"observed_at":"2026-05-18T19:21:46.618753Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-agent reinforcement learning: A comprehensive survey","venue":null,"work_id":"1c005fce-81e5-4580-b222-69526eeedb75","year":null},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:16725a4f8ffb305d0c201a3db9e10fb4aae589a845128c552a73af8230e66cd3","observation_id":"4fcfd900-328a-435f-a8a1-afc240977055","resolution":{"observed_at":"2026-05-18T19:22:50.426645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10256","last_updated":"2024-07-03T00:27:14Z","snapshot_observed_at":"2026-07-06T17:03:56.263404Z","submitted_at":"2023-12-15T23:16:54Z","title":"Multi-agent Reinforcement Learning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2312.10256","doi":"10.48550/arxiv.2312.10256","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10256","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multi-agent reinforcement learning: A comprehensive survey","venue":"arXiv (Cornell University)","work_id":"e1130275-34a2-4ccd-a589-7f945d00c81c","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2312.10256","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:650f9041aea61bf5785a0cf09a10a0a35abeacbc0db0a37699a09ea221489e2a","observation_id":"7a445999-f65f-4c74-8227-913d327376e2","resolution":{"observed_at":"2026-05-18T19:21:48.282484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"b16e31f9-ad07-405b-b5d9-179329514d71","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:a17224c82da915d55412d0d06961f3de2125fe8b0bb87629415f312d308e15c3","observation_id":"01685371-3625-47d6-a637-18bed9d705c0","resolution":{"observed_at":"2026-05-18T19:22:50.432658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f37b26b53294695716a25fe76f8a8a1fd7012473560c0e7278d218fcdc878e86","observation_id":"2c337282-0282-4e35-b81b-aebb6370eff7","resolution":{"observed_at":"2026-05-18T19:21:48.266422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:294bc312be55cf291435d490288ae7a66d4e1443d0c1aefcda48ec5c799fd5a6","observation_id":"58e06a1a-2b09-4152-9ce7-7630c00b9215","resolution":{"observed_at":"2026-05-18T19:21:48.138145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai o3 and o4-mini: Next-generation reasoning models","venue":null,"work_id":"7a576e00-da31-4903-9553-6c103bb3dcda","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:50ab8afa3fd788523afe3063c0c3fec340ae96152a3c4f77c7765f1d36072510","observation_id":"dc1a6192-e18c-40a2-95a6-49ece5ccadf2","resolution":{"observed_at":"2026-05-18T19:22:50.405181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12328","last_updated":"2025-04-12T16:07:36Z","snapshot_observed_at":"2026-07-06T21:10:31.989050Z","submitted_at":"2025-04-12T16:07:36Z","title":"A Comprehensive Survey of Reward Models: Taxonomy, Applications, Challenges, and Future","version":1},"cited_work":{"arxiv_id":"2504.12328","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.12328","snapshot_observed_at":"2026-07-02T05:46:41.076602Z","title":"A comprehensive survey of reward models: Taxonomy, applications, challenges, and future","venue":null,"work_id":"66d2bc8c-9efa-4c86-b7b3-262ebc90877f","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.12328","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:06dfe5f5036f95b8d8e8af7386453860b612c3ac10ca70dcc250113f027e9452","observation_id":"4f5f303e-8ec3-4e6a-8cec-2d4640f9a9f7","resolution":{"observed_at":"2026-05-18T19:21:48.183065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":"f5f35a00-2545-4b67-bfe9-bf70e7fd4c50","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:f2f1e913482accf0ef913ee7b9a333cf95ac165af398b2007798993c303fc749","observation_id":"ee604cd5-9a49-4432-86e8-bc5da3c09b6d","resolution":{"observed_at":"2026-05-18T19:22:50.402099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model alignment as prospect theoretic optimization","venue":null,"work_id":"d78ba2f2-91ed-4ade-8b36-b03ea45e21e4","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e33f150e7bc5f20e35ac74c2d450dee18848ac6817ab39c1a8107810f7e4a363","observation_id":"8ec5c89e-c66c-46a1-86db-9b1020d8e098","resolution":{"observed_at":"2026-05-18T19:22:50.408414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2504.05118","doi":"10.1109/access.2024.3384487","metadata_source":"pith","pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","venue":"cs.AI","work_id":"c2351652-65f7-47cd-ae80-dbcd72a6eb20","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:7eba1d8f52a5147e45782c73184e1e34302cb2e2e6f3315df000fe755bd3f9d4","observation_id":"b2ab2c70-a02f-4218-9207-3bb352e10aca","resolution":{"observed_at":"2026-05-18T19:21:48.013620Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Part i: Tricks or traps? a deep dive into rl for llm reasoning","venue":null,"work_id":"a4721dd8-29f0-4839-b602-f43efed10c19","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:507b9102f1853cfb127602bac6275c670a045d26acf5022392e184d55c32f358","observation_id":"d47cb896-c4a9-49d3-91dc-6ff91af02719","resolution":{"observed_at":"2026-05-18T19:22:50.411470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Policy filtration for RLHF to mitigate noise in reward models","venue":null,"work_id":"76cb3584-14b7-481b-a538-cf18d8bc98bb","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:1098ecdd776c33a3fad74000f01c23b74f3d4188789a866f599bbc4d762b43df","observation_id":"9ad6a137-df59-4412-8227-3f7838253bb7","resolution":{"observed_at":"2026-05-18T19:22:50.417568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-07-06T19:26:12.102947Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":"2410.01679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-07-09T11:16:11.296273Z","title":"Available: https://arxiv.org/abs/2410.01679","venue":"cs.LG","work_id":"1b370c79-344d-4e23-8065-f313dbdc84de","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:53d429a9e90b37f42ed2a36958ef3cf037c841cbf21385cbbee8c6f3440400ed","observation_id":"6179bf92-2916-48d4-8521-503ca9af2743","resolution":{"observed_at":"2026-05-18T19:21:48.734746Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Process supervision-guided policy optimization for code generation","venue":null,"work_id":"ee3569aa-8151-4bea-bafd-293c8fed2afb","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c8d51ada471b97352e47d8180801ac7e1af8823846079ee7906c974033498a86","observation_id":"518b9d2a-53a1-498b-8f60-db0e3e94ec91","resolution":{"observed_at":"2026-05-18T19:22:50.435823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"$\\beta$-DPO: Direct preference optimization with dynamic $\\beta$","venue":null,"work_id":"e96ca764-a613-4bbc-a70f-a1d3f44594fd","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:ef5c2843857389a0329323b388a18588d5c94ac502e89fa51c937da7a046cac0","observation_id":"85ca1492-1eb5-4891-b8f5-cfaa50b4e617","resolution":{"observed_at":"2026-05-18T19:22:50.414636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SimPO: Simple preference optimization with a reference- free reward","venue":null,"work_id":"c402d39b-373c-4abe-9318-743721c8329e","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:38bcda568b68f6f85b09fffdd094d9d1d622d6d49796151fd3d9a25489566e3a","observation_id":"b69bf1a4-b249-410c-a560-13219291986a","resolution":{"observed_at":"2026-05-18T19:22:50.451664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":"2403.07691","doi":"10.48550/arxiv.2403.07691","metadata_source":"pith","pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","venue":"cs.CL","work_id":"93ad9e7b-6db2-4249-a0fa-8a96ef124d53","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:0a43ad83b625df3b84523df12209a7dc37356d723494ea468cb6d1cd1e523964","observation_id":"79879293-fddf-4ffa-b97a-0261ab07e005","resolution":{"observed_at":"2026-05-18T19:21:48.143700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":"2406.18629","doi":"10.48550/arxiv.2406.18629","metadata_source":"pith","pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","venue":"cs.LG","work_id":"c36a9ddb-5e98-40df-a3c4-ec831be19023","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:14d545ba12263bec42e86402efc8d0986bc8536810c3f3583a6ef7aa16f7e73b","observation_id":"808fbd4d-c3e0-4f1f-88bc-b8bff91c6cc2","resolution":{"observed_at":"2026-05-18T23:58:29.262663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10164","last_updated":"2026-04-15T15:39:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-13T20:00:09Z","title":"Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization","version":2},"cited_work":{"arxiv_id":"2508.10164","doi":"10.48550/arxiv.2508.10164","metadata_source":"pith","pith_arxiv_id":"2508.10164","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Pruning Long Chain-of-Thought of Large Reasoning Models via Small-Scale Preference Optimization","venue":"cs.AI","work_id":"e04043f3-44e7-4e23-b596-9e3cd2102788","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.10164","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:5157621f3052ca36be73ca297c51f10c9fb51e26425578cb93886c4984fffabd","observation_id":"9c6eb917-b493-4053-8f5d-207c5f29a10f","resolution":{"observed_at":"2026-05-18T19:21:48.068374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:27c0230c74b11db327630c1c40409429471bde55c1917ea39e6206d5ef6069a1","observation_id":"dc87ac1d-53ef-498d-85f7-32e9f5e14888","resolution":{"observed_at":"2026-05-18T19:21:48.409093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.18071","doi":"10.48550/arxiv.2507.18071","metadata_source":"pith","pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Group Sequence Policy Optimization","venue":"cs.LG","work_id":"3a98b53b-9f52-4d95-adf7-89353c0a9a65","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:a6128f8acf0fd7253595724ee29fe8669e94d4c1afc12c91cd3851809b7871df","observation_id":"63add13d-d4b5-4056-b866-47cd0302d06f","resolution":{"observed_at":"2026-05-18T19:21:48.052038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.20673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.190550Z","title":"Geometric-mean policy optimization","venue":null,"work_id":"a9c27ea5-14a8-4719-a98d-c59a3a8c142a","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c147eca5e7f284cc877fb1ecf3137bb0f6f2d6bf8111c2d329f27e53216f9615","observation_id":"3a6d2884-cd12-4c1c-9b70-725a57238a5d","resolution":{"observed_at":"2026-05-18T19:21:48.512545Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":"2505.24864","doi":"10.48550/arxiv.2505.24864","metadata_source":"pith","pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","venue":"cs.CL","work_id":"b6fae4a8-0f64-45dd-b9f4-22f8e0a7e7f6","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:334ebc309bf6d9f307674f8e01926c8ea01bd3cc75143998880e9acc0a3864f0","observation_id":"c5a2fb91-77c4-41df-a9a1-7264959a1673","resolution":{"observed_at":"2026-05-18T20:52:33.970587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05170","last_updated":"2026-05-05T15:31:45Z","snapshot_observed_at":"2026-07-06T22:09:13.286008Z","submitted_at":"2025-08-07T09:04:10Z","title":"ReCode: Reinforcing Code Generation with Reasoning-Process Rewards","version":3},"cited_work":{"arxiv_id":"2508.05170","doi":"10.48550/arxiv.2508.05170","metadata_source":"pith","pith_arxiv_id":"2508.05170","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ReCode: Reinforcing Code Generation with Reasoning-Process Rewards","venue":"cs.SE","work_id":"5189297d-938c-4b3c-8c55-08c2c99ca8d4","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.05170","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:5a188300070466e9b0cdaeea7493dcb189e80deec94415d1bfd9c0a7853b8e34","observation_id":"122ae140-4eb5-4fc2-a6dc-cb60cc1aead6","resolution":{"observed_at":"2026-05-18T19:21:48.003226Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":"2503.20783","doi":"10.48550/arxiv.2503.20783","metadata_source":"pith","pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","venue":"cs.LG","work_id":"ec354f3b-9484-4a0c-94c8-92d4d0260835","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:33cf3476576e16639f0b7ae9bef2745e0db4b977b3ade5835594b16dd75181fd","observation_id":"181db150-9ff2-45ac-a448-0f9a114bf0df","resolution":{"observed_at":"2026-05-18T19:21:48.073138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:05.84445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-07-31T07:01:13.724738Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2503.12937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-07-10T05:16:48.080500Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":"cs.AI","work_id":"e1614961-16d2-43bc-908a-8c57da5b151c","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c3dcf87fc499a7a0d49b9b820a82ee40c9a107c03e5562f201aaa4af710addcd","observation_id":"0a41b68b-c538-473c-99e2-959846fa58ca","resolution":{"observed_at":"2026-05-18T19:21:48.310900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14286","last_updated":"2025-04-22T10:07:13Z","snapshot_observed_at":"2026-07-06T21:11:54.143996Z","submitted_at":"2025-04-19T13:06:03Z","title":"SRPO: A Cross-Domain Implementation of Large-Scale Reinforcement Learning on LLM","version":2},"cited_work":{"arxiv_id":"2504.14286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14286","snapshot_observed_at":"2026-07-03T04:27:36.773999Z","title":"Srpo: A cross-domain imple- mentation of large-scale reinforcement learning on llm","venue":null,"work_id":"e76afec2-5180-4990-9b9e-24059ef14a80","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.14286","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9d2f0f9b08b8fdc740772b5ce5c72cb1f1178a1bb83e4c84766339b10302acd3","observation_id":"5ff6a99d-6525-439b-bee4-924540413cb4","resolution":{"observed_at":"2026-05-18T19:21:48.803557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"15e09c19-938e-473f-8a03-c48519a17b70","year":null},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:4e35556f12869dee222d5bc475b742f14fc272967a8490c1132013748094ac3d","observation_id":"e3703e59-508a-46ab-96f4-cc98e1583768","resolution":{"observed_at":"2026-05-18T19:22:50.395864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02177","last_updated":"2025-06-02T19:03:00Z","snapshot_observed_at":"2026-07-06T21:35:22.208213Z","submitted_at":"2025-06-02T19:03:00Z","title":"Act Only When It Pays: Efficient Reinforcement Learning for LLM Reasoning via Selective Rollouts","version":1},"cited_work":{"arxiv_id":"2506.02177","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02177","snapshot_observed_at":"2026-07-03T09:47:59.849796Z","title":"Bartoldson, Bhavya Kailkhura, Fan Lai, Jiawei Zhao, and Beidi Chen","venue":null,"work_id":"d2eaa80f-327c-4ce1-925b-baaff8681593","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2506.02177","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9fb3dcf0401bee513f08605af5837541323c7d4363b7aeecca221050e699ad1b","observation_id":"b4d40336-1471-4269-b24f-77da40690d0f","resolution":{"observed_at":"2026-05-18T19:21:48.638499Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-07-06T21:15:59.063396Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9496ddc5f3ef29b34ad7e9be59b677c9c06e3bf13da4e4fa2d21b91ec40932bf","observation_id":"4e4c5d38-576b-494f-b239-26b6df0b04bd","resolution":{"observed_at":"2026-05-18T19:21:48.689674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10628","last_updated":"2025-07-16T15:30:11Z","snapshot_observed_at":"2026-07-06T21:57:03.414218Z","submitted_at":"2025-07-14T08:10:00Z","title":"GHPO: Adaptive Guidance for Stable and Efficient LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2507.10628","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10628","snapshot_observed_at":"2026-07-04T20:00:08.029366Z","title":"arXiv preprint arXiv:2507.10628 , year=","venue":null,"work_id":"e6ef51f6-345c-4a8e-9007-3f3df283b908","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.10628","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:8a11b9efe1b014b51ab76a66fb3b5a8e077bce52827d69e08c9d7655d9dd8f03","observation_id":"005cfd71-2387-45e5-adae-73e25cfbd840","resolution":{"observed_at":"2026-05-18T19:21:48.567762Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-04T14:10:02.519865Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":"2504.16656","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-07-04T20:10:08.032034Z","title":"Skywork r1v2: Multimodal hybrid reinforcement learning for reasoning","venue":null,"work_id":"eb56fa03-88a4-4a9b-b449-b695b39f7832","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:982514b06edfc7c47f45d44854b262e9ababca9d0571ceb26e4d4257ed340a19","observation_id":"b2df9d6a-be8e-4b2f-ba4f-e856480b8e1c","resolution":{"observed_at":"2026-05-18T19:21:48.436079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19201","last_updated":"2025-08-26T17:03:46Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:03:46Z","title":"Understanding Tool-Integrated Reasoning","version":1},"cited_work":{"arxiv_id":"2508.19201","doi":"10.48550/arxiv.2508.19201","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.19201","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding tool-integrated reasoning","venue":"arXiv (Cornell University)","work_id":"d7b833e3-8bfb-4ff0-b539-8c12f6ef11e0","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.19201","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:7c8dee138e218a90e5ae21b9a88c090bc9246b00a4eee2c736e5cd0d6ec4343a","observation_id":"81bbebef-4da3-4fce-b002-9c69f4ab4b61","resolution":{"observed_at":"2026-05-18T19:21:48.422826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17445","last_updated":"2025-08-24T16:52:37Z","snapshot_observed_at":"2026-07-06T22:17:26.368596Z","submitted_at":"2025-08-24T16:52:37Z","title":"TreePO: Bridging the Gap of Policy Optimization and Efficacy and Inference Efficiency with Heuristic Tree-based Modeling","version":1},"cited_work":{"arxiv_id":"2508.17445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.17445","snapshot_observed_at":"2026-07-04T20:00:08.411000Z","title":"Treepo: Bridging the gap of policy optimization and efficacy and inference efficiency with heuristic tree-based modeling","venue":null,"work_id":"c7e309cd-548e-4957-934f-101c526a9610","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.17445","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d3527342a219c1d0ebf1c4e9a1c3c63e106c39b2c912d1ec45c4f106b950a525","observation_id":"6e85e4c9-95eb-4636-b522-21e93dec0dec","resolution":{"observed_at":"2026-05-18T19:21:48.770589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-07-06T22:04:35.202101Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"cited_work":{"arxiv_id":"2507.21848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.21848","snapshot_observed_at":"2026-07-03T09:47:59.935150Z","title":"Edge-grpo: Entropy-driven grpo with guided error correction for advantage diversity.arXiv preprint arXiv:2507.21848","venue":null,"work_id":"202a6e63-322d-43bd-bbfd-4ffd691465ed","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.21848","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:3dd69601165bc3538e12a87dc7e3d0c8fea6e8f6a1500b17d5784d37de83a9d2","observation_id":"cf2cc2bc-117b-4cd6-847a-ba838efe361b","resolution":{"observed_at":"2026-05-18T19:21:48.764302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13755","last_updated":"2026-04-12T13:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-19T11:51:40Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","version":8},"cited_work":{"arxiv_id":"2508.13755","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.13755","snapshot_observed_at":"2026-07-04T08:09:40.621610Z","title":"Depth-Breadth Synergy in RLVR: Unlocking LLM Reasoning Gains with Adaptive Exploration","venue":"cs.LG","work_id":"f6699fce-0a85-4d3e-958a-b94201b37151","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.13755","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:31c0a8346ff7dbd8847a1a61b93f28cbcaa0a613d4801a4bce505b3333eb918e","observation_id":"28aa91b4-ef3e-4a99-9638-7cb0a8cb5ec7","resolution":{"observed_at":"2026-05-18T19:21:48.758177Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.11408","doi":"10.48550/arxiv.2508.11408","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2508.11408 , year=","venue":"arXiv (Cornell University)","work_id":"994df3c4-5dc6-45c0-9db5-e82e415ce5d8","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:b09da36f90664bf5c15f2b1b61851311f170024f4cda6bd7fbbb6fac8628e387","observation_id":"d29ee98b-ad09-460f-b317-c504c15b29d7","resolution":{"observed_at":"2026-05-18T19:21:48.441115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06448","last_updated":"2026-04-14T16:31:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T23:22:34Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","version":5},"cited_work":{"arxiv_id":"2507.06448","doi":"10.48550/arxiv.2507.06448","metadata_source":"pith","pith_arxiv_id":"2507.06448","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Perception-Aware Policy Optimization for Multimodal Reasoning","venue":"cs.CL","work_id":"21674beb-d5af-4cf7-a1e0-c994ecedde54","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.06448","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:a86165555a26066bdcf29794ae7bb73431b778d042261959f11f9f9544e49b3c","observation_id":"e7d8987a-1e34-4486-b289-3db04d99566c","resolution":{"observed_at":"2026-05-18T19:21:48.458569Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pass@k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"f85853e4-2a8e-42ac-9d84-12a7fde02e2b","year":null},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:4f741384a863a77db180487fdc17eb5ce9a46fbf08a87fe40193cdcbd8fc36d9","observation_id":"22d80a05-e4f4-4ebe-913a-986afc61037c","resolution":{"observed_at":"2026-05-18T19:22:50.385396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-01T16:48:14.960826Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2508.10751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.10751","snapshot_observed_at":"2026-07-04T21:00:08.457909Z","title":"Pass@ k training for adaptively balancing exploration and exploitation of large reasoning models","venue":null,"work_id":"e7962a8e-fc74-4d96-9a1b-3c7897f6c60d","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.10751","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:ffda34264e1074c994c299a354e4abaa585610a131458f54cf5ff83ab1afb83c","observation_id":"799af097-4862-4a75-989d-849b0b503152","resolution":{"observed_at":"2026-05-18T19:21:48.591192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llm-powered autonomous agents.lilianweng.github.io, Jun 2023","venue":null,"work_id":"f60912aa-5792-4c15-a5dd-52cf19e179f6","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:81adb08d8a1f3dcbe046e34f58e6d28c9d03fe665cb5cd5c332e6e60bbfd656c","observation_id":"c150adfb-e10f-4dfa-9a3d-fbff1e0149e7","resolution":{"observed_at":"2026-05-18T19:22:50.399038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentsquare: Automatic LLM agent search in modular design space","venue":null,"work_id":"9f53ee63-2dde-4067-ac93-de2fe73d3320","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:b4f2e1904c362f82d7c588e1284118205a5d5f6a701591a200d3d1491aa6827c","observation_id":"3cb555e9-4f99-4d75-9994-d037a04b337d","resolution":{"observed_at":"2026-05-18T19:22:50.381883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.acl-long","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ISBN 979-8-89176-251-0","venue":null,"work_id":"2600ef32-de86-4edc-bcf2-b00fcc304cf8","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:030966085ac2ed8ae61f2a5fb99fb739b542cb14b4baf7f368211a28355be229","observation_id":"fddb92de-a7ef-4a3f-9b9a-e1b5541c8ca1","resolution":{"observed_at":"2026-05-18T19:21:46.625626Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:21.28382+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:21.28382+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca0d9e27-4eed-4a61-8bf2-964696f4356c","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:bce009bc5fa2a9ae677791dab5f4ab0433e791e6b1c4e8fef15b6daaf19832d0","observation_id":"a71b2933-cd04-489e-8ebe-cc12767fbab4","resolution":{"observed_at":"2026-05-18T19:22:50.388581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LLM as a mastermind: A survey of strategic reasoning with large language models","venue":null,"work_id":"bfe3f4ca-566c-4edc-a73c-abcf14fcc1c2","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:a4691fe1c596bec7803688fda1c701ea6ecc71cf8b4b9d0835f604f810946f6a","observation_id":"261db82e-e2be-4f29-8e14-7279eddd3777","resolution":{"observed_at":"2026-05-18T19:22:50.366987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3704435","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tool learning with foundation models","venue":"ACM Computing Surveys","work_id":"2994f155-2501-432e-bfd6-61ab6b22373c","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e5c057299c2b4ab6d260fb93719942bddaaebd56e3f26be10eb667ed47e59fb4","observation_id":"127adaf1-3e28-45c7-8f98-b287df11f931","resolution":{"observed_at":"2026-05-18T19:21:46.736820Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Elements of a theory of human problem solving.Psychological review, 65(3):151","venue":null,"work_id":"3dd88459-405f-4b81-84b4-29ba6b596aea","year":1958},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:51d072bfc9a4193c152cf9e4a039818e8cdc7dbd1819bcdef16683e727b4b5fc","observation_id":"69b943a9-d04f-449b-8703-96f8c92b8312","resolution":{"observed_at":"2026-05-18T19:22:50.363554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02716","last_updated":"2024-02-05T04:25:24Z","snapshot_observed_at":"2026-07-06T17:25:14.115360Z","submitted_at":"2024-02-05T04:25:24Z","title":"Understanding the planning of LLM agents: A survey","version":1},"cited_work":{"arxiv_id":"2402.02716","doi":"10.48550/arxiv.2402.02716","metadata_source":"pith","pith_arxiv_id":"2402.02716","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding the planning of LLM agents: A survey","venue":"cs.AI","work_id":"6daa5311-7f56-401d-94db-17be43e95cbc","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2402.02716","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:263a20b4d19a8fa3c30b0aa1d3d94bddac2952101ffe9db9d62869ab86057f5d","observation_id":"abbb2d01-8e70-491f-9ce1-4fc5e002bb0b","resolution":{"observed_at":"2026-05-18T19:21:48.239818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T20:20:12.598477+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T20:20:12.598477+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02716","last_updated":"2024-02-05T04:25:24Z","snapshot_observed_at":"2026-07-06T17:25:14.115360Z","submitted_at":"2024-02-05T04:25:24Z","title":"Understanding the planning of LLM agents: A survey","version":1},"cited_work":{"arxiv_id":"2402.02716","doi":"10.48550/arxiv.2402.02716","metadata_source":"pith","pith_arxiv_id":"2402.02716","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding the planning of LLM agents: A survey","venue":"cs.AI","work_id":"6daa5311-7f56-401d-94db-17be43e95cbc","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2402.02716","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c5677566beee3490abc4b8422239f364f759d8613fe4ba1ebb0c8361de7af3cf","observation_id":"66cab004-858c-4dc3-8d18-86affe20f3c6","resolution":{"observed_at":"2026-05-18T19:21:46.759838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T20:20:12.598477+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T20:20:12.598477+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"1c64578d-57bf-455b-8535-31fc8d64461a","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:1182a2ab160c6ef3c3c2156ca076ce475ccbda3172e2af7c1227077020591d21","observation_id":"42eeca06-3ad2-4c69-ba04-d4fd3d2760cc","resolution":{"observed_at":"2026-05-18T19:22:50.370819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":"9b749f9e-5cc1-46d2-a982-e1078ee390f6","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:347f2005a1760e856365abf0f37c2fa4724cbd374c481a1e1d19f5bf583a2587","observation_id":"42575813-c981-482d-9242-1614ec963728","resolution":{"observed_at":"2026-05-18T19:22:50.378508Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language agent tree search unifies reasoning, acting, and planning in language models","venue":null,"work_id":"7347c9c4-0567-496e-ba12-ff6491af7180","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:fa363a58d88bc6848b0b39652af40b84230873955fb81fe81ce9fb4d2560d1d1","observation_id":"b9098cef-aa05-4468-ad87-3384385ee767","resolution":{"observed_at":"2026-05-18T19:22:50.351629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.18098","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T08:09:40.711993Z","title":"Planning without search: Refining frontier llms with offline goal-conditioned rl","venue":null,"work_id":"f6f8b4c6-8425-4cd0-a878-20bd1161da36","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:778be85beb781a88cd43ae6f55918d741d990126a9f9065407637c2e90521ee2","observation_id":"ba991bd1-c692-43b5-b6ea-ba1d1a6dbab7","resolution":{"observed_at":"2026-05-18T19:21:48.111021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.03581","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:59:57.849446Z","title":"Learning when to plan: Efficiently allocating test-time compute for llm agents","venue":null,"work_id":"d1a2548b-5502-40fd-8e3a-b26513bc9170","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c836ce3b92a144fddbbc422b2483c924fac7c66c433c92d8640fb7c86d490cf9","observation_id":"a92bf813-e794-45f0-9ab9-3863594c978d","resolution":{"observed_at":"2026-05-18T19:21:48.628450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22130","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deshmukh","venue":null,"work_id":"318e9611-9eef-4920-96c8-73a1d2f15939","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:a319c3275d8381ed5b41a1c0f5daacf97cdd4b0d30c879907e6e6e97348b5a24","observation_id":"71995afe-1318-4193-8be6-7f97b73df15b","resolution":{"observed_at":"2026-05-18T19:21:48.160251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.409","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trial and error: Exploration- based trajectory optimization of LLM agents","venue":null,"work_id":"6ed76a90-a2b6-4e01-87b1-07263e66d208","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:64ec77574c482d8e52197a6fe170dd37bef71b10db5ebfa4d2348c0aa77e9c6d","observation_id":"ee4b2b14-200b-4ffe-979c-a74267c12c86","resolution":{"observed_at":"2026-05-18T19:21:46.667234Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:50:24.442065+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:50:24.442065+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Voyager: An open-ended embodied agent with large language models.Transactions on Machine Learning Research","venue":null,"work_id":"71609884-2dd0-4c6c-9592-db1bdf0abdfa","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:d48fb37f12a48dc7adc714e8c3986013cd38f4bba3b6005118b39595072cb8b3","observation_id":"1fe0a0f9-2855-47fc-98c1-e0c7a53c56ae","resolution":{"observed_at":"2026-05-18T19:22:50.358704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01920","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.815763Z","title":"Dynamic speculative agent planning","venue":null,"work_id":"e78d1587-10ea-4d7e-addd-f519d56491ac","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:bdf3e7ec9efefa2793bbe86ca8fc82839e7051e0b8332e77715e1af10f9136eb","observation_id":"3f518fd1-643b-4a88-9340-2a1a77aafeae","resolution":{"observed_at":"2026-05-18T19:21:48.708756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19598","last_updated":"2025-08-27T06:19:50Z","snapshot_observed_at":"2026-07-06T22:19:18.624181Z","submitted_at":"2025-08-27T06:19:50Z","title":"Encouraging Good Processes Without the Need for Good Answers: Reinforcement Learning for LLM Agent Planning","version":1},"cited_work":{"arxiv_id":"2508.19598","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.19598","snapshot_observed_at":"2026-07-09T11:16:11.340947Z","title":"Encouraging good processes without the need for good answers: Reinforcement learning for llm agent planning","venue":"cs.LG","work_id":"9d394028-e798-472d-8802-1ff36b428157","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.19598","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:ce7557a7e9cfff02f44d025080a1ee5b037427964ea246160deb306fea1acb85","observation_id":"4c2ea35a-3944-4662-935b-63a1c61f2ed2","resolution":{"observed_at":"2026-05-18T19:21:48.698956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00344","last_updated":"2026-07-28T07:42:46Z","snapshot_observed_at":"2026-07-31T23:54:14.125988Z","submitted_at":"2025-08-01T06:17:11Z","title":"PilotRL: Training Language Model Agents via Global Planning-Guided Progressive Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2508.00344","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.00344","snapshot_observed_at":"2026-07-29T02:24:11.040454Z","title":"Pilotrl: Training language model agents via global planning-guided progressive reinforcement learning","venue":null,"work_id":"9e4e9451-9d21-4870-917e-b55a67fb4a96","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2508.00344","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:4bd4cfa057da698d45fe8ff1b021d13289c8dc5368bfd0199cc39547a86c2bac","observation_id":"5e4d2d28-a510-4f85-b061-dcabb6b549b8","resolution":{"observed_at":"2026-07-29T02:24:11.040454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Planner-r1: Reward shaping enables efficient agentic rl with smaller llms","venue":null,"work_id":"15e515fc-9037-4243-88ec-6e068d1c4412","year":null},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:27f3fc88564e460b0693ef78341ce1f3a08847098798aeac316871a6827c53a3","observation_id":"68e79a83-d91e-47bf-8ebe-3ea74e9f02cf","resolution":{"observed_at":"2026-05-18T19:22:50.374625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:20:07.654884Z","title":"Planner-r1: Reward shaping enables efficient agentic rl with smaller llms","venue":null,"work_id":"6df6d901-41e8-4692-82da-772962713744","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c4c0e89b1e9ed7548448e9588e0f3834365d5b703a974463ace36b989119b828","observation_id":"d2762523-ea31-441f-93f4-1145ba12a75d","resolution":{"observed_at":"2026-05-18T19:21:48.703490Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-025-63804-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A brain-inspired agentic architec- ture to improve planning with llms.Nature Communications, 16(1):8633","venue":"Nature Communications","work_id":"5837160d-a853-4235-8962-2c879b18b27a","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:673ef4fd66450382eb4b032934557116ed5fc8b005398f618b586dcae10c3d30","observation_id":"63e3f720-3a8b-4398-ba5c-98ae87fe806d","resolution":{"observed_at":"2026-05-18T19:21:46.680300Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toolformer: Language models can teach them- selves to use tools","venue":null,"work_id":"441574c7-14e5-4038-873d-cfd34b3169c2","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:8515cdb10f3b75a36dcf7d867261df842a7f03cc339a7c1619bd3344632ec71b","observation_id":"08887fbe-0b1f-413f-9d99-f07452820a75","resolution":{"observed_at":"2026-05-18T19:22:50.348198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05915","last_updated":"2023-10-09T17:58:38Z","snapshot_observed_at":"2026-08-01T07:39:12.092512Z","submitted_at":"2023-10-09T17:58:38Z","title":"FireAct: Toward Language Agent Fine-tuning","version":1},"cited_work":{"arxiv_id":"2310.05915","doi":"10.48550/arxiv.2310.05915","metadata_source":"arxiv_reference","pith_arxiv_id":"2310.05915","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fireact: Toward language agent fine-tuning","venue":"arXiv (Cornell University)","work_id":"382904a8-a33f-42d0-ae77-b61c9f0cb7cb","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2310.05915","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:5e68420661bc232e0971350e76f84505a9ecefc78372249af26ed75b862fe9b5","observation_id":"7d149853-178e-4757-a71c-fdf5f94f7ea8","resolution":{"observed_at":"2026-05-18T19:21:48.752794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:47:46.776388Z","title":"Knowledge-Centric Hallucination Detection","venue":null,"work_id":"557a574b-31bd-4f07-9bd0-47bc7c74bcd8","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:95201e5434cce9bbb6ee4753ed5be489563e66e72ad952d7c3d3c46fb66ef717","observation_id":"30507396-f3d7-4e55-9e8e-68627b5ccdd0","resolution":{"observed_at":"2026-05-18T19:21:46.686021Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:47.367793+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:47.367793+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agent-FLAN: Designing data and methods of effective agent tuning for large language models","venue":null,"work_id":"8a5c69a0-7e44-480f-a062-28749a4e72ef","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:eff48093f6851276cf2b79b471ace3ef7702399c6635d3119563389815f2395a","observation_id":"d5de3d6c-f9bf-4fc6-be28-3eff2b34e99f","resolution":{"observed_at":"2026-05-18T19:22:50.343624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-acl.557","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2024.findings-acl.557","venue":null,"work_id":"d0141c84-b6e0-475f-b223-3e1f9bc2f3c2","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:5a66e5d81cf13ed0de7cf8a0046c40e6e4c55e637d61b3904f8005786b824ac1","observation_id":"035db9a4-bf6e-4035-89f2-2e35b5aca205","resolution":{"observed_at":"2026-05-18T19:21:46.641108Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Agentbank: Towards generalized llm agents via fine-tuning on 50000+ interaction trajectories","venue":null,"work_id":"5adc0ab8-e4e4-4107-9b2f-4ea152e098c6","year":2024},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:c2278fc1a79f8a2ae123e97d5b6d2cd99f61a7e75c174f23d937992c36f6e688","observation_id":"ae81e564-ef8e-4cbc-9baa-ae7934baf2ff","resolution":{"observed_at":"2026-05-18T19:22:50.354885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.emnlp-main.187","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"API-Bank : A comprehensive benchmark for tool-augmented LLMs","venue":null,"work_id":"de94520c-2e89-456f-9142-14484d735d11","year":2023},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:7ffdb158ba15d286b59ce1f5cfb15a847e6f08c9bdbf49c35c2ed16e8f07409a","observation_id":"9893c56f-167f-4db3-88cd-898bf89c4dfd","resolution":{"observed_at":"2026-05-18T19:21:46.696153Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:20:39.384523+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:20:39.384523+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13958","last_updated":"2025-04-16T21:45:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-16T21:45:32Z","title":"ToolRL: Reward is All Tool Learning Needs","version":1},"cited_work":{"arxiv_id":"2504.13958","doi":"10.48550/arxiv.2504.13958","metadata_source":"pith","pith_arxiv_id":"2504.13958","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ToolRL: Reward is All Tool Learning Needs","venue":"cs.LG","work_id":"82252022-0241-4006-9b28-fd1e69293343","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2504.13958","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:9aa915c813e5ed539fe8a554237bd58ea02cbcb9dc55f5f1c53a055035ae2290","observation_id":"97d5aa68-d662-47c0-b740-2d8553e714df","resolution":{"observed_at":"2026-05-18T19:21:48.675756Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acting less is reasoning more! teaching model to act efficiently","venue":null,"work_id":"d07cc693-b102-46ba-a938-5c61349d616c","year":null},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:8ee0e67cdff8123c6aaa336801251313e0bde006c1724f5006dc505f373ee5f9","observation_id":"d4db3474-c124-4d39-aa05-13d3579a4cd9","resolution":{"observed_at":"2026-05-18T19:22:50.392161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","latest_version":5,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":11,"parse_uncertain":0,"unresolved":2,"verified_exact":55,"verified_fuzzy":30},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 64 inbound Pith citation observations for arXiv:2509.02547."}