{"as_of":"2026-08-21T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:736a46c63d5aa608125cb07e4d7b523f57c8afc762dd19adee05b9d86da38371","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:22:02.778783Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:31:12.889246Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T13:56:19.181721Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-09T18:07:52.239881Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00691","last_updated":"2025-07-18T07:40:22Z","snapshot_observed_at":"2026-08-20T12:59:05.656899Z","submitted_at":"2025-02-02T06:32:23Z","title":"To Code or not to Code? Adaptive Tool Integration for Math Language Models via Expectation-Maximization","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T18:07:52.239881Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2502.00691"},"observation_digest":"sha256:6214a139667e40bf0109b8fa9fec9afe8a9ffdf3b026242c1617aa225c03444b","observation_id":"6783f560-53d4-472e-a0b7-7c0b9d4f7635","resolution":{"observed_at":"2026-08-09T18:07:52.239881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-15T23:31:12.889246Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.05515","last_updated":"2025-05-07T14:25:46Z","snapshot_observed_at":"2026-08-15T23:58:16.239225Z","submitted_at":"2025-05-07T14:25:46Z","title":"Nature's Insight: A Novel Framework and Comprehensive Analysis of Agentic Reasoning Through the Lens of Neuroscience","version":1},"reference_index":262,"source":"pdf_text","source_observed_at":"2026-08-15T23:31:12.889246Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2505.05515"},"observation_digest":"sha256:b207183a07cd2afd6c4fcf9e65db3f302e2040cd3519de5c52efc1ebfc3b0cbf","observation_id":"8e371134-90ec-4c96-b54d-11d522178d0e","resolution":{"observed_at":"2026-08-15T23:31:12.889246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-07T13:53:03.357476Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training.arXiv preprint arXiv:2501.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20732","last_updated":"2025-05-27T05:21:04Z","snapshot_observed_at":"2026-08-20T01:46:00.683780Z","submitted_at":"2025-05-27T05:21:04Z","title":"SPA-RL: Reinforcing LLM Agents via Stepwise Progress Attribution","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:03.357476Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2505.20732"},"observation_digest":"sha256:073724d1b42043fb76debecf27cd0f0d3d091b9d8a2ebabb454ce4f4f4ff9cf5","observation_id":"07ef6a90-fbf8-41b6-b362-2ba868b5ac26","resolution":{"observed_at":"2026-08-07T13:53:03.357476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2506.00886","last_updated":"2026-05-08T17:19:33Z","snapshot_observed_at":"2026-08-16T03:08:21.502461Z","submitted_at":"2025-06-01T07:52:16Z","title":"Position: Agent Should Invoke External Tools ONLY When Epistemically Necessary","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T11:34:44.319579Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2506.00886"},"observation_digest":"sha256:295478b4164b3d07d94118961bc9a528e5351c1ce28b3901b3ca19d5bf8728b0","observation_id":"d54b30e9-74f0-491c-911b-2e4fe225f983","resolution":{"observed_at":"2026-05-19T11:37:15.878565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-07T10:54:07.875213Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04065","last_updated":"2025-06-04T15:31:46Z","snapshot_observed_at":"2026-08-13T19:00:44.799706Z","submitted_at":"2025-06-04T15:31:46Z","title":"Progressive Mastery: Customized Curriculum Learning with Guided Prompting for Mathematical Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:54:07.875213Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2506.04065"},"observation_digest":"sha256:d1261e8a406fb968be9bf2cbb71f55e6ad4f2097742aaa7eb5b84ffee03fabb2","observation_id":"43fc11a3-37d9-4aed-a4af-3d44e94031d9","resolution":{"observed_at":"2026-08-07T10:54:07.875213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2506.15841","last_updated":"2025-07-17T08:53:48Z","snapshot_observed_at":"2026-08-13T07:45:46.918603Z","submitted_at":"2025-06-18T19:44:46Z","title":"MEM1: Learning to Synergize Memory and Reasoning for Efficient Long-Horizon Agents","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-15T00:27:37.360221Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2506.15841"},"observation_digest":"sha256:5e15a4f06f94c33d44b18cddcaea0826497c99ed3645b54fb2c0d0f464f8cbf6","observation_id":"cc3e3565-2606-4351-a445-408950042b7d","resolution":{"observed_at":"2026-05-15T00:27:37.449450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T21:55:05.817610Z","title":"Agent-r: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23127","last_updated":"2025-06-29T07:31:24Z","snapshot_observed_at":"2026-08-14T15:01:44.047747Z","submitted_at":"2025-06-29T07:31:24Z","title":"Unleashing Embodied Task Planning Ability in LLMs via Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T21:55:05.817610Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2506.23127"},"observation_digest":"sha256:b83eef93242b67b125dfcb00203f1c29d66bc4ad75888e5add29d25167fa4465","observation_id":"60ac31f0-aca5-4678-9ad2-e093e0cffafa","resolution":{"observed_at":"2026-08-06T21:55:05.817610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T18:47:23.023790Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.07441","last_updated":"2025-08-20T22:10:48Z","snapshot_observed_at":"2026-08-18T01:37:45.887688Z","submitted_at":"2025-07-10T05:38:15Z","title":"SAND: Boosting LLM Agents with Self-Taught Action Deliberation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T18:47:23.023790Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2507.07441"},"observation_digest":"sha256:b7ba7417e4eb01dd8034a77f68df07abc0b9aa2e362f2a1170d8e6a6f207fdc1","observation_id":"5e784283-0055-4fc5-9ae7-06df5910fdd3","resolution":{"observed_at":"2026-08-06T18:47:23.023790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T18:29:35.842058Z","title":"Agent-r: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08270","last_updated":"2025-07-11T02:34:16Z","snapshot_observed_at":"2026-08-07T01:31:51.955348Z","submitted_at":"2025-07-11T02:34:16Z","title":"Agent Safety Alignment via Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:29:35.842058Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2507.08270"},"observation_digest":"sha256:d71872b0215b14bd39fdfbb0dd2ad30e823875e43788477c51b1c65669733ef5","observation_id":"11389ede-4427-4e8b-9513-85c8adb70359","resolution":{"observed_at":"2026-08-06T18:29:35.842058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-06T11:21:27.676834Z","title":"Agent-r: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22844","last_updated":"2025-07-30T17:00:48Z","snapshot_observed_at":"2026-08-19T03:54:53.855141Z","submitted_at":"2025-07-30T17:00:48Z","title":"RLVMR: Reinforcement Learning with Verifiable Meta-Reasoning Rewards for Robust Long-Horizon Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:21:27.676834Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2507.22844"},"observation_digest":"sha256:0a046014fb4ffccddb59d4253099eaa69271f8a79a029cf385c3e3fc5c1479aa","observation_id":"51204792-88b2-4000-8f53-bc77a7647bbc","resolution":{"observed_at":"2026-08-06T11:21:27.676834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-05T21:24:07.124905Z","title":"Agent-r: Training language model agents to reflect via iterative self- training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08790","last_updated":"2025-08-12T09:44:47Z","snapshot_observed_at":"2026-08-14T15:37:02.777434Z","submitted_at":"2025-08-12T09:44:47Z","title":"ReQuestNet: A Foundational Learning model for Channel Estimation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.124905Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2508.08790"},"observation_digest":"sha256:29401f3cd5ab1c5b291d70e214148bf9c860a13859a815724096a3545e27547b","observation_id":"e6063efe-068b-4e87-b5ff-a213379dd495","resolution":{"observed_at":"2026-08-05T21:24:07.124905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2508.08791","last_updated":"2026-04-15T06:01:13Z","snapshot_observed_at":"2026-08-14T15:36:23.868569Z","submitted_at":"2025-08-12T09:45:19Z","title":"Feedback-Driven Tool-Use Improvements in Large Language Models via Automated Build Environments","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-18T23:53:41.256273Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2508.08791"},"observation_digest":"sha256:e8ce3c94002dfd86d5f1e0bb1b1979613a5defe0b4ce9471db0b478f3c025738","observation_id":"954732c8-7d21-451e-80ed-82a9d6e7e726","resolution":{"observed_at":"2026-05-18T23:56:55.227957Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2604.06734","last_updated":"2026-04-10T13:03:12Z","snapshot_observed_at":"2026-08-20T19:48:51.435321Z","submitted_at":"2026-04-08T06:57:42Z","title":"TEC: A Collection of Human Trial-and-error Trajectories for Problem Solving","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T18:52:09.041721Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2604.06734"},"observation_digest":"sha256:6df7ff1473c9a23edc953d72b67429d71009582ec549dd1d08bdc14ee4b7ab1b","observation_id":"de9b7b6a-e106-4af2-bfbf-effc413786b6","resolution":{"observed_at":"2026-05-10T23:45:54.216137Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-10T18:15:08.727921Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2604.07774"},"observation_digest":"sha256:36f20490fdfbb6eecf818eb1191699796db712970818d474e6b936b1238b1a8a","observation_id":"bcc60619-bd81-4b0f-b25f-4c9e98bba6b2","resolution":{"observed_at":"2026-05-11T05:15:56.874791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2604.10674","last_updated":"2026-04-12T14:57:52Z","snapshot_observed_at":"2026-08-18T16:44:14.964518Z","submitted_at":"2026-04-12T14:57:52Z","title":"Skill-SD: Skill-Conditioned Self-Distillation for Multi-turn LLM Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T15:28:07.981488Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2604.10674"},"observation_digest":"sha256:c46386a0cf530724ca8e3e3e804fca111fbddb1f635421d75eac1c87f68a25a2","observation_id":"16135e9c-96b2-45d1-a29a-6a40c1678038","resolution":{"observed_at":"2026-05-11T10:31:00.981125Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2605.24426","last_updated":"2026-05-23T06:41:31Z","snapshot_observed_at":"2026-08-14T06:06:26.348742Z","submitted_at":"2026-05-23T06:41:31Z","title":"SEAL: Synergistic Co-Evolution of Agents and Learning Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T13:38:10.466713Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2605.24426"},"observation_digest":"sha256:a641272ce04ba2446846a9926cf51e8b9a656dd8b9bd37db594df9122227a3ba","observation_id":"564c48f5-03ab-4bf5-bec0-99c7ad73ab0c","resolution":{"observed_at":"2026-06-30T13:44:40.927696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2606.02372","last_updated":"2026-06-01T15:21:17Z","snapshot_observed_at":"2026-08-14T01:18:56.815276Z","submitted_at":"2026-06-01T15:21:17Z","title":"COMAP: Co-Evolving World Models and Agent Policies for LLM Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-28T14:27:50.260308Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2606.02372"},"observation_digest":"sha256:2c6a24f0b81fbd58abe54ef96c26f033b1640ce68e906dca4add040938a98b7e","observation_id":"ab2e037c-6af1-4670-ad6a-2f084ca6cb25","resolution":{"observed_at":"2026-07-01T23:16:24.851089Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2607.00035","last_updated":"2026-06-25T14:05:37Z","snapshot_observed_at":"2026-08-20T11:51:01.948950Z","submitted_at":"2026-06-25T14:05:37Z","title":"Making Failure Safe: A Constrained, Verifiable Agent Framework for Open-Web Data Collection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-02T20:55:02.866723Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.00035"},"observation_digest":"sha256:45c1c841a8fc085b297a74d53a0a1df55a4173d0cc389389ee5f3808b5b16ebf","observation_id":"1636119b-fa91-4868-b79f-a072ea86b6a0","resolution":{"observed_at":"2026-07-02T20:57:22.687885Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Agent-R: Training language model agents to reflect via iterative self-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-19T16:11:35.903833Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a81d07ccade306c354a36c29b6da999b31f2ee6682b63c95d0c38dbb870d7f83","observation_id":"a797b419-0d5b-43d1-8e7a-6a9debd70232","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":"2501.11425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-09T13:56:19.181721Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training","venue":"cs.AI","work_id":"96e9503b-b69c-42a2-920d-e67b3f95ab54","year":2025},"citing_paper":{"arxiv_id":"2607.07361","last_updated":"2026-07-10T08:24:37Z","snapshot_observed_at":"2026-08-19T13:27:33.176695Z","submitted_at":"2026-07-08T12:56:39Z","title":"BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-09T13:51:49.149342Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.07361"},"observation_digest":"sha256:55ba0232f2114b3ae81dac9bd8e086fa9a06e38abfe1cec1905706c46464419c","observation_id":"382ab218-744c-4c8e-b635-2ac60247a19e","resolution":{"observed_at":"2026-07-09T13:56:19.183080Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-13T06:45:27.857034Z","title":"arXiv preprint arXiv:2501.11425 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.07361","last_updated":"2026-07-10T08:24:37Z","snapshot_observed_at":"2026-08-19T13:27:33.176695Z","submitted_at":"2026-07-08T12:56:39Z","title":"BUS: Brain-Inspired Unsupervised Self-Reflection via Backward Prediction for Multimodal Reasoning","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-13T06:45:27.857034Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.07361"},"observation_digest":"sha256:ee0c43d95ecbb2306329b052619429d9f7a1cd346fad06efa096efba2797da43","observation_id":"92210d39-2e0c-402e-acb5-0ec6fe9095ca","resolution":{"observed_at":"2026-07-13T06:45:27.857034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-01T22:37:39.546572Z","title":"arXiv:2501.11425 [cs.AI] https://arxiv.org/abs/2501.11425","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16352","last_updated":"2026-07-17T07:10:46Z","snapshot_observed_at":"2026-08-20T09:51:25.997850Z","submitted_at":"2026-07-17T07:10:46Z","title":"Clarify Before Executing: A Self-Evolving Agent for Resolving Intent Asymmetry in 3D Tool Orchestration","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T22:37:39.546572Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.16352"},"observation_digest":"sha256:dd1e319da73e63ff373bde80468cabfb638894a17519a40e8c2d2babf664a012","observation_id":"e96571b2-8592-4b12-97e6-b2a69fdcc141","resolution":{"observed_at":"2026-08-01T22:37:39.546572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-01T12:44:32.128287Z","title":"arXiv:2501.11425 [cs.AI] doi:10.48550/arXiv.2501.11425","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19336","last_updated":"2026-07-21T17:55:10Z","snapshot_observed_at":"2026-08-17T03:34:50.323101Z","submitted_at":"2026-07-21T17:55:10Z","title":"Agents in the Wild: Where Research Meets Deployment","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T12:44:32.128287Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.19336"},"observation_digest":"sha256:68c1eceb53272dc4e549d407fca165e9232342264da3fe2109ca86a68d45832f","observation_id":"1af4d129-b140-4e06-ad80-fd63bfe22bdc","resolution":{"observed_at":"2026-08-01T12:44:32.128287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-07-31T00:46:12.934662Z","title":"Agent-r: Train- ing language model agents to reflect via iterative self-training.arXiv preprint arXiv:2501.11425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27443","last_updated":"2026-07-29T20:14:43Z","snapshot_observed_at":"2026-08-14T08:46:40.314502Z","submitted_at":"2026-07-29T20:14:43Z","title":"Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-31T00:46:12.934662Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2607.27443"},"observation_digest":"sha256:dd804eb03f3711203c3b6a7d2b3abaea360e3ec859c01a678f5ca47a9f2708fd","observation_id":"b173eeee-323c-4da1-baa0-0e874dc85a6f","resolution":{"observed_at":"2026-07-31T00:46:12.934662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-05T00:37:57.352425Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00613","last_updated":"2026-08-17T03:56:53Z","snapshot_observed_at":"2026-08-20T23:12:42.842243Z","submitted_at":"2026-08-01T12:09:47Z","title":"From Failures to Supervision: DynamicEnvPlan for Robust Long-Horizon Embodied Planning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T00:37:57.352425Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2608.00613"},"observation_digest":"sha256:888b6c052d54477713820640e7071964b2640642542a46743ad6cf8c902a9702","observation_id":"fad88add-183b-4f1f-bc9b-07f6cf689383","resolution":{"observed_at":"2026-08-05T00:37:57.352425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-15T14:26:48.754960Z","title":"doi: 10.1 8653/v1/2023.findings-acl.507","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10333","last_updated":"2026-08-11T00:28:02Z","snapshot_observed_at":"2026-08-17T21:30:14.655393Z","submitted_at":"2026-08-11T00:28:02Z","title":"MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T14:26:48.754960Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2608.10333"},"observation_digest":"sha256:a45cc82c5f1a4cfc73f775362d51872f4bc306b990495af548c8922efbc706e6","observation_id":"17822924-6ec9-4ab3-b904-8366e7604baf","resolution":{"observed_at":"2026-08-15T14:26:48.754960Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11425","snapshot_observed_at":"2026-08-15T14:26:48.759983Z","title":"URLhttps://arxiv.org/abs/2501.11425","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.10333","last_updated":"2026-08-11T00:28:02Z","snapshot_observed_at":"2026-08-17T21:30:14.655393Z","submitted_at":"2026-08-11T00:28:02Z","title":"MERA: Model Evolution and Routing with Skill Adaptation for Agentic Systems at Scale","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T14:26:48.759983Z"},"links":{"cited_paper":"/paper/2501.11425","citing_paper":"/paper/2608.10333"},"observation_digest":"sha256:81e8d3553b75a71ebe90567c52d6b60e5374999c8fff3665b78682f94fe6c2ce","observation_id":"20bb84e0-bdfb-42d2-a03e-4b3ccbd56b01","resolution":{"observed_at":"2026-08-15T14:26:48.759983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11425/citation-record","integrity":"/paper/2501.11425/integrity","json":"/paper/2501.11425/citation-record.json","paper":"/paper/2501.11425"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.432865Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.432865Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:478cc25ac5dd157cfcf0bad10166f67e10ebb781dc5188ecc557862597f3b0b0","observation_id":"fc30c406-cd27-445d-a861-b0f1b83d3663","resolution":{"observed_at":"2026-08-10T18:22:02.432865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.965957Z","title":"A survey of monte carlo tree search methods.IEEE Transactions on Computational Intelligence and AI in games, 4 (1):1–43, 2012","venue":null,"work_id":"c2fac280-be4b-4cdf-85a9-c1dc16a1f3bc","year":2012},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.439192Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f57a04f4dd8f1eb102688dca23255c3b0f4a9780a27b22c28996e6485e373f3a","observation_id":"de5b2e6b-ec7d-4f59-9342-ee5d6bcc9aa9","resolution":{"observed_at":"2026-08-10T18:22:03.971502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16247","last_updated":"2024-11-10T12:54:35Z","snapshot_observed_at":"2026-08-16T20:17:19.946842Z","submitted_at":"2024-05-25T14:11:44Z","title":"AutoManual: Constructing Instruction Manuals by LLM Agents via Interactive Environmental Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16247","snapshot_observed_at":"2026-08-10T18:22:02.444592Z","title":"Automanual: Generating instruction manuals by llm agents via interactive environmental learning.arXivpreprintarXiv:2405.16247, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.444592Z"},"links":{"cited_paper":"/paper/2405.16247","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:a7df3c75b2babbe7672ca256703289895a25a23750c8b54bec6317c98ade21f0","observation_id":"8056b4fb-a666-4045-a1bb-097288ad86ce","resolution":{"observed_at":"2026-08-10T18:22:02.444592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.948426Z","title":"Teaching large language models to self-debug","venue":null,"work_id":"463a594d-f208-475c-b7b7-e5e72426ef00","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.450516Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:afc846edac1c4959d0a27f94a9e3fc72a57656703ca1ab9ebaa94f62181dd4f5","observation_id":"c2bc9fb5-a5b4-4ef4-8c9d-68613b0e36d1","resolution":{"observed_at":"2026-08-10T18:22:03.953505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.455638Z","title":"Mindsearch: Mimicking human minds elicits deep ai searcher.arXiv preprint arXiv:2407.20183, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.455638Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:88d7cb9a0172cba8c1b20d6fe728f57503c7d4af576080c3069447524f733ce5","observation_id":"9787c36e-e909-4162-b804-af0ca607f57a","resolution":{"observed_at":"2026-08-10T18:22:02.455638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.460876Z","title":"Agent-FLAN: Designing data and methods of effective agent tuning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.460876Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:c16d7039064592bd571541a84cd113e3fc06e05add89a79162f762a70ee41b75","observation_id":"6210d6f9-f99d-4d3f-81e6-2725fdfa4412","resolution":{"observed_at":"2026-08-10T18:22:02.460876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.930263Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"cc33586a-58bc-46cd-85d1-8ea4ebb28702","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.467259Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:b553fe9c26db107330bb868b2af8f38b7962a1980212a615252002aef067ddb8","observation_id":"dd7fcaad-0590-42bf-ad33-d4d5966e6ef4","resolution":{"observed_at":"2026-08-10T18:22:03.936605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13413","last_updated":"2024-10-17T10:23:24Z","snapshot_observed_at":"2026-08-16T13:08:28.822909Z","submitted_at":"2024-10-17T10:23:24Z","title":"Think Thrice Before You Act: Progressive Thought Refinement in Large Language Models","version":1},"cited_work":{"arxiv_id":"2410.13413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.13413","snapshot_observed_at":"2026-08-10T18:22:03.429859Z","title":"Think Thrice Before You Act: Progressive Thought Refinement in Large Language Models","venue":"cs.CL","work_id":"4402b1a0-88c2-421e-af23-ec32a5800037","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.472300Z"},"links":{"cited_paper":"/paper/2410.13413","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:ed439e43bc512cf79af580bc57a55201a003db33461debab5c7a303fb09b11b1","observation_id":"26f30bf4-4a45-49d9-a9fa-2141e6728f8e","resolution":{"observed_at":"2026-08-10T18:22:03.435529Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T18:22:02.477330Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.477330Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:b17a84a1ebeefc771e3f062ab885e101230ddf3d88e418ffb2e64c949bf04bbd","observation_id":"c0765e97-8f2c-47cc-b15e-79b0dccb2673","resolution":{"observed_at":"2026-08-10T18:22:02.477330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.912499Z","title":"CRITIC: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":"6678228d-41f9-4caf-b8e0-67fcbb98b19f","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.482619Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:a533f48245ed5582c3d70da2593ad0b1305c559f9cf3d359e910f21fa674a755","observation_id":"b23979a3-e773-43ec-88df-a1913136c8e2","resolution":{"observed_at":"2026-08-10T18:22:03.917830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.895033Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":"a29bd3ea-b420-4b8a-a008-e0e6777a9455","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.488670Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:3f6b42d7cfc828fcac1e9a2edec4a0340b3a8b57ce2943d1de7dfb858ec3afe8","observation_id":"da80a68a-9e6f-4df9-b7a2-8b56d5762239","resolution":{"observed_at":"2026-08-10T18:22:03.901045Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10963","last_updated":"2024-06-25T03:14:10Z","snapshot_observed_at":"2026-08-16T14:18:50.765820Z","submitted_at":"2024-02-13T20:16:29Z","title":"GLoRe: When, Where, and How to Improve LLM Reasoning via Global and Local Refinements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10963","snapshot_observed_at":"2026-08-10T18:22:02.493706Z","title":"Glore: When, where, and how to improve llm reasoning via global and local refinements.arXiv preprint arXiv:2402.10963, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.493706Z"},"links":{"cited_paper":"/paper/2402.10963","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:fbbd65851dcd1a96ba3f8b6927477c01686b2384a27c017190e951785560846b","observation_id":"ce9379a9-42a0-4f69-a7e5-203032654627","resolution":{"observed_at":"2026-08-10T18:22:02.493706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-08-13T03:11:04.678829Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-10T18:22:02.499194Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.499194Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f49ed07640c15f54df6107a0fd5bd8292dc7f164b012c6e1247028ed9df1e680","observation_id":"a00a9c5c-f345-46d2-90a7-f5e9191715aa","resolution":{"observed_at":"2026-08-10T18:22:02.499194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.504569Z","title":"When can LLMs actually correct their own mistakes? a critical survey of self-correction of LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.504569Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:e5967ac8860d2091defcaa232b32b49de12387292bea14e7c6b081f432336ae7","observation_id":"bc36c2b5-9564-4f71-baa2-68aab2079569","resolution":{"observed_at":"2026-08-10T18:22:02.504569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.876480Z","title":"Language models can solve computer tasks.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"badc3260-3e8f-4a4c-94fd-2808fb96db09","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.509272Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:ed4dcb94c81cfc8589d2e3c156d9d81e28b19884f0781e867a925b38df984ba6","observation_id":"8c0470dd-b146-4bbc-87a6-5b3811586b23","resolution":{"observed_at":"2026-08-10T18:22:03.882033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.513954Z","title":"Bandit based monte-carlo planning","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.513954Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:41d85c946a3499175c741291924687ed5f4da08309e41da51f7829d8345a82fb","observation_id":"d1bbc986-49d0-4ca2-896b-78f13456cb4c","resolution":{"observed_at":"2026-08-10T18:22:02.513954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.518668Z","title":"Tree search for language model agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.518668Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:3dca2d0fed56d5cb3d40929244c6cbfe30ad267b49c213883e8e664ce811f87e","observation_id":"81a94272-d4cb-4793-83b2-cab28001cc60","resolution":{"observed_at":"2026-08-10T18:22:02.518668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-08-16T03:33:39.637646Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-10T18:22:02.523043Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.523043Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:d26934f9fa7f499001d26a08ebc910109ea7146443ebbb7119e51a0652ff4cfe","observation_id":"3ea87d23-bed6-47eb-bf51-54565b8895b2","resolution":{"observed_at":"2026-08-10T18:22:02.523043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10635","last_updated":"2025-07-29T09:42:39Z","snapshot_observed_at":"2026-08-16T13:25:17.985662Z","submitted_at":"2024-08-20T08:22:04Z","title":"Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search","version":3},"cited_work":{"arxiv_id":"2408.10635","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10635","snapshot_observed_at":"2026-08-10T18:22:03.244759Z","title":"Strategist: Self-improvement of LLM Decision Making via Bi-Level Tree Search","venue":"cs.AI","work_id":"c967febb-7831-4476-82d3-2eee0b9e996a","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.528542Z"},"links":{"cited_paper":"/paper/2408.10635","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:60482f56af519ab75a464c58c5f7ad254b20d934e27516650a28f8dcef2bb296","observation_id":"dbe50344-23bc-4dd6-b5b5-afd588893e4e","resolution":{"observed_at":"2026-08-10T18:22:03.251016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14809","last_updated":"2024-06-01T07:46:28Z","snapshot_observed_at":"2026-08-16T14:16:07.131589Z","submitted_at":"2024-02-22T18:59:02Z","title":"CriticBench: Benchmarking LLMs for Critique-Correct Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14809","snapshot_observed_at":"2026-08-10T18:22:02.533704Z","title":"Criticbench: Benchmarking llms for critique-correct reasoning.arXiv preprint arXiv:2402.14809, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.533704Z"},"links":{"cited_paper":"/paper/2402.14809","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:2f696b2985223ed1ed3ece080d4c6ec15be54a3b4ce8f46509dd73e4b96eb6b1","observation_id":"e4b7a4b8-e042-4425-be3a-058db3c31911","resolution":{"observed_at":"2026-08-10T18:22:02.533704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T18:22:02.539124Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.539124Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:8e2f6c7a07dd8c9a6dd2f82fc4ad0105db62af5057977d3d41fcfe15cd44b82f","observation_id":"d3775be2-59b5-40c0-89c5-ac32b53d0c83","resolution":{"observed_at":"2026-08-10T18:22:02.539124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.844424Z","title":"Agentbench: Evaluating LLMs as agents","venue":null,"work_id":"44a50fe4-a4cd-4173-9b2c-94d52688142c","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.545155Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:30df0dae84b954067b59bab24d26c64543482c2231a99de4a05f3c0e07d2b6c3","observation_id":"65759579-653f-4f03-b936-60b3d1dc65e8","resolution":{"observed_at":"2026-08-10T18:22:03.850307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.828720Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":"4d48c6bd-73dc-4528-a773-38e3fbd4ceda","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.550138Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f6db1cf259ccb34b60f94d746e1e955c990cce596427014b393e712d29ffc076","observation_id":"50791d4d-44c9-4e19-bc7f-943e920f4d32","resolution":{"observed_at":"2026-08-10T18:22:03.833741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10134","last_updated":"2023-10-16T07:17:27Z","snapshot_observed_at":"2026-08-19T13:27:14.048616Z","submitted_at":"2023-10-16T07:17:27Z","title":"CLIN: A Continually Learning Language Agent for Rapid Task Adaptation and Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10134","snapshot_observed_at":"2026-08-10T18:22:02.554860Z","title":"Clin: A continually learning language agent for rapid task adaptation and generalization.arXiv preprint arXiv:2310.10134, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.554860Z"},"links":{"cited_paper":"/paper/2310.10134","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:a10fa3c702735b8dd7b8256c271a1311a729cfe94ea23c8865514e8cdabadb84","observation_id":"81f6ec6e-87d6-4675-9b33-216e3f464499","resolution":{"observed_at":"2026-08-10T18:22:02.554860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.813167Z","title":"Skill set optimization: Reinforcing language model behavior via transferable skills.arXiv,","venue":null,"work_id":"6ba358e9-4982-48d0-8245-e40148285e9c","year":null},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.560049Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:1078f0ba6bf663305724624489e7dfc43ae86c60817c9dd49111011002d94442","observation_id":"2ba0a2d0-9a25-41a7-b62b-6bab1660447b","resolution":{"observed_at":"2026-08-10T18:22:03.818445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.795529Z","title":"Is self-repair a silver bullet for code generation? InThe TwelfthInternational Conference on Learning Representations, 2023","venue":null,"work_id":"632ee844-1ddd-454d-9792-088863206ac1","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.569970Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f69ff06f18cf8c1a360c1e7d41403024f798ef93b2a03adb51740615b19e451c","observation_id":"1aab42fc-a660-47e3-8191-1d5f5235d877","resolution":{"observed_at":"2026-08-10T18:22:03.800890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.780956Z","title":"Chatgpt, 2022","venue":null,"work_id":"47d9deac-4c3b-4937-8ba1-9f56bac89aca","year":2022},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.574882Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:98428786296c18ebeb67844d9fbc916880e073d8010ed9e6035bd172d3032e01","observation_id":"4ff89f03-d10d-41b3-a00f-8d650f6bfa51","resolution":{"observed_at":"2026-08-10T18:22:03.785588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T18:22:02.579427Z","title":"GPT-4 technical report.CoRR, abs/2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.579427Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:9e3ca6183ad66bb5d31736b4415ccdb947db1207a4c1906272622112280d22e8","observation_id":"a3d8e3b5-4dfe-4198-a0c2-ab44ed9e8891","resolution":{"observed_at":"2026-08-10T18:22:02.579427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.765003Z","title":"Automatically correcting large language models: Surveying the landscape of diverse automated correction 16 strategies","venue":null,"work_id":"2fb15ac3-0578-4352-bd44-9c9d2b768913","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.584365Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:a2e56895e07243ae7d23ca6bd75a44a0fb7fe2c10d21619dfef783ed2176eb7e","observation_id":"017dd6c6-f96a-49f6-b60e-fbf466411766","resolution":{"observed_at":"2026-08-10T18:22:03.770225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20309","last_updated":"2024-10-01T21:28:29Z","snapshot_observed_at":"2026-08-18T10:39:50.603543Z","submitted_at":"2024-05-30T17:52:36Z","title":"Large Language Models Can Self-Improve At Web Agent Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20309","snapshot_observed_at":"2026-08-10T18:22:02.589106Z","title":"Large language models can self-improve at web agent tasks.arXiv preprint arXiv:2405.20309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.589106Z"},"links":{"cited_paper":"/paper/2405.20309","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:e971db38fc858762842ddd6017c9b6b5353753811d976163b07ada2b42ac7ea3","observation_id":"9b16a689-438d-40d6-bb91-282ac9963ae4","resolution":{"observed_at":"2026-08-10T18:22:02.589106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.593979Z","title":"ADaPT: As-needed decomposition and planning with language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.593979Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:5cb3422d3ca68c2c1c8066c4dd452c7fc0345ae107a64833a0fc8359093c94a5","observation_id":"cf92a693-a6f9-40d5-bcd9-91eab11af435","resolution":{"observed_at":"2026-08-10T18:22:02.593979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-14T15:46:52.927758Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-10T18:22:02.598640Z","title":"Agent q: Advanced reasoning and learning for autonomous ai agents.arXiv preprint arXiv:2408.07199, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.598640Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:b1b5b8c2dee899c93e86c4af78ffdbee33815aeae382084277c1185ca13e2e09","observation_id":"2ade1b4b-ae86-431f-a876-ce7674bababd","resolution":{"observed_at":"2026-08-10T18:22:02.598640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.747302Z","title":"Agent planning with world knowledge model","venue":null,"work_id":"2f426f46-6c1c-4d94-b412-e7f96adb2293","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.604585Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:8c989cd52be579c14639d3db912d5998832d0ddcf88e51a5d2bf278599584744","observation_id":"9bfb9819-8c81-4aef-87d9-67fdbb1116d2","resolution":{"observed_at":"2026-08-10T18:22:03.752891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.730488Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"5c888af0-5f71-4e5c-bd0e-78994e241a35","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.609858Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:a84c89292aa226c3ed8238fa9c7e80feafa92573413b4ac8ec1598b5161153f8","observation_id":"5bf36f80-3d4f-4ec9-b0a5-af1cdd27e2a3","resolution":{"observed_at":"2026-08-10T18:22:03.735679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.713698Z","title":"Tarr, William W","venue":null,"work_id":"5e1c7420-f9b4-468b-a534-f191bcc7d140","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.615781Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:edae39ca94e3f1ba42526a686d9d3d9b0457eb2b0f62232659f45611bcbd85fe","observation_id":"4aabfb35-7752-428e-8b4a-bf5326e186d0","resolution":{"observed_at":"2026-08-10T18:22:03.719042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16755","last_updated":"2024-02-22T22:29:10Z","snapshot_observed_at":"2026-08-16T15:44:38.702011Z","submitted_at":"2023-03-28T17:04:15Z","title":"Training Language Models with Language Feedback at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16755","snapshot_observed_at":"2026-08-10T18:22:02.620898Z","title":"Training language models with language feedback at scale.arXiv preprint arXiv:2303.16755, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.620898Z"},"links":{"cited_paper":"/paper/2303.16755","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:8ec3a72b70018f52b6194fbc444dde4e611f04cfa9d3507815809fb510082880","observation_id":"5809b1a9-2387-48c7-95d6-9c2197943fd2","resolution":{"observed_at":"2026-08-10T18:22:02.620898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.697612Z","title":"Direct multi-turn preference optimization for language agents","venue":null,"work_id":"85906b6e-131d-4c2c-a4e5-a32fe20c4ccf","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.626075Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:c1ed960bffb8a9637ea389f36541411239de6e70fe573369f4ae02d9ab0e1774","observation_id":"7a7a265f-2706-4240-b3d2-97d936605bf7","resolution":{"observed_at":"2026-08-10T18:22:03.702618Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-17T19:15:32.679249Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-10T18:22:02.630904Z","title":"Reflexion: an autonomous agent with dynamic memory and self-reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.630904Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:d5fa45f73873b013eb5818c53aca91ac681d47d4621a2fdc81b7a655af7b9846","observation_id":"0969a0b0-779e-48d3-8434-8c62e6ceed97","resolution":{"observed_at":"2026-08-10T18:22:02.630904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.636678Z","title":"AgentBank: Towards generalized LLM agents via fine-tuning on 50000+ interaction trajectories","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.636678Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:ef15bcb03f6189d5189a2f56bb0c574f2346bb035c18ca5194cb17f75df8c005","observation_id":"074fb72d-495b-4f9c-9f98-5387ed6e8771","resolution":{"observed_at":"2026-08-10T18:22:02.636678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.642438Z","title":"Trial and error: Exploration- based trajectory optimization of LLM agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.642438Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:91b963475ee86075c3bf11d90ba4cf208b8b2d9182f9536f651a3c09f330dbb6","observation_id":"80d42ed4-d03e-4cec-97a7-a1ae631c99e8","resolution":{"observed_at":"2026-08-10T18:22:02.642438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T18:22:02.647644Z","title":"Llama 2: Open foundation and fine-tuned chat models.CoRR, abs/2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.647644Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:ba41032bf998ff7d980508a67d6e983d438243331753a153ee7315def80f9edd","observation_id":"14980220-a53a-42f9-8068-999085826d5a","resolution":{"observed_at":"2026-08-10T18:22:02.647644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.654533Z","title":"LLMs cannot find reasoning errors, but can correct them given the error location","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.654533Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:28d9f100ed3a6ecf8a44311ba0b3fac644a6f124e191fa9024e70dd615f05766","observation_id":"0c7b7ecc-f1b2-475e-9124-50a1bffb1152","resolution":{"observed_at":"2026-08-10T18:22:02.654533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.660044Z","title":"E2CL: Exploration-based error correction learning for embodied agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.660044Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:2702f82224eb2d5e2645cce55eb0bc12c1a95af0a2ac9faab2c587634847def8","observation_id":"2f57b7be-685c-4589-a5f1-d83132e06c45","resolution":{"observed_at":"2026-08-10T18:22:02.660044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.665226Z","title":"Math-shepherd: Verify and reinforce LLMs step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.665226Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:c435375f1c6009c2320723bcab78e8795ff634f4cbab1da01f146e933452bcd5","observation_id":"52a95e2d-0e36-4fe4-88d8-5ed75631bc11","resolution":{"observed_at":"2026-08-10T18:22:02.665226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.669844Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.669844Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:68e88737b36e20070def2b473b0495ad99f849c2957cd68f9efa0406a692afaf","observation_id":"1191ddaf-e89b-4d2a-890d-0857e25a1068","resolution":{"observed_at":"2026-08-10T18:22:02.669844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.680463Z","title":"Generating sequences by learning to self-correct","venue":null,"work_id":"1571e03a-a0eb-4ffe-891e-042c70a99b26","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.674460Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:54ee976e4628d676ef24c432bb344f62e7ebd66080d7a0d3b665c1b332f4efd3","observation_id":"04a7e4b1-7a16-494b-9010-50aa380defec","resolution":{"observed_at":"2026-08-10T18:22:03.686466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07864","last_updated":"2023-09-19T08:29:18Z","snapshot_observed_at":"2026-08-17T06:15:32.510873Z","submitted_at":"2023-09-14T17:12:03Z","title":"The Rise and Potential of Large Language Model Based Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.07864","snapshot_observed_at":"2026-08-10T18:22:02.679923Z","title":"The rise and potential of large language model based agents: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.679923Z"},"links":{"cited_paper":"/paper/2309.07864","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:011487e1c2374813d3b17a99542612103ba33022f447385e4bac2e8101c4b567","observation_id":"10a268ff-9cd9-4e05-b738-7e099d664208","resolution":{"observed_at":"2026-08-10T18:22:02.679923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04151","last_updated":"2024-06-06T15:15:41Z","snapshot_observed_at":"2026-08-16T13:45:29.257000Z","submitted_at":"2024-06-06T15:15:41Z","title":"AgentGym: Evolving Large Language Model-based Agents across Diverse Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04151","snapshot_observed_at":"2026-08-10T18:22:02.685354Z","title":"Agentgym: Evolving large language model-based agents across diverse environments.arXiv preprint arXiv:2406.04151, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.685354Z"},"links":{"cited_paper":"/paper/2406.04151","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:d89b2ab14b122e82c4f73638cbd143d4e34a0bb36e18fd9b084667bf3181ff37","observation_id":"cf3f601e-e429-4d2c-9ab2-ec4c26db51de","resolution":{"observed_at":"2026-08-10T18:22:02.685354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16579","last_updated":"2024-11-25T17:11:54Z","snapshot_observed_at":"2026-08-12T12:55:35.142701Z","submitted_at":"2024-11-25T17:11:54Z","title":"Enhancing LLM Reasoning via Critique Models with Test-Time and Training-Time Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16579","snapshot_observed_at":"2026-08-10T18:22:02.691028Z","title":"Enhancing llm reasoning via critique models with test-time and training-time supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.691028Z"},"links":{"cited_paper":"/paper/2411.16579","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:e8a486702108c77619fa00772222dfefe576a47556cca0de299ac870464f65ea","observation_id":"c206319f-92cb-444b-9adf-3a15c3694d30","resolution":{"observed_at":"2026-08-10T18:22:02.691028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12409","last_updated":"2024-10-16T09:44:38Z","snapshot_observed_at":"2026-08-16T13:08:52.096449Z","submitted_at":"2024-10-16T09:44:38Z","title":"Revealing the Barriers of Language Agents in Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12409","snapshot_observed_at":"2026-08-10T18:22:02.696782Z","title":"Revealing the barriers of language agents in planning.arXiv preprint arXiv:2410.12409, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.696782Z"},"links":{"cited_paper":"/paper/2410.12409","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:09e8478cade1c6575a5fb2854e70c83a3d6cd4ba1ab5174d9b53bed5c7d4a737","observation_id":"4cd919ec-6f6e-450d-a938-e4d10ae54cd9","resolution":{"observed_at":"2026-08-10T18:22:02.696782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.663538Z","title":"Watch every step! LLM agent learning via iterative step-level process refinement","venue":null,"work_id":"ae2ce681-306c-45ef-b890-cde62eac335e","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.702547Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:1d924f10c731491cc3111aeed8dcde2b8863ff8a4d4034928571cb6e7396f0da","observation_id":"c075135a-30b0-4840-a78f-ac5030ce8299","resolution":{"observed_at":"2026-08-10T18:22:03.668662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.645248Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":"4cbb9482-ba83-4aa1-a8bb-4c42a3ed0d0e","year":2022},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.714040Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:0dd22150a0ad3fed97e21a8dd5ed425c2d72650881ef842aa3f8bf16512995c8","observation_id":"e74debc2-423f-4817-9ebd-665e86ea25dc","resolution":{"observed_at":"2026-08-10T18:22:03.650796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.708296Z","title":"doi: 10.18653/v1/2024.emnlp-main.93","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.708296Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:2a9cce0b3fa43c3f4c0c10b0a0c8dbe0a549538aa8953ce2e2dccd1cc25c998a","observation_id":"dc5e646f-feee-4270-b631-4d500d6a64c6","resolution":{"observed_at":"2026-08-10T18:22:02.708296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.612638Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"b0eafea2-ee84-472e-b405-3fc9d5f40f23","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.725688Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:96063fb71945764202f7b4fc9051ed03085f88365601d0ac9cc8830769383bda","observation_id":"93c63a08-8297-46d0-a87d-5d035a6249d8","resolution":{"observed_at":"2026-08-10T18:22:03.617617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.628646Z","title":"Griffiths, Yuan Cao, and Karthik R Narasimhan","venue":null,"work_id":"208afb85-effe-40da-9032-04151598dcd1","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.719972Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:42691e18b7253b5d961ddf8877abeaea0508c2267146e39cae15e6910b29fc78","observation_id":"cf35c683-d0ab-423a-882c-f5201de890fb","resolution":{"observed_at":"2026-08-10T18:22:03.634254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.737096Z","title":"AgentTuning: Enabling generalized agent abilities for LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.737096Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:3f2015e27722cf32c81f67271293fe2cf18002d9a990f8c08a57452a96a748d7","observation_id":"92a6e8a6-28df-4483-836a-1c185e033216","resolution":{"observed_at":"2026-08-10T18:22:02.737096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14228","last_updated":"2025-03-10T02:42:01Z","snapshot_observed_at":"2026-08-16T13:41:08.794281Z","submitted_at":"2024-06-20T11:49:23Z","title":"EvoAgent: Towards Automatic Multi-Agent Generation via Evolutionary Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14228","snapshot_observed_at":"2026-08-10T18:22:02.731402Z","title":"Evoagent: Towards automatic multi-agent generation via evolutionary algorithms.arXiv preprint arXiv:2406.14228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.731402Z"},"links":{"cited_paper":"/paper/2406.14228","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:cf303c510ebcae1560c5f566a550e0e40f733d05c59e6625cd050ca45a6dce96","observation_id":"24abe105-cf0b-434e-9722-75430a43dce3","resolution":{"observed_at":"2026-08-10T18:22:02.731402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.09345","last_updated":"2024-09-14T07:32:49Z","snapshot_observed_at":"2026-08-16T13:18:36.724914Z","submitted_at":"2024-09-14T07:32:49Z","title":"Enhancing Decision-Making for LLM Agents via Step-Level Q-Value Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.09345","snapshot_observed_at":"2026-08-10T18:22:02.748089Z","title":"Enhancing decision-making for llm agents via step-level q-value models.arXiv preprint arXiv:2409.09345, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.748089Z"},"links":{"cited_paper":"/paper/2409.09345","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f10b29f250927ce022c31123e974eb07a87e008f2cec5e1e1cfd303802c9a524","observation_id":"055d0052-2503-4156-b4c9-94ca80654ecb","resolution":{"observed_at":"2026-08-10T18:22:02.748089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.593927Z","title":"Mr-ben: A meta-reasoning benchmark for evaluating system-2 thinking in llms","venue":null,"work_id":"3d4c4110-eded-4f64-a422-6aa7e96851f6","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.742711Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:203384acd9f9c48647beb28aeaf318b4e9f0f36bd64bd2cd6da65d2b8736f8ac","observation_id":"2c684ccf-89ed-4073-8934-75df5e4e3385","resolution":{"observed_at":"2026-08-10T18:22:03.599236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.576744Z","title":"TimeArena: Shaping efficient multitasking language agents in a time-aware simulation","venue":null,"work_id":"0a40d8e9-89d2-4519-aa30-883c6ba406dc","year":null},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.759929Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:5db478ac7c1710c824be8ba11b1bb93f99b126e5ad00a0955b53f897c3597bed","observation_id":"a562d886-1e95-4db8-aedd-b9fac972a046","resolution":{"observed_at":"2026-08-10T18:22:03.581994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14959","last_updated":"2025-07-15T07:07:14Z","snapshot_observed_at":"2026-08-17T17:25:55.687474Z","submitted_at":"2024-12-19T15:39:31Z","title":"Understanding the Dark Side of LLMs' Intrinsic Self-Correction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14959","snapshot_observed_at":"2026-08-10T18:22:02.753853Z","title":"Understanding the dark side of llms’ intrinsic self-correction.arXiv preprint arXiv:2412.14959, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.753853Z"},"links":{"cited_paper":"/paper/2412.14959","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:12ca39ef1500a8b74c5e41d888ecd00e046eec6ccae478297c004b357b7c215d","observation_id":"f1a7ad6e-ff5a-4b07-a3ee-63a1deb9b859","resolution":{"observed_at":"2026-08-10T18:22:02.753853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:03.547365Z","title":"Large language models as commonsense knowledge for large-scale task planning","venue":null,"work_id":"80607b7e-4016-49ef-a2d8-a65e71c5a0d6","year":2023},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.774196Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:f500e30ad40768b8512e84379117b292489fcd811c781ee9ac7aa66ea97c4e3b","observation_id":"bb57cd0c-894e-404e-ad6c-ce3f6c9de42d","resolution":{"observed_at":"2026-08-10T18:22:03.553059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.215","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.813603Z","title":"doi: 10.18653/v1/2024.acl-long.215","venue":null,"work_id":"cc6a79c8-3e31-414f-b056-50032dc1e9bd","year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.765103Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:8de0f5272fbcf6faea98a92c8f6feae420d4b8fa62bb51b5eb4e04a441727c16","observation_id":"c61f8360-c129-4225-bc9b-1b7963c77796","resolution":{"observed_at":"2026-08-10T18:22:02.819846Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:22:02.769678Z","title":"Expel: Llm agents are experiential learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.769678Z"},"links":{"citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:a18171f6cf8f7d2676e1c8679ed76ee2b6c5ca8d3be20f86e848d1314dc86c74","observation_id":"862c5247-0abc-48b1-a4bf-12cf69eea0eb","resolution":{"observed_at":"2026-08-10T18:22:02.769678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06559","last_updated":"2025-05-26T14:03:32Z","snapshot_observed_at":"2026-08-14T07:02:14.518172Z","submitted_at":"2024-12-09T15:11:40Z","title":"ProcessBench: Identifying Process Errors in Mathematical Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06559","snapshot_observed_at":"2026-08-10T18:22:02.778783Z","title":"Processbench: Identifying process errors in mathematical reasoning.arXiv preprint arXiv:2412.06559, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.778783Z"},"links":{"cited_paper":"/paper/2412.06559","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:24d54c4dddf31532463d9117b85e39d64a8deb162801b2582ec1efc290235ad8","observation_id":"ad1a84b3-d726-436e-a107-0b84beaf7b08","resolution":{"observed_at":"2026-08-10T18:22:02.778783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03244","last_updated":"2024-06-22T18:58:09Z","snapshot_observed_at":"2026-08-16T14:21:19.525721Z","submitted_at":"2024-02-05T17:59:00Z","title":"Skill Set Optimization: Reinforcing Language Model Behavior via Transferable Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03244","snapshot_observed_at":"2026-08-10T18:22:02.564724Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T18:22:02.564724Z"},"links":{"cited_paper":"/paper/2402.03244","citing_paper":"/paper/2501.11425"},"observation_digest":"sha256:01b20f0b268288e9ecfa24a2f495b6f2d675a2ac676d23e27f05fef7d06e7d35","observation_id":"f3c65df3-ac3a-477f-bea1-81b2af148280","resolution":{"observed_at":"2026-08-10T18:22:02.564724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.11425","last_updated":"2025-03-24T10:18:56Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T13:39:54.022528Z","submitted_at":"2025-01-20T11:46:04Z","title":"Agent-R: Training Language Model Agents to Reflect via Iterative Self-Training"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":3,"verified_fuzzy":22},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 27 inbound Pith citation observations for arXiv:2501.11425."}