{"as_of":"2026-08-18T08:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6128b3382caa7ed665dd34eb70ab4473c9ead6a3b9c97d34825010d6f4120bf3","coverage":[{"denominator":97,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":97,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:33:33.662364Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.11772/citation-record","integrity":"/paper/2608.11772/integrity","json":"/paper/2608.11772/citation-record.json","paper":"/paper/2608.11772"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:31.971243Z","title":"Many-shot in-context learning.Advances in Neural Information Processing Systems, 37:76930–76966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:31.971243Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:b10b6c1eaaa57621d073cc8a0bb7f0f890e1742322a3e0e69544e9f67c5da1c7","observation_id":"09d97e4f-ced6-45d7-b2c7-f740760deaba","resolution":{"observed_at":"2026-08-16T00:33:31.971243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12963","last_updated":"2025-01-19T15:59:56Z","snapshot_observed_at":"2026-08-16T14:50:36.841746Z","submitted_at":"2023-10-19T17:57:39Z","title":"AutoMix: Automatically Mixing Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12963","snapshot_observed_at":"2026-08-16T00:33:32.022958Z","title":"Automix: Automatically mixing lan- guagemodels.arXiv preprint arXiv:2310.12963,2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.022958Z"},"links":{"cited_paper":"/paper/2310.12963","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:341ceababab17771589d4b8ff62657f4ba7428db65ba150172401584a1d601e6","observation_id":"4cd93409-239c-459f-aabe-a81841f4d6e6","resolution":{"observed_at":"2026-08-16T00:33:32.022958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-14T13:34:39.415942Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-16T00:33:32.077850Z","title":"Gepa: Reflective prompt evolution can outperform reinforcement learning.arXiv preprint arXiv:2507.19457, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.077850Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:430c7f632cea72a29f64409a266bdf2168b1b3be61323dea97a4263f28c97cd8","observation_id":"0b72f677-7202-4924-9558-e84a1d72653a","resolution":{"observed_at":"2026-08-16T00:33:32.077850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.137007Z","title":"InProceedings of the 62nd Annual Meeting of the Association for Computational Linguis- tics (Volume 1: Long Papers), pages 12248–12267, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.137007Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:40e7eba89666aa8ce707f32ccca6217a90309e4aa1549954fe23118d8c0d571d","observation_id":"a557d41f-20aa-4b00-817f-a22960f39aba","resolution":{"observed_at":"2026-08-16T00:33:32.137007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.140785Z","title":"Self-RAG: Learning to retrieve, generate, and critique through self-reflection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.140785Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:9b050989c72f8ebc2d4fea227b7ff6b5c2cbd32466ac608e3a636bf8e7952fa0","observation_id":"189ba2c5-240b-47dd-8b9b-3248219af6b5","resolution":{"observed_at":"2026-08-16T00:33:32.140785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-16T00:33:32.144679Z","title":"Programsynthesiswithlargelanguagemodels","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.144679Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:c0ba6a1fd0b03985ff2b08f5dee4fb5f24ad6d52be626145dc72d584c7781036","observation_id":"80c5210e-e431-49a4-bc98-06596e564ebc","resolution":{"observed_at":"2026-08-16T00:33:32.144679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.148827Z","title":"Digirl: Train- ingin-the-wilddevice-controlagentswithautonomous reinforcement learning.Advances in Neural Informa- tion Processing Systems, 37:12461–12495, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.148827Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:a739a7d388239cec46728d28589a7445f7815c5e6930a7f48b9519c4f269bdf1","observation_id":"a9a07f0d-e26c-4c80-aaa5-58032f277c49","resolution":{"observed_at":"2026-08-16T00:33:32.148827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-16T00:33:32.153242Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.153242Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:4f8ee3c4360865085c662851d40774d1e86d9192512f2a7e4901950a3d61c5e8","observation_id":"32950d6a-7f69-4603-b4ed-89caaa41b9e3","resolution":{"observed_at":"2026-08-16T00:33:32.153242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.157190Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.157190Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:4fb744b42868018d5102324170e7b8d040f7ff97c7f6fe011eb1226bb20b6c3a","observation_id":"47acc963-bb6c-4f64-9f31-3004eb87f8b5","resolution":{"observed_at":"2026-08-16T00:33:32.157190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-16T00:33:32.160580Z","title":"Codet: Code generation with generated tests.arXiv preprint arXiv:2207.10397, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.160580Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:06ea4bc315f1103c3d8e422cd222b2693f4ca74a5230f16937abde170520c276","observation_id":"5cbd9b77-0cb8-445d-be94-2dc0f90a379c","resolution":{"observed_at":"2026-08-16T00:33:32.160580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.05176","last_updated":"2023-05-09T05:11:02Z","snapshot_observed_at":"2026-08-10T11:59:11.481480Z","submitted_at":"2023-05-09T05:11:02Z","title":"FrugalGPT: How to Use Large Language Models While Reducing Cost and Improving Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.05176","snapshot_observed_at":"2026-08-16T00:33:32.164506Z","title":"Frugal- gpt: How to use large language models while reduc- ing cost and improving performance.arXiv preprint arXiv:2305.05176, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.164506Z"},"links":{"cited_paper":"/paper/2305.05176","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:f1b8050906a24e2265d6f54683a11054840ff1941c6dc69872e972a03764cb1a","observation_id":"d078e36f-47f6-44cb-a93b-60be7de38413","resolution":{"observed_at":"2026-08-16T00:33:32.164506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-16T00:33:32.168031Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.168031Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:bee583e40593f73cae91bb9d718ded87b8ed3ba421a120b8aa5a5831bb45be3d","observation_id":"68ecc026-c855-4dd6-b247-1378d728b4e4","resolution":{"observed_at":"2026-08-16T00:33:32.168031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.171640Z","title":"Teaching large language models to self-debug","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.171640Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:1a3efcc89fc00bc083f9b5aeb03addc09e35f69f2060c3121d812720b4d36bb0","observation_id":"c874b937-257f-4ef4-bd2f-47a0a4774bc9","resolution":{"observed_at":"2026-08-16T00:33:32.171640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T00:33:32.175234Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.175234Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:34d9c27efda3c3563328f1cefcf1123c7fd1f12128be0ba139a5b1d841a028f7","observation_id":"2b073000-76d2-40ae-9712-a8f8872eb97f","resolution":{"observed_at":"2026-08-16T00:33:32.175234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04468","last_updated":"2024-11-07T06:36:19Z","snapshot_observed_at":"2026-08-13T07:44:55.410720Z","submitted_at":"2024-11-07T06:36:19Z","title":"Magentic-One: A Generalist Multi-Agent System for Solving Complex Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04468","snapshot_observed_at":"2026-08-16T00:33:32.179467Z","title":"Magentic-one: A generalist multi-agent system for solving complex tasks.arXiv preprint arXiv:2411.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.179467Z"},"links":{"cited_paper":"/paper/2411.04468","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:893c242bf6d4bc748611949f76e3e54f153296a04f4f63b975ed86ff2e4b0881","observation_id":"0f48e516-0c7c-4e28-bc03-41dc99ab008b","resolution":{"observed_at":"2026-08-16T00:33:32.179467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.182753Z","title":"Precise zero-shot dense retrieval without rel- evance labels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.182753Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:6d2a7ac5006103f20e562ddeffe2c36167b3cd2596d2e63e791dd5f8fb260e7e","observation_id":"e2fb1888-51f0-48fd-8924-dfa3ddd58756","resolution":{"observed_at":"2026-08-16T00:33:32.182753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.186272Z","title":"REALM: Retrieval- augmented language model pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.186272Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:d8353c9f70a7d011593e8abbe73ec892d172194d9061e843a466c655c2e5c2f7","observation_id":"96df189d-b461-4611-9233-1430c2a4a05d","resolution":{"observed_at":"2026-08-16T00:33:32.186272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.189460Z","title":"Measuring massive multitask language under- standing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.189460Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ac25b1bed985dc021e85d160aa230ee178db924173f25950b5b77a1202fbb322","observation_id":"af93ce11-40a2-4316-929a-f29a1c26016b","resolution":{"observed_at":"2026-08-16T00:33:32.189460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.193279Z","title":"MetaGPT: Meta programming for a multi-agent col- laborative framework.International Conference on Learning Representations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.193279Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:89d4079288c8ca104ef095dd73c2e513af24e2c0df6ef2e4e546b50f41077d9b","observation_id":"fd1acf69-ee37-487d-823e-9bc27a45faca","resolution":{"observed_at":"2026-08-16T00:33:32.193279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06654","last_updated":"2024-08-06T21:48:58Z","snapshot_observed_at":"2026-08-15T18:01:46.669862Z","submitted_at":"2024-04-09T23:41:27Z","title":"RULER: What's the Real Context Size of Your Long-Context Language Models?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06654","snapshot_observed_at":"2026-08-16T00:33:32.196910Z","title":"RULER: What’s the real context size of your long-context language models?arXiv preprint arXiv:2404.06654, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.196910Z"},"links":{"cited_paper":"/paper/2404.06654","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:d620aedfdcf80998967f25b6bd0ec9b7c602573045fbe80f6609af43ee59af9e","observation_id":"fa226199-b19d-48e6-add2-59c7a12eb9c0","resolution":{"observed_at":"2026-08-16T00:33:32.196910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.24426","last_updated":"2026-05-23T06:41:31Z","snapshot_observed_at":"2026-08-14T06:06:26.348742Z","submitted_at":"2026-05-23T06:41:31Z","title":"SEAL: Synergistic Co-Evolution of Agents and Learning Environments","version":1},"cited_work":{"arxiv_id":"2605.24426","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.24426","snapshot_observed_at":"2026-08-16T00:33:34.202231Z","title":"SEAL: Synergistic Co-Evolution of Agents and Learning Environments","venue":"cs.CL","work_id":"41aaad1b-090b-4833-84f2-6b0313aee8ee","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.200281Z"},"links":{"cited_paper":"/paper/2605.24426","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:af44787fc14f4ac7f05fc8aae961c8eae9fb2f720049ee6ad0018a8f75b8d3ab","observation_id":"e841e3bc-1a57-44dc-959a-0d6ebac2a071","resolution":{"observed_at":"2026-08-16T00:33:34.206650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.204786Z","title":"Leveraging pas- sage retrieval with generative models for open domain question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.204786Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:9a53e6ef8a1f00ccc6c5abaf74fbc7387ccd1bca4a306188151c5664dcad0a64","observation_id":"51eb4269-139a-4e06-b618-13f06e4d30c0","resolution":{"observed_at":"2026-08-16T00:33:32.204786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03299","last_updated":"2022-11-16T16:38:18Z","snapshot_observed_at":"2026-08-13T00:16:02.335397Z","submitted_at":"2022-08-05T17:39:22Z","title":"Atlas: Few-shot Learning with Retrieval Augmented Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03299","snapshot_observed_at":"2026-08-16T00:33:32.208555Z","title":"Few-shot learning with retrieval augmented language models.arXiv preprint arXiv:2208.03299, 1 (2):4, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.208555Z"},"links":{"cited_paper":"/paper/2208.03299","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:f7e7550f917550e0eebc9abd20d067906e3755e232a32c3b073f16357271c898","observation_id":"002df34c-bb15-4c7b-84a3-eed606ef1358","resolution":{"observed_at":"2026-08-16T00:33:32.208555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.228347Z","title":"Adaptive-rag: Learning to adapt retrieval-augmented large language models through question complexity","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.228347Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:3cbac4f353ef743ef0455aac653557ad438622a819e31df361191f552ce8d84d","observation_id":"c1426c6e-e4a0-4500-87fd-c8064ca820d1","resolution":{"observed_at":"2026-08-16T00:33:32.228347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.288079Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.288079Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:20c319c32d6ec38bb187e72dd576d1c46cdecd23b006b6e9ad9f1aa58f24d19b","observation_id":"75256c16-6b1b-4bf2-9c60-344eb5af9e3c","resolution":{"observed_at":"2026-08-16T00:33:32.288079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.00445","last_updated":"2022-05-01T11:01:28Z","snapshot_observed_at":"2026-08-17T19:53:31.995761Z","submitted_at":"2022-05-01T11:01:28Z","title":"MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.00445","snapshot_observed_at":"2026-08-16T00:33:32.416509Z","title":"MRKL systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.416509Z"},"links":{"cited_paper":"/paper/2205.00445","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:a3385af1304b41f097f63866e7fe064f44cabf24ef55fc74e56bd83e67b4ee5b","observation_id":"f22a8f96-6674-4744-90b3-77beeff398b5","resolution":{"observed_at":"2026-08-16T00:33:32.416509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.467329Z","title":"Densepassageretrievalforopen-domain question answering","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.467329Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ba52a20d7ce122453a22850ad65ff9ec8b60bc7b0d64a15d37eb347e10a01cae","observation_id":"8d91ba6c-99f5-49aa-a9cb-63cd2ee6690a","resolution":{"observed_at":"2026-08-16T00:33:32.467329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-16T00:33:32.474145Z","title":"Dspy: Compiling declarative lan- guagemodelcallsintoself-improvingpipelines.arXiv preprint arXiv:2310.03714, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.474145Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:6663dbafd186e8b0d7366442b6faf35cde50dd63e6f3d58d2b9cd55afe8db2f0","observation_id":"620349e2-6004-4fe6-a454-7177b30781fe","resolution":{"observed_at":"2026-08-16T00:33:32.474145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.478752Z","title":"Decomposedprompting: Amodular approach for solving complex tasks.International Conference on Learning Representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.478752Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:2e88cb1ff0bca75583a539c9cedad5effce1c64609f457da87b5f498bf178d2a","observation_id":"6be8f683-fa64-4f16-92c4-505ba26e9f0c","resolution":{"observed_at":"2026-08-16T00:33:32.478752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.481838Z","title":"Language models can solve computer tasks.Advances in Neural Information Processing Systems, 36:39648– 39677, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.481838Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:6b4e3af980cb090e239ea4006236220de36d2703c558b6b4087ac896d537a8b4","observation_id":"2ae42f66-aeb2-46db-9777-42c899ab93d3","resolution":{"observed_at":"2026-08-16T00:33:32.481838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.484935Z","title":"Large language modelsare zero-shotreasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.484935Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ffa4603f8b02cb661c30ab85fb7cfe82cb416f03838cbdc3a185818a67e9d391","observation_id":"8515de51-d582-453a-bb2f-e1e49c602329","resolution":{"observed_at":"2026-08-16T00:33:32.484935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-16T00:33:32.488403Z","title":"RLAIF: Scaling re- inforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.488403Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:b836a0f598e0cf0e9806b66c01b2fa05725388d3ee22154a498f306348b17c61","observation_id":"b40e6beb-36f6-425f-bd6f-e4328a11da63","resolution":{"observed_at":"2026-08-16T00:33:32.488403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.492546Z","title":"Retrieval-augmented generation for knowledge- intensive nlp tasks.Advances in neural information processing systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.492546Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:6b8df40f5f005707da06140c7eaaeb4474b673fe5b7c58a73d44ec8712d07fde","observation_id":"08a108b0-374a-4483-a78c-86ff582a0635","resolution":{"observed_at":"2026-08-16T00:33:32.492546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.577713Z","title":"CAMEL: Communicative agents for mind exploration of large language model society.Advances in Neu- ral Information Processing Systems, 36:51991–52008, 2023","venue":null,"work_id":"21c09147-275d-4431-8251-80424e5d5e50","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.495468Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:da682e55481dc7f39bc6920c58ccf2c8a7dc15c44ddf62834b656add7621bafd","observation_id":"5211ec49-0bb9-4d1e-bded-90916a296193","resolution":{"observed_at":"2026-08-16T00:33:35.581738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04939","last_updated":"2024-09-06T05:06:51Z","snapshot_observed_at":"2026-08-16T14:45:06.045654Z","submitted_at":"2023-11-08T01:45:37Z","title":"LooGLE: Can Long-Context Language Models Understand Long Contexts?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04939","snapshot_observed_at":"2026-08-16T00:33:32.498179Z","title":"LooGLE: Can long-context language mod- els understand long contexts?arXiv preprint arXiv:2311.04939, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.498179Z"},"links":{"cited_paper":"/paper/2311.04939","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:08fc58e0e811c1814bfe5afbae320b389d72cca9fcd802339105028b7bdc46f2","observation_id":"ffa740c5-05f8-4e55-b9c9-ffb58f9373f5","resolution":{"observed_at":"2026-08-16T00:33:32.498179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08244","last_updated":"2023-10-25T06:54:12Z","snapshot_observed_at":"2026-08-02T00:07:12.855748Z","submitted_at":"2023-04-14T14:05:32Z","title":"API-Bank: A Comprehensive Benchmark for Tool-Augmented LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08244","snapshot_observed_at":"2026-08-16T00:33:32.555235Z","title":"API-bank: A comprehensive benchmark for tool-augmented llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.555235Z"},"links":{"cited_paper":"/paper/2304.08244","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:2510a1315a559fc011c2738a5cc41861ada52ed3ac3dbb5cfd74f4b3837fcc68","observation_id":"48ae8444-11cf-4995-945a-6bdd9cbe490f","resolution":{"observed_at":"2026-08-16T00:33:32.555235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.535614Z","title":"Rethinking the role of entropy in optimizing tool-use behaviors for large language model agents","venue":null,"work_id":"d52d6b1e-0a06-4e7d-8d10-c14d24be850f","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.622026Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:e9ae83ca9e5336f1cbcf697f1e0ecfb7cd739507c96850179651d20563f8b462","observation_id":"7339dda7-b780-4ef4-9a17-47c79564b0b5","resolution":{"observed_at":"2026-08-16T00:33:35.571104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10505","last_updated":"2024-05-16T02:22:23Z","snapshot_observed_at":"2026-08-16T14:51:42.615061Z","submitted_at":"2023-10-16T15:25:14Z","title":"ReMax: A Simple, Effective, and Efficient Reinforcement Learning Method for Aligning Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10505","snapshot_observed_at":"2026-08-16T00:33:32.695930Z","title":"Remax: A simple, effective, and efficient reinforcement learning method for aligning large language models.arXiv preprint arXiv:2310.10505, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.695930Z"},"links":{"cited_paper":"/paper/2310.10505","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:e4f6b6e8afd138f4dfe4be36d3f06734467cc1ff73237bf1e878f60a97b5ae92","observation_id":"82d101be-2327-4503-97b4-9f1b2144bb32","resolution":{"observed_at":"2026-08-16T00:33:32.695930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.438721Z","title":"Holisticevaluationoflanguagemodels.InTransactions on Machine Learning Research, 2023","venue":null,"work_id":"8d8d3d01-da1e-4b84-a96c-bf3bb779914b","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.761395Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:4b210c857f2df424ea157505e6ff80a7a0373f77b81549ac1d155da67a82562d","observation_id":"8c273b47-1aa3-4ddb-a50d-f7eb068852f8","resolution":{"observed_at":"2026-08-16T00:33:35.499331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.396611Z","title":"Let’s verify step by step","venue":null,"work_id":"cde1e699-b3bb-4a01-8197-d370a26e79f7","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.765307Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:d91b713ad3ba5584a9c9d6e32dbb07df7ee2086b9abe08e1d0e747592e0c33f8","observation_id":"02fa0e63-0548-47d8-86b0-1d655b8ffab3","resolution":{"observed_at":"2026-08-16T00:33:35.399743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.386377Z","title":"Toxicchat: Unveiling hidden challenges of toxicity detection in real-world user-ai conversation","venue":null,"work_id":"8374ea7a-c1cb-4e07-92d0-837ce37fe97d","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.769066Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:f64b389d8e06a4d80dc17a7231ed159ff3b55866246f369343344eb0a7e0537f","observation_id":"b560e841-de80-490f-b16d-3224831a7d2e","resolution":{"observed_at":"2026-08-16T00:33:35.390237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.375747Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paran- jape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":"64d2393b-7865-419c-8301-853e71dbb51d","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.773447Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:8a7b0e0aa60837267866742ab760402d0de77ebd36d8bbdafb10da6f7eef7a7f","observation_id":"86a963b1-50dd-4db6-a4a5-f74944028721","resolution":{"observed_at":"2026-08-16T00:33:35.379798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.365654Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":"37120a79-9b7f-448a-809c-eb47d0052a62","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.777679Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:3976c2080593d797018b15bfe4f87095f61c2eb669241e8f0d613919ac62b892","observation_id":"d224acb1-c0af-4393-9c86-7685f3ca1f9b","resolution":{"observed_at":"2026-08-16T00:33:35.369200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15538","last_updated":"2024-02-23T06:25:20Z","snapshot_observed_at":"2026-08-17T05:45:32.513069Z","submitted_at":"2024-02-23T06:25:20Z","title":"AgentLite: A Lightweight Library for Building and Advancing Task-Oriented LLM Agent System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15538","snapshot_observed_at":"2026-08-16T00:33:32.781745Z","title":"Agentlite: A lightweight library for building and advancing task-oriented llm agent system.arXiv preprint arXiv:2402.15538, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.781745Z"},"links":{"cited_paper":"/paper/2402.15538","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:368fadb6c099cf80a738cdfb6377f67a68b67c2abafd1530d530d65f5fc1bdf5","observation_id":"c12d4d46-ca23-48da-b358-38ff6cbbf340","resolution":{"observed_at":"2026-08-16T00:33:32.781745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.355619Z","title":"Finer: Finan- cial numeric entity recognition for xbrl tagging","venue":null,"work_id":"b02d00d2-35f3-4a47-bf63-f07192c698a5","year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.863716Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:6a4547b567a52ca40b6ac15c9afc19975b62eb561ee66c2f1c00946bfb8c9c36","observation_id":"fa9fc889-98e2-46f7-a0f0-14f1e6633a05","resolution":{"observed_at":"2026-08-16T00:33:35.359186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.345425Z","title":"Self- refine: Iterative refinement with self-feedback","venue":null,"work_id":"a8ce5a5d-f272-43b0-9ff7-bb960963e089","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.921545Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:b2d52304045585b1d3c0d95f253055f0710f86e828f4e8ad533ef512e5925b29","observation_id":"8e82d994-dcbb-4bea-9c43-bb0db391b830","resolution":{"observed_at":"2026-08-16T00:33:35.348917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.326209Z","title":"Lever: Learning to verify language-to-code genera- tion with execution","venue":null,"work_id":"548cc79c-cc9c-4b1b-ab75-609dac2345d3","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.925203Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:c167fdfb37955b2174c78c93073b36392a7c8edde5699df2aeb3a3da888c077d","observation_id":"0d30f7b4-3722-4297-8b49-91ede3b6da8c","resolution":{"observed_at":"2026-08-16T00:33:35.338188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.240815Z","title":"Optimizing instructions and demon- strations for multi-stage language model programs","venue":null,"work_id":"8e3a3686-1250-4c51-8f2a-ea532d00eb50","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.928763Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:3816876a30aa7bf3ed229b7e53946077ac90ccd9118202587d557bbca917fe7b","observation_id":"2dba78d6-0612-4f7a-b24f-bc3841774a86","resolution":{"observed_at":"2026-08-16T00:33:35.287312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.932441Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.932441Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:bb8c0caf543b53aa30b02814e77d2a4e2fa803602c8c014e8100dad9c4d0d4b5","observation_id":"b4ceec2c-27ba-43fe-a8f3-3a57918d247e","resolution":{"observed_at":"2026-08-16T00:33:32.932441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.170319Z","title":"Understanding and miti- gatingoverrefusalinllmsfromanunveilingperspective of safety decision boundary","venue":null,"work_id":"6bb64b80-127a-43c0-813d-324f1b8926ee","year":2025},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.937025Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:abaa8f76bb868c335d587ea81a03a79ba57328f38fd2428b98d8c8d5adedc4ae","observation_id":"3a935459-b786-4a8a-8438-c2408fe2c0c1","resolution":{"observed_at":"2026-08-16T00:33:35.205605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06036","last_updated":"2026-05-07T11:26:04Z","snapshot_observed_at":"2026-08-15T08:50:42.110716Z","submitted_at":"2026-05-07T11:26:04Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","version":1},"cited_work":{"arxiv_id":"2605.06036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06036","snapshot_observed_at":"2026-08-16T00:33:34.028902Z","title":"Optimal Transport for LLM Reward Modeling from Noisy Preference","venue":"cs.LG","work_id":"7799bbcc-3abb-4eca-8594-8f7ff0edcb4c","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.940440Z"},"links":{"cited_paper":"/paper/2605.06036","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:bb056e2e58553773b57dc1260553b21ce65c1114347971b468399752936d0ecf","observation_id":"9613c332-f4ba-43a0-8f25-58e6c8b3ad20","resolution":{"observed_at":"2026-08-16T00:33:34.071641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09014","last_updated":"2023-03-16T01:04:45Z","snapshot_observed_at":"2026-08-18T04:54:46.080762Z","submitted_at":"2023-03-16T01:04:45Z","title":"ART: Automatic multi-step reasoning and tool-use for large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09014","snapshot_observed_at":"2026-08-16T00:33:32.944284Z","title":"ART: Automatic multi-step rea- soning and tool-use for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.944284Z"},"links":{"cited_paper":"/paper/2303.09014","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:7e36173c810a43d1eda1f7244be9f9ea2a191986a32605687f56f4a561cef220","observation_id":"51a50405-d900-4128-ac77-8a3e5d0687de","resolution":{"observed_at":"2026-08-16T00:33:32.944284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03442","last_updated":"2023-08-06T00:21:19Z","snapshot_observed_at":"2026-08-16T03:49:04.888755Z","submitted_at":"2023-04-07T01:55:19Z","title":"Generative Agents: Interactive Simulacra of Human Behavior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03442","snapshot_observed_at":"2026-08-16T00:33:32.949504Z","title":"O’Brien, Carrie J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.949504Z"},"links":{"cited_paper":"/paper/2304.03442","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:f5bf15587a34551138adb0dd854da4f370cef5140b8e66b7fb2a430590b51a72","observation_id":"724498f6-bcc6-4194-b5e7-ebd3be301342","resolution":{"observed_at":"2026-08-16T00:33:32.949504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.952720Z","title":"Gorilla: Large language model connected with massive apis.Advances in Neural Information Processing Systems, 37:126544–126565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.952720Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:19e7d61894fd9766fca8aaacd4a03c4ec4fb1c8e810bc4a1ea429ddc2918bc77","observation_id":"7aecd48e-25eb-439e-b06b-123a90b728ba","resolution":{"observed_at":"2026-08-16T00:33:32.952720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.101083Z","title":"Webrl: Training llm web agents via self- evolving online curriculum reinforcement learning","venue":null,"work_id":"e01e33e8-66f6-4a8d-8531-b305d85a53a8","year":2025},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.956425Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:d3439e13f71b3d4ef8520b0e0528f148a8956eb17041d6096a85b102b3c57098","observation_id":"b7ca47cf-09ef-4cbe-8e99-15c781a63853","resolution":{"observed_at":"2026-08-16T00:33:35.128534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.091178Z","title":"Toolllm: Facilitating large language modelstomaster16000+real-worldapis.InThe twelfth international conference on learning representations, 2023","venue":null,"work_id":"b49bdc06-2bad-44c2-80bd-cdfc68d70833","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.959681Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:659d0bdbe76b7da3ddf1aacb21aa015eebfb918140963b0bf0cce746a297163f","observation_id":"926f485e-c26d-47d7-8e51-ae9a50e2d937","resolution":{"observed_at":"2026-08-16T00:33:35.094626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:32.963369Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.963369Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:24ab8e289fdec56d0b7147e7dba64a005fd56387ff3984764764d3726d69b981","observation_id":"53834e41-48b2-4bb5-9a3e-10e333d704a2","resolution":{"observed_at":"2026-08-16T00:33:32.963369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.074863Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model, April 2026","venue":null,"work_id":"737f08cc-cb83-4a18-bcf9-cf39dd8dd744","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:32.996014Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:06e98b0b9469c488eec0db6c566db8f6327ef2b08c7de421a32edef913c5dc7f","observation_id":"843c4dc3-8dc5-4edd-8626-97b439ac488f","resolution":{"observed_at":"2026-08-16T00:33:35.078721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:35.063522Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in neural infor- mation processing systems, 36:53728–53741, 2023","venue":null,"work_id":"0c5f340b-a99a-4be8-bfad-ac30c4d892fd","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.072226Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:b0fb4b0a735fed60577a1766a420673c12a2a11742baabced41c71983459dd2f","observation_id":"5979b046-04a3-4fda-a452-1aae76c2bd1f","resolution":{"observed_at":"2026-08-16T00:33:35.068292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.981021Z","title":"Tool- former: Language models can teach themselves to use tools.Advances in neural information processing systems, 36:68539–68551, 2023","venue":null,"work_id":"3e7b92cc-3123-440b-9ccc-b30289c740c2","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.076577Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:591a8dd111b12ac6f124c1ba14a0bbba72b3603a2f8d1245e422585d3a8cb7a5","observation_id":"98de1b21-8a3c-443d-86eb-1b51b29ff57b","resolution":{"observed_at":"2026-08-16T00:33:35.056321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T00:33:33.080607Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.080607Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:4a4dc5407d098afa5ab9bf65810e8a65fda7551b047574cd2765921de0f2d01d","observation_id":"6c3a2dc9-614e-4199-b5ce-391f0d27dc1a","resolution":{"observed_at":"2026-08-16T00:33:33.080607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.903079Z","title":"HuggingGPT: Solvingaitaskswithchatgptanditsfriendsinhugging face.Advances in Neural Information Processing Systems, 36:38154–38180, 2023","venue":null,"work_id":"5061863b-a5df-4283-b3b0-2d3c2531807d","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.084094Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:b65e2efab5afdaf3e08fc13a23b42bebc7a11bc8f03285ea89c5ce975ab08778","observation_id":"66175715-5efd-44f8-b949-db35c5e00be9","resolution":{"observed_at":"2026-08-16T00:33:34.944393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.892271Z","title":"Chi, Nathanael Schärli, andDennyZhou","venue":null,"work_id":"648b0a64-0e8a-46ea-a377-a7f87a4d2afb","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.088514Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:05c42a598e7ab3f425984dcf01f973a2131c2369cd5194e512fd093ac599c978","observation_id":"76a573c4-808a-4277-b3aa-fdc10cefd3f6","resolution":{"observed_at":"2026-08-16T00:33:34.896116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:33.091708Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.091708Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:cb35b47e4e6b326e2ea5a67f3ed6264c5f4b80884a2db2184f1756969148aeb9","observation_id":"bac1e0a3-91ec-4b3c-b897-c8d5004b4344","resolution":{"observed_at":"2026-08-16T00:33:33.091708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-08-13T15:27:25.430393Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-16T00:33:33.095593Z","title":"Alfworld: Aligning text and embodied environments for interactive learning.arXiv preprint arXiv:2010.03768, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.095593Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:92f36a973c5eb03ce09640f39d5fc0d6d41fac85390d900b954c8db8e0ca0501","observation_id":"e47806f5-7490-4a44-b27e-aedce987065a","resolution":{"observed_at":"2026-08-16T00:33:33.095593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.876437Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of lan- guage models.Transactions on Machine Learning Research, 2023","venue":null,"work_id":"e655afc5-494e-4053-a0f2-9f3478978af8","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.099964Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:2465e21cbe6d85ef08f0a7b49873e87014a5d27b4bc1549add8b6612ac36bb1f","observation_id":"24c2a113-bd2e-4d10-874d-acd65cf0e319","resolution":{"observed_at":"2026-08-16T00:33:34.880215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02427","last_updated":"2024-03-15T15:44:11Z","snapshot_observed_at":"2026-08-18T07:01:35.707347Z","submitted_at":"2023-09-05T17:56:20Z","title":"Cognitive Architectures for Language Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02427","snapshot_observed_at":"2026-08-16T00:33:33.103535Z","title":"Cognitive architectures for language agents.arXiv preprint arXiv:2309.02427, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.103535Z"},"links":{"cited_paper":"/paper/2309.02427","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:d97bec4b1bc50b70ac959839006f3c98e9b3a010f51768d724a27b4140e74f94","observation_id":"7f3c1aee-d14e-4347-83bb-b07b6977ca5f","resolution":{"observed_at":"2026-08-16T00:33:33.103535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.866737Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them","venue":null,"work_id":"b1d64ebb-1d96-4df3-a0be-3d387dfff4a6","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.184604Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:a488410492821cbe3f85d5f5b02340131b0df9289499fb3815b97f931d1d2c11","observation_id":"7d41055d-f86f-4679-b786-b1159d401579","resolution":{"observed_at":"2026-08-16T00:33:34.870263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02442","last_updated":"2024-10-14T13:57:29Z","snapshot_observed_at":"2026-08-16T13:28:29.726326Z","submitted_at":"2024-08-05T13:08:24Z","title":"Let Me Speak Freely? A Study on the Impact of Format Restrictions on Performance of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02442","snapshot_observed_at":"2026-08-16T00:33:33.224105Z","title":"Let me speak freely? a study on the impact of format restrictions on performance of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.224105Z"},"links":{"cited_paper":"/paper/2408.02442","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:cdf398bc26f16cacc9fd98a118a793bf12b15a71d036786f67b38579af7e561d","observation_id":"3b250c3d-05f6-4c53-8346-29ba93471cb1","resolution":{"observed_at":"2026-08-16T00:33:33.224105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12342","last_updated":"2023-11-15T00:59:54Z","snapshot_observed_at":"2026-08-17T23:05:11.004111Z","submitted_at":"2023-10-18T21:42:16Z","title":"Eliminating Reasoning via Inferring with Planning: A New Framework to Guide LLMs' Non-linear Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12342","snapshot_observed_at":"2026-08-16T00:33:33.228103Z","title":"Eliminating reasoning via inferring with planning: A new frame- worktoguidellms’non-linearthinking.arXiv preprint arXiv:2310.12342, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.228103Z"},"links":{"cited_paper":"/paper/2310.12342","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:f5fb5d7101d55c97a6a299d086fc3ac921a48d467b67f88a57733d7154f23137","observation_id":"26f07466-fff7-4e29-85ae-6ab6f60cf66a","resolution":{"observed_at":"2026-08-16T00:33:33.228103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.857128Z","title":"Canllmslearnfromprevious mistakes? investigating llms’ errors to boost for rea- soning","venue":null,"work_id":"6555ae6c-0753-45ba-b443-57561ba80c00","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.231626Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ca3956e7a624f21e9a7ecd36185336af6460319c32b7c6b11faca538233914ba","observation_id":"c547dd5e-94a3-4c2a-9a6e-fa6183c73134","resolution":{"observed_at":"2026-08-16T00:33:34.860646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04086","last_updated":"2024-05-07T07:39:15Z","snapshot_observed_at":"2026-08-16T13:54:47.274759Z","submitted_at":"2024-05-07T07:39:15Z","title":"Optimizing Language Model's Reasoning Abilities with Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04086","snapshot_observed_at":"2026-08-16T00:33:33.235031Z","title":"Optimizing language model’s rea- soning abilities with weak supervision.arXiv preprint arXiv:2405.04086, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.235031Z"},"links":{"cited_paper":"/paper/2405.04086","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:3fa272c90e0a9c53939137ccc23967201eafb3e19b343d870c6ca2f0489be30f","observation_id":"578b6c1e-9374-4af1-9efb-6502704c0d7f","resolution":{"observed_at":"2026-08-16T00:33:33.235031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.847076Z","title":"Appworld: A controllable world of apps and people for benchmarking interactive coding agents","venue":null,"work_id":"21df629d-7d50-48e0-89f5-1b37420fe1fc","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.238494Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:5fb4022762e8ebf6f2235f0fd03c844c88de0214f77dc3734458adbae3f6de2b","observation_id":"2789af54-40cf-46f6-ae27-64ea6b5d4cb1","resolution":{"observed_at":"2026-08-16T00:33:34.850747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19819","last_updated":"2025-05-26T10:58:51Z","snapshot_observed_at":"2026-08-16T07:43:52.935207Z","submitted_at":"2025-05-26T10:58:51Z","title":"FinLoRA: Benchmarking LoRA Methods for Fine-Tuning LLMs on Financial Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19819","snapshot_observed_at":"2026-08-16T00:33:33.242741Z","title":"Finlora: Benchmarking lora methods for fine-tuning llms on financial datasets","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.242741Z"},"links":{"cited_paper":"/paper/2505.19819","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:eb704df17b1f50e0693dd8a349c8f6ed62ebe6e55e122338df3321928c7cc8d5","observation_id":"32516c05-0ee4-47f5-922e-0d1c91c624a6","resolution":{"observed_at":"2026-08-16T00:33:33.242741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-16T00:33:33.285570Z","title":"Voyager: Anopen-endedembod- ied agent with large language models.arXiv preprint arXiv:2305.16291, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.285570Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:143296bfeeac16246a94266baced044c82247e3ea5a57901d540ceec3a9aee22","observation_id":"58f28120-81b0-4846-b256-acf8819992f7","resolution":{"observed_at":"2026-08-16T00:33:33.285570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.836916Z","title":"REFLEX: Reflective evolution from LLM experience","venue":null,"work_id":"c3af14d3-edd4-4ce6-99c8-1b61e356cb65","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.342258Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:60ca7c68340ebaf7cdca557e764eaf36348b62838e947e61ca19fd732cfca108","observation_id":"e92c1da4-0770-4dba-bcf1-7c5d81521fe3","resolution":{"observed_at":"2026-08-16T00:33:34.840862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17933","last_updated":"2026-05-18T06:41:14Z","snapshot_observed_at":"2026-08-16T23:20:35.963765Z","submitted_at":"2026-05-18T06:41:14Z","title":"AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17933","snapshot_observed_at":"2026-08-16T00:33:33.435925Z","title":"Atlasva: Self-evolving vi- sual skill memory for teacher-free vlm agents.arXiv preprint arXiv:2605.17933, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.435925Z"},"links":{"cited_paper":"/paper/2605.17933","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:2e4d3e7d56db171164fd86479d2ba7c7db60099398b9786ee8eb14de8c01df6c","observation_id":"4e5eadef-055e-4428-8a26-08917106bcd0","resolution":{"observed_at":"2026-08-16T00:33:33.435925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11651","last_updated":"2024-04-16T11:41:13Z","snapshot_observed_at":"2026-08-16T19:23:14.478746Z","submitted_at":"2024-02-18T17:10:07Z","title":"Learning From Failure: Integrating Negative Examples when Fine-tuning Large Language Models as Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11651","snapshot_observed_at":"2026-08-16T00:33:33.490521Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.490521Z"},"links":{"cited_paper":"/paper/2402.11651","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:c2a161466baf955feae6ada42eaa3dda4ea490a316dbf547b989e624cd880d30","observation_id":"896cc7b9-c227-48b8-b059-40c9543f532e","resolution":{"observed_at":"2026-08-16T00:33:33.490521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.827360Z","title":"BPO: Towards balanced preference optimization between knowledge breadth and depth in alignment","venue":null,"work_id":"eb68071a-246d-46d3-af24-7205fbd12964","year":2025},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.495167Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:30b91682762508790d0d7c6703027115b62dcdaedd39a16fcc1af391df094d18","observation_id":"88ca43e4-4628-4468-b315-fa7325705753","resolution":{"observed_at":"2026-08-16T00:33:34.830847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-14T17:59:52.524740Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-16T00:33:33.498815Z","title":"Xu, Xiangru Tang, Mingchen Zhuge, Jiayi Pan, Yue Song, Bowen Li, Jaskirat Singh, et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.498815Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:604c96a57b6f7ae11c521589ef56ede45ed16956312037ed29931a19ff679e48","observation_id":"088094cc-c51b-4956-9ecf-7f9145f63a4d","resolution":{"observed_at":"2026-08-16T00:33:33.498815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-08-16T01:49:22.176843Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-16T00:33:33.503441Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.503441Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:12a41203bd0ec44835d8d151337dd4a79c9b3ec3d069e30e78ba544b19b050bd","observation_id":"1ae4ec73-b70d-4cfd-90d6-ffd9223b2f86","resolution":{"observed_at":"2026-08-16T00:33:33.503441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.735095Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"5fd87692-6e49-4c97-914c-6dc54752f93e","year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.506774Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ea66fad9d3b744f0ea39af316704d0e966d03757e2eea2d456a08271cd91899e","observation_id":"82300874-c092-48f0-9e21-94999a2fcfed","resolution":{"observed_at":"2026-08-16T00:33:34.814090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.591233Z","title":"Generating sequences by learning to self- correct","venue":null,"work_id":"a6dbbf82-fe29-4367-a7bb-e74d01d44791","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.509673Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:bccd4e731188b7cae1ce3b6956e98b92b024e18691c3f5f3c62fd7d8866fa0c9","observation_id":"9e6b5135-869a-43ef-8e63-a87a5a065628","resolution":{"observed_at":"2026-08-16T00:33:34.661793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.553488Z","title":"Autogen: Enabling next-genllmapplicationsviamulti-agentconversations","venue":null,"work_id":"86864801-a364-4f7f-800c-86b74bb0031b","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.512348Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:72e5c31425d76ab67d0c7a91cc873e0f298f82141b3b8cb94d4060e61662aca3","observation_id":"189255af-02e9-4150-b435-18a40aa37400","resolution":{"observed_at":"2026-08-16T00:33:34.558483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01489","last_updated":"2024-10-29T17:29:27Z","snapshot_observed_at":"2026-08-17T17:32:59.508600Z","submitted_at":"2024-07-01T17:24:45Z","title":"Agentless: Demystifying LLM-based Software Engineering Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01489","snapshot_observed_at":"2026-08-16T00:33:33.515805Z","title":"Agentless: Demystifying llm- based software engineering agents.arXiv preprint arXiv:2407.01489, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.515805Z"},"links":{"cited_paper":"/paper/2407.01489","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:e8bdef0aecd978242826f21a93d42b2bb150a92fa5bf6083ab00a7f5eb0a30f7","observation_id":"80b0ac03-dfb2-4ef9-a65b-af2f0ad7feb6","resolution":{"observed_at":"2026-08-16T00:33:33.515805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.540263Z","title":"Understanding conflicts in multi- objective alignment through reward consistency","venue":null,"work_id":"0a6dab3a-aad1-428c-a435-c4dc86f79005","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.519209Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ec9e6abcd3b74585214058018121fabc2647d4bc88791fb43ea4c7d0a1f2995c","observation_id":"fcc01372-0216-406d-b5a0-4c595510e4f1","resolution":{"observed_at":"2026-08-16T00:33:34.545677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15884","last_updated":"2024-10-07T02:19:21Z","snapshot_observed_at":"2026-08-17T09:14:38.619275Z","submitted_at":"2024-01-29T04:36:39Z","title":"Corrective Retrieval Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15884","snapshot_observed_at":"2026-08-16T00:33:33.522211Z","title":"Correctiveretrievalaugmentedgeneration.arXiv preprint arXiv:2401.15884, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.522211Z"},"links":{"cited_paper":"/paper/2401.15884","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:02361f4e1687833ee55ca7ad31035922bc088d101ff659c54515d2e496170780","observation_id":"cc1f9429-1855-4ebc-88aa-e9db5d0afafa","resolution":{"observed_at":"2026-08-16T00:33:33.522211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.529437Z","title":"SWE-agent: Agent-computer interfaces enable automatedsoftwareengineering.InAdvances in Neural Information Processing Systems, volume 37, 2024","venue":null,"work_id":"ffa80d44-2389-4b51-8403-356c36b13b9e","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.525916Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:df84820241b7c811f90170d759c39b1815020ae52cc6c2ccb8aaf2002775283c","observation_id":"e443eff3-8741-4a37-9111-932790c0bef7","resolution":{"observed_at":"2026-08-16T00:33:34.533251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.519220Z","title":"How is llm reasoning distracted by irrelevant context? an analysis using a controlled benchmark","venue":null,"work_id":"16816cff-06bf-4bcd-aadb-dc7be8165b89","year":2025},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.553434Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:77d003339141b44c578d5c82b78523fc2b3852217dd7b812d5f0d4036d2eb4b5","observation_id":"2ea8998c-607c-4368-8d9e-2f37126e16fc","resolution":{"observed_at":"2026-08-16T00:33:34.523071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-16T00:33:33.588385Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.588385Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:815257d830fb0a9a562dd2190a6c6176f3d0abbcb514cc86ab5fd64ec263f4b6","observation_id":"0d040aec-434f-4b5a-a34a-b9441f54389d","resolution":{"observed_at":"2026-08-16T00:33:33.588385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.508357Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":"c7bd08bc-67b4-4d8d-9a39-8bcc88b89567","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.641615Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:c8bbd3775f519c46af71c5273ac1ed326321a4a07e7c12cee03b86a3e2f9f2a6","observation_id":"34d85fb8-9456-4f94-bf2e-1fd169af05e9","resolution":{"observed_at":"2026-08-16T00:33:34.511755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-17T20:31:29.818313Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-16T00:33:33.645802Z","title":"𝜏-bench: : A benchmark for tool-agent- user interaction in real-world domains.arXiv preprint arXiv:2406.12045, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.645802Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:b696eac3767b9c07fd57b0b7c96f3ac1b51382f2814e037cd5c81353be494abf","observation_id":"1aa9ee3c-da5e-4dc4-8dc7-733ba2c82a06","resolution":{"observed_at":"2026-08-16T00:33:33.645802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.498752Z","title":null,"venue":null,"work_id":"7d05d059-cbd1-4b9a-9c30-6218876041a8","year":2022},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.649136Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:079afda924508da70717a196faf85200e87869f1f7a00367082f68b2f60ce21d","observation_id":"e72c3e34-d083-45f0-a36b-91aad86262f4","resolution":{"observed_at":"2026-08-16T00:33:34.502260Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.488330Z","title":"Agenticcon- text engineering: Evolving contexts for self-improving language models","venue":null,"work_id":"9d47bf16-5219-4bed-8c1e-de1fb5850627","year":2026},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.652423Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:20d3a87ca2af8715a5e5bdcb01455e0c6b0f83be5ebe05f04791291db3dcb932","observation_id":"3f749eb0-d9a9-4aae-be9c-94aebded2811","resolution":{"observed_at":"2026-08-16T00:33:34.492208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.448378Z","title":"Debug like a human: A large language model debugger via verifying runtime execution step-by-step","venue":null,"work_id":"57f15f38-4451-4562-9bd3-52f63a14a4d8","year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.655858Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:147a14b1249c3429f1e369f4b7b3bea2277efd4ef5c2d06d05c909009e79f456","observation_id":"49112e5b-16e2-488a-b499-b839b9e8c802","resolution":{"observed_at":"2026-08-16T00:33:34.481415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:33:34.308850Z","title":"Least-to- most prompting enables complex reasoning in large language models","venue":null,"work_id":"55c1d9cc-a4f1-4c0c-a454-5c3604f04c4d","year":2023},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.658664Z"},"links":{"citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:8cf9f56ca5a839800631a139faf3dce5fd212ab8ab45018b7a35ad5d2c1aa09b","observation_id":"089374cc-2037-440c-a863-59c4f7bc4ff1","resolution":{"observed_at":"2026-08-16T00:33:34.384144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19446","last_updated":"2024-02-29T18:45:56Z","snapshot_observed_at":"2026-08-16T14:14:00.679899Z","submitted_at":"2024-02-29T18:45:56Z","title":"ArCHer: Training Language Model Agents via Hierarchical Multi-Turn RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19446","snapshot_observed_at":"2026-08-16T00:33:33.662364Z","title":"Archer: Training language model agents via hierarchical multi-turn rl.arXiv preprint arXiv:2402.19446, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-16T00:33:33.662364Z"},"links":{"cited_paper":"/paper/2402.19446","citing_paper":"/paper/2608.11772"},"observation_digest":"sha256:ac3e32936402ee6beb7cebc6626670af2a22aedc009d1196bdc231b2d387c4fc","observation_id":"a6063bd7-fd89-4283-bd7b-34fe3c9f1b14","resolution":{"observed_at":"2026-08-16T00:33:33.662364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.11772","last_updated":"2026-08-12T08:14:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T13:29:36.867985Z","submitted_at":"2026-08-12T08:14:45Z","title":"Diagnosis Before Recovery: Turning Agent Failures into Selective Self-Correction"},"reference_resolution":{"displayed":97,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":2,"verified_fuzzy":35},"total_outbound_references":97},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 97 of 97 outbound references and 0 inbound Pith citation observations for arXiv:2608.11772."}