{"as_of":"2026-08-07T01:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b68afadabc39f945fccef195b5eda68144b099dc4cd08b5fb11119d586edf8c","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:11:09.642275Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.20477/citation-record","integrity":"/paper/2605.20477/integrity","json":"/paper/2605.20477/citation-record.json","paper":"/paper/2605.20477"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-06T03:52:41.836315Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2507.19457","doi":"10.48550/arxiv.2507.19457","metadata_source":"pith","pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","venue":"cs.CL","work_id":"40b60d06-dc1c-4799-b75d-ff1eca653049","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:4c7f159c4605d28932e749bbf80b19dca74abf0c0542e1073736fd5b6d09771a","observation_id":"d0575f69-4592-4cdf-b54c-b1ac1b1a13f0","resolution":{"observed_at":"2026-05-21T07:14:02.609943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:19.13226+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:19.13226+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openai gym","venue":null,"work_id":"a9e00073-a37b-4b37-aee1-856d97eeeb8f","year":2016},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:889e1335351555bf9a03ca59db089f61b33ea7a3523dc3d76b160560cc5967fa","observation_id":"7335257d-2e04-41c7-8091-86fc361f1099","resolution":{"observed_at":"2026-05-21T07:14:46.731454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:57:25.332055Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901","venue":null,"work_id":"bd7ec542-9242-446e-955e-bb75e729be5d","year":1901},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:4c5c985ad07ae550067c9ff7179a85fc496805bb2af0ad6e63665b640b699173","observation_id":"9bc94e4c-2619-41f1-a1a8-b67f6717569e","resolution":{"observed_at":"2026-05-21T07:14:46.733794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.09666","doi":"10.48550/arxiv.2505.09666","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"System prompt optimization with meta- learning","venue":"ArXiv.org","work_id":"093327ba-c407-42fe-8886-9031f6195de0","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:e703d3bbae64ee0e7d8bc149ab7e9005a80968e87ea816838c0c7109fada1d16","observation_id":"c464cd0b-aa18-4ada-89c9-67c9997ece16","resolution":{"observed_at":"2026-05-21T07:14:02.620371Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:13.648471+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:13.648471+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving retrospective language agents via joint policy gradient optimization","venue":null,"work_id":"7b4bcdad-c75e-438c-baa9-4e1034b9aad1","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:927470395e27f09c8a1a5b9717244b003316691ea852fedec543435d7ffc4c98","observation_id":"08f9f6e7-465d-41d0-a05e-41a2911fae6d","resolution":{"observed_at":"2026-05-21T07:14:46.727285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Samule: Self-learning agents enhanced by multi-level reflection","venue":null,"work_id":"3a7266cf-3753-4a9d-9557-99501fc77029","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:d63381178d928e75fe42d58023b0d9438a9623023cec535d6dd5405da7a3e03b","observation_id":"d2d0aab2-8033-4101-858f-74a3afbb3930","resolution":{"observed_at":"2026-05-21T07:14:46.729416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meta-rl induces exploration in language agents","venue":null,"work_id":"cc144f4c-dbb4-4c2d-8974-d600d3ab6235","year":2026},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:ea5485943cda6eee9a67ceda8274bd18aa3f76a36cef1e284a9ec0106234190b","observation_id":"b2792107-6ad0-473d-9d75-99635800c804","resolution":{"observed_at":"2026-05-21T07:14:46.725235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01441","last_updated":"2025-05-23T11:13:40Z","snapshot_observed_at":"2026-07-06T20:00:09.775334Z","submitted_at":"2024-12-02T12:31:58Z","title":"LMAct: A Benchmark for In-Context Imitation Learning with Long Multimodal Demonstrations","version":3},"cited_work":{"arxiv_id":"2412.01441","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01441","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lmact: A benchmark for in-context imitation learning with long multimodal demonstrations","venue":null,"work_id":"715bee06-e0e4-4da6-87fd-6af6b538f9d4","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2412.01441","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:4dac045b763bee49542d3d50abc077e67d16bd3787f4c68b4c7382965832a90f","observation_id":"fb825063-655f-4ad6-98ce-cc7398056407","resolution":{"observed_at":"2026-05-21T07:14:02.612567Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minihack the planet: A sandbox for open-ended reinforcement learning research","venue":null,"work_id":"d06ad829-87c6-4a28-b442-4179369e73d0","year":2021},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:19fea3490a62d0d95c912e4f2cf193ddda5eb67b7609891f25399a2112bdb1a5","observation_id":"b56f7cea-0bc9-4139-8a11-4423d9966f1c","resolution":{"observed_at":"2026-05-21T07:14:46.718180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00234","last_updated":"2025-05-16T21:52:57Z","snapshot_observed_at":"2026-07-06T21:17:23.576970Z","submitted_at":"2025-05-01T00:48:12Z","title":"Self-Generated In-Context Examples Improve LLM Agents for Sequential Decision-Making Tasks","version":3},"cited_work":{"arxiv_id":"2505.00234","doi":"10.48550/arxiv.2505.00234","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00234","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-generated in-context examples improve LLM agents for sequential decision-making tasks","venue":"ArXiv.org","work_id":"ff3b9960-0934-4f0f-b772-18ee77993ba3","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2505.00234","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:2cb6bac32cc23fb8b658c2fa5f09950c2e53fc6df51666105b0fc0868f08afea","observation_id":"f3822e6a-619b-4f23-9b07-9fa736463b64","resolution":{"observed_at":"2026-05-21T07:14:02.632692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:09.682714+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:09.682714+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.06438","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can foundation models actively gather information in interactive environments to test hypotheses?","venue":null,"work_id":"589e2e95-2dd9-444c-8dc4-9ee2dd8e4bd5","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:22207ca8dd7db077befc3a1b08962c5b1a98d98d4a9a50c46a6f2acf01ed4d32","observation_id":"3779a81b-68be-4745-beeb-8cebec9963ee","resolution":{"observed_at":"2026-05-21T07:14:02.635780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:77bfb7600a30d01d3c4676e614510900b3d2c8f31b1b2ada93693029c16a451d","observation_id":"7c08bb24-47fe-4f83-9c00-96af5b80d4cc","resolution":{"observed_at":"2026-05-21T07:14:02.622820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":"2409.19256","doi":"10.1145/3689031.3696075.url:","metadata_source":"pith","pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","venue":"cs.LG","work_id":"7eb9c9f4-b322-4bba-8011-09ff8d6ad801","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:ef49b530d4c02c6443835ae535b675238ea583069ac2a2c5965e458cfa9585af","observation_id":"4f481cf5-6a9b-4367-b737-de41b94ac7d9","resolution":{"observed_at":"2026-05-21T07:14:02.625298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T03:44:29.499952Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36:8634–8652","venue":null,"work_id":"a1894bfe-ed8e-4cc3-a955-b4689ee7d53f","year":2023},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:e15ea43acb287476c65c673c07e59e2a30abc07e01043b5f981e3bbf595df91c","observation_id":"82a2cfd3-3ddc-4405-aafd-be070015b8f4","resolution":{"observed_at":"2026-05-21T07:14:46.720600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":null,"work_id":"fc44f762-2dee-4dd2-84ce-43a20b9fa76b","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:592e3558c8495165da178be930526a15a4336ad00d70f56ff371b547af5a9641","observation_id":"61856e92-1d27-48ee-ace9-0b2603b1ddf9","resolution":{"observed_at":"2026-05-21T07:14:46.712234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03768","last_updated":"2021-03-14T22:44:38Z","snapshot_observed_at":"2026-07-06T10:02:33.297722Z","submitted_at":"2020-10-08T05:13:36Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","version":2},"cited_work":{"arxiv_id":"2010.03768","doi":"10.1109/cvpr.2001.990517","metadata_source":"pith","pith_arxiv_id":"2010.03768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ALFWorld: Aligning Text and Embodied Environments for Interactive Learning","venue":"cs.CL","work_id":"fa436f46-ec0a-4d2e-a0ff-e697def4a7be","year":2020},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2010.03768","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:b85d35976dbb1e5650ff32597cfddab827da771ca370c5fddf35de31be7c2e51","observation_id":"81080f43-7494-4373-ba7a-f76f71833c8b","resolution":{"observed_at":"2026-05-21T07:14:02.617944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T11:23:33.289391+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Welcome to the era of experience.Google AI, 1","venue":null,"work_id":"a65b549e-b193-4c70-b8a3-c36cf729a4c0","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:255f77482a088d696b90832dd55027ab8575fa4dead31c95ef253d6fe8dc1450","observation_id":"2781f0a4-ce1d-443d-8178-5212b9c6351d","resolution":{"observed_at":"2026-05-21T07:14:46.714201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cognitive architec- tures for language agents.Transactions on Machine Learning Research","venue":null,"work_id":"7ba12dc0-4776-4315-8994-52484cf9a09a","year":2023},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:4805a0d732d20dec54a2cb773dd552d4294b08ba9c07f640029f0caad7337599","observation_id":"79819df9-1c0c-4542-acb8-32aeab412892","resolution":{"observed_at":"2026-05-21T07:14:46.705714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:33.958459Z","title":"A survey on large language model based autonomous agents.Frontiers of Computer Science, 18(6):186345","venue":null,"work_id":"22d0f278-0f8d-4a9a-941a-1a0feef5523b","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:b2641ef25f65918a8e44cb77a65bd44d2321a454ca92ca6d960dfc5403c86c1e","observation_id":"9a165cc2-7fc3-4e0f-afde-191b8ac2a5ce","resolution":{"observed_at":"2026-05-21T07:14:46.708114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:fd1a3720a075ae2200b34691fb7adf657368be80058dae1771d2122c8443f8b1","observation_id":"26220ed4-5bac-409c-a97f-eb8cd1f98c7a","resolution":{"observed_at":"2026-05-21T07:14:02.630011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:24:54.951575Z","title":"Large language models as optimizers","venue":null,"work_id":"d6277824-fc2e-4feb-81ee-bbbf100bcdc7","year":2023},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:1b3bace6826b5cf5b08aff1db1921bfed08260267af7e7af92c0c352fb502f33","observation_id":"044bf3c0-48eb-417c-91c5-12ad3182d313","resolution":{"observed_at":"2026-05-21T07:14:46.716175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T18:37:32.087006Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"404308e4-3b7a-4845-8899-d58a0072d6ed","year":2022},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:1f1bda6de92538ffd41911fbd7e5632a84b5274dbe932d92afc1c73b74cfb69e","observation_id":"6d60c726-6090-4c48-84da-7651d43b299c","resolution":{"observed_at":"2026-05-21T07:14:46.723025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-07-06T16:02:23.099952Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:5fb250ec6a4d4b30fc5d676016bdfb312e5cd13032005e949fe86cbecca57433","observation_id":"b931cb18-5ab5-47e2-b9d4-e2fa4fe981fe","resolution":{"observed_at":"2026-05-21T07:14:02.615242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12821","last_updated":"2025-07-22T17:07:08Z","snapshot_observed_at":"2026-08-06T16:35:38.850014Z","submitted_at":"2025-07-17T06:28:14Z","title":"Assessing Adaptive World Models in Machines with Novel Games","version":2},"cited_work":{"arxiv_id":"2507.12821","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12821","snapshot_observed_at":"2026-06-30T13:24:40.541740Z","title":"Assessing adaptive world models in machines with novel games","venue":null,"work_id":"37f5e27c-e77d-423d-bfdd-e8d22b1b3edc","year":2025},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2507.12821","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:789c573fbf35a3f0c9ae6bd5f2b09d558d50819c18bf3daa83ccfaab426e84ac","observation_id":"9b13a92c-9b9e-4214-9dff-29c3405f7973","resolution":{"observed_at":"2026-05-21T07:14:02.627802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expel: Llm agents are experiential learners","venue":null,"work_id":"d6c6d826-ae70-46e4-98ff-eff947683157","year":2024},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:ce5907e6d05993a5a1fb6aa2338238bc370bd7c55f160eb642d3dcd4c5294861","observation_id":"5f50fbc8-9a26-4340-87c2-cf49a37a18d3","resolution":{"observed_at":"2026-05-21T07:14:46.710188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a71a28aa-d7b0-435c-8664-5b5034c910b8","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:c66e15522a6eef28faf6dbab967337533c3bdc597f7c81fc4fba5bcfd9f82d69","observation_id":"50480d2a-a712-4630-b675-14547b666410","resolution":{"observed_at":"2026-05-21T07:14:46.703743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3c1b17b7-d355-4a0d-a48e-42507d84a72f","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:a3f182634d0be953c49d136b88029045f50d42ba73c4ed4dedaecca36046e241","observation_id":"39e026f5-c9a7-40d2-9d95-62e76332d934","resolution":{"observed_at":"2026-05-21T07:14:46.700145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Qwen/Qwen2.5-7B-Instruct","venue":null,"work_id":"92d9e6f8-d0eb-4dc8-8974-53274b5b5081","year":2048},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:bf2693fe7c467afe7912a91176a2be51efeab0f61a45fb489c32ff3aa3e710e1","observation_id":"188e03b2-acb2-4554-b34c-9ad0f97d2d11","resolution":{"observed_at":"2026-05-21T07:14:46.701969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9ccbecd7-a40f-4ae7-b14e-e72e7d5eba09","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:8351404817636405c84b4b4c7859fa749617cbda5af4e6edf73a6dd225069224","observation_id":"1f25f9fa-c319-40ce-b8b2-b7ee59cff123","resolution":{"observed_at":"2026-05-21T07:14:46.696464Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"48a56eae-ba72-4121-bf1c-5588aa2aac71","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:80e3ee75cf27c8ef9e05f43c76b9f5e788f5d29114e3eccf1577afa46452cd82","observation_id":"9c149829-0e1b-4dde-b3de-8e51b1eed1bc","resolution":{"observed_at":"2026-05-21T07:14:46.698343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f81f5904-95d4-44f6-97f5-e2d2d238afc5","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:e2e6ef0e20b5f50347394705cc268c73270a13ce29b29e8ad68385702abc6f58","observation_id":"e5f32a59-ed69-4c71-a145-49271e60f199","resolution":{"observed_at":"2026-05-21T07:14:46.691346Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"<\" symbol. I will move east to investigate further. Action 2: step e Observation 2","venue":null,"work_id":"af305e57-e88a-4309-85aa-ff465ed0c20b","year":null},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:cb76ad018aa2d6ba3f96571aec5043bbc7b54835eedaf2f1408b5e54e1393997","observation_id":"e97f10c0-e480-44c2-8264-38e5828d5b3a","resolution":{"observed_at":"2026-05-21T07:14:46.693384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":11,"verified_fuzzy":16},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2605.20477."}