{"as_of":"2026-08-07T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a8b355eadab9fd98ac0a1e1dac6b8e9b59f22216f712e1145e9a4fd213588f9e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":13,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:24:14.981510Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.626281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":234,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:59508e1b72013160b6e1d84ff02cafcea3b682f4e726fad3501186956278c095","observation_id":"f8659ef3-82dc-41a9-a27b-7aafb6eb37c1","resolution":{"observed_at":"2026-05-19T20:28:39.056161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-15T07:21:39.440092Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2404.13501"},"observation_digest":"sha256:43e62dffea1ca29c9538a1023dc35f868cd6fa028a8b137c9f5ef23fc0280847","observation_id":"c960f693-2689-47f1-85d4-6dd2a9dec05e","resolution":{"observed_at":"2026-05-15T07:21:39.992190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2504.15965","last_updated":"2025-04-23T13:47:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T15:05:04Z","title":"From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-17T11:05:09.588491Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2504.15965"},"observation_digest":"sha256:dce4c9b9a8bc82e3a1c7a1686d147fb9e2bc5d578bee75414146a797897b1b85","observation_id":"6682630d-db10-425d-8e0a-61d2a7e13492","resolution":{"observed_at":"2026-05-17T11:05:09.813162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-07T00:24:14.981510Z","title":"Retroformer: Retrospective large language agents with policy gradient op- timization.ArXiv, abs/2308.02151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14234","last_updated":"2025-06-17T06:47:19Z","snapshot_observed_at":"2026-08-07T00:15:52.455187Z","submitted_at":"2025-06-17T06:47:19Z","title":"Xolver: Multi-Agent Reasoning with Holistic Experience Learning Just Like an Olympiad Team","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:24:14.981510Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2506.14234"},"observation_digest":"sha256:c45e57ef45c9e31d799eb274d637add5397bd4d4d2418d0c7f9d4ffa8f2a2688","observation_id":"498ff026-fe3f-4f37-bd26-0a457ef52ece","resolution":{"observed_at":"2026-08-07T00:24:14.981510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:22022adefae5076d4fd478f1f774a5e8ac449c51ae4a6deed4a9b034bf0aee94","observation_id":"d97be4d3-3c47-4cd2-b2ba-ae416b0d23cf","resolution":{"observed_at":"2026-05-11T20:06:08.681011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:bf04411aa7350ed86a0357b59e7dff7afedf751e0d2e1875d6b094371b7228b7","observation_id":"fd45479c-89ef-47c3-8787-9f632c461736","resolution":{"observed_at":"2026-05-11T04:00:56.846868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:aa787681c62ecf579f9c64465236a88a92fcf1c2a4f57b17764024611fa70dd9","observation_id":"2257a956-2335-440d-96e2-ff68c3f54f44","resolution":{"observed_at":"2026-05-13T07:17:28.208672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:47:39.926540Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:df61d423f8333cc891d2c8eda4846fcd1389f31b3bd528e6d7eb05c98be509be","observation_id":"e9983242-aa4a-4fd2-b415-f426ffd395d4","resolution":{"observed_at":"2026-05-11T04:20:57.093072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:15:44.550045Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:3d6927d0afc10213f38f649bb8d87a93b406dcadd881e4032feaec2e51a3d7b0","observation_id":"919c1440-c2f1-490e-b7ce-0b418b1e4dae","resolution":{"observed_at":"2026-05-20T23:19:14.904430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:23:42.883286Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:e57b638549e67f350eebb41b73fef1c9bee394dd73fb991d02aca36287bdd47b","observation_id":"20f42e94-cf13-40f8-96f7-4ab6f5e594db","resolution":{"observed_at":"2026-06-30T23:25:07.333934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-07-06T23:31:03.878152Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:86b7e913b5c09728e385ab5dc3d8ab5638300aa8499a0a4520c8fca2710d4c27","observation_id":"b931cb18-5ab5-47e2-b9d4-e2fa4fe981fe","resolution":{"observed_at":"2026-05-21T07:14:02.615242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2606.18235","last_updated":"2026-06-16T17:56:57Z","snapshot_observed_at":"2026-08-05T03:00:41.649486Z","submitted_at":"2026-06-16T17:56:57Z","title":"EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T00:34:47.530464Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2606.18235"},"observation_digest":"sha256:0af5901cd8d237c1e774d7a746d24f4349ad2439404b46cc6866a83e5942907f","observation_id":"84dc25dd-01a6-4f6c-a937-6bf2731214a6","resolution":{"observed_at":"2026-07-03T21:28:58.628130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-02T13:58:42.937172Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization.arXiv preprint arXiv:2308.02151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18258","last_updated":"2026-05-15T09:09:57Z","snapshot_observed_at":"2026-08-07T01:09:03.575259Z","submitted_at":"2026-05-15T09:09:57Z","title":"S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T13:58:42.937172Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2607.18258"},"observation_digest":"sha256:54240dc1f65731444f1a62d37600fa6b5588111591b839d4f25895da37bf8b8e","observation_id":"2d5a709f-7554-4495-9096-3cfa72d7bed2","resolution":{"observed_at":"2026-08-02T13:58:42.937172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.02151/citation-record","integrity":"/paper/2308.02151/integrity","json":"/paper/2308.02151/citation-record.json","paper":"/paper/2308.02151"},"outbound":[],"paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T03:57:16.625123Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 13 inbound Pith citation observations for arXiv:2308.02151."}