{"as_of":"2026-08-09T03:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4bff88c48ccef7d393bcc73bda4a18c1f9cd13255ad319b279b2e35add614701","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T02:16:43.153818Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00017/citation-record","integrity":"/paper/2608.00017/integrity","json":"/paper/2608.00017/citation-record.json","paper":"/paper/2608.00017"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:40.747999Z","title":"Sutton and Andrew G","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:40.747999Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:89a2cd04c8d8ae0e7e4e791e62a85a6d84c8b5d40e8e1f5b6e814268cf899de5","observation_id":"fd057453-96b2-4df1-a1ab-376a65485ac9","resolution":{"observed_at":"2026-08-04T02:16:40.747999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:40.856553Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:40.856553Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:a5e9e20e2ddae6c85f0451a5d303d465b6204961d505f49f45e7647266cc942c","observation_id":"447acec5-3a1d-4f99-958d-76c0f90fe96f","resolution":{"observed_at":"2026-08-04T02:16:40.856553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:40.977158Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:40.977158Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:3b0799e337796137f9e23e6027e612140344acc52f038f57f749c226cc439f56","observation_id":"a6f4abcf-f05e-4d6c-bce7-1f0790d49458","resolution":{"observed_at":"2026-08-04T02:16:40.977158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16153","last_updated":"2025-08-25T13:32:12Z","snapshot_observed_at":"2026-08-06T23:53:22.457977Z","submitted_at":"2025-08-22T07:25:30Z","title":"Memento: Fine-tuning LLM Agents without Fine-tuning LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.16153","snapshot_observed_at":"2026-08-04T02:16:41.032797Z","title":"Memento: Fine-tuning LLM agents without fine-tuning LLMs.arXiv preprint arXiv:2508.16153, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.032797Z"},"links":{"cited_paper":"/paper/2508.16153","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:c730c79fdb80bddaeb5dcc977d3682374b9ac9238ed377356da6f9664bec12e8","observation_id":"3eae2184-c78d-4153-b98b-ae7922e7dc3b","resolution":{"observed_at":"2026-08-04T02:16:41.032797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:41.161168Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.161168Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:d3aad5670739dec0e3952dc67db205ae520b196b863b4fdd5803f57bbcd6b69f","observation_id":"7930bc81-c268-43a0-9e0b-f5d687120db2","resolution":{"observed_at":"2026-08-04T02:16:41.161168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:41.274957Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.274957Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:40f7493330f2471c34803c344bc747a9d26fe36dd8e75b4cf129a01b2d4dd81e","observation_id":"5786c519-f5b3-41e4-842d-710903a365b2","resolution":{"observed_at":"2026-08-04T02:16:41.274957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-04T02:16:41.355262Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.355262Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:b9aee89f81de6aea6a7ea1e0f7b68b1dcfe9557a13a4a2a7a929cf8bd50cc8af","observation_id":"d6c6b4a9-8649-4919-83f0-a8c63062c1aa","resolution":{"observed_at":"2026-08-04T02:16:41.355262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04549","last_updated":"2024-07-05T14:34:50Z","snapshot_observed_at":"2026-08-03T03:39:29.907591Z","submitted_at":"2024-07-05T14:34:50Z","title":"Spontaneous Reward Hacking in Iterative Self-Refinement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04549","snapshot_observed_at":"2026-08-04T02:16:41.453612Z","title":"Bowman, and Shi Feng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.453612Z"},"links":{"cited_paper":"/paper/2407.04549","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:42ec0b2e38d69f881176472507bfda219ad2007b31c5855445736902da882c40","observation_id":"8e747de1-a639-4923-9c64-bc7ae891cec7","resolution":{"observed_at":"2026-08-04T02:16:41.453612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:41.531771Z","title":"ReAct: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.531771Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:4e4b35b98dbf4838a425ccb32e87ee1e5a72297260489afc270315a7d17559a6","observation_id":"35b6a77f-a2ce-47d1-bcad-4aa26abeec89","resolution":{"observed_at":"2026-08-04T02:16:41.531771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:41.585883Z","title":"Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.585883Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:2f4ddc534003530cec6e678e8cf5d74337012cd188fe83851304feaffc3d1ed9","observation_id":"efce4652-528d-4fbf-b651-7b5ec098f964","resolution":{"observed_at":"2026-08-04T02:16:41.585883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:41.640511Z","title":"Retrieval-augmented generation for knowledge-intensive NLP tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.640511Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:57d34ead91a1ce75a73d2fee08a35e02fb9fe8ba5d029b800bad7b6edc2fbbaf","observation_id":"c9f74aae-e796-4c1a-a602-ca878731518f","resolution":{"observed_at":"2026-08-04T02:16:41.640511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:41.697684Z","title":"O’Brien, Carrie J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.697684Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:e6a8c1ffca4ce7a395085bf2e16b03a0ae43f1f7fe8fac3ee67a0578e97f5e5e","observation_id":"e6f0ec12-58c4-472a-acd2-36a4f878530d","resolution":{"observed_at":"2026-08-04T02:16:41.697684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25140","last_updated":"2026-03-16T20:49:28Z","snapshot_observed_at":"2026-08-02T12:08:17.149184Z","submitted_at":"2025-09-29T17:51:03Z","title":"ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25140","snapshot_observed_at":"2026-08-04T02:16:41.810687Z","title":"ReasoningBank: Scaling agent self-evolving with reasoning memory.arXiv preprint arXiv:2509.25140, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.810687Z"},"links":{"cited_paper":"/paper/2509.25140","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:4d5998a2f8f99dba8c88c958567631b81d7056dea0cb3b9b4007bf07e7bb5370","observation_id":"6f525c53-dfb7-4ca9-bea7-94f9b8ef7b97","resolution":{"observed_at":"2026-08-04T02:16:41.810687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03192","last_updated":"2026-02-12T05:43:57Z","snapshot_observed_at":"2026-08-08T14:48:20.406898Z","submitted_at":"2026-01-06T17:14:50Z","title":"MemRL: Self-Evolving Agents via Runtime Reinforcement Learning on Episodic Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03192","snapshot_observed_at":"2026-08-04T02:16:41.870358Z","title":"MemRL: Self-evolving agents via runtime reinforcement learning on episodic memory.arXiv preprint arXiv:2601.03192, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.870358Z"},"links":{"cited_paper":"/paper/2601.03192","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:dcb4dd534bae835a319e2f6c6844ebbfcff47d4c09a9006ea01f935af0293c58","observation_id":"3908e104-b9e0-4dac-8be4-f7b14aeb47bd","resolution":{"observed_at":"2026-08-04T02:16:41.870358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19828","last_updated":"2026-01-14T14:21:21Z","snapshot_observed_at":"2026-07-06T22:19:28.487854Z","submitted_at":"2025-08-27T12:26:55Z","title":"Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19828","snapshot_observed_at":"2026-08-04T02:16:41.921304Z","title":"Memory-R1: Enhancing large language model agents to manage and utilize memories via reinforcement learning.arXiv preprint arXiv:2508.19828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.921304Z"},"links":{"cited_paper":"/paper/2508.19828","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:9b7ee2779df1b388c093f02ba84cd503ddb864517e90ecc49bfe5ab93570cda8","observation_id":"b3ce45e0-ef31-4735-8a5e-1e9c439c1224","resolution":{"observed_at":"2026-08-04T02:16:41.921304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25911","last_updated":"2025-09-30T08:02:34Z","snapshot_observed_at":"2026-08-06T02:56:06.576393Z","submitted_at":"2025-09-30T08:02:34Z","title":"Mem-{\\alpha}: Learning Memory Construction via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25911","snapshot_observed_at":"2026-08-04T02:16:41.975585Z","title":"Mem-α: Learning memory construction via reinforcement learning.arXiv preprint arXiv:2509.25911, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:41.975585Z"},"links":{"cited_paper":"/paper/2509.25911","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:7af746297673ec90d2ea633815fa9cc6a134df4a9647eb4ff31f14965e69a0b3","observation_id":"16ca1f9d-4d80-4d02-9ffe-3b8d22a1f76f","resolution":{"observed_at":"2026-08-04T02:16:41.975585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01885","last_updated":"2026-07-23T06:23:36Z","snapshot_observed_at":"2026-08-03T14:57:06.604444Z","submitted_at":"2026-01-05T08:24:16Z","title":"Agentic Memory: Learning Unified Long-Term and Short-Term Memory Management for Large Language Model Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.01885","snapshot_observed_at":"2026-08-04T02:16:42.052502Z","title":"Agentic memory: Learning unified long-term and short- term memory management for large language model agents.arXiv preprint arXiv:2601.01885, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.052502Z"},"links":{"cited_paper":"/paper/2601.01885","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:4c15b21e41728ee3d7bda49f51e92898efb3fe84b96e35b9153e2a518c16a320","observation_id":"c472d61b-1dc4-45c2-841a-9b957d0c94ef","resolution":{"observed_at":"2026-08-04T02:16:42.052502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.27283","last_updated":"2026-04-30T00:32:53Z","snapshot_observed_at":"2026-07-06T23:12:47.745700Z","submitted_at":"2026-04-30T00:32:53Z","title":"Learning When to Remember: Risk-Sensitive Contextual Bandits for Abstention-Aware Memory Retrieval in LLM-Based Coding Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.27283","snapshot_observed_at":"2026-08-04T02:16:42.111892Z","title":"Learning when to remember: Risk-sensitive contextual bandits for abstention- aware memory retrieval in LLM-based coding agents.arXiv preprint arXiv:2604.27283, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.111892Z"},"links":{"cited_paper":"/paper/2604.27283","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:68ac72876363da5ebd6aa39c0c86eb11a3441224ecae5132cfab74e7cec84a3b","observation_id":"f38068a7-e067-42f2-8516-ed08db3d8f06","resolution":{"observed_at":"2026-08-04T02:16:42.111892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-04T02:16:42.170552Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.170552Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:59831df909f1b7c332208982dcf908ae64f5139c06d61ab396600dd2bb3fae50","observation_id":"53f58fce-b58a-4ba1-b605-2a8acaf8246a","resolution":{"observed_at":"2026-08-04T02:16:42.170552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.225662Z","title":"Process reward models that think.arXiv preprint arXiv:2504.16828, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.225662Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:04efd98c9300067bfe6d050db6f4704b4f489efba8ea6cc4a8c7f123c669e2c2","observation_id":"82440356-8ab7-48d8-9169-ed5612ca0019","resolution":{"observed_at":"2026-08-04T02:16:42.225662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21819","last_updated":"2025-06-21T08:39:06Z","snapshot_observed_at":"2026-08-04T18:30:37.623897Z","submitted_at":"2024-10-29T07:42:18Z","title":"Self-Preference Bias in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21819","snapshot_observed_at":"2026-08-04T02:16:42.284063Z","title":"Self-preference bias in LLM-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.284063Z"},"links":{"cited_paper":"/paper/2410.21819","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:250c12a835ff63b4e4f597a37c050e85943965ba24ef5fe5d13217d5833cd578","observation_id":"8a4080ab-d542-4623-b6fc-f8b558591d70","resolution":{"observed_at":"2026-08-04T02:16:42.284063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02592","last_updated":"2025-06-03T08:12:47Z","snapshot_observed_at":"2026-08-07T15:19:01.070855Z","submitted_at":"2025-06-03T08:12:47Z","title":"Beyond the Surface: Measuring Self-Preference in LLM Judgments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02592","snapshot_observed_at":"2026-08-04T02:16:42.324571Z","title":"Beyond the surface: Measuring self-preference in LLM judgments.arXiv preprint arXiv:2506.02592, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.324571Z"},"links":{"cited_paper":"/paper/2506.02592","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:0ed239b2e9d93dff62b6cacf5e5059b8acb9d27006c17a18a72002e76b7d75a9","observation_id":"a4352c5a-0e5b-440b-af5c-2a8cb2ba9922","resolution":{"observed_at":"2026-08-04T02:16:42.324571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29800","last_updated":"2026-05-28T11:48:17Z","snapshot_observed_at":"2026-08-08T20:42:23.976022Z","submitted_at":"2026-05-28T11:48:17Z","title":"Nine Judges, Two Effective Votes: Correlated Errors Undermine LLM Evaluation Panels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29800","snapshot_observed_at":"2026-08-04T02:16:42.387470Z","title":"Nine judges, two effective votes: Correlated errors undermine LLM evaluation panels.arXiv preprint arXiv:2605.29800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.387470Z"},"links":{"cited_paper":"/paper/2605.29800","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:ff894a8640b306c83e8bce6fd98aa61fc47f04aab60dc4e27730b8827dfd0b01","observation_id":"dd5bacfb-663a-450b-a497-04c25024b9a9","resolution":{"observed_at":"2026-08-04T02:16:42.387470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.432525Z","title":"QuickCheck: A lightweight tool for random testing of Haskell programs","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.432525Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:764bcdbb53dd659d729b95610121b89ddeac0c5905128d150246b508606f8d4f","observation_id":"93271f3e-459c-4d8a-a4a1-31539340c8a6","resolution":{"observed_at":"2026-08-04T02:16:42.432525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.487271Z","title":"Finding and understanding bugs in C compilers","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.487271Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:711f0ec87f134e3b53c76d49dae8dc64977362b4437ae30063f7b3b95da878cf","observation_id":"af03401f-98e5-498a-a261-110f4ce576aa","resolution":{"observed_at":"2026-08-04T02:16:42.487271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.553548Z","title":"Metamorphic testing: A new approach for generating next test cases","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.553548Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:b27b09a705ffa248ab6e57949326ba8b58bc6089e4ffbe8a9dd090b634372292","observation_id":"46ef34c9-c955-4cc7-b7c5-511c74ad8216","resolution":{"observed_at":"2026-08-04T02:16:42.553548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.599839Z","title":"Sanchez, and Antonio Ruiz-Cortés","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.599839Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:f05cf06c70e9f903526e28427c5fbd3a25ebf361539b173a89f3e7719a5fd29e","observation_id":"007d0614-1a62-46dc-a84f-6dcd08ccd8f5","resolution":{"observed_at":"2026-08-04T02:16:42.599839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10397","last_updated":"2022-11-23T07:42:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-21T10:18:37Z","title":"CodeT: Code Generation with Generated Tests","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10397","snapshot_observed_at":"2026-08-04T02:16:42.650963Z","title":"CodeT: Code generation with generated tests","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.650963Z"},"links":{"cited_paper":"/paper/2207.10397","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:acdb2f489054e2f2ee87f42f5d42f60b69c122a0ab489e08d0d59a385f0969b1","observation_id":"627f7534-db2a-4faf-84b4-54f9f4c36b80","resolution":{"observed_at":"2026-08-04T02:16:42.650963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.696928Z","title":"SEDM: Scalable self-evolving distributed memory for agents.arXiv preprint arXiv:2509.09498, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.696928Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:da5554de01ab51d842809cc00378819e795210b2fbd1844816e90d38b95f3133","observation_id":"789a2fc0-204f-4784-9c26-0b7f2f84402e","resolution":{"observed_at":"2026-08-04T02:16:42.696928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.741781Z","title":"A-MemGuard: A proactive defense framework for LLM-based agent memory.arXiv preprint arXiv:2510.02373, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.741781Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:8cbb731f9cb3564b8b720dd3a3395ed5d19a70084edd798664bfa9f26269a7ce","observation_id":"c92c542c-80b1-4a3c-93e5-ed051c3adf30","resolution":{"observed_at":"2026-08-04T02:16:42.741781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:42.796735Z","title":"MemMA: Coordinating the memory cycle through multi-agent reasoning and in-situ self-evolution.arXiv preprint arXiv:2603.18718, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.796735Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:a4e73053e5e19bf123b91ed892d656234fad40dd7736c1917ea7cb4fcd2b4baa","observation_id":"6697af4e-3474-45b7-880a-d8c1346fca88","resolution":{"observed_at":"2026-08-04T02:16:42.796735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12978","last_updated":"2026-05-13T04:15:50Z","snapshot_observed_at":"2026-08-07T18:13:07.355577Z","submitted_at":"2026-05-13T04:15:50Z","title":"Useful Memories Become Faulty When Continuously Updated by LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12978","snapshot_observed_at":"2026-08-04T02:16:42.847936Z","title":"Useful memories become faulty when continuously updated by LLMs.arXiv preprint arXiv:2605.12978, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.847936Z"},"links":{"cited_paper":"/paper/2605.12978","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:aba635569d93c5bd48c25aa71d803c49bedb79235a0be5341d6b33ecd13c8ef4","observation_id":"513546c6-3ba1-4884-aca6-dd24b0455df1","resolution":{"observed_at":"2026-08-04T02:16:42.847936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-04T02:16:42.906699Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.906699Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:9bf58cc0c6b51968fe4c9be4a32b0a4710c42308f42d827bdaf06d8fca2f5770","observation_id":"982f9154-3941-4ad3-9d34-9ddeabfc1b34","resolution":{"observed_at":"2026-08-04T02:16:42.906699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1407.7644","last_updated":"2014-10-30T11:23:37Z","snapshot_observed_at":"2026-07-06T03:50:17.740473Z","submitted_at":"2014-07-29T07:19:08Z","title":"Estimating the Accuracies of Multiple Classifiers Without Labeled Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1407.7644","snapshot_observed_at":"2026-08-04T02:16:42.955345Z","title":"Estimating the accuracies of multiple classifiers without labeled data.Artificial Intelligence and Statistics (AISTATS), 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:42.955345Z"},"links":{"cited_paper":"/paper/1407.7644","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:31db5b486cc6c0136441613eaab55b2f16f514b1db75eb59f36e36d291e378f5","observation_id":"f5ca1904-22a6-4d15-8504-7dec3c645ce7","resolution":{"observed_at":"2026-08-04T02:16:42.955345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05392","last_updated":"2023-12-08T22:06:44Z","snapshot_observed_at":"2026-07-06T16:59:03.166901Z","submitted_at":"2023-12-08T22:06:44Z","title":"The logic of NTQR evaluations of noisy AI agents: Complete postulates and logically consistent error correlations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05392","snapshot_observed_at":"2026-08-04T02:16:43.009324Z","title":"The logic of NTQR evaluations of noisy AI agents.arXiv preprint arXiv:2312.05392, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:43.009324Z"},"links":{"cited_paper":"/paper/2312.05392","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:14ac91f45cfce0f5f7e6107050f6972b5f5c053778e0ed16ce0e1cda5468c68b","observation_id":"db240d47-19ca-4da0-8977-24a1072d9624","resolution":{"observed_at":"2026-08-04T02:16:43.009324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03111","last_updated":"2023-11-15T04:56:25Z","snapshot_observed_at":"2026-07-06T15:23:29.240615Z","submitted_at":"2023-05-04T19:02:29Z","title":"Can LLM Already Serve as A Database Interface? A BIg Bench for Large-Scale Database Grounded Text-to-SQLs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03111","snapshot_observed_at":"2026-08-04T02:16:43.096931Z","title":"Can LLM already serve as a database interface? a BIg bench for large-scale database grounded text-to-SQLs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:43.096931Z"},"links":{"cited_paper":"/paper/2305.03111","citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:9cafa9ec3479473b5ec14146abbd3cae3be335a36f0b1959fddfd2f79e7b197d","observation_id":"972e9bf5-95b7-4051-8b8c-e970ef6b557d","resolution":{"observed_at":"2026-08-04T02:16:43.096931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T02:16:43.153818Z","title":"SimCSE: Simple contrastive learning of sentence embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T02:16:43.153818Z"},"links":{"citing_paper":"/paper/2608.00017"},"observation_digest":"sha256:8868542bf1442bef274c272330a313e54744106ae472194ca5db841bdb1a4c96","observation_id":"f4f5eede-59ea-405a-adce-2633ee73e701","resolution":{"observed_at":"2026-08-04T02:16:43.153818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00017","last_updated":"2026-06-29T12:20:14Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T15:03:02.082641Z","submitted_at":"2026-06-29T12:20:14Z","title":"Memory Reward Inflation in Self-Improving LLM Agents"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2608.00017."}