{"as_of":"2026-08-07T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9264ca6758acb90ad5c12d470f3f5ada3f10baa233c5d2889fc4735f2e11231f","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:07:01.736890Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14004/citation-record","integrity":"/paper/2607.14004/integrity","json":"/paper/2607.14004/citation-record.json","paper":"/paper/2607.14004"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-06T03:52:41.836315Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-02T03:06:57.655149Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:57.655149Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:b45dd1b2b71692385977c1b433847beefd56f477a953b451b2a731784cfbbf68","observation_id":"b39a6960-0658-4aa4-b918-381b484ee6a3","resolution":{"observed_at":"2026-08-02T03:06:57.655149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:57.805283Z","title":"Claude code.https://www.anthropic.com/claude-code, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:57.805283Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:653943da367d771aaa9180492beb22f71963278ac6d23a16632530b47b16fd45","observation_id":"4316c8be-730e-42d9-99d1-e67e13b3d517","resolution":{"observed_at":"2026-08-02T03:06:57.805283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:57.996291Z","title":"Dreaming.https://platform.claude.com/docs/en/managed-agents/dreams,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:57.996291Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:e4e7099a561d9b61dbd6afdd85efc4107deb56ece55ebb5c625479194ab85211","observation_id":"b70666a3-86c8-4a7a-b7e0-36c6733e35b0","resolution":{"observed_at":"2026-08-02T03:06:57.996291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:58.397629Z","title":"HALO: An RLM-based automatic agent optimization loop.https://github.com/ context-labs/halo, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:58.397629Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:9ad0fd593d8c4cbdbd22d29d1640f29eb79e3dea76824cf1ddec9967adaa594f","observation_id":"8a2fd03c-f95b-409d-b32d-2344276bcee5","resolution":{"observed_at":"2026-08-02T03:06:58.397629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:58.521041Z","title":"Harbor: A framework for evaluating and optimizing agents and models in container environments, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:58.521041Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:9fcfb00fdbd313d917e556a3e7a6ca29783e3f914ef3d506b4b6ddeda49e7f6c","observation_id":"62c571e3-1f7d-4b2c-a117-a9b290aed180","resolution":{"observed_at":"2026-08-02T03:06:58.521041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:58.655378Z","title":"Karpathy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:58.655378Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:069357b339e5045b9fcd1776bba3b7482f48bb95d2c52545fa1a11a12615148e","observation_id":"bf14ea6f-95c9-4a2c-b27e-12352003cc63","resolution":{"observed_at":"2026-08-02T03:06:58.655378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-02T03:06:58.809844Z","title":"Khattab, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:58.809844Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:d22fdaa4dda09220f212711c790b035628f8d5484365e5b0253f93054b655491","observation_id":"463ab879-ae17-49bd-b296-a3721cd1d6d8","resolution":{"observed_at":"2026-08-02T03:06:58.809844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00796","last_updated":"2017-01-25T13:01:51Z","snapshot_observed_at":"2026-08-04T14:09:02.234596Z","submitted_at":"2016-12-02T19:18:37Z","title":"Overcoming catastrophic forgetting in neural networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00796","snapshot_observed_at":"2026-08-02T03:06:59.001551Z","title":"Kirkpatrick, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.001551Z"},"links":{"cited_paper":"/paper/1612.00796","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:7a835ad0fe5674b4525887b8b55e2389ad4d023076498a7a5c5feeb8f7f5c499","observation_id":"81497779-d164-4e2c-92a4-2679e1741035","resolution":{"observed_at":"2026-08-02T03:06:59.001551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-02T03:06:59.116346Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.116346Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:9df084748b79893e9fc8c3ec58455ed6db15f42d857d6638721e5f3d01caffd7","observation_id":"cbb44bc6-537e-4bdb-9048-1ed77038712a","resolution":{"observed_at":"2026-08-02T03:06:59.116346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:59.192854Z","title":"Letta (formerly MemGPT): Stateful agents with long-term memory.https://github.com/ letta-ai/letta, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.192854Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:ff6dcfd169313ece4fa9972012a9104d08cf24c396ebbefbbd7fa48fe0dc91f6","observation_id":"8d19b858-6539-418b-893f-01a7fa5e628c","resolution":{"observed_at":"2026-08-02T03:06:59.192854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04247","last_updated":"2026-04-05T20:07:48Z","snapshot_observed_at":"2026-07-13T10:33:16.289426Z","submitted_at":"2026-04-05T20:07:48Z","title":"Combee: Scaling Prompt Learning for Self-Improving Language Model Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04247","snapshot_observed_at":"2026-08-02T03:06:59.275957Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.275957Z"},"links":{"cited_paper":"/paper/2604.04247","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:f6449c89def7a1c66f504373c3d748a099af43866dd64f7478b5b3261095beff","observation_id":"222ab042-8d71-4ec4-8010-167b7c402aad","resolution":{"observed_at":"2026-08-02T03:06:59.275957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:59.359190Z","title":"Motus.https://github.com/lithos-ai/motus, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.359190Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:1f9e280428ed9c8437819262d6d432b9554e23ec1787b930940cffeb8633f585","observation_id":"306dd607-a383-4f35-86f2-29008544f4ef","resolution":{"observed_at":"2026-08-02T03:06:59.359190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.04585","last_updated":"2019-02-24T08:12:46Z","snapshot_observed_at":"2026-07-06T06:27:55.499625Z","submitted_at":"2018-03-13T01:15:39Z","title":"Categorizing Variants of Goodhart's Law","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.04585","snapshot_observed_at":"2026-08-02T03:06:59.462591Z","title":"Manheim and S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.462591Z"},"links":{"cited_paper":"/paper/1803.04585","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:592a2cf0a6b0ce1604d54c6139cc05f6777cd5ce732d564d891d6e4bc62add1e","observation_id":"8d9831da-640e-45ef-b372-bef73337ce29","resolution":{"observed_at":"2026-08-02T03:06:59.462591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:59.575218Z","title":"mem0: Memory layer for AI agents.https://github.com/mem0ai/mem0, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.575218Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:dd285b352df325885e24206a36aa368e8e4ec62e2c4d8c25185cf7cc5d92e0a1","observation_id":"c8454bd5-5a8d-446f-92ba-d1786c4a6d98","resolution":{"observed_at":"2026-08-02T03:06:59.575218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-02T03:06:59.716514Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.716514Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:7e2f2492af7d9e5daab6f0748e55d4b699f3c46a10d0017ff2b308a3c2d49b83","observation_id":"ab1de30e-1af7-40a2-acf2-3d944f9268b3","resolution":{"observed_at":"2026-08-02T03:06:59.716514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:59.832023Z","title":"Hermes.https://github.com/nousresearch/hermes-agent, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.832023Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:e038b5379dc3fa4ce4b048f259aacfe1ad43c2be59ebcf1e27c6a0c4504ea51b","observation_id":"c959f2d0-c04f-4f95-b137-68a3e5925186","resolution":{"observed_at":"2026-08-02T03:06:59.832023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:59.983768Z","title":"Codex.https://openai.com/index/introducing-codex/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:59.983768Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:be10a93920b0329ccb924623ca13c01c90793e3165cdfabd5f2ed2fa62f368ad","observation_id":"ca8c73d7-ad73-4b7c-be5d-4c3644a95168","resolution":{"observed_at":"2026-08-02T03:06:59.983768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11695","last_updated":"2024-10-06T17:34:26Z","snapshot_observed_at":"2026-07-06T18:32:19.794373Z","submitted_at":"2024-06-17T16:12:03Z","title":"Optimizing Instructions and Demonstrations for Multi-Stage Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11695","snapshot_observed_at":"2026-08-02T03:07:00.083970Z","title":"Opsahl-Ong, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.083970Z"},"links":{"cited_paper":"/paper/2406.11695","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:593adfcd3cf65659e5f0cf672db3cae49c889859bdc33b61f2f74e2b648031d1","observation_id":"1d5d6830-e951-4b4f-b5bb-8e1d115ef81e","resolution":{"observed_at":"2026-08-02T03:07:00.083970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-02T03:07:00.201320Z","title":"Pyatkin, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.201320Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:39cd5b79b2a9c8693ce14b366240a974933bc5de3451d81ac83dd89ffc326f54","observation_id":"60b2eb1f-2bea-4948-beb2-df2a2f36e895","resolution":{"observed_at":"2026-08-02T03:07:00.201320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T03:07:00.333315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.333315Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:21dce6c17b2df48fc3934934a4d82ff0b1001b529871e60c8d516a77176124ed","observation_id":"43f1767b-9f51-4eba-b23b-301d893ba9f3","resolution":{"observed_at":"2026-08-02T03:07:00.333315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-02T03:07:00.458580Z","title":"Shinn, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.458580Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:f483f00192538587c6332f9b85446ac6e09c05d143b6f3d8a0db0ab4179121e6","observation_id":"e2efb186-9e8d-43bc-a706-ac7b81613cf2","resolution":{"observed_at":"2026-08-02T03:07:00.458580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:00.559956Z","title":"Tannyhill","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.559956Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:510b1e542ce9fbe5a0c65cf12f2ae525359f0fe9bd97e6c7972c529579c1847e","observation_id":"402e3873-8f1c-463f-b92d-20cf2219e28b","resolution":{"observed_at":"2026-08-02T03:07:00.559956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04642","last_updated":"2025-09-04T20:00:37Z","snapshot_observed_at":"2026-08-06T18:52:05.233637Z","submitted_at":"2025-09-04T20:00:37Z","title":"Maestro: Joint Graph & Config Optimization for Reliable AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.04642","snapshot_observed_at":"2026-08-02T03:07:00.673765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.673765Z"},"links":{"cited_paper":"/paper/2509.04642","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:ba0a240247dd086e58e5e4c10c89e6748e00d860d96159d72329bcce32b4f0c6","observation_id":"9f4aef0e-c401-445d-9ee0-02d27f2115a0","resolution":{"observed_at":"2026-08-02T03:07:00.673765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:00.789351Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.789351Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:19b4dbd3221f72f42570a9697b4982027b08e8e4282f6a1fab6702294cf6387e","observation_id":"32f92bda-f1d3-4d97-8336-cff93dfc2554","resolution":{"observed_at":"2026-08-02T03:07:00.789351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:00.923650Z","title":"Zhang, B","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:00.923650Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:64e233dd1f2e80c3623bc205d66988b4d14de5c51ef31708398c1fb5b9efbab6","observation_id":"60763ea9-a45b-4757-98ca-44cc5804728f","resolution":{"observed_at":"2026-08-02T03:07:00.923650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04618","last_updated":"2026-03-29T09:18:02Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:30:18Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04618","snapshot_observed_at":"2026-08-02T03:07:01.058753Z","title":"Zhang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.058753Z"},"links":{"cited_paper":"/paper/2510.04618","citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:0f8fe921551e993a37ac6bca77efef435b6635e159b32504c35faeeca23353b7","observation_id":"60d31c03-edbb-44ab-b3c9-a35344bb92c8","resolution":{"observed_at":"2026-08-02T03:07:01.058753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:01.220940Z","title":"TerminusKira","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.220940Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:0dd6625d107bce35294db5a8f121da80e346a0da4afb6af1995fa6b3317ce345","observation_id":"d2230fba-9fd8-43ce-a456-401183cdfa1a","resolution":{"observed_at":"2026-08-02T03:07:01.220940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:01.358806Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.358806Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:3235ecdbbfbcc0cc77513fdf7af4f1c40fe220e10994ba2a53170cf5dfa4caeb","observation_id":"14de4084-fcd0-45a0-84d6-1be8ae85efe4","resolution":{"observed_at":"2026-08-02T03:07:01.358806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:01.486922Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.486922Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:ee1eed7120bc6ac1c298f4189f6bc3d486b45ada5cb42af4a6fc9d998b4f4637","observation_id":"c922a1db-a993-4790-9df0-cd5017e20494","resolution":{"observed_at":"2026-08-02T03:07:01.486922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:01.589192Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.589192Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:324fc5b68cf11ecebfb6037ef3c5177b80d37fe025f3bf9d58e38bda0a2c5af0","observation_id":"daf65cd2-c119-49bb-9fe5-93a0f1a1c676","resolution":{"observed_at":"2026-08-02T03:07:01.589192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:01.689132Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.689132Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:11c46dcb84e48ae36aefcdcc5536b1e629d036e24d765bf2147b9861a580e5c3","observation_id":"307f4af3-8261-4cd5-a2e7-e1240028d8d5","resolution":{"observed_at":"2026-08-02T03:07:01.689132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:07:01.736890Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:07:01.736890Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:01eab8f8f179cdcc3f83db775e47d379f9567bac4f244c268f01df8e2c98e511","observation_id":"a63b6cf7-394b-429b-918d-5cca9547db86","resolution":{"observed_at":"2026-08-02T03:07:01.736890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:06:58.198693Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T03:06:58.198693Z"},"links":{"citing_paper":"/paper/2607.14004"},"observation_digest":"sha256:9fd04d7134eb5e65fea7e5abcb5d6d011b0fa827274de549b26de256ecf1393c","observation_id":"e8f69650-fa5c-4578-bb92-d70e4ec09eb4","resolution":{"observed_at":"2026-08-02T03:06:58.198693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14004","last_updated":"2026-07-15T16:36:04Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T00:36:57.555991Z","submitted_at":"2026-07-15T16:36:04Z","title":"Do Agent Optimizers Compound? A Continual-Learning Evaluation on Terminal-Bench 2.0"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2607.14004."}