{"as_of":"2026-08-19T07:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:874690098710014337b4ad1fe5abc03fc5832f43f914c31711a68832434cdc95","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:09:08.945549Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03764/citation-record","integrity":"/paper/2608.03764/integrity","json":"/paper/2608.03764/citation-record.json","paper":"/paper/2608.03764"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.295308Z","title":"A survey of self-evolving agents: What, when, how, and where to evolve on the path to artificial super intelligence.Transactions on Machine Learning Research, 2026","venue":null,"work_id":"6c510cf7-a44a-409d-bee3-0bd164ef6ecc","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:05.884507Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:3c9a4ec04152c81bafc0055e411f0bf3a40495ecf14b10437d527d7dc91bee81","observation_id":"f18c76b0-c63b-49c9-a1cd-f674f1596b8a","resolution":{"observed_at":"2026-08-05T13:09:13.404964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.099337Z","title":"A comprehensive survey of continual learning: Theory, method and application.IEEE Transactions on Pattern Analysis and Machine Intelligence, 46:5362–5383, 2024","venue":null,"work_id":"09525783-c1d2-4cee-bba4-b4b39cdd907f","year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.043829Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:05e52bf95119221f27cd4bdaddc04530d394f775050cd43a2b0bbd50d59e9446","observation_id":"323bfd6f-ea54-47e9-ac69-82a1372d9fb0","resolution":{"observed_at":"2026-08-05T13:09:13.187967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:12.919898Z","title":"Reflexion: Language 10 agents with verbal reinforcement learning","venue":null,"work_id":"86bc2759-25ae-4f2e-8c5a-06825bc9c1e0","year":2023},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.138087Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:512f3dcaaa7b341977dbc3f14fe786c3c8d788c779a39210ebdcada65b3c796f","observation_id":"1181aecd-ac95-4f6c-a8f9-eadee7eb2edf","resolution":{"observed_at":"2026-08-05T13:09:12.995487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:12.726134Z","title":"ExpeL: LLM agents are experiential learners","venue":null,"work_id":"745f04ce-a3ef-4241-9314-2e8818603832","year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.226363Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:aef246fef77e19aaac6f320a351597e3b7aba45a849989aa362808f42ffdb7bf","observation_id":"fcbed200-7f4a-4a32-b7ea-16b99f87d0d8","resolution":{"observed_at":"2026-08-05T13:09:12.812322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:12.547496Z","title":"G¨ odel machines: Fully self-referential optimal universal self-improvers","venue":null,"work_id":"72aa02d6-d295-45d4-bf81-dde26671c232","year":2007},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.333375Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:7a9d71c2fdd3a2b224f379db3a1c2db058f7664225643613b8f76031e6c703e9","observation_id":"dd4e9245-4fe1-43c6-956b-3a4fb1d012ac","resolution":{"observed_at":"2026-08-05T13:09:12.636324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22954","last_updated":"2026-03-12T23:47:40Z","snapshot_observed_at":"2026-08-13T19:47:12.152634Z","submitted_at":"2025-05-29T00:26:15Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22954","snapshot_observed_at":"2026-08-05T13:09:06.410037Z","title":"Lange, and Jeff Clune","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.410037Z"},"links":{"cited_paper":"/paper/2505.22954","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:620cd6b67af3db7c77ffad74975bc6f9f13d7c326b66f093dcf79553ac0145f0","observation_id":"14365f4e-6c3d-4859-88e1-193e66514baf","resolution":{"observed_at":"2026-08-05T13:09:06.410037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05155","last_updated":"2026-07-06T14:39:22Z","snapshot_observed_at":"2026-08-16T06:48:52.700573Z","submitted_at":"2026-07-06T14:39:22Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","version":1},"cited_work":{"arxiv_id":"2607.05155","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05155","snapshot_observed_at":"2026-08-05T13:09:10.342277Z","title":"EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments","venue":"cs.CL","work_id":"33b50464-e3c6-4d2c-b077-cd255bb4d470","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.494394Z"},"links":{"cited_paper":"/paper/2607.05155","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:11e2aa8641f73714bb4c86907426e2a9240a480d7396a38ee8c9daabf6759847","observation_id":"e58e4473-b390-4895-91ea-d33b71e320b1","resolution":{"observed_at":"2026-08-05T13:09:10.439914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.17308","last_updated":"2026-04-19T07:51:46Z","snapshot_observed_at":"2026-08-12T16:33:08.248134Z","submitted_at":"2026-04-19T07:51:46Z","title":"SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.17308","snapshot_observed_at":"2026-08-05T13:09:06.622558Z","title":"SkillFlow: Benchmarking lifelong skill discovery and evolution for autonomous agents.CoRR, abs/2604.17308, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.622558Z"},"links":{"cited_paper":"/paper/2604.17308","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:33bbc1a80bdb0e6265b44126a533e92320adfd73240db27dca0814bd7bfd32b9","observation_id":"b973ed99-b7d1-436c-ad94-e6aae7b54064","resolution":{"observed_at":"2026-08-05T13:09:06.622558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08988","last_updated":"2026-05-24T11:57:07Z","snapshot_observed_at":"2026-08-14T19:57:39.067766Z","submitted_at":"2026-04-10T05:49:50Z","title":"SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08988","snapshot_observed_at":"2026-08-05T13:09:06.712982Z","title":"SEA-Eval: A benchmark for evaluating self-evolving agents beyond episodic assessment.CoRR, abs/2604.08988, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.712982Z"},"links":{"cited_paper":"/paper/2604.08988","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:c60b8160e63daf7594809bc93785cf05d835da045ff5f1233e436ef8bddaf829","observation_id":"0f7172b8-3e07-4067-818d-4c13b2c0a6df","resolution":{"observed_at":"2026-08-05T13:09:06.712982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05202","last_updated":"2026-07-06T15:17:09Z","snapshot_observed_at":"2026-08-01T16:59:54.701989Z","submitted_at":"2026-07-06T15:17:09Z","title":"EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer","version":1},"cited_work":{"arxiv_id":"2607.05202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05202","snapshot_observed_at":"2026-08-05T13:09:10.140281Z","title":"EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer","venue":"cs.AI","work_id":"54fab2ad-277e-4e84-832d-be54bb7cd200","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.823752Z"},"links":{"cited_paper":"/paper/2607.05202","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:ce4284567442d81f063b7bf6cabc0dec4212e938d5fe9736afa5f44bfe4c118c","observation_id":"7bba5e16-9abd-448f-9f42-095f16815c49","resolution":{"observed_at":"2026-08-05T13:09:10.241179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29225","last_updated":"2026-05-28T01:25:37Z","snapshot_observed_at":"2026-08-15T20:30:12.777921Z","submitted_at":"2026-05-28T01:25:37Z","title":"BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents","version":1},"cited_work":{"arxiv_id":"2605.29225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.29225","snapshot_observed_at":"2026-08-05T13:09:09.960532Z","title":"BenchTrace: A Benchmark for Testing Reflection Ability and Controlled Evolution in LLM Agents","venue":"cs.AI","work_id":"492d2d63-a92e-4f91-b1e6-98361c1394d3","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.907341Z"},"links":{"cited_paper":"/paper/2605.29225","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:66413197eddf7f89335f10b7c4112d03987312605e9618f5d46ba96634169d61","observation_id":"0bff3dce-b501-4881-8b3c-7e55c52d112a","resolution":{"observed_at":"2026-08-05T13:09:10.035784Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:12.335385Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik R","venue":null,"work_id":"71d5e24a-2484-4c01-b204-342752bdbff2","year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:06.986986Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:0c4006a49882df3d5a018e5be41a0524a0566236c83707236b05bd8db8ce24b1","observation_id":"b890d3ec-6d7e-4343-9ca9-a8ffe333cb3c","resolution":{"observed_at":"2026-08-05T13:09:12.444324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T13:09:07.068377Z","title":"Merrill, Alexander Glenn Shaw, Nicholas Carlini, Boxuan Li, Harsh Raj, Ivan Bercovich, Lin Shi, Jeong Yeon Shin, Thomas Walshe, Estefany Kelly Buchanan, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.068377Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:a310913c2790f0c7a538b446ff62698c355d2230d909d53b9d173d7049fae61d","observation_id":"9f14d8b9-53a5-414a-8c41-9eeb6008326e","resolution":{"observed_at":"2026-08-05T13:09:07.068377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:12.185539Z","title":"Kim, Patrick Chao, Samuel Miserendino, Gildas Chabot, David Li, Michael Sharman, Alexandra Barr, Amelia Glaese, and Jerry Tworek","venue":null,"work_id":"1ed60422-3c0b-4e35-b65f-32cbf398fdf2","year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.158436Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:06d6a3f4e77164fdcdbb75d8c540b62bb3d652506ecf5b95533196703bb1bf17","observation_id":"00f87561-2eb7-4b66-b1b7-906fecd4cf7b","resolution":{"observed_at":"2026-08-05T13:09:12.267688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:07.219151Z","title":"SOP-Bench: Complex industrial SOPs for evaluating LLM agents.CoRR, abs/2506.08119, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.219151Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:326cd5afa8f32995eaca49a9fda06fcf387c561b95a6b554bcb010737fcb0682","observation_id":"dea83764-8c4c-4cdf-91a4-e9634c9da93c","resolution":{"observed_at":"2026-08-05T13:09:07.219151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.998689Z","title":"JobBench: Aligning agent work with human will.CoRR, 2026","venue":null,"work_id":"8477ab4d-0826-4681-8e8b-b6b16608a1f1","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.334268Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:2f4d72ddd8d580e78fb5173d8087e9cd8847a9da7bd8a9c50c9ef560f873c5ef","observation_id":"8d38aca4-dcf1-4b29-a09e-2df355d7f387","resolution":{"observed_at":"2026-08-05T13:09:12.087003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.813139Z","title":"LiveBench: A challenging, contamination-limited LLM benchmark","venue":null,"work_id":"f8e37e07-b7dc-4cff-9021-ea89ad416f7a","year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.430347Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:d03b7af9ae52dfa27b87395ea478e6b41235fecbb29e04d80368323782ae4533","observation_id":"b54a4f99-b720-4dd9-8b09-1b45e80194d1","resolution":{"observed_at":"2026-08-05T13:09:11.905290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.601547Z","title":"AntiLeakBench: Preventing data contamination by automatically constructing benchmarks with updated real-world knowledge","venue":null,"work_id":"e927f351-cf15-4a83-b315-8de45e1ea876","year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.513842Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:0a9811e164a36aeff3d2245d37d83cc81aa1f7897dd2905a2806c09a8204a9b5","observation_id":"d3d0c413-acb6-4dc0-9ffa-a2d08416ec68","resolution":{"observed_at":"2026-08-05T13:09:11.681345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.428852Z","title":"Benchmarking large language models under data contamination: A survey from static to dynamic evaluation","venue":null,"work_id":"422a8156-c6ca-4932-a4b7-21ba3357bbfd","year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.620433Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:4869153429c9b7afe79be81ce524a5daf5a83f4e0301b7749a19bc41a01af7a1","observation_id":"02b81de1-9fb0-4369-a57c-d9e5093eda5e","resolution":{"observed_at":"2026-08-05T13:09:11.503412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:07.681368Z","title":"Voyager: An open-ended embodied agent with large language models.Transactions on Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.681368Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:fc814f8038996b5b84259269da606f3ce50bb14f8f71f2f51cd7162ee15d1bce","observation_id":"466b1304-ad71-412e-afaa-f12d86c8e29f","resolution":{"observed_at":"2026-08-05T13:09:07.681368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19457","last_updated":"2026-02-14T11:42:30Z","snapshot_observed_at":"2026-08-14T13:34:39.415942Z","submitted_at":"2025-07-25T17:42:32Z","title":"GEPA: Reflective Prompt Evolution Can Outperform Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19457","snapshot_observed_at":"2026-08-05T13:09:07.776106Z","title":"Agrawal, Shangyin Tan, Dilara Soylu, Noah Ziems, Rishi Khare, Krista Opsahl-Ong, Arnav Singhvi, Herumb Shandilya, Michael J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.776106Z"},"links":{"cited_paper":"/paper/2507.19457","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:79282e6dbcf29445680f2ceb9c4f18b9aee2bd0bd9ee549f6cc238e0d0807a2a","observation_id":"432c6128-8d9b-467c-aa7e-f636ec66fb39","resolution":{"observed_at":"2026-08-05T13:09:07.776106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.25886","last_updated":"2026-07-28T15:46:41Z","snapshot_observed_at":"2026-08-15T15:47:26.100019Z","submitted_at":"2026-07-28T15:46:41Z","title":"RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement","version":1},"cited_work":{"arxiv_id":"2607.25886","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.25886","snapshot_observed_at":"2026-08-05T13:09:09.720243Z","title":"RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement","venue":"cs.SE","work_id":"d0ec7079-85e2-4d9d-a5d0-acfc925394ad","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.863829Z"},"links":{"cited_paper":"/paper/2607.25886","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:1d6c0e0fb3caa662ecac494421231e83b8b263074f3dd4029f96e47bd1742af3","observation_id":"2b224103-8426-4d03-94a3-98f4b0c21057","resolution":{"observed_at":"2026-08-05T13:09:09.800507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23791","last_updated":"2025-03-31T07:09:07Z","snapshot_observed_at":"2026-08-16T12:45:27.632840Z","submitted_at":"2025-03-31T07:09:07Z","title":"LLMigrate: Transforming \"Lazy\" Large Language Models into Efficient Source Code Migrators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23791","snapshot_observed_at":"2026-08-05T13:09:07.958750Z","title":"LLMigrate: Transforming “lazy” large language models into efficient source code migrators.CoRR, abs/2503.23791, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:07.958750Z"},"links":{"cited_paper":"/paper/2503.23791","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:b33a69c52b8099663d8613dfc990cb328c678192510c54720d7dbbb985a702a5","observation_id":"c020f1da-c0bf-453c-9e38-3b5777b6d402","resolution":{"observed_at":"2026-08-05T13:09:07.958750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.203003Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":"79d9a01d-cc69-4a28-963d-758223c10639","year":1901},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.041173Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:0a32f9d7e0ca47911abd5b924a72e65aaffec2d299168af195619bb7dbbaa659","observation_id":"ddaf9f13-1905-4dc5-8f81-6bc041788c33","resolution":{"observed_at":"2026-08-05T13:09:11.316441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06303","last_updated":"2026-04-24T20:21:17Z","snapshot_observed_at":"2026-08-16T11:59:00.706363Z","submitted_at":"2025-05-21T16:15:01Z","title":"Reward Is Enough: LLMs Are In-Context Reinforcement Learners","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06303","snapshot_observed_at":"2026-08-05T13:09:08.132427Z","title":"Reward is enough: LLMs are in-context reinforcement learners.CoRR, abs/2506.06303, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.132427Z"},"links":{"cited_paper":"/paper/2506.06303","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:ec2d32cc5b9badb42fc2a65cf2af1903a5e404cfc52c49ec7d3f62e03999ae47","observation_id":"7a5f93ed-3540-4308-b8cd-f2696d2e7fb1","resolution":{"observed_at":"2026-08-05T13:09:08.132427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15777","last_updated":"2026-05-24T16:35:56Z","snapshot_observed_at":"2026-08-14T09:57:19.184516Z","submitted_at":"2026-05-15T09:35:15Z","title":"SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?","version":2},"cited_work":{"arxiv_id":"2605.15777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15777","snapshot_observed_at":"2026-08-05T13:09:09.483501Z","title":"SaaS-Bench: Can Computer-Use Agents Leverage Real-World SaaS to Solve Professional Workflows?","venue":"cs.AI","work_id":"e97df3bf-c610-4804-a2b2-85d014829bba","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.210473Z"},"links":{"cited_paper":"/paper/2605.15777","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:3c4d1c778065b0f7dd1aad243bf687cab86a2fa5e66a4e56c85c2c5af3168477","observation_id":"42494414-8e2c-40b5-8a79-e309ce44dc0a","resolution":{"observed_at":"2026-08-05T13:09:09.574586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T13:09:08.293502Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.293502Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:0f4af7708eeb3552390403db3862d21a5fdfefcabfb2d3edf4b804add26f5cf2","observation_id":"73bf45cd-9e53-4a20-993e-0d8569b9efd5","resolution":{"observed_at":"2026-08-05T13:09:08.293502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.16679","last_updated":"2026-05-19T05:51:20Z","snapshot_observed_at":"2026-08-16T12:26:18.226673Z","submitted_at":"2026-05-15T22:34:31Z","title":"CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?","version":2},"cited_work":{"arxiv_id":"2605.16679","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.16679","snapshot_observed_at":"2026-08-05T13:09:09.291291Z","title":"CHI-Bench: Can AI Agents Automate End-to-End, Long-Horizon, Policy-Rich Healthcare Workflows?","venue":"cs.CL","work_id":"52c688d8-79fc-471f-b009-7c33449c7e98","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.411553Z"},"links":{"cited_paper":"/paper/2605.16679","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:5b527d4d6b0568f73fefc2839ef2788342c77cd782f3f7b780a1ea394e0a8069","observation_id":"c8e6ed68-1157-4b7b-923c-3502c1b24722","resolution":{"observed_at":"2026-08-05T13:09:09.387826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14654","last_updated":"2025-02-12T05:32:07Z","snapshot_observed_at":"2026-08-17T08:12:26.593970Z","submitted_at":"2025-01-24T17:21:01Z","title":"MedAgentBench: A Realistic Virtual EHR Environment to Benchmark Medical LLM Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14654","snapshot_observed_at":"2026-08-05T13:09:08.491553Z","title":"Black, Gloria Geng, Danny Park, Andrew Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.491553Z"},"links":{"cited_paper":"/paper/2501.14654","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:ff2157554a4e2798d76a5b9c56658dee972860ba3da9de29efe4b3185d6779ce","observation_id":"d33b646e-a2ec-41a9-8144-9e8dea90379c","resolution":{"observed_at":"2026-08-05T13:09:08.491553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:08.590394Z","title":"Pollard, Alistair Johnson, Edward Choi, Yugang Jia, and Jong Ha Lee","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.590394Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:a2e23e96267cd7605a4fb094542f166974261658915e3802f609eff7ed2cdabf","observation_id":"61c8d1c8-f899-4566-9e1c-5e74ed2fafb2","resolution":{"observed_at":"2026-08-05T13:09:08.590394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.048939Z","title":"Harvey LAB: The legal agent benchmark","venue":null,"work_id":"48fd04ea-f1da-4e6c-b5cf-3e83f4547d31","year":2026},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.651464Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:222099a025ad11236caf5344098b0373562201f91d88c1f09d3fe816993eabdc","observation_id":"d3e56211-5923-4e10-ae1c-c9a8c05b391c","resolution":{"observed_at":"2026-08-05T13:09:11.114346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:10.860475Z","title":"SpreadsheetBench: Towards challenging real world spreadsheet manipulation","venue":null,"work_id":"67f3017e-2976-4b10-8d9a-0f8558a5d8b8","year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.730253Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:2e0a97d18d12c6ddf404d40ab7de222cd114820248eb61612b58f4464204b1b6","observation_id":"9fb19912-667d-41b2-ae54-ad01b4e6a465","resolution":{"observed_at":"2026-08-05T13:09:10.949683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:10.687575Z","title":"InfiAgent-DABench: Evaluating agents on data analysis tasks","venue":null,"work_id":"01fa1d70-a185-449b-b2c3-f1358e5f78f4","year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.783111Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:5904c71b0ff1f3001e5c82b8d927ccc64134408a191504f0a96bf7fa7b5f5142","observation_id":"8ad928f2-3a8f-4e0d-82bf-0e40e05a660a","resolution":{"observed_at":"2026-08-05T13:09:10.769801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:08.848101Z","title":"BIRD-INTERACT: Re-imagining text-to-SQL evaluation for large language models via lens of dynamic interactions.CoRR, abs/2510.05318, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.848101Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:af7952cfd9c352f0049dd62bf18ac0847442b91f10bc6f8cd5350a3d9b8a8904","observation_id":"d0420d3e-d12a-4e27-afe8-3df81dc3b39d","resolution":{"observed_at":"2026-08-05T13:09:08.848101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:10.528881Z","title":"LiveSQLBench: A dynamic and contamination-free benchmark for evaluating LLMs on real-world text-to-SQL tasks.https://github.com/bird-bench/livesqlbench, 2025","venue":null,"work_id":"3cb40e50-46b3-4bc4-9bf5-777b9189b8c3","year":2025},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.898514Z"},"links":{"citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:3889e2bceb97e3dc7ca29ef53541da2b9c916a4531c91e5713c7a5daeea999d5","observation_id":"927f1840-81d4-4634-84c2-ddc6ccafb9b2","resolution":{"observed_at":"2026-08-05T13:09:10.620259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00823","last_updated":"2024-08-03T12:41:29Z","snapshot_observed_at":"2026-08-16T13:56:11.796611Z","submitted_at":"2024-05-01T19:07:03Z","title":"WorkBench: a Benchmark Dataset for Agents in a Realistic Workplace Setting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00823","snapshot_observed_at":"2026-08-05T13:09:08.945549Z","title":"may be better","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.945549Z"},"links":{"cited_paper":"/paper/2405.00823","citing_paper":"/paper/2608.03764"},"observation_digest":"sha256:f6cfb8d1e49a4b36612f9a25bc2468c690adeacb10cf3d81f921d30d2a88b79b","observation_id":"092207ef-8fef-46f4-ad6b-2ef6e2675dbe","resolution":{"observed_at":"2026-08-05T13:09:08.945549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03764","last_updated":"2026-08-04T14:51:56Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T17:52:56.118803Z","submitted_at":"2026-08-04T14:51:56Z","title":"GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":6,"verified_fuzzy":16},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2608.03764."}