{"as_of":"2026-08-16T20:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18ea97c7e602d21e90c05a029ca82ea45cc50bec2b7da562fb820057717d2765","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:22:26.870215Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09096/citation-record","integrity":"/paper/2608.09096/integrity","json":"/paper/2608.09096/citation-record.json","paper":"/paper/2608.09096"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.14249","last_updated":"2026-07-23T03:12:37Z","snapshot_observed_at":"2026-08-16T09:42:18.256426Z","submitted_at":"2026-06-12T08:27:11Z","title":"HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.14249","snapshot_observed_at":"2026-08-14T04:22:26.628134Z","title":"Harnessx: A composable, adaptive, and evolvable agent harness foundry.arXiv preprint arXiv:2606.14249,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.628134Z"},"links":{"cited_paper":"/paper/2606.14249","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:bc58e416ee2b55379f34323da979cc00591ce48cded06c692724c4c5740ce0aa","observation_id":"21a47d1a-1229-447d-8e70-15b6cd4707a0","resolution":{"observed_at":"2026-08-14T04:22:26.628134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.636498Z","title":"11 Evo-Bench: Can Language Models Improve Agent Harness? DeepSeek-AI","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.636498Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:b1683af7c40e0cc9a823b49d18408b914c1c45584ce1f418ff2e0bcf0c6e44ce","observation_id":"b94458d9-0d25-41da-bf49-88c57a490cd2","resolution":{"observed_at":"2026-08-14T04:22:26.636498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27276","last_updated":"2026-05-28T08:21:29Z","snapshot_observed_at":"2026-08-07T09:48:37.006970Z","submitted_at":"2026-05-26T16:55:46Z","title":"SIA: Self Improving AI with Harness & Weight Updates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27276","snapshot_observed_at":"2026-08-14T04:22:26.644350Z","title":"Sia: Self improving ai with harness & weight updates.arXiv preprint arXiv:2605.27276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.644350Z"},"links":{"cited_paper":"/paper/2605.27276","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:2e19c506fb7ce8c11f0cb7899bcca8f90ecc035b7110c3956f5bb5fe30032531","observation_id":"192edf02-eef4-49db-98f1-2d6ce7af8406","resolution":{"observed_at":"2026-08-14T04:22:26.644350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08435","last_updated":"2025-03-02T05:13:28Z","snapshot_observed_at":"2026-08-06T11:45:45.286982Z","submitted_at":"2024-08-15T21:59:23Z","title":"Automated Design of Agentic Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08435","snapshot_observed_at":"2026-08-14T04:22:26.648963Z","title":"Automated design of agentic systems.arXiv preprint arXiv:2408.08435,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.648963Z"},"links":{"cited_paper":"/paper/2408.08435","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:43dd2552e0570af72d2598ecf146cd5fd2bf197b72bc0fbad205d3bb91488fe9","observation_id":"542b4358-d5d5-4cfc-baaf-7ee47c9cd90d","resolution":{"observed_at":"2026-08-14T04:22:26.648963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03302","last_updated":"2024-04-14T21:02:16Z","snapshot_observed_at":"2026-08-16T14:54:54.719304Z","submitted_at":"2023-10-05T04:06:12Z","title":"MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03302","snapshot_observed_at":"2026-08-14T04:22:26.653121Z","title":"Mlagentbench: Evaluating language agents on machine learning experimentation.arXiv preprint arXiv:2310.03302,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.653121Z"},"links":{"cited_paper":"/paper/2310.03302","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:852b41af2f2e1092cfc40b2de61e2f79f66489a16d2a8d2b8d5059591bf7eec9","observation_id":"5f998b68-8bfa-4d4e-b156-2a4bcfd2b75a","resolution":{"observed_at":"2026-08-14T04:22:26.653121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-13T11:59:50.629136Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13392","snapshot_observed_at":"2026-08-14T04:22:26.661868Z","title":"Xunhao Lai, Weiqi Xu, Yufeng Yang, Qiaorui Chen, Yang Xu, Lunbin Zeng, Xiaolong Li, Haohai Sun, Haichao Zhu, Vito Zhang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.661868Z"},"links":{"cited_paper":"/paper/2606.13392","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:f83d17d789134f11b7a44bc3a0e799cc7f6cbb55e3fb024f6aa2a171400d4192","observation_id":"7d91f3af-8392-4574-a5e8-d0ebd3653329","resolution":{"observed_at":"2026-08-14T04:22:26.661868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-08-11T05:18:08.192130Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-14T04:22:26.665740Z","title":"Meta- harness: End-to-end optimization of model harnesses.arXiv preprint arXiv:2603.28052,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.665740Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:e1fae18261c104e8827fbb741335b291781843c0a080201ca045fa95c45b7bb9","observation_id":"9a3a6329-b9da-45e3-85f6-f93c83c20bf1","resolution":{"observed_at":"2026-08-14T04:22:26.665740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18543","last_updated":"2026-06-10T02:43:26Z","snapshot_observed_at":"2026-08-12T18:47:26.431104Z","submitted_at":"2026-04-20T17:36:49Z","title":"ClawEnvKit: Automatic Environment Generation for Claw-Like Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.18543","snapshot_observed_at":"2026-08-14T04:22:26.670161Z","title":"Clawenvkit: Automatic environment generation for claw-like agents.arXiv preprint arXiv:2604.18543,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.670161Z"},"links":{"cited_paper":"/paper/2604.18543","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:8cfe49c54e37d6769d00211058d3a990e88d9e31e5fa9126b651b94fca726d01","observation_id":"60e17c74-e933-49df-965a-8b850b4db3d5","resolution":{"observed_at":"2026-08-14T04:22:26.670161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30621","last_updated":"2026-05-28T22:16:14Z","snapshot_observed_at":"2026-08-02T11:09:20.796647Z","submitted_at":"2026-05-28T22:16:14Z","title":"Harness Updating Is Not Harness Benefit: Disentangling Evolution Capabilities in Self-Evolving LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30621","snapshot_observed_at":"2026-08-14T04:22:26.673955Z","title":"Harness updating is not harness benefit: Disentangling evolution capabilities in self-evolving llm agents.arXiv preprint arXiv:2605.30621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.673955Z"},"links":{"cited_paper":"/paper/2605.30621","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:66237c504915af0caf27680c0ceaf2c500f5be23913af26ccfd580fd7fb404c2","observation_id":"f1e14da7-cf84-4e04-974c-c61c67ca037d","resolution":{"observed_at":"2026-08-14T04:22:26.673955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.04455","last_updated":"2026-06-03T04:58:17Z","snapshot_observed_at":"2026-08-06T11:33:07.154821Z","submitted_at":"2026-06-03T04:58:17Z","title":"The Meta-Agent Challenge: Are Current Agents Capable of Autonomous Agent Development?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.04455","snapshot_observed_at":"2026-08-14T04:22:26.679367Z","title":"The meta-agent challenge: Are current agents capable of au- tonomous agent development?arXiv preprint arXiv:2606.04455,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.679367Z"},"links":{"cited_paper":"/paper/2606.04455","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:e5ba5e42a0933d85433446fe0495a2abb96ce5d18b8aaf70627597d29b5f427b","observation_id":"0dc64604-d4fd-4563-9004-aaf627cdceee","resolution":{"observed_at":"2026-08-14T04:22:26.679367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-08-11T23:48:15.512738Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-08-14T04:22:26.683106Z","title":"Alphaevolve: A coding agent for scientific and algorithmic discovery.arXiv preprint arXiv:2506.13131,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.683106Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:5f6378d54131165d04f1ca5f199123fc010e27cefc1202d668512c84860fbfa9","observation_id":"41b0c0d4-d6b0-45ed-9a06-eb006d0cb72c","resolution":{"observed_at":"2026-08-14T04:22:26.683106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.686828Z","title":"16, 2025; cloud-agent research preview announced May 16,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.686828Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:f4699de5f1b9a05d081488098fb4d3bbd499265ad15d040e27b8baf4684281cd","observation_id":"ae91a44e-5ae1-41f6-b4ef-1a20507e0424","resolution":{"observed_at":"2026-08-14T04:22:26.686828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-14T04:22:26.691164Z","title":"Gdp- val: Evaluating ai model performance on real-world economically valuable tasks.arXiv preprint arXiv:2510.04374,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.691164Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:623222d69bd698101c470897aa1e71a4493dff1403cfad8ac298ca9e0da316d1","observation_id":"98c760b8-a68b-4f7c-acaf-fef3972e3371","resolution":{"observed_at":"2026-08-14T04:22:26.691164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.696626Z","title":"Qwen3.6-27B: Flagship-level coding in a 27B dense model, April 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.696626Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:ac7a3f24bcfe8157fd4b4068308bd69aa53c33f9d7bdf808139a2c5dde3f1c5d","observation_id":"c95b22f6-3d20-4ced-b076-616f405caaf0","resolution":{"observed_at":"2026-08-14T04:22:26.696626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-14T04:22:26.700377Z","title":"Paperbench: Evaluating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.700377Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:6d1f69afffbb8729503e451b112db403b0dd28e65a108a39b4ec2272d6296aab","observation_id":"cfc401ee-8430-4d30-90e9-ab59b4f4e620","resolution":{"observed_at":"2026-08-14T04:22:26.700377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-13T20:57:43.825707Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-14T04:22:26.705407Z","title":"Gemma 4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.705407Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:8df4cb784b87255f502df830436da723a1b06bddcc3a1dc54b329d63213c3ed9","observation_id":"f739b9d8-5d58-4ebe-a8d2-e9c415888516","resolution":{"observed_at":"2026-08-14T04:22:26.705407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.11793","last_updated":"2026-04-21T16:02:11Z","snapshot_observed_at":"2026-08-14T05:17:40.668746Z","submitted_at":"2025-11-14T18:52:07Z","title":"MiroThinker: Pushing the Performance Boundaries of Open-Source Research Agents via Model, Context, and Interactive Scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.11793","snapshot_observed_at":"2026-08-14T04:22:26.710180Z","title":"Mirothinker: Pushing the performance boundaries of open-source research agents via model, context, and interactive scaling.arXiv preprint arXiv:2511.11793,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.710180Z"},"links":{"cited_paper":"/paper/2511.11793","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:dde0db009e4063339ae97356f379296f9ddbdcc8c049966d7b4ab9a4ff73b236","observation_id":"0174f3a2-cb08-46a2-8fcf-1240ab09803f","resolution":{"observed_at":"2026-08-14T04:22:26.710180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.22480","last_updated":"2026-06-02T16:57:10Z","snapshot_observed_at":"2026-08-16T15:01:30.190840Z","submitted_at":"2026-02-25T23:40:22Z","title":"VeRO: A Harness for Agents to Optimize Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.22480","snapshot_observed_at":"2026-08-14T04:22:26.714960Z","title":"Vero: A harness for agents to optimize agents.arXiv preprint arXiv:2602.22480,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.714960Z"},"links":{"cited_paper":"/paper/2602.22480","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:eb3c10b57007ce975e93044fd974238b875cb8619c70cb9a7d5e56ea4f955955","observation_id":"108dbe65-6a23-495c-9c94-9e21f0963f76","resolution":{"observed_at":"2026-08-14T04:22:26.714960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.730007Z","title":"Apex-agents.arXiv preprint arXiv:2601.14242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.730007Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:5c2fdae12343ca288308afcad345540770ad9335039e07de06a767ce5a753e3d","observation_id":"def9e4d5-b117-45cf-9016-6c6da82b2285","resolution":{"observed_at":"2026-08-14T04:22:26.730007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.12227","last_updated":"2026-07-14T00:18:42Z","snapshot_observed_at":"2026-08-15T01:38:55.868139Z","submitted_at":"2026-07-14T00:18:42Z","title":"Rethinking the Evaluation of Harness Evolution for Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.12227","snapshot_observed_at":"2026-08-14T04:22:26.761061Z","title":"Rethinking the evaluation of harness evolution for agents.arXiv preprint arXiv:2607.12227,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.761061Z"},"links":{"cited_paper":"/paper/2607.12227","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:2fa195352a06805f9a1d54b81af8c429e60ea3b5c6ea6db0cc495a0353311118","observation_id":"4308d9a8-9172-47a9-b55f-c1eacca0b19e","resolution":{"observed_at":"2026-08-14T04:22:26.761061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12516","last_updated":"2025-04-16T22:27:45Z","snapshot_observed_at":"2026-08-13T03:19:29.377723Z","submitted_at":"2025-04-16T22:27:45Z","title":"BrowseComp: A Simple Yet Challenging Benchmark for Browsing Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12516","snapshot_observed_at":"2026-08-14T04:22:26.804133Z","title":"Browsecomp: A simple yet challenging benchmark for browsing agents.arXiv preprint arXiv:2504.12516,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.804133Z"},"links":{"cited_paper":"/paper/2504.12516","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:dc18302d758a8bde64ff0c3c8970a26f4655d064f71aa2bbd495ded14d64ac5e","observation_id":"6c557bd6-57e4-4451-8b03-2bd022e647fa","resolution":{"observed_at":"2026-08-14T04:22:26.804133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-12T16:49:37.896696Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-14T04:22:26.843491Z","title":"Hjalmar Wijk, Tao Lin, Joel Becker, Sami Jawhar, Neev Parikh, Thomas Broadley, Lawrence Chan, Michael Chen, Josh Clymer, Jai Dhyani, et al","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.843491Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:86ff313781fc5ee4caf236c27f4a9eab0fa58640360e561a55297231ebc27fbd","observation_id":"40910431-7f02-4f95-ab99-34b730e701de","resolution":{"observed_at":"2026-08-14T04:22:26.843491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-14T14:24:18.501413Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-14T04:22:26.848374Z","title":"arXiv:2406.12045, June","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.848374Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:d8a9b952b346baa7a07e18ec23b707a77c4de82d0218405e7fcc05f24538d383","observation_id":"f1477e90-55bf-4874-b626-25d1c27f2edf","resolution":{"observed_at":"2026-08-14T04:22:26.848374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-14T14:24:18.501413Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-14T04:22:26.851933Z","title":"Bowen Ye, Rang Li, Qibin Yang, Yuanxin Liu, Linli Yao, Hanglong Lv, Zhihui Xie, Chenxin An, Lei Li, Lingpeng Kong, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.851933Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:15f8a42fc8b3ba54688310d9cc9806f2631e8ef4cff4c355dd12a935276f77f8","observation_id":"f0df5ac0-0714-4f99-9677-2070dfceb393","resolution":{"observed_at":"2026-08-14T04:22:26.851933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-14T04:22:26.856839Z","title":"Glm-5: from vibe coding to agentic engineering.arXiv preprint arXiv:2602.15763,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.856839Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:c356735588d2a14fbe05fa5cc3c067e8bb6b0bd620d29ea36ec04bd5f5433261","observation_id":"3206dd85-11ef-448a-a448-3c52425eeef9","resolution":{"observed_at":"2026-08-14T04:22:26.856839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09498","last_updated":"2026-08-12T16:54:29Z","snapshot_observed_at":"2026-08-15T23:12:07.819094Z","submitted_at":"2026-06-08T13:50:23Z","title":"Self-Harness: Harnesses That Improve Themselves","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09498","snapshot_observed_at":"2026-08-14T04:22:26.860842Z","title":"Self-harness: Harnesses that improve themselves.arXiv preprint arXiv:2606.09498, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.860842Z"},"links":{"cited_paper":"/paper/2606.09498","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:5b0d8c367a57186d6ec3c8787ae1773fedd214feedd5fcd1d94155c3d6b0f40a","observation_id":"ef8392bb-4f72-42ca-baca-929458df42b2","resolution":{"observed_at":"2026-08-14T04:22:26.860842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.865501Z","title":"16 A.2 Details of the Policy Harness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.865501Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:2e30aaa056de47b321fd15d7dc0829471612c5b41d402d8537a972a062e969f5","observation_id":"77191e59-d1ca-4303-b48b-1e2363aa591e","resolution":{"observed_at":"2026-08-14T04:22:26.865501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.870215Z","title":"Domain tools, planning, memory, and verification are left for evolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.870215Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:0e6021d1876d9d377db35e94cd9a4b47e373a8440d88e0d4a266813628c1806e","observation_id":"3f3e5601-2092-4b19-952a-7e640d960733","resolution":{"observed_at":"2026-08-14T04:22:26.870215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08988","last_updated":"2026-05-24T11:57:07Z","snapshot_observed_at":"2026-08-14T19:57:39.067766Z","submitted_at":"2026-04-10T05:49:50Z","title":"SEA-Eval: A Benchmark for Evaluating Self-Evolving Agents Beyond Episodic Assessment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.08988","snapshot_observed_at":"2026-08-14T04:22:26.657509Z","title":"Sea-eval: A benchmark for evaluating self-evolving agents beyond episodic assessment.arXiv preprint arXiv:2604.08988,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.657509Z"},"links":{"cited_paper":"/paper/2604.08988","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:f7aab35e4539222d0908af75188bc6e2fb32d568226a128037f3e5b5671745a9","observation_id":"f98ced87-c1ac-48b5-ab92-2d30adcc738a","resolution":{"observed_at":"2026-08-14T04:22:26.657509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.05202","last_updated":"2026-07-06T15:17:09Z","snapshot_observed_at":"2026-08-01T16:59:54.701989Z","submitted_at":"2026-07-06T15:17:09Z","title":"EvoAgentBench: Benchmarking Agent Self-Evolution via Ability Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.05202","snapshot_observed_at":"2026-08-14T04:22:26.640162Z","title":"Evoagentbench: Benchmarking agent self-evolution via ability transfer.arXiv preprint arXiv:2607.05202,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.640162Z"},"links":{"cited_paper":"/paper/2607.05202","citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:37883e68704daeb6317e311d46d898d039153f65e74face22145d607a1173958","observation_id":"a1d1bcf8-d99b-489d-a183-23f4ca6af170","resolution":{"observed_at":"2026-08-14T04:22:26.640162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.620002Z","title":"24, 2025; general availability May 22,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.620002Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:e5fca8556e51ee0611e2dc55ec4c5a0ef6384217038b08efebb4943076e7af93","observation_id":"65bbff88-96b1-4ed7-974c-958d79cbae98","resolution":{"observed_at":"2026-08-14T04:22:26.620002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:22:26.624677Z","title":"Mle-bench: Evaluating machine learn- ing agents on machine learning engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:22:26.624677Z"},"links":{"citing_paper":"/paper/2608.09096"},"observation_digest":"sha256:34f71d5b1e5eb43a283d984ba5c1b2d81bc12783a0d074f8b8fb9b038d693c43","observation_id":"fffa250f-dc3b-462d-8df6-8ba7d009ff76","resolution":{"observed_at":"2026-08-14T04:22:26.624677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09096","last_updated":"2026-08-11T02:53:55Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T17:03:39.454138Z","submitted_at":"2026-08-10T03:49:28Z","title":"Evo-Bench: Can Language Models Improve Agent Harness?"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2608.09096."}