{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2933932d224dfc5c4454dbb0df5ec302e6c3d2707ced3fe10a7c348b03d04e96","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:02:25.819108Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06301/citation-record","integrity":"/paper/2608.06301/integrity","json":"/paper/2608.06301/citation-record.json","paper":"/paper/2608.06301"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.833781Z","title":null,"venue":null,"work_id":"ffe0a9df-e842-43e9-8264-492ba34ba1d7","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.616441Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:2015b7978f07ea7e1c1210e70bc34c6dee00062115fec7239c1786fe09f0bef6","observation_id":"7c5f7cd5-2b14-40f1-a771-e60121272912","resolution":{"observed_at":"2026-08-07T06:02:26.840406Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-07T06:02:25.621540Z","title":"Austin, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.621540Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:1b8fd176b96bd2637bd5164aace02ba68cfd265aafc0b3361bde2a433dbfc536","observation_id":"84c6ef51-45d5-495f-9a85-66d6b116523e","resolution":{"observed_at":"2026-08-07T06:02:25.621540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07095","last_updated":"2025-02-26T11:57:30Z","snapshot_observed_at":"2026-08-06T21:08:58.653035Z","submitted_at":"2024-10-09T17:34:27Z","title":"MLE-bench: Evaluating Machine Learning Agents on Machine Learning Engineering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07095","snapshot_observed_at":"2026-08-07T06:02:25.626627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.626627Z"},"links":{"cited_paper":"/paper/2410.07095","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:f876872ad71e8d5fdea4276bdd6846760f6b1a92138f4742c75fec0df9bf5276","observation_id":"6b862b9b-a108-44ff-b7c2-bfc126a7f381","resolution":{"observed_at":"2026-08-07T06:02:25.626627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.14249","last_updated":"2026-07-23T03:12:37Z","snapshot_observed_at":"2026-08-05T08:20:08.381254Z","submitted_at":"2026-06-12T08:27:11Z","title":"HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry","version":3},"cited_work":{"arxiv_id":"2606.14249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.14249","snapshot_observed_at":"2026-08-07T06:02:26.514955Z","title":"HarnessX: A Composable, Adaptive, and Evolvable Agent Harness Foundry","venue":"cs.AI","work_id":"7ff193b7-9a59-4c32-9e47-a2e1efbdde7a","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.639914Z"},"links":{"cited_paper":"/paper/2606.14249","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:2830efe7aa7fb8fe27498fd0e00cdd0ddb8d41af7f7bbef3d0f3169f1f36dfcf","observation_id":"5fecd972-8608-4139-bedb-a94f5cec91d0","resolution":{"observed_at":"2026-08-07T06:02:26.542719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.818572Z","title":null,"venue":null,"work_id":"fa81733b-1892-49d6-a89a-e4ba14370f70","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.644768Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:3da0b8282a63f8030b8cb7420c29f77630e06136a3eaa34040e9d89150c72165","observation_id":"06ae2d74-049d-4f54-a113-92f478ceaf97","resolution":{"observed_at":"2026-08-07T06:02:26.823414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16218","last_updated":"2024-11-01T00:01:01Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-23T21:05:31Z","title":"Trace is the Next AutoDiff: Generative Optimization with Rich Feedback, Execution Traces, and LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16218","snapshot_observed_at":"2026-08-07T06:02:25.649833Z","title":"Cheng, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.649833Z"},"links":{"cited_paper":"/paper/2406.16218","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:c865606fcd15b377bebe54800116c98dd90885f5ed2676624992b375bd6f80c7","observation_id":"7e24c6bc-e978-4394-a654-b4a3c2cfc91a","resolution":{"observed_at":"2026-08-07T06:02:25.649833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.655395Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.655395Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:fe20cc5e39a47148ce1184bb6746afe33173c2dc8f018204b46f69c20171a4a8","observation_id":"1ad6944b-e18e-41d3-b5e1-095ed755382e","resolution":{"observed_at":"2026-08-07T06:02:25.655395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.787871Z","title":null,"venue":null,"work_id":"7bd44557-0b86-4880-8b11-f031b6688d00","year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.659935Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:118a2186ce71634e9e13663377df34eab06a4d7ac11639d8b9f8f1368511dde3","observation_id":"4e70b33f-ef19-4b64-b8e2-73e9f5469edd","resolution":{"observed_at":"2026-08-07T06:02:26.792632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-07T06:02:25.668797Z","title":"Khattab, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.668797Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:ec3c8c861537513eaaf6132528f87983971c70e23c2babc91849fad742c35374","observation_id":"95aa86d1-88d4-415c-97c5-7a24d9379dfd","resolution":{"observed_at":"2026-08-07T06:02:25.668797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.19349","last_updated":"2025-09-17T17:49:02Z","snapshot_observed_at":"2026-08-04T18:42:43.786371Z","submitted_at":"2025-09-17T17:49:02Z","title":"ShinkaEvolve: Towards Open-Ended And Sample-Efficient Program Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.19349","snapshot_observed_at":"2026-08-07T06:02:25.673512Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.673512Z"},"links":{"cited_paper":"/paper/2509.19349","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:193ace9a8093480cb09cc72fdd681354d290d1725d031e2a7b0ecde124e4f46f","observation_id":"72497daf-5131-42b4-be49-78a98649a566","resolution":{"observed_at":"2026-08-07T06:02:25.673512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28052","last_updated":"2026-03-30T05:33:50Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-30T05:33:50Z","title":"Meta-Harness: End-to-End Optimization of Model Harnesses","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28052","snapshot_observed_at":"2026-08-07T06:02:25.678912Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.678912Z"},"links":{"cited_paper":"/paper/2603.28052","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:13617c62eb12d63540903a4f7023b0385b81ee37d31f1e22f14884637f67455d","observation_id":"b114c3e1-3999-451f-90ca-dd70996b620e","resolution":{"observed_at":"2026-08-07T06:02:25.678912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25850","last_updated":"2026-05-18T15:11:47Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T16:55:02Z","title":"Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.25850","snapshot_observed_at":"2026-08-07T06:02:25.684162Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.684162Z"},"links":{"cited_paper":"/paper/2604.25850","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:2cc7fa3888221f37eba200b70766191c352e63b834c81d7dcb10ccf2b230ab6a","observation_id":"45050dee-36a5-4044-bb03-177129addcc5","resolution":{"observed_at":"2026-08-07T06:02:25.684162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.25886","last_updated":"2026-07-28T15:46:41Z","snapshot_observed_at":"2026-08-07T09:45:34.637759Z","submitted_at":"2026-07-28T15:46:41Z","title":"RSIBench-Data: Benchmarking Data-Centric Research for Recursive Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.25886","snapshot_observed_at":"2026-08-07T06:02:25.689165Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.689165Z"},"links":{"cited_paper":"/paper/2607.25886","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:90252c8a5e8af3baca63800add0fe32df80ab0439061f16925d39e032de059d9","observation_id":"59ab5bed-bff7-4a79-bee9-45284fe28a2e","resolution":{"observed_at":"2026-08-07T06:02:25.689165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-07T06:02:25.694406Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.694406Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5b986e787506b72c7e5a94186aed20d77cb17017d6a1143a4f2c5c6cdf23a38e","observation_id":"7a5ea708-3a4e-48e5-a781-7d8f087d9d65","resolution":{"observed_at":"2026-08-07T06:02:25.694406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12983","last_updated":"2023-11-21T20:34:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-21T20:34:47Z","title":"GAIA: a benchmark for General AI Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12983","snapshot_observed_at":"2026-08-07T06:02:25.699110Z","title":"Mialon, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.699110Z"},"links":{"cited_paper":"/paper/2311.12983","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:dc646f3fa5ed10d87dc57c433ae0e8102dcb2e4659f0fe5591f825ffc5d82368","observation_id":"832e847c-45be-4983-ae0d-e267fdca825c","resolution":{"observed_at":"2026-08-07T06:02:25.699110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13131","last_updated":"2025-06-16T06:37:18Z","snapshot_observed_at":"2026-08-07T04:21:43.190472Z","submitted_at":"2025-06-16T06:37:18Z","title":"AlphaEvolve: A coding agent for scientific and algorithmic discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13131","snapshot_observed_at":"2026-08-07T06:02:25.704618Z","title":"Novikov, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.704618Z"},"links":{"cited_paper":"/paper/2506.13131","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:51067372a414858805dc0f851368ceddcb67071e0f1040259170411aec36f431","observation_id":"ac423a22-3cfe-41b3-918c-a10db151494c","resolution":{"observed_at":"2026-08-07T06:02:25.704618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.710081Z","title":"Opsahl-Ong, A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.710081Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:c9d6251fa5e66cbadba2e8ab59c037ac4d1a7c6d25192627492f53a8f4052306","observation_id":"6d6365fd-311e-4770-9698-675129b7400d","resolution":{"observed_at":"2026-08-07T06:02:25.710081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.768056Z","title":"Ouyang, S","venue":null,"work_id":"2d14fedb-b211-4bcd-a69e-124a2473e251","year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.714285Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:bd2bc15f512e6c19714aed0dc992ee5e0688b171e916b11cddccd58830f837ad","observation_id":"ad972446-d52d-4349-a01d-73c312377a8b","resolution":{"observed_at":"2026-08-07T06:02:26.773465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.718442Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.718442Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:69717e90e61879e973bbcdbf3781c7cec4bd8b136aa1cb152fb779da87f30bcd","observation_id":"6a3d847d-bc83-419c-ba9a-46bfdafc02e9","resolution":{"observed_at":"2026-08-07T06:02:25.718442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.731989Z","title":"Romera-Paredes, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.731989Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:f328ab05836e940731a862bbfa8d74af2ad81eb11999527482466547e177c404","observation_id":"f8c1677d-df60-4c64-b1d0-0381581b932d","resolution":{"observed_at":"2026-08-07T06:02:25.731989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.749683Z","title":"Ursekar, A","venue":null,"work_id":"cea1ff54-a28b-4b01-bc9c-cd049c34e488","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.736276Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:ca76405f78d5b223a58ae4672dc1377debb5927d0d76e7cc56f40fe22633010b","observation_id":"72fcfa4e-52d1-4680-a932-1113a7b1aafa","resolution":{"observed_at":"2026-08-07T06:02:26.755690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.732690Z","title":null,"venue":null,"work_id":"02492c75-a73d-45e8-879a-885718471c28","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.740882Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:78d16621d1f4902ab589f60d7b09e7e29f24991dbbb2462b4f3db6dcb542fb27","observation_id":"8c554198-4a8f-4996-add4-14b687b00309","resolution":{"observed_at":"2026-08-07T06:02:26.737554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.745383Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.745383Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5b71a646172188753ebd9b0d15ee96a65b2704151ce29e893cf9405464144934","observation_id":"6b69b85f-28e1-4de3-95f4-1ebd8cd4499e","resolution":{"observed_at":"2026-08-07T06:02:25.745383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.709432Z","title":null,"venue":null,"work_id":"69a33e2e-4e79-4355-a79c-aaa5309ab4be","year":2023},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.749972Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:e63e8fd565b05ff7305a49fc552f7a11169f90d2da6bcadf47bf76b430235a5a","observation_id":"5957b07f-23e7-492c-bfc7-8ae6bb7b80b7","resolution":{"observed_at":"2026-08-07T06:02:26.716924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.685758Z","title":null,"venue":null,"work_id":"d691aa0b-3b5d-4909-9075-38afc0d7b196","year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.754561Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5375d11e7fa3d11957a5d4cacf45c53f062605377a1df907d2bccfbfcafe8560","observation_id":"5cadbf08-4f74-4106-b420-6f947be9a055","resolution":{"observed_at":"2026-08-07T06:02:26.692576Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-01T07:23:06.300790Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-07T06:02:25.759327Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.759327Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:5ccf54b70d29907b50d6fe8094b230763e6c287aea2ca341d005f71c6d42ad8a","observation_id":"c3ee986a-611a-463a-941e-2e856cb77cad","resolution":{"observed_at":"2026-08-07T06:02:25.759327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.663443Z","title":null,"venue":null,"work_id":"398debcc-1e4a-4652-b6bf-c8a8600bcd97","year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.763834Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:bb3f538b0c7fe7d79ba03751fbd01d3d87740c5e0d3d9cc8dca0e663314360d7","observation_id":"db2fe2c1-8763-4894-8e1e-9ca36870d67f","resolution":{"observed_at":"2026-08-07T06:02:26.671001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27922","last_updated":"2026-05-27T03:47:35Z","snapshot_observed_at":"2026-08-05T01:33:47.362496Z","submitted_at":"2026-05-27T03:47:35Z","title":"Harness-Bench: Measuring Harness Effects across Models in Realistic Agent Workflows","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.27922","snapshot_observed_at":"2026-08-07T06:02:25.768245Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.768245Z"},"links":{"cited_paper":"/paper/2605.27922","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:aae7507d58272227fd3b420cdc92fb6ab4a89ed389fddf026043006418b0f8e0","observation_id":"f0aa53e8-970e-4a68-b894-3261e7658649","resolution":{"observed_at":"2026-08-07T06:02:25.768245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:25.772900Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.772900Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:292df4448bc2ea3d350eed2188693f1865425c4d94ae9de6c6e3b8275d1d0032","observation_id":"07ccd406-2445-4169-8b89-6f761f2e1fb8","resolution":{"observed_at":"2026-08-07T06:02:25.772900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04444","last_updated":"2025-05-31T07:33:17Z","snapshot_observed_at":"2026-08-03T21:44:57.583731Z","submitted_at":"2024-10-06T10:49:40Z","title":"G\\\"odel Agent: A Self-Referential Agent Framework for Recursive Self-Improvement","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04444","snapshot_observed_at":"2026-08-07T06:02:25.787406Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.787406Z"},"links":{"cited_paper":"/paper/2410.04444","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:c7ccc9ed11a3c51dff870fcbb5604c8de9fba75c694c2f347b1e66064e92784d","observation_id":"5853d2ef-5886-4c79-908a-c3d9a07ba557","resolution":{"observed_at":"2026-08-07T06:02:25.787406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07496","snapshot_observed_at":"2026-08-07T06:02:25.793445Z","title":"differentiation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.793445Z"},"links":{"cited_paper":"/paper/2406.07496","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:8b38acd24b56d62785094d4fc417d79a3387b368901a49f4cd183dc029166d9a","observation_id":"fd38340b-54e5-4194-bb30-b1108b5bc95d","resolution":{"observed_at":"2026-08-07T06:02:25.793445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.642320Z","title":"Zelikman, E","venue":null,"work_id":"b84c669e-4d63-460b-ac0a-a5d534dcf5af","year":2024},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.799359Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:d73c21d002e39b4d06f4ae139d38de4f742421842f32b4d14bdc598e463ee352","observation_id":"8b7b2ce4-092c-41fe-8d39-6e49194a1169","resolution":{"observed_at":"2026-08-07T06:02:26.647834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16673","last_updated":"2025-01-30T16:40:12Z","snapshot_observed_at":"2026-08-06T08:29:39.486028Z","submitted_at":"2025-01-28T03:18:48Z","title":"LLM-AutoDiff: Auto-Differentiate Any LLM Workflow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16673","snapshot_observed_at":"2026-08-07T06:02:25.783053Z","title":"14 Scale AI Research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.783053Z"},"links":{"cited_paper":"/paper/2501.16673","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:e1519cfec19a4b712763f57664d59f38f4e883a11acd6c87abcf1c67a2be722d","observation_id":"fc3bd319-50f2-4c22-b079-517dfd5d96b7","resolution":{"observed_at":"2026-08-07T06:02:25.783053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:02:26.625049Z","title":"Zhang, J","venue":null,"work_id":"8a00ebce-f621-484f-a9f1-3b60d88403e7","year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.809069Z"},"links":{"citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:d4eeda7c9812765a8acbafc1a44a89c7755b6fd095bbe0539e371e99dfb61e84","observation_id":"e86ce37a-0105-4da9-9a23-55caca814dba","resolution":{"observed_at":"2026-08-07T06:02:26.629708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23950","last_updated":"2026-05-07T15:24:59Z","snapshot_observed_at":"2026-08-03T13:44:55.519841Z","submitted_at":"2026-05-07T15:24:59Z","title":"Stop Comparing LLM Agents Without Disclosing the Harness","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23950","snapshot_observed_at":"2026-08-07T06:02:25.819108Z","title":"closer together than re-running the grid moves them","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.819108Z"},"links":{"cited_paper":"/paper/2605.23950","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:0a246a84272a8b57a560888e5c1d2079c108a19fdd53716a292a26aabb29d5e3","observation_id":"0382457f-3707-41e7-b59a-3175ac6c7b7c","resolution":{"observed_at":"2026-08-07T06:02:25.819108Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22954","last_updated":"2026-03-12T23:47:40Z","snapshot_observed_at":"2026-07-06T21:32:33.515702Z","submitted_at":"2025-05-29T00:26:15Z","title":"Darwin Godel Machine: Open-Ended Evolution of Self-Improving Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22954","snapshot_observed_at":"2026-08-07T06:02:25.804071Z","title":"Zhang, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.804071Z"},"links":{"cited_paper":"/paper/2505.22954","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:47170204f6a341cbe553f39659c75448ed7772ef17fb07ecc68dad24092854f0","observation_id":"73f9813b-71b4-42ab-adfc-fa76a52057a8","resolution":{"observed_at":"2026-08-07T06:02:25.804071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10762","last_updated":"2025-04-15T02:44:55Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:40:40Z","title":"AFlow: Automating Agentic Workflow Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10762","snapshot_observed_at":"2026-08-07T06:02:25.813777Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.813777Z"},"links":{"cited_paper":"/paper/2410.10762","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:cf0696f0f4cdbfd1394566e2d6dd1864d87151115fe55fc4efa240255b3db5b9","observation_id":"9aa97db2-102f-483b-9dd4-c900c79cfe0e","resolution":{"observed_at":"2026-08-07T06:02:25.813777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T06:02:25.635628Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.635628Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:139633fe07e12072947881334b53f97d43a1cc9489972788ac42e2390632aa41","observation_id":"f1e92752-39a5-4a6e-98a4-f093a899e2ea","resolution":{"observed_at":"2026-08-07T06:02:25.635628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-07T06:02:25.664469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.664469Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:b291fc414bff6e214051721e86b20157a2980a59d755201de6b8cff302f9da9d","observation_id":"234b9e0a-50f4-453b-8d80-4979d8b30ea7","resolution":{"observed_at":"2026-08-07T06:02:25.664469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15228","last_updated":"2025-05-16T20:58:56Z","snapshot_observed_at":"2026-08-07T16:00:31.124805Z","submitted_at":"2025-04-21T16:58:18Z","title":"A Self-Improving Coding Agent","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15228","snapshot_observed_at":"2026-08-07T06:02:25.727335Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T06:02:25.727335Z"},"links":{"cited_paper":"/paper/2504.15228","citing_paper":"/paper/2608.06301"},"observation_digest":"sha256:4d6484816b75583a77849f913c3c645a8fa1d47adb54b210a510134d7edf05cf","observation_id":"5ae73031-9670-42b4-b8d3-9d6859d5658e","resolution":{"observed_at":"2026-08-07T06:02:25.727335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06301","last_updated":"2026-08-06T17:21:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T15:35:19.081205Z","submitted_at":"2026-08-06T17:21:05Z","title":"HarnessOpt-Bench: Evaluating LLMs at Harness Optimization"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2608.06301."}