{"as_of":"2026-08-06T21:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aa01bc73c9572bd5457764025da518fe353b6bcf44e9c330d72f6141e3ed8262","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":92,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:12:29.973349Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":24,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2506.22598","last_updated":"2026-04-21T20:17:15Z","snapshot_observed_at":"2026-08-03T23:13:09.503654Z","submitted_at":"2025-06-27T19:41:41Z","title":"RExBench: Can coding agents autonomously implement AI research extensions?","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T07:33:39.675929Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2506.22598"},"observation_digest":"sha256:7ffa0fcd0fdce65b8ed4af23bb8ba688d5ba83fa4fb3f5bcbddfa09339bf241c","observation_id":"2b502811-4942-428e-86a9-5d4dfe898868","resolution":{"observed_at":"2026-05-19T07:37:08.857659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T18:12:29.973349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.09089","last_updated":"2025-07-25T00:43:07Z","snapshot_observed_at":"2026-08-06T18:02:32.676640Z","submitted_at":"2025-07-12T00:16:33Z","title":"Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:12:29.973349Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.09089"},"observation_digest":"sha256:09b1e552ebe5f5be74ecbb55325633c2b247d8ca24bb988a736759b27c801ea0","observation_id":"67142ef4-7af1-4e38-b009-ac8717362e4a","resolution":{"observed_at":"2026-08-06T18:12:29.973349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T15:17:53.470087Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.16280","last_updated":"2025-07-22T06:51:26Z","snapshot_observed_at":"2026-08-06T15:11:21.494236Z","submitted_at":"2025-07-22T06:51:26Z","title":"ResearcherBench: Evaluating Deep AI Research Systems on the Frontiers of Scientific Inquiry","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:17:53.470087Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.16280"},"observation_digest":"sha256:141c127776862ac00b149fd0aee3e2db716c6ead98b7686097420664fe699eee","observation_id":"8435c964-b386-4800-90ca-3ce4dfea7ddb","resolution":{"observed_at":"2026-08-06T15:17:53.470087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T14:59:40.491746Z","title":"S.; Maksin, L.; Dias, R.; Mays, E.; Kinsella, B.; Thompson, W.; et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.17186","last_updated":"2025-07-31T08:14:21Z","snapshot_observed_at":"2026-08-06T14:52:40.738276Z","submitted_at":"2025-07-23T04:19:16Z","title":"FinGAIA: A Chinese Benchmark for AI Agents in Real-World Financial Domain","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T14:59:40.491746Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.17186"},"observation_digest":"sha256:ba5d0f8be3ee0b72f7e04dea23998324efdeb1ad68a4514cf1365330dfa26498","observation_id":"a499560a-949c-4d55-9455-0d36b8774fea","resolution":{"observed_at":"2026-08-06T14:59:40.491746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T14:22:31.521193Z","title":"Paperbench: Evaluating ai's ability to replicate ai research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19477","last_updated":"2025-07-25T17:59:13Z","snapshot_observed_at":"2026-08-06T14:22:15.971521Z","submitted_at":"2025-07-25T17:59:13Z","title":"Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T14:22:31.521193Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.19477"},"observation_digest":"sha256:3684c3ebe9cecff40a1f5cf65e71290063b00ca3422fde1f019629998c768ef7","observation_id":"49d2a624-c4fe-4a6f-9b92-e73c5df55f1a","resolution":{"observed_at":"2026-08-06T14:22:31.521193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-10T17:49:27.926646Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.20534"},"observation_digest":"sha256:ecc5ab1d5df01eef7434398a825777d982119491fc50ab1ff232a0fce5f10435","observation_id":"1522369f-a2ac-412c-b1c6-3b185221915b","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T12:44:21.776309Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21504","last_updated":"2025-07-29T04:57:02Z","snapshot_observed_at":"2026-08-06T15:35:42.279155Z","submitted_at":"2025-07-29T04:57:02Z","title":"Evaluation and Benchmarking of LLM Agents: A Survey","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-06T12:44:21.776309Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.21504"},"observation_digest":"sha256:4aac23f7a400edf4c971f045eebce0d7b7f84f684494ef1a339a883ceb4ae08d","observation_id":"efe2d978-22e7-4464-9c6b-3e8158d9a37f","resolution":{"observed_at":"2026-08-06T12:44:21.776309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T10:55:15.021219Z","title":"Paperbench: Evaluating ai's ability to replicate ai research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23276","last_updated":"2025-08-01T12:49:36Z","snapshot_observed_at":"2026-08-06T10:54:57.937285Z","submitted_at":"2025-07-31T06:32:06Z","title":"How Far Are AI Scientists from Changing the World?","version":2},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-06T10:55:15.021219Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.23276"},"observation_digest":"sha256:b6684bf7f16f146fffcfdcfded8d87b3d277f48a19a84a4bf5e8b14b9944d26a","observation_id":"899640bd-8c91-443e-b784-8e78d7700c19","resolution":{"observed_at":"2026-08-06T10:55:15.021219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T10:32:33.675992Z","title":"Jason Wei, Zhiqing Sun, Spencer Papay, Scott McKinney, Jeffrey Han, Isa Fulford, Hyung Won Chung, Alex Tachard Passos, William Fedus, and Amelia Glaese","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23701","last_updated":"2025-08-13T17:45:14Z","snapshot_observed_at":"2026-08-06T10:32:32.518490Z","submitted_at":"2025-07-31T16:22:55Z","title":"TextQuests: How Good are LLMs at Text-Based Video Games?","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:33.675992Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2507.23701"},"observation_digest":"sha256:4e817d5c1cb46a9daacbbc7919ad710100b9dd0928d0b918947e4e53a6965dc3","observation_id":"cf4fa4a3-6d43-4ab8-b363-b39db566f4f3","resolution":{"observed_at":"2026-08-06T10:32:33.675992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T15:53:54.201712Z","title":"Starace, O","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19461","last_updated":"2025-08-26T22:29:31Z","snapshot_observed_at":"2026-08-06T04:54:53.822239Z","submitted_at":"2025-08-26T22:29:31Z","title":"Reliable Weak-to-Strong Monitoring of LLM Agents","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T15:53:54.201712Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2508.19461"},"observation_digest":"sha256:deff9d5627d87b5132b617ed05af312261fcee42b7d8db63e0d77b8b40300e33","observation_id":"40a1eb17-837a-427d-8003-8dbac838c2ca","resolution":{"observed_at":"2026-08-05T15:53:54.201712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T14:21:48.654747Z","title":"PaperBench: A Rubric-based Benchmark for Scientific Paper Summarization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.02594","last_updated":"2026-07-27T13:01:03Z","snapshot_observed_at":"2026-08-05T14:21:46.209025Z","submitted_at":"2025-08-29T09:51:41Z","title":"OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:21:48.654747Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2509.02594"},"observation_digest":"sha256:18bc043623d6c3afa07c29040a383a15b25735ea524a658b1331ad67d9662d04","observation_id":"b1c8718a-f500-42f2-80f9-5492d1609b8e","resolution":{"observed_at":"2026-08-05T14:21:48.654747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2509.11206","last_updated":"2026-04-20T05:43:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-14T10:24:13Z","title":"Evalet: Evaluating Large Language Models through Functional Fragmentation","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-18T16:57:25.259866Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2509.11206"},"observation_digest":"sha256:b04cff414bcf9bb78449f08a8246a7e03e434e22bdfed1e0cab9742ec8ae765c","observation_id":"22a6f9bc-c61a-4b15-9237-0f9624ff9a67","resolution":{"observed_at":"2026-05-18T17:01:39.890501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2509.20374","last_updated":"2026-04-26T17:39:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T22:21:26Z","title":"CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T15:05:37.519850Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2509.20374"},"observation_digest":"sha256:01ad167f6c03b396744a34966f653547dd7c2b516a5d53702aca8b748b071d54","observation_id":"36bd4472-ea6f-49ec-a2c2-f999fbe9401b","resolution":{"observed_at":"2026-05-18T15:06:32.139371Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-04T10:36:24.531675Z","title":"Jaffe, D","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.09517","last_updated":"2026-07-02T09:56:45Z","snapshot_observed_at":"2026-08-04T10:36:20.713563Z","submitted_at":"2025-10-10T16:28:43Z","title":"StatEval: A Comprehensive Benchmark for Large Language Models in Statistics","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T10:36:24.531675Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2510.09517"},"observation_digest":"sha256:f56477301f71e5fe241a4fbdfffb5ff6b66d2bc80e2aa52d5e2b069f1f12057f","observation_id":"c900501e-0855-41ed-9663-22471c67a678","resolution":{"observed_at":"2026-08-04T10:36:24.531675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-04T09:22:44.150906Z","title":"Paperbench: Evaluating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-05T08:56:19.289886Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:44.150906Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:2b25fafc7418430f2782be61978b49d422be8d339291a5f9a874905c93d3c6a1","observation_id":"96fb2987-9169-495a-9dff-6ae253a63d3b","resolution":{"observed_at":"2026-08-04T09:22:44.150906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2510.24428","last_updated":"2026-04-04T09:39:50Z","snapshot_observed_at":"2026-07-06T22:34:18.297603Z","submitted_at":"2025-10-28T13:52:46Z","title":"CodeWiki: Evaluating AI's Ability to Generate Holistic Documentation for Large-Scale Codebases","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T03:10:21.188635Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2510.24428"},"observation_digest":"sha256:dace258fc8b565cdcd4f848fd14503e81c22db7368a9b944e42c671b2d9a7855","observation_id":"70a7171b-9d98-42ab-99bd-a8521a871200","resolution":{"observed_at":"2026-05-18T03:10:48.468533Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-03T14:34:51.330668Z","title":"Fahim Tajwar, Yiding Jiang, Abitha Thankaraj, Sumaita Sadia Rahman, J Zico Kolter, Jeff Schneider, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20111","last_updated":"2026-06-04T03:41:38Z","snapshot_observed_at":"2026-08-03T14:34:47.811827Z","submitted_at":"2025-12-23T07:11:26Z","title":"ABBEL: Learning Natural-Language Belief States for Memory-Efficient Interaction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T14:34:51.330668Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2512.20111"},"observation_digest":"sha256:8ae5facc1ae341b05b67db3d840044e75c7f5e2fcf1ff5460000bd049fad5160","observation_id":"4a526915-422d-4a4e-87ac-7c9c060f66d3","resolution":{"observed_at":"2026-08-03T14:34:51.330668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2602.00052","last_updated":"2026-04-16T23:03:18Z","snapshot_observed_at":"2026-07-06T22:43:45.998263Z","submitted_at":"2026-01-19T18:38:36Z","title":"AI-assisted Protocol Information Extraction For Improved Accuracy and Efficiency in Clinical Trial Workflows","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T12:52:48.443287Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.00052"},"observation_digest":"sha256:a4d0219f4c48142c74645bf9513f3e7da64324b4db9a035e32da90a40e75fca5","observation_id":"95b8e48d-112c-479c-aebb-8c185ebc7ed3","resolution":{"observed_at":"2026-05-16T12:52:53.260889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-07-06T22:44:09.804048Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:524e8524adf03f8ca37a2f9801f3102843fe316fd518c9d5075c8bc5b6cdd0de","observation_id":"6219e2b6-7f02-4af3-ab03-ff06febf5b53","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-03T05:17:18.391571Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.02905","last_updated":"2026-07-10T18:07:40Z","snapshot_observed_at":"2026-08-03T10:58:28.649766Z","submitted_at":"2026-02-02T23:21:13Z","title":"FIRE-Bench: Evaluating AI Agents on the Rediscovery of Scientific Insights","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T05:17:18.391571Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.02905"},"observation_digest":"sha256:4207ba03c3975861e105fbcc61baa2bf001c4de36d3e556e07c1485719b5aba6","observation_id":"65a82c89-567e-44b8-82cd-f489ab58f16c","resolution":{"observed_at":"2026-08-03T05:17:18.391571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2602.08561","last_updated":"2026-04-23T07:57:30Z","snapshot_observed_at":"2026-07-06T22:45:05.823859Z","submitted_at":"2026-02-09T11:59:59Z","title":"Automating Computational Reproducibility in Social Science: Comparing Prompt-Based and Agent-Based Approaches","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T05:55:48.203213Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.08561"},"observation_digest":"sha256:6f7182f13c12546bb8a845ab0b35923c00e946da455a8936e00bda0ede7acaab","observation_id":"25b70385-4c54-47c5-a026-9f61e93a434c","resolution":{"observed_at":"2026-05-16T05:57:24.419477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2602.11354","last_updated":"2026-04-09T18:26:34Z","snapshot_observed_at":"2026-07-06T22:45:34.674215Z","submitted_at":"2026-02-11T20:42:10Z","title":"ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T02:01:07.555124Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.11354"},"observation_digest":"sha256:b7d12d8bf56af8d5aefd0dd7ccd713007bb56730dacbc6380b1bd3cae1a3ac63","observation_id":"3807827d-d024-4bb4-b443-b9f7ecba8420","resolution":{"observed_at":"2026-05-16T02:02:06.911840Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2602.21480","last_updated":"2026-04-13T13:29:15Z","snapshot_observed_at":"2026-07-06T22:46:58.146051Z","submitted_at":"2026-02-25T01:12:35Z","title":"Both Ends Count! Just How Good are LLM Agents at \"Text-to-Big SQL\"?","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T19:52:53.443887Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.21480"},"observation_digest":"sha256:4d6b43d0f0c85d00992d6b3e50a97acee46f22dc1aebe823bf360c4f76cd10f5","observation_id":"d7b3e0b5-e862-4cb9-b439-5b8bf971e3d1","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T20:09:20.123350Z","title":"Starace, G., Jaffe, O., Sherburn, D., Aung, J., Chan, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24009","last_updated":"2026-07-17T11:02:54Z","snapshot_observed_at":"2026-08-06T18:59:30.903665Z","submitted_at":"2026-02-27T13:32:53Z","title":"Jailbreak Foundry: From Papers to Runnable Attacks for Reproducible Benchmarking","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:09:20.123350Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2602.24009"},"observation_digest":"sha256:1105fff922b4a32af79cd7af78f61c423eb141431d5ac52797f88f40bbee5204","observation_id":"3244be22-c2e9-4041-bf4b-96e80ff2eef1","resolution":{"observed_at":"2026-08-02T20:09:20.123350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-13T20:49:09.477849Z","title":"Paperbench: Evaluating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.21489","last_updated":"2026-07-08T16:30:55Z","snapshot_observed_at":"2026-08-03T00:37:21.202769Z","submitted_at":"2026-03-23T02:26:35Z","title":"Effective Strategies for Asynchronous Software Engineering Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T20:49:09.477849Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2603.21489"},"observation_digest":"sha256:33f0a3c5e38d92bf10cd4cd1e3fcf8e6eefff0f010ca7d73edff976f52940a16","observation_id":"3de791bc-76f8-471f-a1fc-dd9f7f0c117c","resolution":{"observed_at":"2026-07-13T20:49:09.477849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.00149","last_updated":"2026-05-10T06:05:55Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T18:56:37Z","title":"Towards Verifiable and Self-Correcting AI Physicists for Quantum Many-Body Simulations","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T22:33:21.677835Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.00149"},"observation_digest":"sha256:92d54e79a587037c9b7602f590e6b691c59ebe77e4c9f2e4b087ed7a5102742c","observation_id":"ae4649b9-597b-4055-9f3d-ff1525f6b71a","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.04074","last_updated":"2026-04-07T17:20:55Z","snapshot_observed_at":"2026-07-06T22:53:06.517678Z","submitted_at":"2026-04-05T11:45:22Z","title":"FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T17:32:06.864338Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.04074"},"observation_digest":"sha256:c698fd622128bd825169aa74c65e115686181e28bf4c86562f0f03143404aa2f","observation_id":"8c9caef3-ccad-4c8e-8b46-4458463f9369","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.04324","last_updated":"2026-04-06T00:13:14Z","snapshot_observed_at":"2026-07-06T22:53:20.122451Z","submitted_at":"2026-04-06T00:13:14Z","title":"RESCORE: LLM-Driven Simulation Recovery in Control Systems Research Papers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T20:26:34.666529Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.04324"},"observation_digest":"sha256:4255be947fa5539c5be39b8b1c460d851882df2d69ea05cfcfd0fb885b2b9af2","observation_id":"84fbb1f2-2e1b-48dc-adfa-dd36c1863a5e","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.05550","last_updated":"2026-05-25T14:50:02Z","snapshot_observed_at":"2026-07-13T09:23:35.944049Z","submitted_at":"2026-04-07T07:52:01Z","title":"AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:43:51.525392Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.05550"},"observation_digest":"sha256:f40e17df0296a587cf3d0482ffee095b31857492e271d6ec6e1c3419ca86f710","observation_id":"cbe5905c-3a12-4fb1-a183-b7cdfc493527","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-13T09:23:40.328143Z","title":"Paperbench: Evaluating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.05550","last_updated":"2026-05-25T14:50:02Z","snapshot_observed_at":"2026-07-13T09:23:35.944049Z","submitted_at":"2026-04-07T07:52:01Z","title":"AutoSOTA: An End-to-End Automated Research System for State-of-the-Art AI Model Discovery","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T09:23:40.328143Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.05550"},"observation_digest":"sha256:3d16020c3ceb6fef3da329e0514b5780cf2cf26c2a96cc0ca7190cb94a4b04dc","observation_id":"efd323f0-d183-439d-a4f0-42d244a41afb","resolution":{"observed_at":"2026-07-13T09:23:40.328143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.06169","last_updated":"2026-04-07T17:59:44Z","snapshot_observed_at":"2026-08-03T02:43:13.230039Z","submitted_at":"2026-04-07T17:59:44Z","title":"In-Place Test-Time Training","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T19:07:47.174513Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.06169"},"observation_digest":"sha256:d700c0f8e098a15c866a09444c658fe24c2e024ca62b563d8282e6c50bf516a9","observation_id":"eae98230-2d11-4743-a694-031fae0fe70e","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-06T21:25:34.517626Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:18:19.955943Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:8184e34ab16c9774d5b29b0656c48fbea2ba8500f0e83fed247051818018b7f9","observation_id":"e372a679-17b7-4c3b-aae9-a8073b83ed22","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T16:40:55.451453Z","title":"Paperbench: Evalu- ating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-06T21:25:34.517626Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T16:40:55.451453Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:a385d38c0f4811ddae9006dff53a5946c7747196c00b8608e5a26532ddc768cd","observation_id":"15e27c42-deb5-4175-92d3-446cf491b2b5","resolution":{"observed_at":"2026-08-02T16:40:55.451453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-04T05:36:43.369991Z","title":"Paperbench: Evalu- ating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.06996","last_updated":"2026-08-03T11:57:08Z","snapshot_observed_at":"2026-08-06T21:25:34.517626Z","submitted_at":"2026-04-08T12:13:53Z","title":"Self-Preference Bias in Rubric-Based Evaluation of Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T05:36:43.369991Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.06996"},"observation_digest":"sha256:5ffbbbec23216b779db65ff70abfeaa900d64cc521d3c84061fac9e260776efe","observation_id":"ab41ee1a-3c78-40c2-befb-1f1ae075a3d3","resolution":{"observed_at":"2026-08-04T05:36:43.369991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.11270","last_updated":"2026-07-30T10:58:23Z","snapshot_observed_at":"2026-08-02T23:57:43.901147Z","submitted_at":"2026-04-13T10:24:28Z","title":"Evaluating LLM Agents on Automated Software Analysis Tasks","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-10T16:38:12.144252Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.11270"},"observation_digest":"sha256:9310f2d71c0b9658dc35940b968159e84b62ece3f76c5160552403d9b747ff8b","observation_id":"33acf2d8-89e2-434a-8357-247ae7b0d8f8","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T16:27:44.960426Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.11270","last_updated":"2026-07-30T10:58:23Z","snapshot_observed_at":"2026-08-02T23:57:43.901147Z","submitted_at":"2026-04-13T10:24:28Z","title":"Evaluating LLM Agents on Automated Software Analysis Tasks","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T16:27:44.960426Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.11270"},"observation_digest":"sha256:cca1d744e0f9434df187228c34b57ac00f6dae69148aade2bab921e89ffb8996","observation_id":"ac3f8fc7-f40b-4efe-8506-39a8a68c303a","resolution":{"observed_at":"2026-08-02T16:27:44.960426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.12290","last_updated":"2026-04-27T16:57:20Z","snapshot_observed_at":"2026-08-05T14:13:55.019169Z","submitted_at":"2026-04-14T05:02:06Z","title":"Frontier-Eng: Benchmarking Self-Evolving Agents on Real-World Engineering Tasks with Generative Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:32.290531Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.12290"},"observation_digest":"sha256:2449034642a2c84ee1a8c7fa1b1cc4efe232e09ca439915c896bef6028603f6d","observation_id":"94eba6f1-b62f-41a1-810b-cec001c75c3a","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.17406","last_updated":"2026-07-01T09:10:53Z","snapshot_observed_at":"2026-08-06T20:50:24.820204Z","submitted_at":"2026-04-19T12:26:05Z","title":"EvoMaster: A Foundational Evolving Agent Framework for Agentic Science at Scale","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-05T17:45:55.631459Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.17406"},"observation_digest":"sha256:488cb19a1dfe04205f41ecd0405d075947a11f452685b827e1aa3fdb8f404618","observation_id":"986f8cfb-5031-4f01-9f0f-d1f5349f97c3","resolution":{"observed_at":"2026-07-05T17:51:14.819303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.19341","last_updated":"2026-04-21T11:24:09Z","snapshot_observed_at":"2026-07-06T23:06:02.635464Z","submitted_at":"2026-04-21T11:24:09Z","title":"Evaluation-driven Scaling for Scientific Discovery","version":1},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-10T03:39:52.204043Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.19341"},"observation_digest":"sha256:5c798cb4ff6913aef49726cff20a98d598fba0a4e79f8a3b0d19cf7b2ddae295","observation_id":"4ec1fb92-a8c8-4ca0-8b67-545666e3c670","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2604.24966","last_updated":"2026-04-27T20:07:09Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T20:07:09Z","title":"Risk Reporting for Developers' Internal AI Model Use","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T17:47:21.321820Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2604.24966"},"observation_digest":"sha256:3011da12963108a0c3e2716356fadc0bd2ed63868d8a7401ade6a8f4d83dc203","observation_id":"f61364c0-76bc-4c06-950e-5273f72fbc45","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.02651","last_updated":"2026-05-14T18:08:35Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:34:36Z","title":"ARA: Agentic Reproducibility Assessment For Scalable Support Of Scientific Peer-Review","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-08T01:46:17.836724Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.02651"},"observation_digest":"sha256:7e111cfa60b5c174214dcd977c1fa920daa698c62532a6f31314b83ed7625c97","observation_id":"69210352-567a-4317-a497-3cdbf5d1be51","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.02651","last_updated":"2026-05-14T18:08:35Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:34:36Z","title":"ARA: Agentic Reproducibility Assessment For Scalable Support Of Scientific Peer-Review","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-19T17:14:18.558837Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.02651"},"observation_digest":"sha256:407a3d62744e84ac97313fb8bec923698bc4f1ff97a1dfeadb18300ec2a883a3","observation_id":"9e73d574-d455-423e-a21d-523752807a52","resolution":{"observed_at":"2026-05-19T17:17:42.608991Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.02661","last_updated":"2026-05-04T14:40:42Z","snapshot_observed_at":"2026-07-06T23:15:41.793878Z","submitted_at":"2026-05-04T14:40:42Z","title":"AcademiClaw: When Students Set Challenges for AI Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-08T19:24:29.696454Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.02661"},"observation_digest":"sha256:48b11634dde2fc5967ce3d9e31d26d0319a6f8a9485aef5e92a221c304dafc1d","observation_id":"f0a159e8-6ab8-4324-9baf-ba3000436cc0","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.06607","last_updated":"2026-05-12T22:57:53Z","snapshot_observed_at":"2026-07-06T23:19:00.794334Z","submitted_at":"2026-05-07T17:27:23Z","title":"AI CFD Scientist: Toward Open-Ended Computational Fluid Dynamics Discovery with Physics-Aware AI Agents","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-14T22:02:47.160731Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.06607"},"observation_digest":"sha256:0c29ada5fdb5f01b8547529c0030c04a54870c78ac6e5be32af690f14db42e11","observation_id":"534dd0cc-5f37-46c8-bc61-7783b7d7672b","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.12808","last_updated":"2026-05-14T01:55:46Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:00:18Z","title":"Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-14T20:23:34.514071Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.12808"},"observation_digest":"sha256:ec09d9472447bbb87a70ed18437ee6ba756cb96064c62c3fb492e6566f2bfea4","observation_id":"95fc485e-4eec-4430-91b9-8f5d212912bb","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.12808","last_updated":"2026-05-14T01:55:46Z","snapshot_observed_at":"2026-07-06T23:24:27.821980Z","submitted_at":"2026-05-12T23:00:18Z","title":"Neurodata Without Boredom: Benchmarking Agentic AI for Data Reuse","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-15T04:51:17.519200Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.12808"},"observation_digest":"sha256:d6da5210626a58872b27c77d89e3a2232f08490457812147e0e4a378693b744f","observation_id":"5836dd27-66f0-4ea9-ae33-6867c4ed5422","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.13275","last_updated":"2026-05-13T09:54:06Z","snapshot_observed_at":"2026-08-02T21:22:35.996632Z","submitted_at":"2026-05-13T09:54:06Z","title":"ReproScore: Separating Readiness from Outcome in Research Software Reproducibility Assessment","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-14T18:27:14.564913Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.13275"},"observation_digest":"sha256:e3667ba593ddf6ca8df9e5c6b7f3b4ad5a5c29ba26fb7d90bfeabc3dc2f49a28","observation_id":"8e783be1-9655-437b-bdc2-25206bfc59d3","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.13950","last_updated":"2026-05-13T18:00:00Z","snapshot_observed_at":"2026-08-01T16:09:17.962725Z","submitted_at":"2026-05-13T18:00:00Z","title":"Collider-Bench: Benchmarking AI Agents with Particle Physics Analysis Reproduction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T06:04:03.605898Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.13950"},"observation_digest":"sha256:07b17432ac3589e5b91782f6abe8b28928b1c99d843159a1a1b513c982ee7518","observation_id":"379b324d-dd7f-40a3-abdd-e8396e169081","resolution":{"observed_at":"2026-05-15T20:09:35.570850Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.15871","last_updated":"2026-05-15T11:40:41Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T11:40:41Z","title":"Agentic Discovery of Neural Architectures: AIRA-Compose and AIRA-Design","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-20T18:58:11.197587Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.15871"},"observation_digest":"sha256:52ef449ecdd9aaca1177e37897252e207981196bcf77ddbf6f5542f94f71d9b6","observation_id":"c0d11633-060a-4552-86a7-6738dc104871","resolution":{"observed_at":"2026-05-20T18:58:53.828922Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.16616","last_updated":"2026-05-15T20:35:32Z","snapshot_observed_at":"2026-07-06T23:27:43.762904Z","submitted_at":"2026-05-15T20:35:32Z","title":"MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T19:59:40.519962Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.16616"},"observation_digest":"sha256:0e5300959fe9eed91bf5989939ff480f3d589e3790d3ff09035a5a176853b31e","observation_id":"f52f1028-c800-40ec-a0c4-f19b8a7aee55","resolution":{"observed_at":"2026-05-20T20:03:44.002213Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.16902","last_updated":"2026-05-16T09:26:08Z","snapshot_observed_at":"2026-07-06T23:27:57.805018Z","submitted_at":"2026-05-16T09:26:08Z","title":"ArtifactLinker: Linking Scientific Artifacts for Automatic State-of-the-Art Discovery","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T20:29:27.398862Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.16902"},"observation_digest":"sha256:cf21c749dad6b080592e927d66ba069b66127b6c349c899b1c17412236306e24","observation_id":"1277a15f-154f-4a4b-9feb-69607a1a3ee0","resolution":{"observed_at":"2026-05-19T20:32:45.507229Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-03T12:30:05.317561Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T12:24:06.062957Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:f1d94f2d4ff1cf2c63a9ee2e724a61a3ce8c7ebeeb07e85f5936c329224d6c4a","observation_id":"f6cd443f-bfed-4275-b35f-2a5fccbb5d97","resolution":{"observed_at":"2026-05-20T12:28:17.244214Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.17637","last_updated":"2026-05-21T20:02:32Z","snapshot_observed_at":"2026-08-03T12:30:05.317561Z","submitted_at":"2026-05-17T20:07:12Z","title":"WebGameBench: Requirement-to-Application Evaluation for Coding Agents via Browser-Native Games","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T05:45:04.573722Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.17637"},"observation_digest":"sha256:f6e0e808e8a0dba4f7180e213bb1c0171193afaf1aa34dcd48f5dd4b90714d8d","observation_id":"0f874185-03d4-4125-88d8-5d71560a1adb","resolution":{"observed_at":"2026-05-25T05:45:23.262252Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.19156","last_updated":"2026-05-18T22:20:33Z","snapshot_observed_at":"2026-08-03T08:44:53.272172Z","submitted_at":"2026-05-18T22:20:33Z","title":"How Far Are We From True Auto-Research?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T09:56:16.160551Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.19156"},"observation_digest":"sha256:572439d279eedd6c786393a958d6c7ef31e07ca014925e7c492b0a0053e654b9","observation_id":"5120d42e-0965-495e-ab34-3fc304e1390d","resolution":{"observed_at":"2026-05-20T09:58:11.246139Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.21413","last_updated":"2026-05-21T09:20:07Z","snapshot_observed_at":"2026-08-03T01:47:24.701499Z","submitted_at":"2026-05-20T17:09:56Z","title":"Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T04:10:37.172329Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.21413"},"observation_digest":"sha256:2c4d405a711db90b3df9865ec2244363cd40c1c1becdfa7ff03feca6820d730b","observation_id":"8100497b-ec48-480f-a262-17c4c2c432d0","resolution":{"observed_at":"2026-05-21T04:13:56.508484Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.21413","last_updated":"2026-05-21T09:20:07Z","snapshot_observed_at":"2026-08-03T01:47:24.701499Z","submitted_at":"2026-05-20T17:09:56Z","title":"Teaching AI Through Benchmark Construction: QuestBench as a Course-Based Practice for Accountable Knowledge Work","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-22T09:42:30.305592Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.21413"},"observation_digest":"sha256:5e6ce987de1da73e8ff2c14866362ad262dc971c96050dbd29f66d6c84cb6768","observation_id":"48493cce-1ff8-4ce0-bb85-0e056ac80b1a","resolution":{"observed_at":"2026-05-22T09:44:45.904629Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.22343","last_updated":"2026-05-21T11:29:08Z","snapshot_observed_at":"2026-08-02T10:20:39.399288Z","submitted_at":"2026-05-21T11:29:08Z","title":"Sibyl-AutoResearch: Autonomous Research Needs Self-Evolving Trial-and-Error Harnesses, Not Paper Generators","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T02:05:05.934682Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.22343"},"observation_digest":"sha256:3f9b0af6571875dd5710a9dc9db205d3567b7b8f0c4120282ae87a31ce9c5e5d","observation_id":"bfff271f-f12a-44a9-95ef-1a83ee0055ab","resolution":{"observed_at":"2026-05-22T02:05:55.413691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.23204","last_updated":"2026-05-22T03:40:30Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T03:40:30Z","title":"AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery","version":1},"reference_index":109,"source":"pdf_text","source_observed_at":"2026-05-25T04:46:43.679185Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.23204"},"observation_digest":"sha256:42b621810d7b5a418748253b4d7f6acc10b40be82a7e92dc392bea43590e6918","observation_id":"d04ba36d-14ee-4c64-b588-5f1c1a9ae2ed","resolution":{"observed_at":"2026-05-25T04:50:21.769927Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.26340","last_updated":"2026-05-25T21:30:27Z","snapshot_observed_at":"2026-07-31T00:39:04.557291Z","submitted_at":"2026-05-25T21:30:27Z","title":"ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-29T21:19:03.281629Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.26340"},"observation_digest":"sha256:7c65de05e6e04f721a474a6c7e3f7a6317d46e821975705a0189ce516df6098e","observation_id":"0077aa23-1c0a-4026-82b1-6e3057abdd98","resolution":{"observed_at":"2026-06-29T21:23:59.092437Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.27492","last_updated":"2026-05-26T16:28:10Z","snapshot_observed_at":"2026-07-31T21:45:32.197960Z","submitted_at":"2026-05-26T16:28:10Z","title":"Benchmarks are Not Enough: RAMP for Runtime Assessing of Agentic Models in Production Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T15:32:21.737028Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.27492"},"observation_digest":"sha256:bdfcb52ea67e14ee7378c3a2a15bcfe33ab5f95ca9a10ebd316bb17047761d7b","observation_id":"f467628d-f6b0-45de-8412-46d4fa7e8630","resolution":{"observed_at":"2026-06-29T15:33:32.787883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2605.28371","last_updated":"2026-05-27T12:11:05Z","snapshot_observed_at":"2026-07-06T23:37:59.285884Z","submitted_at":"2026-05-27T12:11:05Z","title":"From paper to benchmark: agentic, framework-based reproduction of under-specified methods in machine health intelligence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T12:13:58.111299Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2605.28371"},"observation_digest":"sha256:8827ebd9154f5a664bc5198837b114fff9d629327edcc9a5db6afca9fbf9a3ab","observation_id":"4ce54e21-e98a-4489-8ca0-e38ccbf8d100","resolution":{"observed_at":"2026-06-29T12:23:24.635069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.01961","last_updated":"2026-06-03T05:43:27Z","snapshot_observed_at":"2026-07-06T23:42:26.018647Z","submitted_at":"2026-06-01T09:22:55Z","title":"AutoMedBench: Towards Medical AutoResearch with Agentic AI Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.017263Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.01961"},"observation_digest":"sha256:bcc60e531abe42385ae1e003d6b3182a457d9c09056850ad6e9cd8de85ae4599","observation_id":"d0cdbdbb-f07d-48ae-b274-11c0b1372d11","resolution":{"observed_at":"2026-07-01T23:06:21.152849Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.05238","last_updated":"2026-06-03T04:59:34Z","snapshot_observed_at":"2026-08-06T20:20:32.352351Z","submitted_at":"2026-06-03T04:59:34Z","title":"DeployBench: Benchmarking LLM Agents for Research Artifact Deployment","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T05:35:12.027697Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.05238"},"observation_digest":"sha256:3e6359c1ecee6bfddf0c9bc41dc4b85227626af5c96fa8426c752f368a0b1191","observation_id":"badb0b11-bb1d-4423-805a-39697d0a727b","resolution":{"observed_at":"2026-07-02T09:16:49.260505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.05570","last_updated":"2026-06-04T01:42:40Z","snapshot_observed_at":"2026-08-02T22:19:59.617747Z","submitted_at":"2026-06-04T01:42:40Z","title":"TensorBench: Benchmarking Coding Agents on a Compiler-Based Tensor Framework","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T01:55:59.002171Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.05570"},"observation_digest":"sha256:35ccad4b50833e5c39dc4a2447e41f2cee56fbd70905a9ac57bb08e48fb0afc4","observation_id":"b3547529-1383-4498-a1fe-f8ec1d4724c2","resolution":{"observed_at":"2026-07-02T12:46:56.495517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-02T19:22:43.861659Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T08:24:42.412763Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.07591"},"observation_digest":"sha256:514b0f9d6f672926fe90dcdb4e0e86e014475eca4ec47f6283fc6769a672f8c9","observation_id":"0b2b4bfd-f12b-4103-a973-152ea360d8b6","resolution":{"observed_at":"2026-06-29T08:33:15.810705Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.07591","last_updated":"2026-07-03T01:40:25Z","snapshot_observed_at":"2026-08-02T19:22:43.861659Z","submitted_at":"2026-05-28T16:27:40Z","title":"ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-04T00:30:00.449270Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.07591"},"observation_digest":"sha256:b2d0d74cea5d0b76ca6078f2e56c4ba550b9ebcbe6eca7667cece8242f28ab55","observation_id":"35e667e5-c9fa-4d36-bf7e-c7fbec662cfb","resolution":{"observed_at":"2026-07-04T00:39:16.541721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.07683","last_updated":"2026-06-05T01:26:07Z","snapshot_observed_at":"2026-08-03T06:24:18.531148Z","submitted_at":"2026-06-05T01:26:07Z","title":"Review the Code, Not the Story: A Vision and Protocol for Code-First Peer Review","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T21:45:03.399754Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.07683"},"observation_digest":"sha256:607d9804626ba59712dca5b0682dabb7e80d8fa5c90c528f555a942e4e483df2","observation_id":"af0b094a-2dee-4d8f-b78e-e3dd45b8b178","resolution":{"observed_at":"2026-07-02T18:57:17.031265Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.07718","last_updated":"2026-06-05T15:38:18Z","snapshot_observed_at":"2026-07-06T23:47:19.773490Z","submitted_at":"2026-06-05T15:38:18Z","title":"A case study of evaluating AI agents on a neuroscience data-to-discovery pipeline","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.07718"},"observation_digest":"sha256:76783af3bc86cf815d0ca74a76c96e1240c68cfe3514c64505cb6fd69b7a7d5d","observation_id":"c723c8bd-596a-431d-90e8-73dceb3e2ec7","resolution":{"observed_at":"2026-06-27T22:01:20.844772Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.09550","last_updated":"2026-06-08T14:29:40Z","snapshot_observed_at":"2026-07-06T23:48:53.420827Z","submitted_at":"2026-06-08T14:29:40Z","title":"InquiTree: Evaluating AI Agents in the Scientific Inquiry Loop with Paper-Derived Research Trees","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T14:06:59.471772Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.09550"},"observation_digest":"sha256:431a50c8b6929b3573d79da6e9bf4f4f9b137ee541ed69b9d79f839da27844be","observation_id":"5f97e3af-41bd-4c13-8fad-b0bce47408ff","resolution":{"observed_at":"2026-07-03T04:07:37.246876Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.11926","last_updated":"2026-06-10T10:57:05Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T10:57:05Z","title":"Toward Generalist Autonomous Research via Hypothesis-Tree Refinement","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-06-27T09:34:41.800309Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.11926"},"observation_digest":"sha256:457a10f5ab746b0ebee9ffce77146604f74580b2488d9e36ce63ad1cac8bb35b","observation_id":"137b7037-94fa-41e5-8a40-c4f541630a56","resolution":{"observed_at":"2026-06-27T09:40:46.983091Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.18356","last_updated":"2026-06-16T18:04:45Z","snapshot_observed_at":"2026-07-06T23:53:49.904730Z","submitted_at":"2026-06-16T18:04:45Z","title":"SafeClawBench: Separating Semantic, Audit-Evidence, and Sandbox Harm in Tool-Using LLM Agents","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T23:40:53.439549Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.18356"},"observation_digest":"sha256:da4f7e3db6f3e51d9638648042e0298ab0ad64d4b207b6abb1723f061363e82b","observation_id":"50701dc5-3c10-49ba-b09d-57c9fcd55005","resolution":{"observed_at":"2026-07-03T22:09:00.158258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-02T11:01:11.072388Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T00:19:47.396643Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:0173f1ae08a27f7b00e39ad2a20f718649b93e656f6a02345cd2e034c76c4b14","observation_id":"44b38372-6e5f-404c-8c00-73861e472074","resolution":{"observed_at":"2026-07-03T21:38:58.689019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T11:01:19.550132Z","title":"PaperBench : Evaluating AI 's ability to replicate AI research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.18543","last_updated":"2026-07-22T06:45:58Z","snapshot_observed_at":"2026-08-02T11:01:11.072388Z","submitted_at":"2026-06-16T23:37:52Z","title":"CEO-Bench: Can Agents Play the Long Game?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T11:01:19.550132Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.18543"},"observation_digest":"sha256:53724d7abdbcf6d0f6dbdbb59df78192291b890d618b29dc7801975466ec0afe","observation_id":"f89ac7ef-4e0c-45e3-8b49-535dd0b668e1","resolution":{"observed_at":"2026-08-02T11:01:19.550132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.20659","last_updated":"2026-07-04T18:33:30Z","snapshot_observed_at":"2026-08-02T12:32:32.544678Z","submitted_at":"2026-06-09T10:16:05Z","title":"Skill Coverage: A Test Adequacy Metric for Agent Skills","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.20659"},"observation_digest":"sha256:d5a266aa7373644518baf3939385fa39ab4ada7c6d79a144ca7681444e15a810","observation_id":"1982cf77-4757-47e5-8aad-891d041ad855","resolution":{"observed_at":"2026-06-27T13:40:57.378439Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.24081","last_updated":"2026-06-23T02:49:10Z","snapshot_observed_at":"2026-08-05T08:22:08.800002Z","submitted_at":"2026-06-23T02:49:10Z","title":"PixJail: Self-Evolving Paper-to-Pipeline Reproduction for Text-to-Image Jailbreak Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-25T23:47:47.892277Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.24081"},"observation_digest":"sha256:5b5c19c1121b35a399cb2a2caf47adfbc815b0768eea88705fac8c0dc042513a","observation_id":"957ae55a-8e66-40c3-85ed-a9856f6a2287","resolution":{"observed_at":"2026-07-04T17:20:00.267468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.24177","last_updated":"2026-06-23T05:57:09Z","snapshot_observed_at":"2026-07-06T23:58:49.574536Z","submitted_at":"2026-06-23T05:57:09Z","title":"Agon: An Autonomous Large-Scale Omnidisciplinary Research System Built on Prompt Economy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-25T23:24:55.361203Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.24177"},"observation_digest":"sha256:3a120e14d2516a1ea84b85ee3e4c70117e5fcbdd2bf972e50718e80641e2ec75","observation_id":"2155120f-2cfd-4f8d-b2da-5636676073e9","resolution":{"observed_at":"2026-07-04T17:50:00.427072Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.24530","last_updated":"2026-07-06T16:56:53Z","snapshot_observed_at":"2026-07-12T12:32:23.590658Z","submitted_at":"2026-06-23T12:58:23Z","title":"NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-26T00:13:14.940915Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.24530"},"observation_digest":"sha256:f4c71ec0864574a449fe5d4d279a0f6d5cd50d0c1bc9584f4f889366010249f3","observation_id":"d74561ea-7965-47dd-9250-0c525dc614c6","resolution":{"observed_at":"2026-07-04T16:49:57.846088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-12T12:32:39.706055Z","title":"PaperBench : Evaluating AI 's ability to replicate AI research, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.24530","last_updated":"2026-07-06T16:56:53Z","snapshot_observed_at":"2026-07-12T12:32:23.590658Z","submitted_at":"2026-06-23T12:58:23Z","title":"NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-12T12:32:39.706055Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.24530"},"observation_digest":"sha256:db101cbd4789e5d94bcd58e7f8ed5277495ec3dcd5bab6ea1b615ef739de9bed","observation_id":"a44e1ac9-2656-460f-8ca3-30cb9f7f776a","resolution":{"observed_at":"2026-07-12T12:32:39.706055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.26346","last_updated":"2026-06-24T19:38:21Z","snapshot_observed_at":"2026-08-01T10:31:00.655586Z","submitted_at":"2026-06-24T19:38:21Z","title":"How Do Tool-Augmented LLM Agents Perform on Real-World Energy Analytics Tasks?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T01:34:10.103638Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.26346"},"observation_digest":"sha256:1513cb79f99646ca1b545f4ce76a6d4bdbc4b0d2b7dabcda9640daa11b164b62","observation_id":"b33ce8a9-c6b0-4f52-9f4c-e63d655b0fb4","resolution":{"observed_at":"2026-07-04T15:29:56.680099Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2606.30246","last_updated":"2026-06-29T12:56:08Z","snapshot_observed_at":"2026-07-07T00:04:05.275293Z","submitted_at":"2026-06-29T12:56:08Z","title":"Clarus: Coordinating Autonomous Research Agents toward Web-Scale Scientific Collaboration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T06:15:29.120280Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2606.30246"},"observation_digest":"sha256:0ba3f685dc79063c5953609682829c84f078c6150da123105ed161ed81b2f6bf","observation_id":"67ee60a2-64b4-4719-915d-688e3e0a9d32","resolution":{"observed_at":"2026-06-30T07:24:22.543275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2607.02134","last_updated":"2026-07-10T01:02:12Z","snapshot_observed_at":"2026-08-04T01:04:03.808476Z","submitted_at":"2026-07-02T13:11:30Z","title":"Coding-agents can replicate scientific machine learning papers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-03T13:07:26.748722Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.02134"},"observation_digest":"sha256:0ba932cf58690a909f703967a6150fe42d929d9fcb634475282ce6201d496fae","observation_id":"4d32ecd3-33f2-41fd-8744-7bcb35fa6fd7","resolution":{"observed_at":"2026-07-03T13:08:07.696988Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-13T07:13:13.354959Z","title":"arXiv preprint arXiv:2504.01848 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02134","last_updated":"2026-07-10T01:02:12Z","snapshot_observed_at":"2026-08-04T01:04:03.808476Z","submitted_at":"2026-07-02T13:11:30Z","title":"Coding-agents can replicate scientific machine learning papers","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-13T07:13:13.354959Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.02134"},"observation_digest":"sha256:eed79c4885b202ba204ff5d4b0d8b800a489e68371a53bab8678d1c80192a12c","observation_id":"69ed3cf0-fca6-476f-abd8-13655ebe9598","resolution":{"observed_at":"2026-07-13T07:13:13.354959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-12T06:02:20.361005Z","title":"PaperBench: Evaluating AI’s ability to replicate AI research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02931","last_updated":"2026-07-03T03:55:59Z","snapshot_observed_at":"2026-08-02T02:39:39.031004Z","submitted_at":"2026-07-03T03:55:59Z","title":"VERITAS: Towards a General-Purpose Replication Tool for Scientific Research","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T06:02:20.361005Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.02931"},"observation_digest":"sha256:bff388a326a7ccb9a6b24fdb41a073109d1ddb8f47e189b8f4c6fb0f60bd3195","observation_id":"c60f2863-a29e-4ca3-b451-c72e77eb0e72","resolution":{"observed_at":"2026-07-12T06:02:20.361005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":"2504.01848","doi":"10.1126/science.adp7429","metadata_source":"pith","pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","venue":"cs.AI","work_id":"7db23490-3dd0-4cfa-a75c-5537ee36dcc2","year":2025},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-05T23:10:59.079432Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T18:29:50.731038Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:03f8a38180cc6d61ba0f8983bff91e225e68ba040e02f4057a2ee7d4ee7989c7","observation_id":"e32c3176-36bd-40b9-b963-846344fa6c13","resolution":{"observed_at":"2026-07-10T18:37:31.196203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-03T00:49:48.856448Z","title":"PaperBench: Evaluating AI’s Ability to Replicate AI Research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.07774","last_updated":"2026-07-30T19:01:17Z","snapshot_observed_at":"2026-08-05T23:10:59.079432Z","submitted_at":"2026-07-08T16:46:06Z","title":"ScopeJudge: Cost-Aware Pre-Execution Gating for Offensive Security Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T00:49:48.856448Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.07774"},"observation_digest":"sha256:a4d47bb44a16de5886501a0c748eab1f9c500b918b27d9cfe9eeb2d95e54c577","observation_id":"3bc42954-0bac-450c-93e7-4b1ac1d1288b","resolution":{"observed_at":"2026-08-03T00:49:48.856448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-14T11:05:51.130839Z","title":"URL https://arxiv.org/abs/2504.01848","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10522","last_updated":"2026-07-12T00:54:06Z","snapshot_observed_at":"2026-07-16T23:18:49.690823Z","submitted_at":"2026-07-12T00:54:06Z","title":"Towards Autonomous and Auditable Medical Imaging Model Development","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T11:05:51.130839Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.10522"},"observation_digest":"sha256:ad8b53503d2cec56a76c65aa1a75a8c9fd57ac1e698292c05dcf4d4959a1dd8b","observation_id":"ca9eb065-8019-49f3-9a0e-8fe6752af78f","resolution":{"observed_at":"2026-07-14T11:05:51.130839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T06:35:59.308317Z","title":"Bas R Steunebrink and JÃ1/4rgen Schmidhuber","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.13104","last_updated":"2026-07-14T09:12:57Z","snapshot_observed_at":"2026-08-05T04:00:59.340225Z","submitted_at":"2026-07-14T09:12:57Z","title":"Self-Improvements in Modern Agentic Systems: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T06:35:59.308317Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.13104"},"observation_digest":"sha256:719a005645a1d066d8d9d34a91e0710804e138e1583e7e62da526e9af4ec5aee","observation_id":"c201216e-df42-49a3-aa31-63698d94c0ab","resolution":{"observed_at":"2026-08-02T06:35:59.308317Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-02T01:00:22.885499Z","title":"Papers were used for planning, planning was converted into implementation prompts, and the resulting code was evaluated, audited, and revised across iterations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14818","last_updated":"2026-07-16T10:37:02Z","snapshot_observed_at":"2026-08-02T01:00:21.856853Z","submitted_at":"2026-07-16T10:37:02Z","title":"Can LLMs Build a MaxSAT Solver from Papers? The CoreForge Experience","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T01:00:22.885499Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.14818"},"observation_digest":"sha256:e9057ebe804e87c0f136ae37bf16ee629eb499c34be0f507ce01f03757a44049","observation_id":"e4180afd-16df-4f7d-8424-a0317e2d8806","resolution":{"observed_at":"2026-08-02T01:00:22.885499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-07-31T01:39:48.664815Z","title":"Starace, O","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25090","last_updated":"2026-07-27T21:30:39Z","snapshot_observed_at":"2026-08-03T01:32:45.260967Z","submitted_at":"2026-07-27T21:30:39Z","title":"Matryoshka Agent: Unfolding Sub-Agents for Long-Horizon Machine Learning Engineering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T01:39:48.664815Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2607.25090"},"observation_digest":"sha256:0f075264a02b603a31c91ff7e19683ea664a995975513644665f2d15904fcaf3","observation_id":"8b21ee08-d16c-4454-b242-05b533ac0dc2","resolution":{"observed_at":"2026-07-31T01:39:48.664815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T00:31:12.166627Z","title":"arXiv preprint arXiv:2504.01848 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01189","last_updated":"2026-08-02T12:14:43Z","snapshot_observed_at":"2026-08-06T21:22:02.730414Z","submitted_at":"2026-08-02T12:14:43Z","title":"MADE: Belief-Driven Dual-Agent Coordination for Autonomous Model Deployment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T00:31:12.166627Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2608.01189"},"observation_digest":"sha256:16cc0758229d8426007a54ce03a94d543dce0fbc973f78907ca88b6faf6944d3","observation_id":"989a91c6-3816-4024-a079-b2f5b2a845fe","resolution":{"observed_at":"2026-08-06T00:31:12.166627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-05T16:49:31.209853Z","title":"S., Maksin, L., Dias, R., Mays, E., Kinsella, B., Thompson, W., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03569","last_updated":"2026-08-04T12:30:13Z","snapshot_observed_at":"2026-08-06T20:57:15.590826Z","submitted_at":"2026-08-04T12:30:13Z","title":"Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-05T16:49:31.209853Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2608.03569"},"observation_digest":"sha256:d46c4e0b30d903a5d04886db1c0e44238efca0043afd9df11a302b19f07fbe8b","observation_id":"2ac05b38-ed7a-43cd-b0b9-8d02f0a39d79","resolution":{"observed_at":"2026-08-05T16:49:31.209853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-06T04:30:43.695729Z","title":"PaperBench: Evaluating AI’s ability to replicate AI research.arXiv preprint arXiv:2504.01848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05139","last_updated":"2026-08-05T17:57:16Z","snapshot_observed_at":"2026-08-06T21:20:36.570839Z","submitted_at":"2026-08-05T17:57:16Z","title":"Toward Skill-Native LLMs: Skill Entropy for Benchmarking and Training Long-Horizon Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T04:30:43.695729Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2608.05139"},"observation_digest":"sha256:87af47144544a51957555aa840629ce37e8910f2f1c42667cfa21361cd13f006","observation_id":"6c3ae39e-671d-4674-a715-775352b9cce4","resolution":{"observed_at":"2026-08-06T04:30:43.695729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.01848/citation-record","integrity":"/paper/2504.01848/integrity","json":"/paper/2504.01848/citation-record.json","paper":"/paper/2504.01848"},"outbound":[],"paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 92 inbound Pith citation observations for arXiv:2504.01848."}