{"as_of":"2026-08-08T02:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f47833eb80ff948ba750306364038c34d38f0a2d0290aa9a0ace0112c9abfb4","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:30:31.148470Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13300/citation-record","integrity":"/paper/2507.13300/integrity","json":"/paper/2507.13300/citation-record.json","paper":"/paper/2507.13300"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.863012Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.863012Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:e861a965277673a42081938ea48d7e51c36df0c29e2b6a159811277a0fa03164","observation_id":"a639b420-0009-4b18-9092-cfeb21672a31","resolution":{"observed_at":"2026-08-06T16:30:30.863012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.867039Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.867039Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:3c720e065ffb7484971dd62d3c1718b7de40b9f3fff44989d5626e4d0ac4746a","observation_id":"f011d55d-8f72-4317-aec8-67d9cde1df15","resolution":{"observed_at":"2026-08-06T16:30:30.867039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01788","last_updated":"2025-03-21T14:49:10Z","snapshot_observed_at":"2026-08-04T15:15:21.414953Z","submitted_at":"2024-02-02T02:41:28Z","title":"LitLLM: A Toolkit for Scientific Literature Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01788","snapshot_observed_at":"2026-08-06T16:30:30.874417Z","title":"Laradji, Laurent Charlin, and Christopher Pal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.874417Z"},"links":{"cited_paper":"/paper/2402.01788","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:a5d5ededeb5a0c2fc9b60742df0ac879f87179953634eaf0f57088c180392a6c","observation_id":"f62fbbe1-67c3-4ba0-9888-9dbece2476eb","resolution":{"observed_at":"2026-08-06T16:30:30.874417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T16:30:30.878617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.878617Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:d3ef52a37e87d57ff6712f3a457fbeb1949951e9a4b2c5b2d89accbb65360b8e","observation_id":"1e0f122c-bade-4270-9f43-b2e7b4882fb0","resolution":{"observed_at":"2026-08-06T16:30:30.878617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.882304Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.882304Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:8eff55d86f47404b3174359934c8f59c6b09ba953ce97a55ef02466755c85d19","observation_id":"c5f3c8dd-ddfc-4b47-9730-c0127cfe2a50","resolution":{"observed_at":"2026-08-06T16:30:30.882304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.885445Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.885445Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:f965749ba04ab47b7438755e166cef05c5a5b88c958d8866c96d0aa53b0ec05f","observation_id":"a99d8233-c32a-458a-a8d9-a266c4f16682","resolution":{"observed_at":"2026-08-06T16:30:30.885445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01903","last_updated":"2025-08-05T16:19:40Z","snapshot_observed_at":"2026-08-07T12:18:28.218519Z","submitted_at":"2025-07-02T17:19:20Z","title":"AI4Research: A Survey of Artificial Intelligence for Scientific Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01903","snapshot_observed_at":"2026-08-06T16:30:30.888470Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.888470Z"},"links":{"cited_paper":"/paper/2507.01903","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:aeb9cd4efdbb0027ce86a4cc61c3c9ede4f9e01fbadba976e1ef014043dc1e27","observation_id":"4300e2b8-afb0-47d2-9086-758216bafeca","resolution":{"observed_at":"2026-08-06T16:30:30.888470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.891644Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.891644Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:e14d147b22c92630f2a7a9d6c019c56fd3c01c5d841dcf2ef852e62f5f88a29d","observation_id":"806d738b-fb99-454e-b8b4-287598e09d3c","resolution":{"observed_at":"2026-08-06T16:30:30.891644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04259","last_updated":"2024-01-08T22:24:17Z","snapshot_observed_at":"2026-08-07T22:46:31.467173Z","submitted_at":"2024-01-08T22:24:17Z","title":"MARG: Multi-Agent Review Generation for Scientific Papers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04259","snapshot_observed_at":"2026-08-06T16:30:30.895146Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.895146Z"},"links":{"cited_paper":"/paper/2401.04259","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:4aca5a31ec2979be9f0253dc8a1209c31e0ee85da1d3cbb933dffed21acca187","observation_id":"2d8c2b77-5c02-4ba8-a27f-920a0e0d3738","resolution":{"observed_at":"2026-08-06T16:30:30.895146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:30.997967Z","title":"Smith, and Matt Gardner","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:30.997967Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:5e1856479b74a127709da6d3f291c5042a5e5a8d5d4314b437187e35b8888d3e","observation_id":"c7fc8dbc-2a70-4e48-b4b7-58745b49fab2","resolution":{"observed_at":"2026-08-06T16:30:30.997967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T16:30:31.001582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.001582Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:5a85c98c9f49a076e018aa608fe540e4b315b181f5f521e92a82dff969a91022","observation_id":"9193c18d-bee3-486d-9062-18ffdb7b4672","resolution":{"observed_at":"2026-08-06T16:30:31.001582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T16:30:31.005307Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.005307Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:e59e679e039ff5a2fffe6caa29640bfce7ae7a1435e5c13f17823fe517f65a8a","observation_id":"7417691f-2df2-4db1-a102-e9ec3e23dcbc","resolution":{"observed_at":"2026-08-06T16:30:31.005307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16253","last_updated":"2024-10-03T02:57:49Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-24T01:30:22Z","title":"LLMs Assist NLP Researchers: Critique Paper (Meta-)Reviewing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16253","snapshot_observed_at":"2026-08-06T16:30:31.008892Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.008892Z"},"links":{"cited_paper":"/paper/2406.16253","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:11ad02929118dd887f3e96dc27f94416d5646300fe0b6958cbc3a4d82d689780","observation_id":"1ee6742d-998c-47f2-9df6-b13f388f3c8d","resolution":{"observed_at":"2026-08-06T16:30:31.008892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.012316Z","title":"Fabbri, Wojciech Kry \\'s ci \\'n ski, Bryan McCann, Caiming Xiong, Richard Socher, and Dragomir Radev","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.012316Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:691266110b2fe5d0b699731af4cb07e1ee98069f55757c29fa83e298debd6789","observation_id":"437f1899-b34d-40ac-b34b-7e818cbf294b","resolution":{"observed_at":"2026-08-06T16:30:31.012316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.818705Z","title":"Sengamedu, and Christos Faloutsos","venue":null,"work_id":"49ffbbcf-986f-480c-abf3-e6ccaf5b1056","year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.015875Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:6052419535fb974bcc35769dc0015e4a6a88d98db1eead2bd585d97dbd3df1d2","observation_id":"083ce5ba-32b1-41d0-ba6a-70f0f2857533","resolution":{"observed_at":"2026-08-06T16:30:31.822196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T16:30:31.019280Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.019280Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c5d641d07a5028aa67583f4c904a9f26a27381de59302e72bd154e58da256e2b","observation_id":"5d8e6790-81d9-416a-a3a5-397944bb2b61","resolution":{"observed_at":"2026-08-06T16:30:31.019280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-07T13:04:50.040909Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-06T16:30:31.022702Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.022702Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:8f4f1cdf8182b98fa0b1ce229baee73d3b548003902d9b83c86b755bf8b56093","observation_id":"5bff5dd6-063f-4307-b1f1-4df0fd3d6c46","resolution":{"observed_at":"2026-08-06T16:30:31.022702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.807075Z","title":null,"venue":null,"work_id":"5c905b06-51fa-42a0-869b-903548b0dbed","year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.026139Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:b1c541e6ad8ad43f6a2d6214e671c47f96028407f456bcbc73967fa000d4f020","observation_id":"4ce7d73f-2297-4606-859d-76ffa23b4283","resolution":{"observed_at":"2026-08-06T16:30:31.811334Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.029330Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.029330Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c954bfb0efd6cd782b8210e6be9a486dea049422bdcafaf0d551312091857d86","observation_id":"4833b901-f4ff-4c94-9853-57b9bafc2ea0","resolution":{"observed_at":"2026-08-06T16:30:31.029330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.032766Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.032766Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:bfc866e6b310b86a994ccb0c3b22b4f99f5087833c54f55e60fdeb7544eefdcb","observation_id":"85bf35d1-8570-41fd-9c0c-a0c74d35e5c0","resolution":{"observed_at":"2026-08-06T16:30:31.032766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.036070Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.036070Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:8891873412157e743920a26a40d71236ec6265ab34b5e0bf2e54a17cf0c53e9b","observation_id":"185b38a5-74db-4f83-b4fb-eea0ac12af20","resolution":{"observed_at":"2026-08-06T16:30:31.036070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09835","last_updated":"2024-08-21T13:36:30Z","snapshot_observed_at":"2026-07-06T16:48:33.164024Z","submitted_at":"2023-11-16T12:03:21Z","title":"ML-Bench: Evaluating Large Language Models and Agents for Machine Learning Tasks on Repository-Level Code","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09835","snapshot_observed_at":"2026-08-06T16:30:31.039397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.039397Z"},"links":{"cited_paper":"/paper/2311.09835","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:507c5a0148351673cea5ab5610bca50f7bbc6a913944763d43223348d60e7ea1","observation_id":"c6f21ed6-1294-43ac-9006-709465b70578","resolution":{"observed_at":"2026-08-06T16:30:31.039397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.042531Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.042531Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:7207c4924018b63986edcc0a972358453ea588ad39c7dfe6cfc2241f269215a2","observation_id":"665073b8-e824-4ccf-b649-b982a6ed0339","resolution":{"observed_at":"2026-08-06T16:30:31.042531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.794783Z","title":null,"venue":null,"work_id":"ab132e53-7c05-44d8-b77b-9dd81f1730bb","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.046147Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:d649fbeceff618d8db8098a35d44b44139114f532de6bd1d6f69a7193f32dfde","observation_id":"f0f220d6-e3a8-4051-87ac-fe2221f36dcc","resolution":{"observed_at":"2026-08-06T16:30:31.798588Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-06T16:30:31.049248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.049248Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:348aa90f20ae55d07324070140c66742ab7292509ad12fa3b6c9ae833fdb132e","observation_id":"25cdec61-3801-45a5-a4a7-23e2d8b87f94","resolution":{"observed_at":"2026-08-06T16:30:31.049248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13610","last_updated":"2024-02-21T08:26:43Z","snapshot_observed_at":"2026-07-06T17:33:17.224327Z","submitted_at":"2024-02-21T08:26:43Z","title":"Data-driven Discovery with Large Generative Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13610","snapshot_observed_at":"2026-08-06T16:30:31.052687Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.052687Z"},"links":{"cited_paper":"/paper/2402.13610","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c52dd377510055f74b6dfba99862e52e3be5859ebed898f04c836e6d2e86c362","observation_id":"29b932a9-8b9e-4da5-9616-39c6dfbc5871","resolution":{"observed_at":"2026-08-06T16:30:31.052687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.783850Z","title":null,"venue":null,"work_id":"724cfed7-d096-4121-8578-8d3ca877713b","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.055903Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:28999cd25152a0ed0a4c614cf2e8773d1bd4f5ddc34aea890f84071fb6f8643b","observation_id":"60c78680-721c-4a0d-89bd-42765d2a061b","resolution":{"observed_at":"2026-08-06T16:30:31.787440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T16:30:31.059038Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.059038Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:36ce78597547aa689636df18aa5141072644304a2aede11ecec328c2fc669370","observation_id":"808d6a98-936f-4299-b0e2-f39aab016ff8","resolution":{"observed_at":"2026-08-06T16:30:31.059038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.062412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.062412Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:080666d8ff0250e02e1322bc6ffaac50dbd5ce1a2224d718ff83a5615a3517de","observation_id":"688d34cc-d254-4706-ab4e-4408e45bc378","resolution":{"observed_at":"2026-08-06T16:30:31.062412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.767178Z","title":null,"venue":null,"work_id":"e84dfe6c-9fb9-4061-b14d-7fe7d2302397","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.065403Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:5375b050decc48aef880052cd10dd236f24c282e4c81716dff1659659feee334","observation_id":"8f0da463-dfff-4cca-86f1-0e4f962c02e8","resolution":{"observed_at":"2026-08-06T16:30:31.770380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.755658Z","title":null,"venue":null,"work_id":"cd3db86b-20f1-4360-876c-61f53a060508","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.068701Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:ceb847c8803921b23cdf353bd88f305202c36f4d9fab9e838fe9ede83d498cfd","observation_id":"a0f174d5-69ae-4218-8f7f-464315482aa1","resolution":{"observed_at":"2026-08-06T16:30:31.759968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.744205Z","title":null,"venue":null,"work_id":"d6566e0e-6571-4d6b-8d5a-ca80191881b4","year":2022},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.071806Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:7df5485212080084f8c380d616e59b04ce37db1090c8e95492a028cc367c316c","observation_id":"fce17fcd-67f8-4626-92bf-62c5ddc75395","resolution":{"observed_at":"2026-08-06T16:30:31.748859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.075285Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.075285Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:0b89bbeb0035577bff5da175e739fa31e5ba8f2ad841d2f05fa82ba2b79283a9","observation_id":"0e27f756-18d3-408c-ab87-faeb6d0df65f","resolution":{"observed_at":"2026-08-06T16:30:31.075285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13062","last_updated":"2024-07-17T05:26:03Z","snapshot_observed_at":"2026-07-06T15:30:42.173342Z","submitted_at":"2023-05-22T14:23:46Z","title":"Table Meets LLM: Can Large Language Models Understand Structured Table Data? A Benchmark and Empirical Study","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13062","snapshot_observed_at":"2026-08-06T16:30:31.078561Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.078561Z"},"links":{"cited_paper":"/paper/2305.13062","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:0c4ed02b3155984e026187319ab25cfc9b4d392c079ab4ab3c7fe6a1b994430f","observation_id":"f1399d7f-bb78-4f69-acec-02d4b62a02d0","resolution":{"observed_at":"2026-08-06T16:30:31.078561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05688","last_updated":"2024-06-09T08:24:17Z","snapshot_observed_at":"2026-08-07T20:42:13.596156Z","submitted_at":"2024-06-09T08:24:17Z","title":"Peer Review as A Multi-Turn and Long-Context Dialogue with Role-Based Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05688","snapshot_observed_at":"2026-08-06T16:30:31.082021Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.082021Z"},"links":{"cited_paper":"/paper/2406.05688","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:4ff48df63a115ae916476827e57b81487d4ab6f1bc333fc34caff5b8bcf57130","observation_id":"ddecfe4f-6646-4ec9-be3e-e20959d4e546","resolution":{"observed_at":"2026-08-06T16:30:31.082021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T16:30:31.085794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.085794Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:83f9522bd155ec9419ee942a8c787387192cdbccf16843008da149025ce0073e","observation_id":"96dbbd43-b39a-4731-8ece-5fe516d7e906","resolution":{"observed_at":"2026-08-06T16:30:31.085794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T16:30:31.089625Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.089625Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:32d26e1088297e9787fea173bc799d4ddde7ca48206bac05a5d452101cb77eb8","observation_id":"c70b9c7c-b688-4624-9d70-de818087afb0","resolution":{"observed_at":"2026-08-06T16:30:31.089625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15569","last_updated":"2025-06-18T15:43:26Z","snapshot_observed_at":"2026-08-06T23:50:35.476736Z","submitted_at":"2025-06-18T15:43:26Z","title":"SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification","version":1},"cited_work":{"arxiv_id":"2506.15569","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.15569","snapshot_observed_at":"2026-08-06T16:30:31.395488Z","title":"SciVer: Evaluating Foundation Models for Multimodal Scientific Claim Verification","venue":"cs.CL","work_id":"e3cfa393-d249-47ba-96ed-f652bc4ddd43","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.093234Z"},"links":{"cited_paper":"/paper/2506.15569","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:957e89dd3763ce52d9841efba2465a915a1af7acbe8b274af7c09933dd8c99eb","observation_id":"9586f3c8-ffe0-4981-932a-9520f2580e60","resolution":{"observed_at":"2026-08-06T16:30:31.399169Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14259","last_updated":"2024-06-03T21:15:28Z","snapshot_observed_at":"2026-07-06T15:31:41.985646Z","submitted_at":"2023-05-23T17:12:08Z","title":"SciMON: Scientific Inspiration Machines Optimized for Novelty","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14259","snapshot_observed_at":"2026-08-06T16:30:31.097289Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.097289Z"},"links":{"cited_paper":"/paper/2305.14259","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:6841ea271b8d20879aba2e8aabdc52e6def84f2984759054c46f2c32634a16cc","observation_id":"19a818ec-0e27-4e39-886a-f8ac522d13db","resolution":{"observed_at":"2026-08-06T16:30:31.097289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06364","last_updated":"2024-04-09T15:01:51Z","snapshot_observed_at":"2026-07-06T17:57:48.153936Z","submitted_at":"2024-04-09T15:01:51Z","title":"SurveyAgent: A Conversational System for Personalized and Efficient Research Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06364","snapshot_observed_at":"2026-08-06T16:30:31.101369Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.101369Z"},"links":{"cited_paper":"/paper/2404.06364","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:7f5ea102654a2fc2915247ba6d552f523152079bd0964d2a997a0dcb57a32309","observation_id":"da8c7d2f-da3d-4060-b1ab-d90fe9923a1c","resolution":{"observed_at":"2026-08-06T16:30:31.101369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.727021Z","title":null,"venue":null,"work_id":"53981183-9afe-4695-81cf-7be8cc2fc3fd","year":2022},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.105540Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:0438d5428e159afd4f2901762ae6daf8e1027d505cf409e2b67b188a68dc7e5a","observation_id":"2b409e93-3539-4596-9a51-bfa40875a554","resolution":{"observed_at":"2026-08-06T16:30:31.730606Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03866","last_updated":"2024-03-06T17:16:44Z","snapshot_observed_at":"2026-07-06T17:40:33.769700Z","submitted_at":"2024-03-06T17:16:44Z","title":"KIWI: A Dataset of Knowledge-Intensive Writing Instructions for Answering Research Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03866","snapshot_observed_at":"2026-08-06T16:30:31.111256Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.111256Z"},"links":{"cited_paper":"/paper/2403.03866","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:e00e518c456e395ea53f46f3cd9438b2a44ddab95c7bcca7e2dc583188c6dad6","observation_id":"5d53540b-a46a-4849-98c9-a0370e2977e5","resolution":{"observed_at":"2026-08-06T16:30:31.111256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02694","last_updated":"2025-07-03T15:04:38Z","snapshot_observed_at":"2026-08-07T02:29:11.672901Z","submitted_at":"2025-07-03T15:04:38Z","title":"Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers","version":1},"cited_work":{"arxiv_id":"2507.02694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.02694","snapshot_observed_at":"2026-08-06T16:30:31.350050Z","title":"Can LLMs Identify Critical Limitations within Scientific Research? A Systematic Evaluation on AI Research Papers","venue":"cs.CL","work_id":"cb782d20-b525-4ae6-8a0f-b18f8dbab0c8","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.115395Z"},"links":{"cited_paper":"/paper/2507.02694","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c9858e626a10acbb83b30fc7e1435beb0edf4af3d5a305647b9157bbebef9227","observation_id":"725bddb8-efc5-4e3d-9f2f-b603cf1cc2e0","resolution":{"observed_at":"2026-08-06T16:30:31.354775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T16:30:31.119728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.119728Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:613a382f3825f9583961bab49cc90342fdc76a7a1edb5fbb36979192e7d9aad3","observation_id":"428c9335-fac2-40f6-9ff1-21fe7f418772","resolution":{"observed_at":"2026-08-06T16:30:31.119728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15793","last_updated":"2024-11-11T20:01:15Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-06T17:41:33Z","title":"SWE-agent: Agent-Computer Interfaces Enable Automated Software Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15793","snapshot_observed_at":"2026-08-06T16:30:31.123653Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.123653Z"},"links":{"cited_paper":"/paper/2405.15793","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:56b2a809c81bbcd0a4c73b63ee7b3410867740c7d549b1d9132d22efd40eef4f","observation_id":"f86dadd1-e385-4c20-bacc-35486fc1a6cb","resolution":{"observed_at":"2026-08-06T16:30:31.123653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.127880Z","title":"Griffiths, Yuan Cao, and Karthik R Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.127880Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:9025e2f2f8d0762b53bf5b5abea3444412d3361ea539b7e68f14a73ebee10b76","observation_id":"1957df79-f98e-4708-a777-28755761d020","resolution":{"observed_at":"2026-08-06T16:30:31.127880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.131703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.131703Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:688bca87420ff3193a1341f97267087f0768ae66967681f7cebf68a31e238e70","observation_id":"8a19b5a3-592f-4cd4-9ae9-fe986ef0618a","resolution":{"observed_at":"2026-08-06T16:30:31.131703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10787","last_updated":"2025-07-14T20:35:25Z","snapshot_observed_at":"2026-08-06T17:22:44.789792Z","submitted_at":"2025-07-14T20:35:25Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","version":1},"cited_work":{"arxiv_id":"2507.10787","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.10787","snapshot_observed_at":"2026-08-06T16:30:31.307464Z","title":"Can Multimodal Foundation Models Understand Schematic Diagrams? An Empirical Study on Information-Seeking QA over Scientific Papers","venue":"cs.CL","work_id":"75842fb0-7584-4f24-b8c6-d3e30f6bec84","year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.136261Z"},"links":{"cited_paper":"/paper/2507.10787","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:db58102dd9200ab8deb252b1e366d6f25d7eae77b6d4aaa892e325010e90fe30","observation_id":"ead4df80-43c5-4fa2-9cd1-94d2e2f83fb5","resolution":{"observed_at":"2026-08-06T16:30:31.315034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.140179Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.140179Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:fb615196bc5927ad553956fe5bbf5a0b38629df8e97af8e8ccc56aa8535ed16c","observation_id":"a10a905c-0f4f-43c5-908f-2607ed074f1d","resolution":{"observed_at":"2026-08-06T16:30:31.140179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:30:31.703345Z","title":null,"venue":null,"work_id":"ce8cd54d-8226-40ac-8a6b-4082a15eb171","year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.144243Z"},"links":{"citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:c00f37c63b8ffd5119f90a069b8b125f111d98fb027a504047a963c4b794cddf","observation_id":"c5de9c4c-c617-430d-aa44-2ee374e800c4","resolution":{"observed_at":"2026-08-06T16:30:31.707216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04326","last_updated":"2024-12-18T19:00:00Z","snapshot_observed_at":"2026-07-06T17:56:18.931340Z","submitted_at":"2024-04-05T18:00:07Z","title":"Hypothesis Generation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04326","snapshot_observed_at":"2026-08-06T16:30:31.148470Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T16:30:31.148470Z"},"links":{"cited_paper":"/paper/2404.04326","citing_paper":"/paper/2507.13300"},"observation_digest":"sha256:1a64b17cb119eca7e3e792c15b0cdf185384628b685691db153b73a656ac4820","observation_id":"87a32eb7-089c-40a5-b0f8-85786feeb8a2","resolution":{"observed_at":"2026-08-06T16:30:31.148470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.13300","last_updated":"2025-07-17T17:09:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:19:08.248754Z","submitted_at":"2025-07-17T17:09:22Z","title":"AbGen: Evaluating Large Language Models in Ablation Study Design and Evaluation for Scientific Research"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2507.13300."}