{"as_of":"2026-08-09T14:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92b8951b95fda6d3ece0808c1c79e0e295c110a2dfd7f7953a9598127d8356e0","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:46:08.376749Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:13:53.040834Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T17:13:54.647415Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"cited_work":{"arxiv_id":"2507.15152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.15152","snapshot_observed_at":"2026-08-05T17:13:54.647415Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","venue":"cs.CL","work_id":"aef22ecb-c629-421f-99f5-b011d3963ad0","year":2025},"citing_paper":{"arxiv_id":"2509.00038","last_updated":"2025-08-22T21:37:49Z","snapshot_observed_at":"2026-08-05T23:50:11.524380Z","submitted_at":"2025-08-22T21:37:49Z","title":"Compiling Prompts, Not Crafting Them: A Reproducible Workflow for AI-Assisted Evidence Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:53.040834Z"},"links":{"cited_paper":"/paper/2507.15152","citing_paper":"/paper/2509.00038"},"observation_digest":"sha256:d70af84af1692675be7683431c9905a0421dbfd7a4db558385561166841796ab","observation_id":"10d2e2ae-f6ec-48f1-a8fa-6aa090174121","resolution":{"observed_at":"2026-08-05T17:13:54.709479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15152/citation-record","integrity":"/paper/2507.15152/integrity","json":"/paper/2507.15152/citation-record.json","paper":"/paper/2507.15152"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.653529Z","title":"Research Synthesis and Meta-Analysis: A Step-by-Step Approach","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.653529Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:639b4dcbf799294d50da285799657c6fd783cd00b73c2bad74cb37dd41fe0af7","observation_id":"59abdfec-2b79-400f-abb4-6896d381a4af","resolution":{"observed_at":"2026-08-06T15:46:07.653529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.664179Z","title":"Analysing data and undertaking meta-analyses, chapter 10, pages 241–284","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.664179Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3b37a9b7c0a47e596075aa9a07465d06433149eeb87e78bbb4fc30dc17165f8a","observation_id":"1f67cc0f-6e6e-4c9c-8dd2-dd9074bee257","resolution":{"observed_at":"2026-08-06T15:46:07.664179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.671805Z","title":"Analysis of the time and workers needed to conduct systematic reviews of medical interventions using data from the prospero registry.BMJ Open, 7 (2), 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.671805Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:eb6c02146846e539872225b1dadcc9e123b2a68f49ec7ce6819b22ee34a33759","observation_id":"d0762771-aa93-47e0-aeb8-895ffc8ebf2c","resolution":{"observed_at":"2026-08-06T15:46:07.671805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/9781119536604","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:03:56.115653Z","title":"Higgins, James Thomas, Jacqueline Chandler, Miranda Cumpston, Tianjing Li, Matthew J","venue":null,"work_id":"fc744b8c-5dfe-44ef-8ba4-2b6f4e69edff","year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.680841Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9618006dbc8b952681ff0dded4c02b1bbcf98e6b44e31c1b7d4c87293e360139","observation_id":"efdddffb-8142-469b-909e-5f43339c72f5","resolution":{"observed_at":"2026-08-06T15:46:09.038582Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1136/bmj-2021-069155","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.014003Z","title":"Validity of data extraction in evidence synthesis practice of adverse events: repro- ducibility study","venue":null,"work_id":"18ef4436-5b49-483b-9eff-2aeba29df73c","year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.685632Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4c8d4b6e0bae4bc506483a5e63ba49d6a57f9e5831423b67e31a1432c9186914","observation_id":"70ea14fd-5453-4d30-8447-05c6b28e9f97","resolution":{"observed_at":"2026-08-06T15:46:09.020674Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.690733Z","title":"Toward systematic review automation: a practical guide to using machine learning tools in research synthesis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.690733Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8ebc76cf468c49eaf27c3d47d8ad007cc0274ca4c47cb06784d12e77480c14bb","observation_id":"975c4024-e2d0-4308-ada1-f84d80119446","resolution":{"observed_at":"2026-08-06T15:46:07.690733Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.697875Z","title":"Exact: automatic extraction of clinical trial characteristics from journal publications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.697875Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:e7ffb7edaa1c88e58960acaea4e6b704994f4dbf134abc99923db56fd95ee98e","observation_id":"b0629e68-bf64-4206-99b4-91252af8cde9","resolution":{"observed_at":"2026-08-06T15:46:07.697875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/bibm.2011.72","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.957233Z","title":"Summerscales, Shlomo Argamon, Shangda Bai, Jordan Hupert, and Alan Schwartz","venue":null,"work_id":"58df341e-48c2-4973-a07b-95b591ec22ec","year":2011},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.746197Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f8360c7b1c04ea8f75496781310e57939dc440b566433d2d3217181a8319258f","observation_id":"fdd4bafa-4184-4928-a2ff-b8fe42880703","resolution":{"observed_at":"2026-08-06T15:46:08.968448Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.77374","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.448692Z","title":null,"venue":null,"work_id":"c5dccd46-c3ee-4235-bd92-b0895f9629ea","year":2016},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.763071Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:db8d620e09663eca974785ff99d646b961fbd40c3622942717953127e48c09ba","observation_id":"ca059850-7817-4bff-a971-e79644f87bd6","resolution":{"observed_at":"2026-08-06T15:46:09.459526Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.784022Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.784022Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:e040683e8aa09736cfcd3e91dafc843fde6e4b15add76257205865c8d18a383f","observation_id":"1c86dbba-aac8-4c3c-ac6b-60cf0a5c8cc7","resolution":{"observed_at":"2026-08-06T15:46:07.784022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.801622Z","title":"Automating meta-analyses of randomized clinical trials: a first look","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.801622Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:2ca9e6548649e01ec81d8d6f2d9e872910669c510d41b72da676da64dd0f8320","observation_id":"bc08e3c2-ce9c-41ab-ae05-793e5c754ed0","resolution":{"observed_at":"2026-08-06T15:46:07.801622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.812345Z","title":"Katz-Rogozhnikov, Kush R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.812345Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:38a3483f0949aa91bc3d44a4eb7008a3dcb2e9a841d02e6e09930bdee7ecfa36","observation_id":"c032b9f2-8819-4519-aed0-7709bda04041","resolution":{"observed_at":"2026-08-06T15:46:07.812345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.817822Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.817822Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:05fcc97b27792fff66284872de4bccb7a88b6c7790c499bb476c95fcbea1f1e5","observation_id":"ec473968-5324-44d2-a235-b93418bdb282","resolution":{"observed_at":"2026-08-06T15:46:07.817822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.12688/f1000research.51117.2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.922295Z","title":"Data extraction methods for systematic review (semi)automation: Update of a living systematic review [version 2; peer review: 3 approved]","venue":null,"work_id":"08274c0e-ab2a-4f69-bef6-39514a99e927","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.824462Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:e12bf496d8f1cef74d188638de46d43b08e759e8bd81f3b9b182e4c2e9036b66","observation_id":"25b1e172-1af5-4a79-be85-76ea657b1997","resolution":{"observed_at":"2026-08-06T15:46:08.928184Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.829830Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.829830Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:0911d941d1a06b0251c4cfa3023b686e99e9a5fdb0a76f161152c54962410fee","observation_id":"094ae696-9487-4bcc-8bfd-ea6e8255c58e","resolution":{"observed_at":"2026-08-06T15:46:07.829830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.834832Z","title":"The data is in: Deciding when to automate screening in your slr, November 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.834832Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8252a434e26f9d1645eb08e1e2de831ca37687d27de1190967117a553dc9d07b","observation_id":"d8fbea24-066b-455d-b1ca-bda23239e5b1","resolution":{"observed_at":"2026-08-06T15:46:07.834832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.839801Z","title":"Toward automated data extraction according to tabular data structure: Cross-sectional pilot survey of the comparative clinical literature","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.839801Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a73a5f64e30813978aa1bde1270db9206a87ad65ca174883017347affc4fbf0b","observation_id":"f63edf05-4f58-41af-89ae-082feb262b6e","resolution":{"observed_at":"2026-08-06T15:46:07.839801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.854237Z","title":"MetaMate: Large Language Model to the Rescue of Automated Data Extraction for Educational Systematic Reviews and Meta-analyses, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.854237Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c47b61d707ec0bb23bce5fe95673af1e9e10a50dccb0545c5c7b20768edbc1ca","observation_id":"28e34ed0-8485-4fcb-8124-2dad653175dd","resolution":{"observed_at":"2026-08-06T15:46:07.854237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.864218Z","title":"Chatgpt: Large language model (mar 14 version)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.864218Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:401fd591fbfca4c2927711778fe048a3f908409bdf9cc232c303760484c8fe80","observation_id":"e7c78217-16e8-4a6f-8fd3-64c498887a46","resolution":{"observed_at":"2026-08-06T15:46:07.864218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.870017Z","title":"Claude 2 model announcement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.870017Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d2400a2a74d14d7a1efdfe113c16bb7ef4de82257578bd530ff9025ee2b4dcae","observation_id":"cac6f8e3-00ef-4460-b6f3-4ea7f1d4f000","resolution":{"observed_at":"2026-08-06T15:46:07.870017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.875116Z","title":"Zero-shot infor- mation extraction for clinical meta-analysis using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.875116Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c3d9f16870b383e0f2adee3e8bb4136fd618db8f91ef161319fd2706a564418e","observation_id":"583f778e-b019-49a5-aa43-88fadb7779a7","resolution":{"observed_at":"2026-08-06T15:46:07.875116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.880456Z","title":"Performance of two large language models for data extraction in evidence synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.880456Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a6f0a06b45c0fb52087f50c5d82b176d8901f115e37e81deac613e081578480f","observation_id":"75556778-c65e-4b3b-8f2d-8b86090c2e79","resolution":{"observed_at":"2026-08-06T15:46:07.880456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.885286Z","title":"Automatically extracting numerical results from randomized controlled trials with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.885286Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:719fb4e2d9d2b5f704df4dd14cc09e9b3b56b1f9a260404897763e099220cc8a","observation_id":"6705cf30-2390-4d27-9f7e-b02c0a6a2512","resolution":{"observed_at":"2026-08-06T15:46:07.885286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.891121Z","title":"Exploring the use of a large language model for data extraction in systematic reviews: a rapid feasibility study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.891121Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:1bd7aa5de4a51dd671fd466a5d1925bed89db0700f50150a46f30ce69ec51b32","observation_id":"fe259602-0acf-4aa5-9e96-25afc38508d9","resolution":{"observed_at":"2026-08-06T15:46:07.891121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41598-024-52894-8","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.859866Z","title":"Lee, Shigeki Yamada, and Tomohiro Mizuno","venue":null,"work_id":"4a2c6a8e-4163-47bd-8294-90db8263d608","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.896068Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d6cd466b4b2f98154fb3f55e687200fb031ecc23509648373a3c9cfd689a3017","observation_id":"94bbea6d-b5f3-4320-89d7-15055bdf1e24","resolution":{"observed_at":"2026-08-06T15:46:08.866219Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.72502","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.362423Z","title":"Effects of the Modified DASH Diet on Adults With Elevated Blood Pressure or Hypertension: A Systematic Review and Meta-Analysis","venue":null,"work_id":"99376167-685c-43d4-b6ac-febef22cac60","year":2021},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.901443Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ab5e7ac15ee44c7691a496566f2719bb7ae56961d412aefe572f3fc097c0764a","observation_id":"1cfbaa80-85fd-4a5a-97d0-24a0a022a479","resolution":{"observed_at":"2026-08-06T15:46:09.370112Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12906-023-04257-5","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.816421Z","title":"Abdelrahim, Nivine Hanach, Refat AlKurd, Moien Khan, Lana Mahrous, Hadia Radwan, Farah Naja, Mohamed Madkour, Khaled Obaideen, Husam Khraiwesh, and MoezAlIslam Faris","venue":null,"work_id":"9a48907a-abb9-42f1-8d52-63f7a26820ba","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.906139Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6d7c4453a358de4b186f7606e54b1032b24fd60d3a487ac1f8685a38387f74c6","observation_id":"96dc95e7-b78e-47d4-bdca-e36962197bcf","resolution":{"observed_at":"2026-08-06T15:46:08.829269Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.14583","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.271237Z","title":"Effect of dietary glycemic index on insulin resistance in adults without diabetes mellitus: a systematic review and meta-analysis","venue":null,"work_id":"a252c44c-405b-468e-81b6-49b4534d96ab","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.913293Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3c2f8ff491fde5132137226bef4266d0f416e16cff1785c4626debbad4e5cfa8","observation_id":"64105b66-d969-41af-a918-8da6e2c4b62b","resolution":{"observed_at":"2026-08-06T15:46:09.285708Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/dmrr.3843","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.791708Z","title":"Choi, Min-Sun Gu, Seo-Yeong Ko, Jae-Hee Kwon, Ja-Young Han, Jae Hyun Kim, and Myeong Gyu Kim","venue":null,"work_id":"f5f074da-6df0-4964-9990-b5fa117c6c56","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.918186Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:972682a211c4f99e39dc40874a0557130fcea25f7398384de95e5a7575a87c04","observation_id":"8b698dba-6c1e-4100-a69b-c5908f7b0a20","resolution":{"observed_at":"2026-08-06T15:46:08.799935Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1530/eor-22-0022","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.766140Z","title":"V olar locking plate vs cast immobilization for distal radius fractures: a systematic review and meta- analysis","venue":null,"work_id":"50452f78-b3e5-42d9-a2a4-729bb182e93d","year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.924380Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:238d08371efe0fd6d16d4bd8b7d9413adbd37e2f9f64bd8ffe7d13304b2d77ee","observation_id":"5c6db0f3-9237-4145-a5d2-9b5c829d2f1e","resolution":{"observed_at":"2026-08-06T15:46:08.774773Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.934074Z","title":"Gpt-4o mini: Advancing cost-efficient intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.934074Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7f90e367a9ba3813553d7221336bfc3b292741627e791e97af955ae5ba51be24","observation_id":"34192b22-a459-443b-8287-0cf5870d8db2","resolution":{"observed_at":"2026-08-06T15:46:07.934074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.939758Z","title":"Gemini 2.0 flash","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.939758Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:0c4955e84ea5972c56d24acc0348fa7969068b82c41d8a3ab776f1596a4ccf8d","observation_id":"c32e8170-e0d4-4921-9966-1a46b81557ab","resolution":{"observed_at":"2026-08-06T15:46:07.939758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.945503Z","title":"Grok-3 language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.945503Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f464cfc00e186c919928197ff918c72be49b4c6d3af40fa71830e5481a56234a","observation_id":"93682bef-d44e-4c7c-8a57-315a4becb015","resolution":{"observed_at":"2026-08-06T15:46:07.945503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.951933Z","title":"The impact of temperature on extracting information from clinical trial publications using large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.951933Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a492467f1a7ac709f2ab35667fc444302c0656f67d5a9b7533aa1019b4cedc95","observation_id":"8b9cbaff-4f41-4132-857c-c60de2b330d0","resolution":{"observed_at":"2026-08-06T15:46:07.951933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11840","last_updated":"2026-07-29T21:54:40Z","snapshot_observed_at":"2026-08-02T23:10:13.538051Z","submitted_at":"2025-01-21T02:49:43Z","title":"AI-Assisted Data Extraction for Systematic Reviews in Education","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11840","snapshot_observed_at":"2026-08-06T15:46:07.958889Z","title":"Schroeder, Chris Davis Jaldi, and Shan Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.958889Z"},"links":{"cited_paper":"/paper/2501.11840","citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a84bd3a7aa91a122341dd0e204c4988e783da0c9cc3a6a7797697efa10c625f3","observation_id":"4bbf6358-214b-43d1-afdb-4f0aea3b2d51","resolution":{"observed_at":"2026-08-06T15:46:07.958889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.965054Z","title":"Use gemini 2.0 to speed up data processing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.965054Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:162ab3cb95073d5780701bf1abbab585ba605a427a631f125f97749d9012310d","observation_id":"178abf96-a100-40cc-b4ea-fefa51c92b6a","resolution":{"observed_at":"2026-08-06T15:46:07.965054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.34297/ajbsr.2025.26.003468","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.742981Z","title":"Harnessing ai for integrative medicine: Exploring grok 3’s role in researching qigong, tai chi, yoga, and mindfulness for college students’ mental health","venue":null,"work_id":"831bf2c3-3a34-40ca-842b-ed3cc7468e00","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.971513Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ef185affb96498f31ad6bef249b85f3700cf3402986914596f36c755754aea9b","observation_id":"f654e4b5-931a-4750-a1f4-2c9e8ea67a82","resolution":{"observed_at":"2026-08-06T15:46:08.748746Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.336166Z","title":"Microsoft adds elon musk’s grok-3 to azure, citing health- care and science use cases","venue":null,"work_id":"6d4f6728-f7f6-4901-aeb2-a2aa53e99449","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.976676Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3d245fdb3656b56994747694e1fdf3258ef6a8ba0f41b40c811e4beec897345f","observation_id":"759dce94-632b-4544-a756-d882cdaf18b0","resolution":{"observed_at":"2026-08-06T15:46:10.347631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.310138Z","title":"Reflexion: language agents with verbal reinforcement learning","venue":null,"work_id":"df98a786-ac9d-442d-9478-67dadb1edf7a","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.989820Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6b2855d080c15f0f93351489a24ba6af96bc3f58c259bf7204427fe20c5ffe12","observation_id":"fc9056f3-42b0-4a30-89cd-34b59992be83","resolution":{"observed_at":"2026-08-06T15:46:10.318292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:07.994474Z","title":"Towards mitigating LLM halluci- nation via self reflection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.994474Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8e7b7a21c8d07986dce489ce7f933cbd5a0f2891f7fe7705eb0dd3f80f1357f8","observation_id":"2acec01b-d982-4110-aa42-d3a6d238ea8e","resolution":{"observed_at":"2026-08-06T15:46:07.994474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.287733Z","title":"When hindsight is not 20/20: Testing limits on reflective thinking in large language models","venue":null,"work_id":"1cadf30a-b0d8-4ffa-bd42-dad9aba18850","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.000826Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f25870cbaf22c9e264e8bec02083ef73fe64d79cd65c74433510aaa147f35466","observation_id":"6c7a93d2-95b1-41d6-8356-4ae8b04c0c95","resolution":{"observed_at":"2026-08-06T15:46:10.295126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.260642Z","title":"Dietterich","venue":null,"work_id":"a81504b2-6175-4f61-81ba-6f0bbf193cbd","year":2000},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.011272Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:b1725bfe6119d7ae97b6a853c005bb5b0fe5854ca14b5d3d84882d0714c50e42","observation_id":"ccc81064-a620-4159-a80e-ba3512ca49d4","resolution":{"observed_at":"2026-08-06T15:46:10.267940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.018396Z","title":"A survey on ensemble learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.018396Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:27224e15a2498114d9e6e67d7b3dafd0dbbea0391d86774b98fbb8d5fb4efbc8","observation_id":"23f4b757-ac28-47ef-8306-fc3ec919bcb0","resolution":{"observed_at":"2026-08-06T15:46:08.018396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/jamia/ocae061","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.637843Z","title":"Ensemble pretrained language models to extract biomedical knowledge from litera- ture","venue":null,"work_id":"21d73a2f-6fa9-4b50-9478-9510efaf4d89","year":1904},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.023179Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:bf034a02e2861e6a224a84877bcf747673dd624046aef4a8ed131736333fee97","observation_id":"e84df5e4-15d8-4caa-aca3-aba9d2a57a96","resolution":{"observed_at":"2026-08-06T15:46:08.645522Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/s12859-022-04994-3","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.611011Z","title":"Zhang and A.L.P","venue":null,"work_id":"df44d8f3-85d9-4ac6-995d-a50cba157feb","year":2022},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.030348Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4d4b003985fa3f181b43d5fcd2ee8bf98763459ae76340d15610691375533923","observation_id":"8d7ef2bc-7931-463f-922d-5202489506dd","resolution":{"observed_at":"2026-08-06T15:46:08.618170Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s43856-025-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.576979Z","title":"Comprehensive testing of large language models for extraction of structured data in pathology","venue":null,"work_id":"6fdf4614-e8d2-481c-93c0-c05d15d9ac0b","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.036361Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:1b7941573c3d5ab5eb14f29ee60bcfb7d6838780baf76e84185285ed9979d395","observation_id":"31adf290-91b9-4d02-862c-b19873f71cee","resolution":{"observed_at":"2026-08-06T15:46:08.587520Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.29173/wclawr112","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.536788Z","title":"Innocence discovery lab - harnessing large language models to surface data buried in wrongful conviction case documents","venue":null,"work_id":"c51f7632-3061-4240-bfc3-829c2c61c587","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.041977Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:5fc771d8065f6fe5ed13e075aba5eafee1c7bf17ff34d63a58b577ec568e2d13","observation_id":"d28dc553-4477-4edf-b7d3-e393a2f59d3f","resolution":{"observed_at":"2026-08-06T15:46:08.546789Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.235130Z","title":"Match, compare, or select? an investigation of large language models for entity matching","venue":null,"work_id":"75739ffe-df2d-49a2-8205-a27083b2a47d","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.048626Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9b54da5f89df15a3d243dcaa25bbf7e52c7756bd7bc69d425266b2ad9fca67ad","observation_id":"18e1f353-74a7-4807-89c8-99ee1df24e4f","resolution":{"observed_at":"2026-08-06T15:46:10.243358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41746-025-01546-w","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.508560Z","title":null,"venue":null,"work_id":"ec12a7d4-479a-4e2f-80dc-98367b5823e5","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.053892Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:c4e88228d0350a1dad8e7b83efe95e05e4b5a4294d11ea771d52caf125993ea3","observation_id":"cc3c1a78-35ff-4e69-a324-9c56813ca94d","resolution":{"observed_at":"2026-08-06T15:46:08.516502Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.061584Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.061584Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7c57be9ab31044933123a048228ab89a77c7fa408b708cf7b8075bfa0d17749d","observation_id":"84af77db-91b6-4c1a-b14e-2095284f718e","resolution":{"observed_at":"2026-08-06T15:46:08.061584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jclinepi.2010.04.026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.482650Z","title":"Guyatt, Andrew D","venue":null,"work_id":"27ddda08-7d00-417f-80bb-f03281cd194d","year":2011},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.068084Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:02fe3022bf0dde17f2e01e6393d2186b943ae248d7111f0b12c7e8ad8642d98f","observation_id":"3f397eca-7685-4cf9-8b04-69ba6bc821d3","resolution":{"observed_at":"2026-08-06T15:46:08.492238Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20113","last_updated":"2025-04-28T00:40:17Z","snapshot_observed_at":"2026-08-07T18:42:22.669204Z","submitted_at":"2025-04-28T00:40:17Z","title":"Transforming Evidence Synthesis: A Systematic Review of the Evolution of Automated Meta-Analysis in the Age of AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20113","snapshot_observed_at":"2026-08-06T15:46:08.075310Z","title":"Transforming evidence synthesis: A systematic review of the evolution of automated meta-analysis in the age of ai, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.075310Z"},"links":{"cited_paper":"/paper/2504.20113","citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:b06c470b8d427b8fc864e53a486a4cbb7bb4608becb279db5a5f0f15e0b7f59d","observation_id":"8614a940-0e89-4af5-add4-f99fb77eb40c","resolution":{"observed_at":"2026-08-06T15:46:08.075310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.187886Z","title":"Agentic reasoning: Reasoning llms with tools for the deep research,","venue":null,"work_id":"8845264e-8657-4757-a88b-09ad8e71d87b","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.083557Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:a2533739c72d62408cf326c82215cff0b3b0d1892019334d5ca43f3d0d874dc3","observation_id":"449df189-eab1-4838-8f8f-8e5dc1abdc35","resolution":{"observed_at":"2026-08-06T15:46:10.198891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.166239Z","title":"TART: An open-source tool- augmented framework for explainable table-based reasoning","venue":null,"work_id":"fc25f3de-a99a-44d6-b96e-be148faa73ab","year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.099934Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8d770aad7dafbd5d5a928dfbe80e4ddbff5e80feeb23449764e3924208290452","observation_id":"2aa669b4-d09e-46ea-aa25-0ac7f3da646a","resolution":{"observed_at":"2026-08-06T15:46:10.171211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.105709Z","title":"Medical hallucination in foundation models and their impact on healthcare","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.105709Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:183c7abfc8016c32a4372caa57f5fa631fac009d1fbcd553e3a9ec4a190b4ebc","observation_id":"b81958ca-a660-4689-bb8e-db65fdbe01a3","resolution":{"observed_at":"2026-08-06T15:46:08.105709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.111858Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.111858Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:22c6d2b42050e9b94a6bc5341ddd6fb330f5847ded1066f968aecabd641340bc","observation_id":"cabcab11-7bd8-46b3-ae71-b44625490a07","resolution":{"observed_at":"2026-08-06T15:46:08.111858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.118777Z","title":"Potential roles of large language models in the production of systematic reviews and meta-analyses","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.118777Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:22e85f990ff39faae0866c135c6f85988d5f66aca6759b4755da316410f26852","observation_id":"2b1898d8-f3f5-489c-9aee-2d67e449992e","resolution":{"observed_at":"2026-08-06T15:46:08.118777Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.148981Z","title":"justification","venue":null,"work_id":"02dd754a-9530-4ce0-a81d-e836bc140a27","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.124679Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:eeac9bc3356875bb159fcde922dc0befaf78dda1b0647a0c049d9e98ff1b81ed","observation_id":"93db9ab6-c6b9-4861-98f0-f20db0315ff6","resolution":{"observed_at":"2026-08-06T15:46:10.153899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.131755Z","title":"other_time_points","venue":null,"work_id":"5ac866b3-12ff-407a-9996-bc8c7eb582a2","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.130975Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:e6b647619b080a93d9a0c267644f0541d5fab5b486ead91d95d168047ffe4496","observation_id":"e1d54069-2ad1-44a4-9a0c-74c7a7d12d35","resolution":{"observed_at":"2026-08-06T15:46:10.136844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.113120Z","title":"needs_transformation","venue":null,"work_id":"7bf6e497-6c50-477f-9f4f-ecb3babeaff9","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.136861Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:b14f5c595539b8437ab938d98f044c541327b2bdbfe51e21e023bba65a9a0a6d","observation_id":"69682989-e509-4562-9ede-0699148ce6d3","resolution":{"observed_at":"2026-08-06T15:46:10.117550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.095460Z","title":"null\"`, NOT `","venue":null,"work_id":"da4d2d8d-b3d1-4ce5-bc8b-b409e1bfd0a1","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.142821Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:74741f1347339824d2907ecfcd86dcc02f1f89475198c2acdace173eb9376fe9","observation_id":"5af7e017-6330-4c4b-9a15-b03cafc5d496","resolution":{"observed_at":"2026-08-06T15:46:10.100782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.069808Z","title":"more common in the intervention group","venue":null,"work_id":"56c481fd-583a-4e91-ba18-5692f693d5da","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.149296Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:507b75b574a50c3db78a034f357c7f6a5569cd0316379a53546318a15a2086d4","observation_id":"502eff7e-a05c-4706-a710-8504908387b9","resolution":{"observed_at":"2026-08-06T15:46:10.078892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.050344Z","title":"data_conflicts","venue":null,"work_id":"3fa7f6cc-5263-4003-b4c7-105d5687e075","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.156022Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f60f072c26335d3abe5f981437997082938232ff2ada6c27f75d80d856d758fe","observation_id":"03ae9405-e1de-40c5-a58f-b5f4d3b0af26","resolution":{"observed_at":"2026-08-06T15:46:10.058081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.030987Z","title":"pdf_status","venue":null,"work_id":"a79b89c7-5ee5-4b00-9609-f701d0ada2a3","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.167425Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9448700cb62ecc8b56e6500dca6f2ca9559576cc04a206843864439665177564","observation_id":"cbdb9462-4a71-409a-9055-a8c6b0f3411e","resolution":{"observed_at":"2026-08-06T15:46:10.036874Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:10.013244Z","title":"pdf_status","venue":null,"work_id":"8d4e0190-d513-4643-ac5d-23852e7d9dc1","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.175488Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:29b92c16fc44f82a382bc5289eadddd5cf7a5081691f2c49ab073362807052ef","observation_id":"be175a7f-d594-4d4a-b249-ba68e6a3e99c","resolution":{"observed_at":"2026-08-06T15:46:10.018641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.995635Z","title":"- Identify any *structural inconsistencies* (e.g., missing key study characteristics, incomplete sample size reporting)","venue":null,"work_id":"4eaf52d1-b1b9-4143-a470-1f615508e58e","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.180143Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:edc639ae6683b240fdb08488d70fcb60064bad7cf699bc1098656c8ad6b439dc","observation_id":"b871bc30-9e35-4490-80b3-93fad8c85ad0","resolution":{"observed_at":"2026-08-06T15:46:10.000536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.976351Z","title":"- *Unit consistency*: Verify all measurements use the correct units (e.g., blood pressure should be in mmHg)","venue":null,"work_id":"a5a9b85c-856f-4e24-834a-0b217227e7c6","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.185009Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:cb3b83a62f028eb491142de8f04e16b1365cbfe3851ea7cc4a4fc79c69d22a4e","observation_id":"011d302c-57c1-4b6c-9e08-c0b603624a95","resolution":{"observed_at":"2026-08-06T15:46:09.981621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.950307Z","title":"- Identify discrepancies and data conflicts between different sections of the paper (e.g., abstract vs","venue":null,"work_id":"33224557-decf-424d-b66d-1095452ec8f9","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.190287Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f1cecdc023731a134edb6c3045dbe63c49804cf9358f427544086389108dffc4","observation_id":"7e25a773-219d-4351-b77e-f33ec5ef81cf","resolution":{"observed_at":"2026-08-06T15:46:09.956642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.924051Z","title":"source\" the most appropriate location in the paper for this data? If not, provide a more accurate source. - Confidence Justification: Is the assigned","venue":null,"work_id":"3d015a27-ccac-4d42-a77f-6cb2b943fbda","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.194780Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8a1401b825eaa3a4fbff589f4af6578cbf3187529aa20afec38ab06971a178c2","observation_id":"eeed05e4-b1e0-4c03-8474-33f38239b288","resolution":{"observed_at":"2026-08-06T15:46:09.929667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.903604Z","title":"needs_transformation","venue":null,"work_id":"e10e8b72-738c-4e54-b66e-d45182ae7270","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.200814Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6386b1a8f181aeb8053edc0605608d687cb6a75121e25e7da5b0b8f7d0028ad2","observation_id":"b82d1c6d-022f-4f65-b6be-1fa851dfde95","resolution":{"observed_at":"2026-08-06T15:46:09.910425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.885567Z","title":null,"venue":null,"work_id":"942e7280-9c69-4fd3-9098-85c6d24b7596","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.207241Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:afa86da714bf8d70d182d620821772bd94a5dc061544aacdba77d426955cef5a","observation_id":"3c9eca83-c241-4135-8854-e64f65e33fec","resolution":{"observed_at":"2026-08-06T15:46:09.890938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.866336Z","title":"null\"` or `","venue":null,"work_id":"8a328117-fc9e-42f7-a81f-9b71c4c7a83d","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.212807Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:ebca25db33ff03617d64d629438f0c2804707f39217d4ac9027c48b6f3dc1294","observation_id":"8fdb2b6c-3a11-49f8-9877-ccc8cae1ee5a","resolution":{"observed_at":"2026-08-06T15:46:09.871709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.848667Z","title":"revised_value","venue":null,"work_id":"37935961-b56d-4c66-a363-4d4ffc5a7b1f","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.217778Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:493e68421b2ea0086eaa7223e1f7564e71dd9158c84937ec54f86057e413399d","observation_id":"92559793-e3f6-4e01-bbf9-3f5fdee6ad67","resolution":{"observed_at":"2026-08-06T15:46:09.855205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.830199Z","title":"pdf_status","venue":null,"work_id":"c9304b03-6c59-4c2a-868c-b0a066e9f9f4","year":2023},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.222572Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:23a25e07bd5154495f0029bf4bf77921bd535dcedb71a372d274134700053c26","observation_id":"9fc1478b-13be-463e-83ff-8a368299de13","resolution":{"observed_at":"2026-08-06T15:46:09.835083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.807902Z","title":"confidence","venue":null,"work_id":"99725ce3-7e05-4159-9050-2607284b8648","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.234818Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3296847fb330136e43b680549fce19841f8d356e55fb5d647e1e99560668dded","observation_id":"90943ae5-6f81-415a-8a34-8356cbc00d3f","resolution":{"observed_at":"2026-08-06T15:46:09.813283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.787783Z","title":null,"venue":null,"work_id":"8359a8c5-208c-4861-a5e1-71fb3fbdda3b","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.240837Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:24cb0b5c0428e25134d9130fa72878b75fa22eafd1a3f506f53ff24091b82b9a","observation_id":"aa8d47f0-2708-41cd-a7a1-9c15b0df1e89","resolution":{"observed_at":"2026-08-06T15:46:09.793979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.764986Z","title":null,"venue":null,"work_id":"ba594968-d040-4628-a4ce-61e0e41ddcd8","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.246699Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d77da9fbeac0f54699f5bb7ca87ec4ee3603c44ac6b15a20af055d53310e36c4","observation_id":"d2d90d35-360b-48b9-b65e-437e63df213b","resolution":{"observed_at":"2026-08-06T15:46:09.770068Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.748452Z","title":"Just return the final merged JSON object","venue":null,"work_id":"10348bf6-7e5c-4341-bb5e-0996740b5125","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.252902Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7cf0d5450e4dc7d0a64aa68d4475352aea86dba425090919faab2e7a881ea631","observation_id":"41fcd1e8-5048-4941-909e-7a53cd38dea4","resolution":{"observed_at":"2026-08-06T15:46:09.753155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.708551Z","title":"LGL_group","venue":null,"work_id":"5f45c079-7f9b-4ea9-adc1-5c432df0d8d5","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.270446Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7da67ecb4b622759c27773ec4b623b34454ceeea1a256297c7cdc172c3a51f43","observation_id":"9385cae5-652e-45cb-8c22-60b0402bf079","resolution":{"observed_at":"2026-08-06T15:46:09.713347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.689673Z","title":"**Note:** EXT fields may be nested","venue":null,"work_id":"d662518c-5960-46e8-9f0f-54bf6cbec332","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.277351Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:8be6d66c39231fb20f782fa418c988b328851172a09156e373afbbcabb01c2a1","observation_id":"bd83a4e9-a0df-4780-ada0-9ec931fa8fcd","resolution":{"observed_at":"2026-08-06T15:46:09.694694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.674634Z","title":"kg/m²\"` and `","venue":null,"work_id":"b1733554-215d-4710-86d8-3f180474a7a8","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.284067Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7ad8eb081bf717d9690d7d66674fd6d88eb82e77bfdcd4089ca8faa3b01ccdd9","observation_id":"6c0500bc-867b-4458-806d-71ba0e2a6d13","resolution":{"observed_at":"2026-08-06T15:46:09.679005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.659645Z","title":"low glycemic load diet","venue":null,"work_id":"ab810b34-589b-4cb1-b4a1-62b256b92faf","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.291370Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:439b19a5e783019c448c0cbc8ad54658b44ccb8007b1da983158a1c0ed920b21","observation_id":"7176815e-0209-41f6-8c8e-5775018994e1","resolution":{"observed_at":"2026-08-06T15:46:09.664051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.645039Z","title":"null\" or","venue":null,"work_id":"531d2794-fc7e-48cc-9079-a5ed0a5cb7fb","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.296906Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:79d30e749b69b5214de0c91a43e674684b7204c5673ba72b524f30aab6d19521","observation_id":"17f12667-e5e3-4b97-af9c-4857f228a268","resolution":{"observed_at":"2026-08-06T15:46:09.649218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.630444Z","title":null,"venue":null,"work_id":"49a70989-32fe-405f-bf26-53d222a357d3","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.305674Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:9d0d8d41999bf7bb41c9857f214378da58d64777a983677b5b8bf07e0a19fefb","observation_id":"1be37d85-a7de-4cf8-8428-1f2016d914b7","resolution":{"observed_at":"2026-08-06T15:46:09.635116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.615377Z","title":"randomised controlled trial","venue":null,"work_id":"1fda5cb4-b449-4e14-9ec9-0330f077b185","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.316558Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:7df5a9c5fc744993dfc4c35d96bfb19660a011774bb46ffddd3a96bd2b1119be","observation_id":"2edfcde8-35c9-4f4d-9765-3301503073e9","resolution":{"observed_at":"2026-08-06T15:46:09.620028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.600334Z","title":"You may refer to EXT field meta-information (e.g., `source`, `notes`, `confidence`) to aid in field matching, especially when EXT uses vague or ambiguous labels","venue":null,"work_id":"62aff1eb-f2d5-414f-89a6-3c8861ee964d","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.322330Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6847004724b587ac60dffdcfbf5c7215c158afc35b2cef7aa8af9e6028ae2349","observation_id":"fc808152-11b7-4421-add0-9536fa7c8b8c","resolution":{"observed_at":"2026-08-06T15:46:09.605521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.585252Z","title":"not reported","venue":null,"work_id":"ad6a30b4-1826-4596-808a-98c67aaa6acc","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.328561Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:99182c056e7e7fdc0834192830388e8e4d7318f5bef6ff0f6a77b199f92685f8","observation_id":"cdf87145-1676-4d00-b375-3100fed7d3fa","resolution":{"observed_at":"2026-08-06T15:46:09.589766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.569963Z","title":null,"venue":null,"work_id":"33e1ecf0-a86a-4517-b1a0-e6f53060f355","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.335133Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:e34b7b213df91408fc8d2063ddc40d22e26d82c0b5335930efcc936bf1801549","observation_id":"685b9bca-5db9-43cd-9dad-2c4663eac3aa","resolution":{"observed_at":"2026-08-06T15:46:09.575016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.553966Z","title":"null\" or","venue":null,"work_id":"68c18e06-3970-4b87-941d-99ad5914deeb","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.340397Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:290252cc3ee97f558eb20b73b3ed1417092d22bacf92500ced54159154330010","observation_id":"8c836ecb-5ab3-4107-a7c8-4d359f7eae8a","resolution":{"observed_at":"2026-08-06T15:46:09.558785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.725751Z","title":"This is the preferred method","venue":null,"work_id":"f39a5965-ca50-4ad1-b78d-fbd04ecac9e2","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.345245Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:f1fafad6d92ae0f189a1520fa2e558740daa73c06f4f61aa002da043fbeca247","observation_id":"606b3b47-a88b-4036-b68c-99e978ad0083","resolution":{"observed_at":"2026-08-06T15:46:09.731507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.538591Z","title":"study_characteristics.PC","venue":null,"work_id":"3ecab22a-4cf9-4aa3-a79b-3bc54762f0df","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.350379Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:71a3737b3fd2eca66d93a1ad9fc9b0ff6083dfde71d876aeff7897de798bb389","observation_id":"eb4f5bfe-8964-4cb9-82f6-44340197761e","resolution":{"observed_at":"2026-08-06T15:46:09.543680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.523579Z","title":"**Note:** GT and EXT fields may be nested","venue":null,"work_id":"1fadb4de-1c4d-4e8e-a8f4-00b289cab076","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.357558Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:2b43bb42f55abbb52d4dcdaefea4f94fc91fe3d075d1a5a643c28ef243e5f4b4","observation_id":"6f81d274-411b-4662-8a29-b2a4b800eb0c","resolution":{"observed_at":"2026-08-06T15:46:09.528298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.508446Z","title":null,"venue":null,"work_id":"80150ca3-e4b8-4a36-b6bc-6ed6c2e0eb02","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.363013Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4f2427da4c1a22d9e5450cfc8fa72dd0a43cebff75f80e9db0b31910974e8cd2","observation_id":"d9c6a707-ca25-4048-ab83-9962fac63c46","resolution":{"observed_at":"2026-08-06T15:46:09.513048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.491034Z","title":"Hallucinated","venue":null,"work_id":"e15fc495-3154-447f-87c4-960d4fd1cf36","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.370459Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:839bd4d8d184199e2c0ec4cb8bba4fdcb33b2f57f1cbaed56a9e64af17ff254f","observation_id":"f85a4249-4b59-4dd7-8a96-a6d65085bd5f","resolution":{"observed_at":"2026-08-06T15:46:09.495300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:09.476401Z","title":"Not reported","venue":null,"work_id":"9aa6dcea-9fe3-4a4b-8b0a-15593dbd87ce","year":1976},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.376749Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:3c4e8274ff566f5578115b9a5e5a39efcd1c83ebd74898ddfff5780d55287450","observation_id":"630a5e2b-c286-48be-b87e-e5bf735924fd","resolution":{"observed_at":"2026-08-06T15:46:09.480859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1186/1472-6947-10-56","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.985897Z","title":null,"venue":null,"work_id":"1436c057-c0df-48a1-8d2e-d6dcf741cde8","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.723776Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:637de5c843d22c69f8b402c4f8a79bbf82ebbd5ec5e13a8d6866739432d0ae97","observation_id":"6eb66810-3256-4c2e-ac1c-081f1c2e57ba","resolution":{"observed_at":"2026-08-06T15:46:08.993029Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2196/33124","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.898026Z","title":"doi:10.2196/33124","venue":null,"work_id":"f2ffbe0f-a3c0-4d14-8561-6bf1d8452717","year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:07.844989Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:4b5479111232b5aaca6d8e1882d260111d474b0de9d394f34939e4c759c8e2b1","observation_id":"f2e4c449-39dc-4619-bcfe-c1fbc710d46c","resolution":{"observed_at":"2026-08-06T15:46:08.908021Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-naacl.237","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:46:08.700496Z","title":"doi:10.18653/v1/2024.findings-naacl.237","venue":null,"work_id":"002b4e91-55b5-45f9-97f7-531cf80673fb","year":2024},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.006169Z"},"links":{"citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:d79198985f7cc34d701eecb8af2b77006e01c092ce333429f767329c6e3a6156","observation_id":"d98a3bf5-63c6-4afe-962e-99dc9b911760","resolution":{"observed_at":"2026-08-06T15:46:08.707784Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04644","last_updated":"2025-07-14T20:06:23Z","snapshot_observed_at":"2026-08-08T21:56:36.049143Z","submitted_at":"2025-02-07T04:08:46Z","title":"Agentic Reasoning: A Streamlined Framework for Enhancing LLM Reasoning with Agentic Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04644","snapshot_observed_at":"2026-08-06T15:46:08.090594Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:46:08.090594Z"},"links":{"cited_paper":"/paper/2502.04644","citing_paper":"/paper/2507.15152"},"observation_digest":"sha256:6546dd8cf4299f17bbeaffeddca36e27126fcc5d56a0ec2fc2578e88cff4e923","observation_id":"eb66b4e2-c9ff-40f7-bcf8-a057212be15a","resolution":{"observed_at":"2026-08-06T15:46:08.090594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15152","last_updated":"2025-07-20T23:09:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T02:21:24.527293Z","submitted_at":"2025-07-20T23:09:04Z","title":"What Level of Automation is \"Good Enough\"? A Benchmark of Large Language Models for Meta-Analysis Data Extraction"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":5,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":37,"verified_exact":16,"verified_fuzzy":38},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 1 inbound Pith citation observation for arXiv:2507.15152."}