{"as_of":"2026-08-19T00:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e7757fefa82231530469848934b6964f5f2951986a5735aabc59e6a284d7030a","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:51:34.451656Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:44:25.941162Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":4,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2601.12910","last_updated":"2026-04-22T09:40:34Z","snapshot_observed_at":"2026-08-15T18:06:48.154984Z","submitted_at":"2026-01-19T10:04:33Z","title":"SciCoQA: Quality Assurance for Scientific Paper--Code Alignment","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:20:07.741347Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2601.12910"},"observation_digest":"sha256:2860c09f2766ae4cdc3452302c5e199df67172e16d342ee2eb1c193a4e782f0b","observation_id":"72a1682b-7151-4ec9-9350-342cd7bd97bb","resolution":{"observed_at":"2026-05-16T13:20:57.864061Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2604.12198","last_updated":"2026-07-02T17:39:41Z","snapshot_observed_at":"2026-08-15T03:11:55.740445Z","submitted_at":"2026-04-14T02:06:59Z","title":"Grounded autonomous scrutiny at scale: emergent critique from reproduction of published computational physics papers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T14:27:49.721496Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2604.12198"},"observation_digest":"sha256:0160bee42e2bc3af84a8274f603f3c6aad35e2d668be7457b23dd33e4e701014","observation_id":"ca655b53-07fd-4b61-973b-66e3a49045ae","resolution":{"observed_at":"2026-05-10T14:30:31.294703Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2605.10425","last_updated":"2026-05-11T12:00:13Z","snapshot_observed_at":"2026-08-13T22:21:27.451315Z","submitted_at":"2026-05-11T12:00:13Z","title":"Toward an Engineering of Science: Rebalancing Generation and Verification in the Age of AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T05:08:12.470413Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2605.10425"},"observation_digest":"sha256:3b5892d298deb0194a83c276aa5d3da1a5f183cf0767b460417c00a48b90287c","observation_id":"0e77ac46-83ba-4ad8-b712-fb2df2ad8082","resolution":{"observed_at":"2026-05-12T05:36:25.773935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2605.23204","last_updated":"2026-05-22T03:40:30Z","snapshot_observed_at":"2026-07-06T23:33:29.550551Z","submitted_at":"2026-05-22T03:40:30Z","title":"AutoResearch AI: Towards AI-Powered Research Automation for Scientific Discovery","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T04:46:43.679185Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2605.23204"},"observation_digest":"sha256:9973b22e9835026020311dbb6f0e7c91f620bd64c744ccd408a7425cab6f9b4d","observation_id":"3d31b126-e3a3-473a-8a3b-f5fb6b4cfc6e","resolution":{"observed_at":"2026-05-25T04:50:21.657844Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2606.18237","last_updated":"2026-06-16T17:58:05Z","snapshot_observed_at":"2026-08-16T16:35:17.192926Z","submitted_at":"2026-06-16T17:58:05Z","title":"ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T01:01:24.456670Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2606.18237"},"observation_digest":"sha256:79afcc6d53d7ec285a2d047d7d0d979142ef8bcd57acedaaae429bf312033af6","observation_id":"cdeecb52-f9fc-4dae-a1b3-c5278c3f73dd","resolution":{"observed_at":"2026-06-27T01:10:20.188905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2606.24177","last_updated":"2026-06-23T05:57:09Z","snapshot_observed_at":"2026-08-14T05:00:34.872558Z","submitted_at":"2026-06-23T05:57:09Z","title":"Agon: An Autonomous Large-Scale Omnidisciplinary Research System Built on Prompt Economy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T23:24:55.361203Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2606.24177"},"observation_digest":"sha256:7858089a1b54e9a85c82a7e6660af081ee95963a8ec84e0e2aaa6896f117b6f1","observation_id":"f42c506e-c08d-415d-9e9e-82acc792eee6","resolution":{"observed_at":"2026-07-04T17:50:00.401307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":"2505.11855","doi":"10.48550/arxiv.2505.11855","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"When ai co-scientists fail: Spot-a benchmark for automated verification of scientific research","venue":"ArXiv.org","work_id":"48e10f4b-4afc-4379-bd98-f017744ac5d9","year":2025},"citing_paper":{"arxiv_id":"2606.28277","last_updated":"2026-06-26T17:19:17Z","snapshot_observed_at":"2026-08-07T03:02:18.160309Z","submitted_at":"2026-06-26T17:19:17Z","title":"Towards Automating Scientific Review with Google's Paper Assistant Tool","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T04:15:47.487244Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2606.28277"},"observation_digest":"sha256:72dd52d6570ecb5972cba6a83b4f1a7743280fcd658eb8eb21b33db7b51a927b","observation_id":"e71ca82e-6069-4fb4-9765-b6404ae24430","resolution":{"observed_at":"2026-07-01T17:05:50.908192Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11855","snapshot_observed_at":"2026-08-02T04:44:25.941162Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13608","last_updated":"2026-07-15T08:56:56Z","snapshot_observed_at":"2026-08-18T18:31:15.674560Z","submitted_at":"2026-07-15T08:56:56Z","title":"Automatic Ordinary Differential Equations Discovery For Biological Systems Using Large Language Model Powered Agentic System","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T04:44:25.941162Z"},"links":{"cited_paper":"/paper/2505.11855","citing_paper":"/paper/2607.13608"},"observation_digest":"sha256:1529ba28c9c0a49e1a9f66cf5efb1b2f248ae05bdce992d687d5c46ab19c1235","observation_id":"5108484b-d59b-4269-bb6d-1d47841309d2","resolution":{"observed_at":"2026-08-02T04:44:25.941162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11855/citation-record","integrity":"/paper/2505.11855/integrity","json":"/paper/2505.11855/citation-record.json","paper":"/paper/2505.11855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:33.971756Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:33.971756Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:20d920fba9f4fa75f195861618992b40734c23e805e988ee4fd6bceaf81af60a","observation_id":"2d0c873f-7ae6-4190-a326-0335623f73a2","resolution":{"observed_at":"2026-08-15T20:51:33.971756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:33.977488Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901, 2020","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:33.977488Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:c634ea489decceb44bff25e5598ab82727cdbec08088fd97462dc2ceb47a84a6","observation_id":"f415ccc6-1207-45a5-904d-3aeb01b29bfc","resolution":{"observed_at":"2026-08-15T20:51:33.977488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-17T01:56:30.007145Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-08-15T20:51:33.982308Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation.arXiv preprint arXiv:2505.02018, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:33.982308Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:2d5fd952dd1c019a6c12a2a1b3aae43ff5daedb2356cfe6814d44402d8b2e9d3","observation_id":"7bb2e622-0bb7-408f-a4e1-f37537f1d806","resolution":{"observed_at":"2026-08-15T20:51:33.982308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:33.987609Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:33.987609Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:0f34da47afdb89ec4e595872a2860aa2abb696103dd423e8777543995f7de088","observation_id":"ac595b49-9203-461e-833e-4da9b9cbcc4a","resolution":{"observed_at":"2026-08-15T20:51:33.987609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21821","last_updated":"2025-03-26T06:21:56Z","snapshot_observed_at":"2026-07-06T20:59:54.016142Z","submitted_at":"2025-03-26T06:21:56Z","title":"PHYSICS: Benchmarking Foundation Models on University-Level Physics Problem Solving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21821","snapshot_observed_at":"2026-08-15T20:51:33.992511Z","title":"Physics: Benchmarking foundation models on university-level physics problem solving.arXiv preprint arXiv:2503.21821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:33.992511Z"},"links":{"cited_paper":"/paper/2503.21821","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:471ed83211bf698d2990c086e41fe310aee34700c68a7a49a607859992f6a910","observation_id":"2d27e811-b29f-49ed-90d8-a9872ccb6b1f","resolution":{"observed_at":"2026-08-15T20:51:33.992511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04109","last_updated":"2024-09-06T08:25:03Z","snapshot_observed_at":"2026-08-17T16:36:25.101775Z","submitted_at":"2024-09-06T08:25:03Z","title":"Can LLMs Generate Novel Research Ideas? A Large-Scale Human Study with 100+ NLP Researchers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04109","snapshot_observed_at":"2026-08-15T20:51:33.997813Z","title":"Can llms generate novel research ideas? a large-scale human study with 100+ nlp researchers.arXiv preprint arXiv:2409.04109, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:33.997813Z"},"links":{"cited_paper":"/paper/2409.04109","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b769e76ed3eb561fa79e0ab690a75deef95428f2d91d48c7a9906d548d78acb0","observation_id":"da9cf596-f628-4906-a4f4-a6e4f9b50e59","resolution":{"observed_at":"2026-08-15T20:51:33.997813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.003461Z","title":"Can chatgpt be used to generate scientific hypotheses?Journal of Materiomics, 10(3):578–584, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.003461Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:2319a7be3129b69f508cb5502d3ce38aa6829e7161fabb84e6e407434aa71c91","observation_id":"ceda3ba0-d88a-4be6-b092-16dbaea4c496","resolution":{"observed_at":"2026-08-15T20:51:34.003461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10120","last_updated":"2025-05-27T11:01:29Z","snapshot_observed_at":"2026-08-15T16:27:36.855506Z","submitted_at":"2025-01-17T11:12:28Z","title":"PaSa: An LLM Agent for Comprehensive Academic Paper Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10120","snapshot_observed_at":"2026-08-15T20:51:34.008442Z","title":"Pasa: An llm agent for comprehensive academic paper search.arXiv preprint arXiv:2501.10120, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.008442Z"},"links":{"cited_paper":"/paper/2501.10120","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:c896ee936ff2091405ed427df2d0896a4671dd0edc11a82e2c62593caa17a6af","observation_id":"99711ad0-3f2b-43a4-be06-0088f70f0552","resolution":{"observed_at":"2026-08-15T20:51:34.008442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.014130Z","title":"Generative ai in writing research papers: a new type of algorithmic bias and uncertainty in scholarly work","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.014130Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:6a77305d997f503efaf5230bc7fe79eb1e0ec5773a38105e9f6fc9196849af70","observation_id":"541aea6a-49a3-4b13-8ae6-08879e11df6c","resolution":{"observed_at":"2026-08-15T20:51:34.014130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-15T20:51:34.019504Z","title":"Towards an ai co-scientist","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.019504Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:7a742b4ffbc2e7abb1eea096ae243da6a7a77112f87b08a67d97af6808948038","observation_id":"a0197d09-e72a-4d56-8331-23c566057272","resolution":{"observed_at":"2026-08-15T20:51:34.019504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06292","last_updated":"2024-09-01T00:41:18Z","snapshot_observed_at":"2026-07-06T18:59:43.564435Z","submitted_at":"2024-08-12T16:58:11Z","title":"The AI Scientist: Towards Fully Automated Open-Ended Scientific Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06292","snapshot_observed_at":"2026-08-15T20:51:34.025322Z","title":"The ai scien- tist: Towards fully automated open-ended scientific discovery.arXiv preprint arXiv:2408.06292, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.025322Z"},"links":{"cited_paper":"/paper/2408.06292","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:85fc9839e260e62325f83cf35b53b4677818cb1f2ab93cf7eaa113bfbdbc98f0","observation_id":"a273955e-0333-4ad0-93ea-c6a6d6ae9f9b","resolution":{"observed_at":"2026-08-15T20:51:34.025322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.030797Z","title":"Ai mirrors experimental science to uncover a novel mechanism of gene transfer crucial to bacterial evolu- tion.bioRxiv, pages 2025–02, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.030797Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:8f508a28dadc493dfd8e65e2c0194caa1385f9b653800a57bdf2bfe5a91d82fa","observation_id":"dc2175da-2857-4477-a8b0-86e5b5516e6b","resolution":{"observed_at":"2026-08-15T20:51:34.030797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.035772Z","title":"Bran, Sam Cox, Oliver Schilter, Carlo Baldassari, Andrew D White, and Philippe Schwaller","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.035772Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:2482f2998d4cf50e9e53235753a70027f67f220af989b498bd6aae80844d929e","observation_id":"e86aaef8-191e-4d85-82f3-6ae296b78e44","resolution":{"observed_at":"2026-08-15T20:51:34.035772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.041049Z","title":"Quantum many-body physics calculations with large language models.Communications Physics, 8(1):49, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.041049Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:d09a2ef14b1f9888a1792580a72aac0258ff728ddb61467ba42d368e2f553f3d","observation_id":"ade9501b-4d23-4c27-b912-466c7bcc6197","resolution":{"observed_at":"2026-08-15T20:51:34.041049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.047576Z","title":"Alphaevolve: a gemini-powered coding agent for design- ing advanced algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.047576Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:4e741f7878d6b26628b887bb5fd87fc762282d5f480b488b8cf8456931e09478","observation_id":"1774546d-4a06-42b0-9f91-72d021a102e8","resolution":{"observed_at":"2026-08-15T20:51:34.047576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.056955Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in Neural Information Processing Systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.056955Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:72228e82a8164c364a20ec4e3cf5932f076e0d6791ac1deb4de70db6b248f1d3","observation_id":"133dfc56-28c4-423d-9371-dfd4d3188fd4","resolution":{"observed_at":"2026-08-15T20:51:34.056955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02164","last_updated":"2020-06-14T19:14:22Z","snapshot_observed_at":"2026-08-14T04:55:53.397142Z","submitted_at":"2019-09-05T00:25:17Z","title":"TabFact: A Large-scale Dataset for Table-based Fact Verification","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02164","snapshot_observed_at":"2026-08-15T20:51:34.061714Z","title":"Tabfact: A large-scale dataset for table-based fact verification","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.061714Z"},"links":{"cited_paper":"/paper/1909.02164","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:a83c03bea5d85d14e7553cc45fbeee3c2c2611b6ef34a66c9dfa5c2e2487ae94","observation_id":"109c1cbc-3da2-454a-ba2b-ab0daef44d97","resolution":{"observed_at":"2026-08-15T20:51:34.061714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.066723Z","title":"A review on fact extraction and verification.ACM Computing Surveys (CSUR), 55(1):1–35, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.066723Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:bf428d3c747039b69653336cd52ccba2f62bd56d0f6ad375bb851aa98513e299","observation_id":"8c58a3b7-a83f-492c-a3b7-642111f06c21","resolution":{"observed_at":"2026-08-15T20:51:34.066723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16541","last_updated":"2025-03-26T23:53:56Z","snapshot_observed_at":"2026-08-16T12:48:47.198039Z","submitted_at":"2025-03-19T01:46:09Z","title":"Poly-FEVER: A Multilingual Fact Verification Benchmark for Hallucination Detection in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16541","snapshot_observed_at":"2026-08-15T20:51:34.072118Z","title":"Poly- fever: A multilingual fact verification benchmark for hallucination detection in large language models.arXiv preprint arXiv:2503.16541, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.072118Z"},"links":{"cited_paper":"/paper/2503.16541","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:1c90914515d66b0a02b9577e349b39ba373fa48aca85f4ad883bbd211149a8eb","observation_id":"712017a8-56f3-49f3-8dd0-237e434a9bc4","resolution":{"observed_at":"2026-08-15T20:51:34.072118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.18526","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.366359Z","title":"Sciclaims: An end-to-end generative system for biomedical claim analysis.arXiv preprint arXiv:2503.18526, 2025","venue":null,"work_id":"17deb43c-f9d1-4a20-ac4e-16050e0f5352","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.077195Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:5bb8c7351e6a588bee0998d0d6403bb0834d8a37fa7c4974b63b86de5449873e","observation_id":"723fec5a-acf5-48d5-919e-c29c0c49e44b","resolution":{"observed_at":"2026-08-15T20:51:35.374442Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10003","last_updated":"2025-02-14T08:34:26Z","snapshot_observed_at":"2026-08-16T23:14:32.063641Z","submitted_at":"2025-02-14T08:34:26Z","title":"SciClaimHunt: A Large Dataset for Evidence-based Scientific Claim Verification","version":1},"cited_work":{"arxiv_id":"2502.10003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.10003","snapshot_observed_at":"2026-08-15T20:51:35.218874Z","title":"SciClaimHunt: A Large Dataset for Evidence-based Scientific Claim Verification","venue":"cs.CL","work_id":"df09ac21-a6e2-4f8b-9e78-e820c7bf9641","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.081901Z"},"links":{"cited_paper":"/paper/2502.10003","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b0143d7e191185985223e000f4ca141592be3f9b4ea70bdbbf6e5de6a2bf7258","observation_id":"7388828d-055b-4328-8fa8-cd8913315ca5","resolution":{"observed_at":"2026-08-15T20:51:35.227421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11363","last_updated":"2026-06-22T22:36:12Z","snapshot_observed_at":"2026-08-16T13:17:45.152269Z","submitted_at":"2024-09-17T17:13:19Z","title":"CORE-Bench: Fostering the Credibility of Published Research Through a Computational Reproducibility Agent Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11363","snapshot_observed_at":"2026-08-15T20:51:34.086961Z","title":"Core- bench: Fostering the credibility of published research through a computational reproducibility agent benchmark.arXiv preprint arXiv:2409.11363, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.086961Z"},"links":{"cited_paper":"/paper/2409.11363","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:57625b75c644aaa066a3c4c388b314c2840b96aade3c28f2fc275db74ee85083","observation_id":"242412c1-3f39-4abc-b6a7-120967c4bc60","resolution":{"observed_at":"2026-08-15T20:51:34.086961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06651","last_updated":"2023-05-19T07:03:27Z","snapshot_observed_at":"2026-08-16T16:16:43.250676Z","submitted_at":"2022-11-12T12:29:38Z","title":"NLPeer: A Unified Resource for the Computational Study of Peer Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06651","snapshot_observed_at":"2026-08-15T20:51:34.092016Z","title":"Nlpeer: A unified resource for the computa- tional study of peer review.arXiv preprint arXiv:2211.06651, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.092016Z"},"links":{"cited_paper":"/paper/2211.06651","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:118fc828723876ddb45a5b090efe9315e22ea3fcef9d7ae1ae1ecce39d33a01b","observation_id":"2abce3ba-e442-40e7-9147-7a946b141602","resolution":{"observed_at":"2026-08-15T20:51:34.092016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13668","last_updated":"2025-02-19T12:24:46Z","snapshot_observed_at":"2026-08-17T14:13:18.278565Z","submitted_at":"2025-02-19T12:24:46Z","title":"PeerQA: A Scientific Question Answering Dataset from Peer Reviews","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13668","snapshot_observed_at":"2026-08-15T20:51:34.097216Z","title":"Peerqa: A scientific question answering dataset from peer reviews.arXiv preprint arXiv:2502.13668, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.097216Z"},"links":{"cited_paper":"/paper/2502.13668","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:f02d829951dbec4aff6a8caca2db79d5f47800bfb901ff3a6cab4d74efde8982","observation_id":"89365f2c-70c9-488d-b475-3071e6e4861d","resolution":{"observed_at":"2026-08-15T20:51:34.097216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.103711Z","title":"Make every example count: On the stability and utility of self-influence for learning from noisy NLP datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.103711Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:f78902de65c14c3da44356a36b0c16fe291a59d3bad9ceaf76e5c7201a1a0a79","observation_id":"995e37ec-49b5-4513-9f45-8e4c9112404b","resolution":{"observed_at":"2026-08-15T20:51:34.103711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.109973Z","title":"FEVER: a large-scale dataset for fact extraction and VERification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.109973Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b051671f3b96b5d2cd473881fc9e46f1140ae554be2caa2e54d1f25df79381ea","observation_id":"bcd1c5db-eafa-4072-8e72-fb88700f74ea","resolution":{"observed_at":"2026-08-15T20:51:34.109973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:36.064974Z","title":"Fact or fiction: Verifying scientific claims","venue":null,"work_id":"8eeb7e33-0bce-4238-8c43-0e66087d5f76","year":2020},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.115683Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:1b9b6a5ad0eaffa94b92def7603a97cdbed303f0ac8466b8baaf8031d42085ee","observation_id":"8bf741d7-66c3-47cd-8cf1-e978ac8fddc1","resolution":{"observed_at":"2026-08-15T20:51:36.070073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:36.047854Z","title":"Moprd: A multidisciplinary open peer review dataset.Neural Computing and Applications, 35(34): 24191–24206, 2023","venue":null,"work_id":"f99132e9-f362-480d-acae-c2c01a736b22","year":2023},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.126149Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:831e367523f58e6d33b3169dae1adc40fdf8b5963f101dcae97df311dacd0c4a","observation_id":"366cf880-d97a-4b64-bcc1-3e06231c9c8c","resolution":{"observed_at":"2026-08-15T20:51:36.053820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.131482Z","title":"Automatically evaluating the paper reviewing capability of large language models.arXiv preprint arXiv:2502.17086, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.131482Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:d2b6886df2c05b65113447bf311b71b1c2bb27d6c88db5b61aef22f4cfa63d26","observation_id":"f32e4cb3-4ecd-4559-b0a5-c61869155b7c","resolution":{"observed_at":"2026-08-15T20:51:34.131482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:36.030174Z","title":"Openai o3 and o4-mini system card","venue":null,"work_id":"0504b24d-996f-40f9-8d40-bdbb9d339629","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.136486Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:1b97d6f4f24297326a0abf80a1ec1da184e873b76e753c8a340e7bf05f5ed52f","observation_id":"8ddae998-2427-48ce-a8cb-3b0b85e0a906","resolution":{"observed_at":"2026-08-15T20:51:36.035418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:36.013871Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innova- tion","venue":null,"work_id":"7dff3726-8f5c-4b05-a382-27b3ad4ccaa4","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.141479Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:c190602fcdde82cd45c9332beb339873fcf57efa01a1aa97c1d3896473439e58","observation_id":"506c3022-380a-427c-adaa-db0cbd874010","resolution":{"observed_at":"2026-08-15T20:51:36.018819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03775","last_updated":"2024-12-04T23:36:23Z","snapshot_observed_at":"2026-08-17T07:25:30.938697Z","submitted_at":"2024-12-04T23:36:23Z","title":"WithdrarXiv: A Large-Scale Dataset for Retraction Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03775","snapshot_observed_at":"2026-08-15T20:51:34.148285Z","title":"Withdrarxiv: A large-scale dataset for retraction study.arXiv preprint arXiv:2412.03775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.148285Z"},"links":{"cited_paper":"/paper/2412.03775","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:8eef9702dd0f8a561244a6b9d1c9537ba1e590f0889602621ef7e3c888e7b632","observation_id":"9b5f2646-e019-4f8d-bcdd-87cb61850f39","resolution":{"observed_at":"2026-08-15T20:51:34.148285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.997658Z","title":"Classification and analysis of pubpeer comments: How a web journal club is used.Journal of the Association for Information Science and Technology, 73(5):655–670, 2022","venue":null,"work_id":"386ed32f-7290-440e-9e19-82ab6b86eaf6","year":2022},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.153530Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:85baff0fb54010b60b67469ff9599d0a81305cf399e224c43c19aa1227a3bab0","observation_id":"47bf3033-2a12-4303-a279-2859e435febc","resolution":{"observed_at":"2026-08-15T20:51:36.002842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.981318Z","title":"American Invitational Mathematics Examination – AIME","venue":null,"work_id":"66209452-ee3a-455d-8870-fd2c38d55ea6","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.163373Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:539f728f3dc606a23c37b9a89cfdafc34c3c492e1ac0963299cb97f87434556d","observation_id":"8861ffd9-a113-45a4-9202-8a98cf225664","resolution":{"observed_at":"2026-08-15T20:51:35.986386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21934","last_updated":"2025-09-04T19:36:32Z","snapshot_observed_at":"2026-08-16T12:46:09.609350Z","submitted_at":"2025-03-27T19:21:05Z","title":"Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21934","snapshot_observed_at":"2026-08-15T20:51:34.167906Z","title":"Proof or bluff? evaluating llms on 2025 usa math olympiad.arXiv preprint arXiv:2503.21934, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.167906Z"},"links":{"cited_paper":"/paper/2503.21934","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:4e233e2279f5a87a4dd9569c8d7b9f5d55e5091fc46365de4f7b7872d2b408bb","observation_id":"4fec5ec3-d608-4198-ba5c-cb03ba127e45","resolution":{"observed_at":"2026-08-15T20:51:34.167906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01848","last_updated":"2025-04-07T12:15:49Z","snapshot_observed_at":"2026-07-06T21:03:06.857885Z","submitted_at":"2025-04-02T15:55:24Z","title":"PaperBench: Evaluating AI's Ability to Replicate AI Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01848","snapshot_observed_at":"2026-08-15T20:51:34.172803Z","title":"Paperbench: Evaluating ai’s ability to replicate ai research.arXiv preprint arXiv:2504.01848, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.172803Z"},"links":{"cited_paper":"/paper/2504.01848","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:da9a6b0bac3d2c190385566cfb7f3d2b1eaee96a8d0f17b25a5777b08fbe3868","observation_id":"360c5245-dd0b-46cf-acee-a4cb9596f492","resolution":{"observed_at":"2026-08-15T20:51:34.172803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.178088Z","title":"Paper2code: Automating code generation from scientific papers in machine learning.arXiv preprint arXiv:2504.17192, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.178088Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:0a7ddd6c2eab4007b17fbdeb363275bbda9164945215880be36fe13bc121e4a0","observation_id":"20dcb9f9-441d-4f74-9372-316a4b4bfc04","resolution":{"observed_at":"2026-08-15T20:51:34.178088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T20:51:34.182811Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.182811Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:04550f0eb6c36678155c77783eab335ba31e943167c480f801f610b45bd62175","observation_id":"b09c2bdc-cc80-4684-a8d9-a3148af549c7","resolution":{"observed_at":"2026-08-15T20:51:34.182811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.964803Z","title":"tiktoken: A fast bpe tokeniser for use with openai’s models","venue":null,"work_id":"cfe84ba8-bf80-4f87-9fd1-04112e1d1fa5","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.187951Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:94ec91bf66735416c979ece63e5a25ffcc173b50381321054eaa78c8b5b24712","observation_id":"030f2c9e-7b5b-4f77-98e1-baea604c75e7","resolution":{"observed_at":"2026-08-15T20:51:35.970185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06565","last_updated":"2024-10-12T14:13:27Z","snapshot_observed_at":"2026-08-18T08:28:40.177322Z","submitted_at":"2024-06-03T05:47:05Z","title":"MixEval: Deriving Wisdom of the Crowd from LLM Benchmark Mixtures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06565","snapshot_observed_at":"2026-08-15T20:51:34.192526Z","title":"Mixeval: Deriving wisdom of the crowd from llm benchmark mixtures.arXiv preprint arXiv:2406.06565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.192526Z"},"links":{"cited_paper":"/paper/2406.06565","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:13e936aa37d2c06726b235f90d670f9608ef656d3d9159a025034962f8d81f0a","observation_id":"31acb379-afae-4f1f-953f-aa1742758e0c","resolution":{"observed_at":"2026-08-15T20:51:34.192526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.198426Z","title":"Spoc: Search-based pseudocode to code.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.198426Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:12a7c24175d3065649099b51614dc7499cfb465dbb0e28de3fc3145e7872948f","observation_id":"972e8633-bd04-4fa4-a737-f3968ba35c81","resolution":{"observed_at":"2026-08-15T20:51:34.198426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-15T20:51:34.203367Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.203367Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:0158fe55cfcd775630e22d000dcffdd2251b0bbb25af0655035c7a7b4d0d0ac9","observation_id":"8ca194c5-6b59-45a3-b1bd-b1d134dedf54","resolution":{"observed_at":"2026-08-15T20:51:34.203367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.937943Z","title":null,"venue":null,"work_id":"2300b2f0-edaa-45f4-b028-0343d21c8143","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.209225Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:fa08af317cd9f93f437f23f2044a0409593bff45f3c1601f7791693df3777035","observation_id":"103b4b0a-850c-46c2-981d-ad473026c98b","resolution":{"observed_at":"2026-08-15T20:51:35.943261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.920225Z","title":"Gemini 2.5 pro","venue":null,"work_id":"86cf3a1a-59e1-4754-9f7a-600b9c032748","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.214041Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:7d32b6e5d67130569efcf7bfb4b301eac7edd90ddc288eec1d68542910cf2c36","observation_id":"c574a8dc-7f3b-4197-9b32-19d7efdcc432","resolution":{"observed_at":"2026-08-15T20:51:35.925752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.904449Z","title":"Gemini 2.0 Flash Lite","venue":null,"work_id":"ffc93623-b1c5-43a1-a97f-4c9f26aef349","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.218794Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:6bb018e8d9f80760fbe49a3a907b191b7ca6364d5883e32cb21938652eda152a","observation_id":"ce12ad1f-b99c-4e61-b13b-5634fd66017f","resolution":{"observed_at":"2026-08-15T20:51:35.909191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.888422Z","title":"Claude 3.7 Sonnet System Card","venue":null,"work_id":"b7e1d83c-7685-4927-9193-310f9a411b2c","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.223686Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:814d676ced5bbf874eb37a76af4974af10c1260e4e96edbb2c7c72fd13745e1c","observation_id":"c7ff58c0-381e-407a-a38c-75c94493c9a1","resolution":{"observed_at":"2026-08-15T20:51:35.893522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:51:34.228794Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.228794Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:16315f3e52db60efca2d6353141cce60b0e8cfea4a36662b5a192ff90cfdbcd1","observation_id":"73454a53-a82b-4e39-ae00-4412a4cda119","resolution":{"observed_at":"2026-08-15T20:51:34.228794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.233596Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.233596Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:9d625642844b732bfda2a2c0efc834fdd00d83705694e182f27876b30669ce05","observation_id":"49f07a06-c9e9-45c9-8a18-05b0538ed520","resolution":{"observed_at":"2026-08-15T20:51:34.233596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-15T20:51:34.238568Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.238568Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:14d545b1789be002021d5c9a5aeea959be19aa28e9e9dd47b40cf6d1f08c44eb","observation_id":"24328483-875b-4710-b6b5-f970455c3e0d","resolution":{"observed_at":"2026-08-15T20:51:34.238568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.243677Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.243677Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:deb5414dddaa6dd25ef5ee5e60ea141e3f3d46d6ff4381625930ba73c68e31ac","observation_id":"4257c18e-5322-4c01-b4d1-aa2024677069","resolution":{"observed_at":"2026-08-15T20:51:34.243677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-15T20:51:34.248451Z","title":"Humanity’s last exam.arXiv preprint arXiv:2501.14249, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.248451Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:bc3e50917ad2647bf7e52a88a552243a86e03d6a65650616672b03c15b0769a9","observation_id":"4b3432f5-3308-43d9-b4bf-6bc420ca87d2","resolution":{"observed_at":"2026-08-15T20:51:34.248451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.253284Z","title":"On calibration of modern neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.253284Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:e14f6c9509b3609fbb6885f645f3e0107d5afb16a9b26a688576bb4489ae92ef","observation_id":"8903a918-5c24-4ed9-a450-2ed0c00f237c","resolution":{"observed_at":"2026-08-15T20:51:34.253284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.257924Z","title":"Can you trust your model’s uncertainty? evaluating predictive uncertainty under dataset shift.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.257924Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b556fd7765832b7ff694198c680d5dd6745b3cfad0c73fd5e1a555a939bf30c2","observation_id":"ac5c5aab-fb44-4f46-9f9a-5cb0aabc752b","resolution":{"observed_at":"2026-08-15T20:51:34.257924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:51:34.263198Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.263198Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:4abf829239642467bd3831e8bcac7f6eba83b18ade84b515789f4778ca310aae","observation_id":"5ca77c99-a692-42ea-b748-f8df352518b5","resolution":{"observed_at":"2026-08-15T20:51:34.263198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T20:51:34.268390Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.268390Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:48528a8bf5bc67dae664937d3faaee3fee8ddcf805164a77968069f1e14ad036","observation_id":"ff70fb3a-935a-482e-bcb5-0503799b4a31","resolution":{"observed_at":"2026-08-15T20:51:34.268390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-15T20:51:34.273333Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.273333Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:573e93b6de83cb971ed1de306cb18f6e14af895ed577c324501741adf9cfbd8d","observation_id":"3adc1fc3-b475-46a6-af57-d820e9de4aa3","resolution":{"observed_at":"2026-08-15T20:51:34.273333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06455","last_updated":"2024-02-15T09:47:09Z","snapshot_observed_at":"2026-07-06T17:14:41.030939Z","submitted_at":"2024-01-12T09:02:47Z","title":"Multiplicative Chow-K\\\"unneth decomposition and homology splitting of configuration spaces","version":2},"cited_work":{"arxiv_id":"2401.06455","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.06455","snapshot_observed_at":"2026-08-15T20:51:34.810471Z","title":"Multiplicative Chow-K\\\"unneth decomposition and homology splitting of configuration spaces","venue":"math.AG","work_id":"0bd4dec9-d8f2-45a3-ab19-76ed639871b5","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.278297Z"},"links":{"cited_paper":"/paper/2401.06455","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:80a90bdac246b729e2d93f32e6e76fe5c422618be8be0dc50c9facd3c69e1373","observation_id":"2ea95058-77e2-4f09-8066-12f48bc7a8c8","resolution":{"observed_at":"2026-08-15T20:51:34.816915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.829132Z","title":"Superacid in situ protected synthesis of covalent organic frameworks","venue":null,"work_id":"1dc3fcaf-38eb-4a7c-8e3d-7b25bfa6208d","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.284626Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:7ffdbc0b2c9b14e12c955fa3c801fe2a6833730672a61a087f27dcc7d06ce9f0","observation_id":"90e9562a-eddf-451a-bc50-49e4330d0e09","resolution":{"observed_at":"2026-08-15T20:51:35.834835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11239","last_updated":"2024-10-02T11:07:14Z","snapshot_observed_at":"2026-08-16T13:17:48.790274Z","submitted_at":"2024-09-17T14:40:02Z","title":"LLM-as-a-Judge & Reward Model: What They Can and Cannot Do","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11239","snapshot_observed_at":"2026-08-15T20:51:34.289576Z","title":"Llm-as-a-judge & reward model: What they can and cannot do.arXiv preprint arXiv:2409.11239, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.289576Z"},"links":{"cited_paper":"/paper/2409.11239","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:c683cd6381c8f461141757029c21fe8240460bb713973a9061aeba9a11f00d7f","observation_id":"e891a275-7c4b-4f7a-83d0-57def7bc15a2","resolution":{"observed_at":"2026-08-15T20:51:34.289576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.00557","last_updated":"2017-04-23T09:15:35Z","snapshot_observed_at":"2026-08-14T21:05:22.388423Z","submitted_at":"2017-04-23T09:15:35Z","title":"Discourse-Based Objectives for Fast Unsupervised Sentence Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.00557","snapshot_observed_at":"2026-08-15T20:51:34.294720Z","title":"Discourse-based objectives for fast unsupervised sentence representation learning.arXiv preprint arXiv:1705.00557, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.294720Z"},"links":{"cited_paper":"/paper/1705.00557","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:3ff3c760fc173d189c6b9991fd846249973f8000006e7e9ccb3350b6402efa5d","observation_id":"02dd2aac-e86c-4eb7-ab5b-9ef2fcce6734","resolution":{"observed_at":"2026-08-15T20:51:34.294720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-08-17T06:16:40.579073Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-15T20:51:34.300238Z","title":"Self-instruct: Aligning language models with self-generated instruc- tions.arXiv preprint arXiv:2212.10560, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.300238Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:498de269c899a7c370b552275d9af11f258fd8258e89cc1a7dadc9b0e6fec699","observation_id":"dd724038-6b4c-47e3-8256-1cfea1e9f252","resolution":{"observed_at":"2026-08-15T20:51:34.300238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10886","last_updated":"2024-12-02T15:40:45Z","snapshot_observed_at":"2026-08-18T12:32:28.815640Z","submitted_at":"2024-02-16T18:43:10Z","title":"Reviewer2: Optimizing Review Generation Through Prompt Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10886","snapshot_observed_at":"2026-08-15T20:51:34.304874Z","title":"Reviewer2: Optimizing review genera- tion through prompt generation.arXiv preprint arXiv:2402.10886, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.304874Z"},"links":{"cited_paper":"/paper/2402.10886","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:ef6a2135777d74e772807afcfdbe6b7982203d568fd0fed3e55fc0391081dcdc","observation_id":"2429bfb3-af12-4b89-95a9-5758101ce73e","resolution":{"observed_at":"2026-08-15T20:51:34.304874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.812897Z","title":"Scientific opinion summarization: Paper meta-review generation dataset, methods, and evaluation","venue":null,"work_id":"ca336a0e-ae47-4b86-9fd1-96399d514475","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.309751Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b4fec15617adb1f917c26831ddd7a2b58a01d69e22bdf111241d8c1ff214bd5b","observation_id":"6cd76ba9-7ae9-43ed-bd6b-2042e5c2b938","resolution":{"observed_at":"2026-08-15T20:51:35.818381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.09774","last_updated":"2021-09-20T18:06:22Z","snapshot_observed_at":"2026-08-16T17:55:19.424929Z","submitted_at":"2021-09-20T18:06:22Z","title":"Inconsistency in Conference Peer Review: Revisiting the 2014 NeurIPS Experiment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.09774","snapshot_observed_at":"2026-08-15T20:51:34.314111Z","title":"Inconsistency in conference peer review: Revisiting the 2014 neurips experiment.arXiv preprint arXiv:2109.09774, 2021","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.314111Z"},"links":{"cited_paper":"/paper/2109.09774","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:5a94e04635b3c65b7569f7e4adfd62b140f3646076749645369872e02f12e774","observation_id":"c4569237-b995-435a-98b8-c9a1d8fa30fa","resolution":{"observed_at":"2026-08-15T20:51:34.314111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.795694Z","title":"A noise audit of the peer review of a scientific article: a wpom journal case study.WPOM-Working Papers on Operations Management, 14(2): 137–166, 2023","venue":null,"work_id":"800da2d2-59e6-4328-b2f8-b527ede6da34","year":2023},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.320209Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:8a0f7b5d1b84786aad1bcdced4073931a9c40b9fc05a86273f04afb65939f494","observation_id":"7f427bc4-e695-4e1a-ae83-40ad7caf3538","resolution":{"observed_at":"2026-08-15T20:51:35.801028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12640","last_updated":"2024-09-20T00:47:33Z","snapshot_observed_at":"2026-08-18T15:47:09.128856Z","submitted_at":"2024-09-19T10:38:01Z","title":"Michelangelo: Long Context Evaluations Beyond Haystacks via Latent Structure Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12640","snapshot_observed_at":"2026-08-15T20:51:34.324998Z","title":"Michelan- gelo: Long context evaluations beyond haystacks via latent structure queries.arXiv preprint arXiv:2409.12640, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.324998Z"},"links":{"cited_paper":"/paper/2409.12640","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b09dd165a68ee47c6f3836e72627b43402b74c24c385028c9bf6904cf81ef37b","observation_id":"c255511a-bdf6-4314-abc3-6df78478d8b4","resolution":{"observed_at":"2026-08-15T20:51:34.324998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03113","last_updated":"2021-04-15T10:03:37Z","snapshot_observed_at":"2026-08-16T18:33:18.216422Z","submitted_at":"2021-04-07T13:34:25Z","title":"Scaling Scaling Laws with Board Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03113","snapshot_observed_at":"2026-08-15T20:51:34.330216Z","title":"Scaling scaling laws with board games.arXiv preprint arXiv:2104.03113, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.330216Z"},"links":{"cited_paper":"/paper/2104.03113","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:ffe3c6e2e6e5bb7335e1c3c4da88b818757c5ba6b1315153673a7541805cd0a0","observation_id":"f87f38e3-97d1-4a75-9eb4-b6ee4a27b08c","resolution":{"observed_at":"2026-08-15T20:51:34.330216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17407","last_updated":"2025-08-01T10:09:29Z","snapshot_observed_at":"2026-08-18T22:21:03.988191Z","submitted_at":"2025-02-24T18:36:15Z","title":"Linguistic Generalizability of Test-Time Scaling in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17407","snapshot_observed_at":"2026-08-15T20:51:34.335360Z","title":"Linguistic generalizability of test-time scaling in mathematical reasoning.arXiv preprint arXiv:2502.17407, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.335360Z"},"links":{"cited_paper":"/paper/2502.17407","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:d98b45ddb643eb52e1ce4dea73e0343176e5ed0ab8af8d4cf188a57b54af660d","observation_id":"a0e4789b-faab-4219-b6d3-3ce4d310aef1","resolution":{"observed_at":"2026-08-15T20:51:34.335360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-15T20:51:34.340516Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.340516Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:698b312b557aeab9035edd45d1f1c64e2c5a2fea197d7eb7311dd25f3c9f0b34","observation_id":"f8ddd532-0db0-4ebf-a81e-546525a6a653","resolution":{"observed_at":"2026-08-15T20:51:34.340516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T20:51:34.346039Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.346039Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:20ab6aa21c09665b6243fabdddf2004536c39921e3dea142fd990723cb6aaf56","observation_id":"d1425ae0-1b37-46b6-8cdd-f23d5e7119fb","resolution":{"observed_at":"2026-08-15T20:51:34.346039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.351393Z","title":"Finding flawed fictions: Evaluating complex reasoning in language models via plot hole detection.arXiv preprint arXiv:2504.11900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.351393Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b27fe0a5fdd280eb85cf7a5b3a0cc08feec1dc12801bd94638460e4d46da6c6f","observation_id":"3d261402-f240-46ea-bbf0-b62b886a6372","resolution":{"observed_at":"2026-08-15T20:51:34.351393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14546","last_updated":"2024-04-06T01:26:54Z","snapshot_observed_at":"2026-07-06T17:33:58.900451Z","submitted_at":"2024-02-22T13:35:26Z","title":"Algebraic description of complex conjugation on cohomology of a smooth projective hypersurface","version":2},"cited_work":{"arxiv_id":"2402.14546","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14546","snapshot_observed_at":"2026-08-15T20:51:34.546899Z","title":"Algebraic description of complex conjugation on cohomology of a smooth projective hypersurface","venue":"math.AG","work_id":"e04e472a-056e-47f8-a56d-7d792bde68b5","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.356275Z"},"links":{"cited_paper":"/paper/2402.14546","citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:ba982a08c9a0b14f07fee17fc9fae8cfae00874b7e7c2e5193f6bfb0a424bc64","observation_id":"869e8f96-440a-4dcf-99f0-a66852e2da12","resolution":{"observed_at":"2026-08-15T20:51:34.553041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.779438Z","title":null,"venue":null,"work_id":"0114da6e-27aa-4049-b306-8d31864d17f4","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.361179Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:badd67187821188fc10f6d3abccc1ea1ef20999d27fe635c07ee253b07869a8a","observation_id":"80dbaa64-993c-4bb8-a430-54c807394d48","resolution":{"observed_at":"2026-08-15T20:51:35.784986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5539/jsd.v17n6p137","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.488580Z","title":"Limitations","venue":null,"work_id":"299dbc55-77f9-40d4-a140-f4b36f762578","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.366339Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:98003ce5293c000c2bbc55df8497918033d2ac0693e252c7e51b50c58982bd88","observation_id":"b3ef3239-d156-4650-972f-a5b1c752b85c","resolution":{"observed_at":"2026-08-15T20:51:34.494849Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.763282Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"30cebae3-cfdb-4cf2-ae6e-a7ebdb06f98b","year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.372242Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:7289fc233dbcaea9426dad5c9d9e79c2d9fbfeee5530b4636aeef9a3afa97deb","observation_id":"49dfd2de-6d24-4031-a9f3-2a5335bd87ce","resolution":{"observed_at":"2026-08-15T20:51:35.768343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.748090Z","title":null,"venue":null,"work_id":"d2a54fc0-0194-49e3-bc37-d77cfa69dd25","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.378243Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:7c7e245972d8aa8c73b796593cb7cb0d78625cca87e1cfc8b584c08c1ff3ec9a","observation_id":"d86d75e8-32a0-4d47-acde-21aa4cefa30b","resolution":{"observed_at":"2026-08-15T20:51:35.753205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.732302Z","title":"Conversely, false positives may occur when:","venue":null,"work_id":"09209548-30ac-41de-b838-1b71ac3a18d9","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.383718Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:5a57497e8028b4fe558c3376abfa36216aebe1b48b7150814ae6277581a4b658","observation_id":"cf924b38-2096-4192-8dcb-fdd0ce54593c","resolution":{"observed_at":"2026-08-15T20:51:35.737536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.716378Z","title":"reasoning effort","venue":null,"work_id":"40f361d5-2273-493f-841b-23ab7010bc2e","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.388879Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:116c64c180bbe0f7c19e464555dc73a0597177188bae29c9026d875e42009e58","observation_id":"853f51a8-fa0b-4256-b657-a14c7b494968","resolution":{"observed_at":"2026-08-15T20:51:35.721107Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.700195Z","title":"decreased from 0.116 eV. . . to 1.03 eV","venue":null,"work_id":"b95087e6-3d48-49f2-a731-ad58c0c9bc22","year":2024},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.394801Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:560680f487c6a05fdad1927bc34844816088d4fa299902d5adad2c1132526f8f","observation_id":"a727aaa3-0704-4346-b6d8-c7ac26147cf3","resolution":{"observed_at":"2026-08-15T20:51:35.705316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.684034Z","title":null,"venue":null,"work_id":"26c698e2-780b-4366-ab3d-dca6ea826026","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.400945Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:4c12d1e6e2372967ab54c19057ee2d8ea6a11c471dac67f8cc0195cd21937bf3","observation_id":"d7fe2f89-fdda-4110-8743-99f9400eafef","resolution":{"observed_at":"2026-08-15T20:51:35.689383Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.667636Z","title":null,"venue":null,"work_id":"69e188a2-66b2-4c57-a5ab-77bcd07c6098","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.406201Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:da5421e264e2e2934dc1af839c0f289d9c872b5fa7e24dc5c4deeb93c9a80c81","observation_id":"26c88657-f69c-44f2-b740-e6053cc4655b","resolution":{"observed_at":"2026-08-15T20:51:35.672481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.651315Z","title":null,"venue":null,"work_id":"7f61e271-b50d-40c1-9a8c-a43057a90cba","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.410893Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:8a916d4ea0cd56fceca64a82a5d5302370b46b23fe730e59b04ba4b3b503e045","observation_id":"d57fc1df-fb11-4c79-8579-a1ad812c9dda","resolution":{"observed_at":"2026-08-15T20:51:35.656237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.633462Z","title":"Generation Prompt","venue":null,"work_id":"073af652-cb54-45e3-92f1-051c0d2a4f69","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.415574Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:b79e07c91ada79f4e09241cbec83f64c933e71b75025804e626bf4d5f82cdea4","observation_id":"5b4e1349-aff1-4836-aa97-054c13dee291","resolution":{"observed_at":"2026-08-15T20:51:35.639532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.614849Z","title":"annotations","venue":null,"work_id":"99420df4-8ef9-48c6-9518-6fae937fd41f","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.420652Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:e86b11c3e781a5930bcc9a45f5de1d1f7d9ea10b460740a5382ddbaf6bd8d6d1","observation_id":"a2214f1e-fd27-435e-be96-2c31d928e4fc","resolution":{"observed_at":"2026-08-15T20:51:35.620338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.597741Z","title":"predictions","venue":null,"work_id":"f2808202-fd8a-4d7a-a4c7-14ca3451b637","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.425891Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:3df87d7c29e11a8c762d00a391b67409b1b3a68410ca82815ef4f6b05c6ebe9e","observation_id":"7c8e0159-fcb3-4911-8710-07d2dbf85ecc","resolution":{"observed_at":"2026-08-15T20:51:35.603384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.580541Z","title":null,"venue":null,"work_id":"66b96cdb-ba21-49be-978c-ae3c7eb749f4","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.431578Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:f724805915a6578f6b1b6c613169abe336f4dc3e7423da7f08eb9bb0a8a3de58","observation_id":"4f5c2bb1-0003-4821-9c10-0f1600bac133","resolution":{"observed_at":"2026-08-15T20:51:35.585470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.563801Z","title":"location","venue":null,"work_id":"2dd4966d-ee31-4821-99ef-d7a105eac81d","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.436601Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:d42d485b41f71475071a6239fdcbe55264293df77b67a5437d27e9bf435e3350","observation_id":"e1db4614-0259-4a17-8ee2-b8433aed7f98","resolution":{"observed_at":"2026-08-15T20:51:35.568770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.547598Z","title":"matches\": [ {","venue":null,"work_id":"83e00724-60e5-4cdf-9db7-c9053635afeb","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.441326Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:fcdf723583ef60cc26e3e178261822ce6dde7002b92a760ab638739d82d7ef9b","observation_id":"d92ebf6b-0b6b-46cb-8fcd-3df1b91b7f45","resolution":{"observed_at":"2026-08-15T20:51:35.553135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.531495Z","title":null,"venue":null,"work_id":"b99d73f0-3043-42fe-95bd-85523c1fd1e2","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.446492Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:a99be1066fed483c28c7ad199e0f02dcf99f3545405c88e8df531da72746e618","observation_id":"8ebfa0d1-ebaa-4ddd-8f6f-de226baa6c33","resolution":{"observed_at":"2026-08-15T20:51:35.536610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:35.515574Z","title":"Table 4:Mean and standard deviation of pass@K for o3 (K∈{1,2,4} ) by error category (left) and paper category (right)","venue":null,"work_id":"2e82d11a-d3d2-4d1e-bbe8-7a61d19897be","year":null},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.451656Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:9565ce9a45f141c6bdbcbb56d30e58257207b53647c855a544c9fa88d437269c","observation_id":"3eb44cf9-32c6-442e-92f4-9daa85ffeafe","resolution":{"observed_at":"2026-08-15T20:51:35.520694Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.121025Z","title":"doi: 10.18653/v1/2020.emnlp-main.609","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.121025Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:23c05b6b801fbcfa8b6cba67dc9b530121509e70761eff131bfab21ba64c238f","observation_id":"df9bbf82-cc38-495a-8ad6-683aa4e36791","resolution":{"observed_at":"2026-08-15T20:51:34.121025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:51:34.052419Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T20:51:34.052419Z"},"links":{"citing_paper":"/paper/2505.11855"},"observation_digest":"sha256:a46213b6924c61b477e5ad63a1ade75e4777711b4af5fd6cddf3ed6010e0a463","observation_id":"8ffb36bc-e6e6-42e7-b077-2450dceb4fc6","resolution":{"observed_at":"2026-08-15T20:51:34.052419Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11855","last_updated":"2025-05-17T05:45:16Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T01:27:05.646461Z","submitted_at":"2025-05-17T05:45:16Z","title":"When AI Co-Scientists Fail: SPOT-a Benchmark for Automated Verification of Scientific Research"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":63,"verified_exact":5,"verified_fuzzy":21},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 8 inbound Pith citation observations for arXiv:2505.11855."}