{"as_of":"2026-08-05T15:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7ac6e8cc57918df8ca95920358a925d9bf448c3288eb109fdf380c337d48b569","coverage":[{"denominator":87,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T21:47:09.588941Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:21:28.776336Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T23:49:02.992717Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-08-03T14:21:28.776336Z","title":"Evaluating large language models in scientiﬁc discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.20732","last_updated":"2026-05-29T12:40:45Z","snapshot_observed_at":"2026-08-03T23:05:14.282754Z","submitted_at":"2025-12-23T19:40:51Z","title":"FEM-Bench: A Structured Scientific Reasoning Benchmark for Evaluating Code-Generating LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T14:21:28.776336Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2512.20732"},"observation_digest":"sha256:8514314168beedb0447510545edea90546c2de5d6df3a73cd0a1148bfe1037fb","observation_id":"f7630111-0b95-430b-b6d9-f8ecef3e64bb","resolution":{"observed_at":"2026-08-03T14:21:28.776336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2603.00883","last_updated":"2026-04-20T04:59:50Z","snapshot_observed_at":"2026-08-01T04:38:07.612005Z","submitted_at":"2026-03-01T03:05:46Z","title":"Knowledge without Wisdom: Measuring Misalignment between LLMs and Intended Impact","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T18:44:17.986764Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2603.00883"},"observation_digest":"sha256:b9d317aa88db00f7006f940971f5c87e2ca1a44ffcb83dbacd0f0a8b78fec4a2","observation_id":"7605bb7a-ab87-472b-b7ba-26d3659aaff0","resolution":{"observed_at":"2026-05-15T18:46:29.476304Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2604.16592","last_updated":"2026-04-17T17:51:46Z","snapshot_observed_at":"2026-07-06T23:03:52.631613Z","submitted_at":"2026-04-17T17:51:46Z","title":"Human Cognition in Machines: A Unified Perspective of World Models","version":1},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:15.663761Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2604.16592"},"observation_digest":"sha256:76ab7f4b3f5a4a419d7ba276c66226573e9b8702b518c43fa7b25fe5699dee2a","observation_id":"3855307a-017b-4c80-925f-9a1f67bdd747","resolution":{"observed_at":"2026-05-11T01:40:43.911729Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2604.27351","last_updated":"2026-04-30T03:02:27Z","snapshot_observed_at":"2026-07-06T23:12:52.141592Z","submitted_at":"2026-04-30T03:02:27Z","title":"Heterogeneous Scientific Foundation Model Collaboration","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-07T08:50:05.980191Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2604.27351"},"observation_digest":"sha256:715ce3bf7b15403bbd80ac0e9375904628258dce13a5373fc245c00461b15458","observation_id":"00abebb5-38ef-4d6c-9288-a2a26771887b","resolution":{"observed_at":"2026-05-12T09:56:27.155571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2605.03808","last_updated":"2026-05-05T14:35:47Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T14:35:47Z","title":"Agentic-imodels: Evolving agentic interpretability tools via autoresearch","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-07T16:37:43.371592Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2605.03808"},"observation_digest":"sha256:3296fc592314ead82ab86de310d1215d359523bae372d7e565606796180db547","observation_id":"b8ccea12-af6d-43b7-8907-4fa7533a808a","resolution":{"observed_at":"2026-05-11T23:36:36.206604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2605.07251","last_updated":"2026-05-08T05:19:59Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:19:59Z","title":"Can Agents Price a Reaction? Evaluating LLMs on Chemical Cost Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T01:29:47.384341Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2605.07251"},"observation_digest":"sha256:367fe02fe75ac98d8da82f8ce3fcb9a6de745fdc86fbdef35a714cbb09a7fc15","observation_id":"d7efebd3-82f0-4765-80ab-fce504f930d4","resolution":{"observed_at":"2026-05-11T01:45:51.815524Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2605.21622","last_updated":"2026-05-20T18:32:56Z","snapshot_observed_at":"2026-07-06T23:32:01.202542Z","submitted_at":"2026-05-20T18:32:56Z","title":"TO-Agents: A Multi-Agent AI Pipeline for Preference-Guided Topology Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-22T09:33:43.733883Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2605.21622"},"observation_digest":"sha256:2a7ecea8d98386f9384449c765b1e7796e223c15c5347058778eae9859b1a7af","observation_id":"c0499d08-6750-449b-be24-7541edb5792b","resolution":{"observed_at":"2026-05-22T09:34:46.896481Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2605.26021","last_updated":"2026-05-25T16:41:41Z","snapshot_observed_at":"2026-07-06T23:35:55.988443Z","submitted_at":"2026-05-25T16:41:41Z","title":"Toward General Quantum Control with Physics-Informed Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T21:55:50.253489Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2605.26021"},"observation_digest":"sha256:cc83d4c9f53d076893bc15f7a1eafa05552f40cf9d26824f12d114418b9e3ded","observation_id":"7ee86ef2-5369-4a25-b34a-c23c4a4a04a8","resolution":{"observed_at":"2026-06-29T22:04:00.500437Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2605.28778","last_updated":"2026-05-27T17:38:00Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:38:00Z","title":"Can LLMs Use Linguistic Uncertainty Markers to Reliably Reflect Intrinsic Confidence?","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-29T12:18:36.854164Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2605.28778"},"observation_digest":"sha256:c0d68e6e61ba6512c494a31b463b697acf2331fed9c1b151e24f145d5a7d4dbe","observation_id":"d8d504e5-b600-4f94-83da-836be0cd4aa3","resolution":{"observed_at":"2026-06-29T12:23:24.413853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.03969","last_updated":"2026-06-02T17:53:45Z","snapshot_observed_at":"2026-07-06T23:44:09.692359Z","submitted_at":"2026-06-02T17:53:45Z","title":"Quantifying Faithful Confidence Expression in Large Reasoning Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T10:24:38.335417Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.03969"},"observation_digest":"sha256:73a6e4000e3bc405e90b12d7e56deb298b0dfffb942433398c2327180ce35ee4","observation_id":"8878780a-7799-4ae2-a725-7217eeedd4f6","resolution":{"observed_at":"2026-07-02T03:06:29.146508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.05206","last_updated":"2026-05-23T19:19:32Z","snapshot_observed_at":"2026-07-06T23:45:11.627867Z","submitted_at":"2026-05-23T19:19:32Z","title":"Ontology-constrained multi-LLM scoring of hypothesis support in the predictive processing literature","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T11:49:43.332490Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.05206"},"observation_digest":"sha256:15f77374e707db014d72e8d0cd210de9c7a453477c73de805de79f29a6bd27b7","observation_id":"08065057-5056-4ed9-9148-32a569d2b1fa","resolution":{"observed_at":"2026-06-30T11:54:38.385810Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.10587","last_updated":"2026-06-09T08:52:49Z","snapshot_observed_at":"2026-07-06T23:49:47.137691Z","submitted_at":"2026-06-09T08:52:49Z","title":"Towards Diverse Scientific Hypothesis Search with Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T14:09:31.837231Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.10587"},"observation_digest":"sha256:a757355b95ac5392f217161169e249335a940bcfb25b800499bcd037e46eec0a","observation_id":"d946edb6-0b61-474c-8c58-9f034d5fa91f","resolution":{"observed_at":"2026-07-03T04:07:36.986726Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.12736","last_updated":"2026-06-10T22:55:30Z","snapshot_observed_at":"2026-08-02T11:05:19.132987Z","submitted_at":"2026-06-10T22:55:30Z","title":"Benchmarking AI Agents for Addressing Scientific Challenges Across Scales","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T09:34:09.347912Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.12736"},"observation_digest":"sha256:240bc3509265322e698d28d2c1c8aebd68f222a305ab5c338bddbf01526c9548","observation_id":"f04ef476-8bc0-4a0f-a835-959f2171633b","resolution":{"observed_at":"2026-07-03T11:28:04.340950Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.13670","last_updated":"2026-06-25T07:12:44Z","snapshot_observed_at":"2026-08-03T00:37:28.417399Z","submitted_at":"2026-06-11T17:58:36Z","title":"Automated reproducibility assessments in the social and behavioral sciences using large language models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:30:08.805659Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.13670"},"observation_digest":"sha256:8813c8819e8184d53df1f15c31f8be9ee81db3a76c4ebaefef09ba954079815d","observation_id":"16b80c3a-0704-43ac-ae4c-2d3b27c49580","resolution":{"observed_at":"2026-07-03T15:28:34.064022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.18961","last_updated":"2026-06-17T11:42:01Z","snapshot_observed_at":"2026-07-06T23:54:18.292223Z","submitted_at":"2026-06-17T11:42:01Z","title":"Be Your Own Teacher: Steering Protein Language Models via Unsupervised Reward Optimization","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-26T21:40:55.946788Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.18961"},"observation_digest":"sha256:802f08e871800fb1efd689d6ec726f8c35fcc80acf4b57c815978b8a6e693064","observation_id":"b0e6370f-d74a-4949-9890-b3c19e1a0373","resolution":{"observed_at":"2026-07-03T23:49:02.994186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.29630","last_updated":"2026-06-28T22:27:26Z","snapshot_observed_at":"2026-08-03T22:42:04.127016Z","submitted_at":"2026-06-28T22:27:26Z","title":"SFBench: The SciFy Scientific Feasibility Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T06:59:19.857066Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.29630"},"observation_digest":"sha256:ff64dc015bd8f79ed00ee18859eece6ce076f7ea4e302ae4b653e842f832baeb","observation_id":"cfc64460-1382-4d82-85fc-a380c1ef1072","resolution":{"observed_at":"2026-06-30T07:04:21.313418Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":"2512.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-03T23:49:02.992717Z","title":"Evaluating Large Language Models in Scientific Discovery","venue":"cs.AI","work_id":"78e61008-f642-4d4f-bd41-c09b28875591","year":2025},"citing_paper":{"arxiv_id":"2606.32032","last_updated":"2026-06-30T17:56:01Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:56:01Z","title":"Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-01T05:22:38.232552Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2606.32032"},"observation_digest":"sha256:3fe47be810b445abe5889c05323b2ac63e989f326c211c3e795fd49b799a9a3c","observation_id":"141afa4a-8756-46a1-bb99-7ba67e15d60f","resolution":{"observed_at":"2026-07-01T10:35:42.129582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-08-02T08:14:36.215489Z","title":"arXiv preprint arXiv:2512.15567 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19406","last_updated":"2026-07-07T22:05:25Z","snapshot_observed_at":"2026-08-02T15:36:09.218785Z","submitted_at":"2026-07-07T22:05:25Z","title":"NMR Elucidation as an Agentic Search Problem, Not a Modeling Problem","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T08:14:36.215489Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2607.19406"},"observation_digest":"sha256:d47504291e9de9de91427c60510b77387d5dd9ef43399f42fc132a5d580e345e","observation_id":"681e9fe6-0b58-4eca-869d-0cdd4b204582","resolution":{"observed_at":"2026-08-02T08:14:36.215489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.15567","snapshot_observed_at":"2026-07-31T23:00:26.004815Z","title":"M., Huang, Y., Guo, K., Luo, X., Qu, Y., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24879","last_updated":"2026-07-27T08:01:51Z","snapshot_observed_at":"2026-08-03T16:41:29.206448Z","submitted_at":"2026-07-27T08:01:51Z","title":"Generative Artificial Intelligence in Scientific Research: Individual Benefits, Collective Risks, and a Framework for Responsible Research with AI","version":1},"reference_index":987,"source":"pdf_text","source_observed_at":"2026-07-31T23:00:26.004815Z"},"links":{"cited_paper":"/paper/2512.15567","citing_paper":"/paper/2607.24879"},"observation_digest":"sha256:b014966c6e4cd18e6a880308f1d783f5b2ed9bfa83703464e1066a5eb3ca08fb","observation_id":"cd74bc2b-cdb4-4fa4-aea9-1793100af5de","resolution":{"observed_at":"2026-07-31T23:00:26.004815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.15567/citation-record","integrity":"/paper/2512.15567/integrity","json":"/paper/2512.15567/citation-record.json","paper":"/paper/2512.15567"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":"1706.03762","doi":"10.1186/s13550-021-00830-6","metadata_source":"pith","pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Is All You Need","venue":"cs.CL","work_id":"baafb5a2-5272-43bc-932f-09fa9ffe5316","year":2017},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:c9a78acd7fdd1c0e4b39b032ff2c30c623274897e9238758dfb67b62d1774d7e","observation_id":"9f0640b1-528c-4d3d-83d2-ace7d6334936","resolution":{"observed_at":"2026-05-16T21:48:34.419764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:3c90de70b7442d0c3b3e74c9d72aeb89ea5bde91de59c40343b1f3e41b414f30","observation_id":"dbc7f627-0a59-479e-9d19-ea2b35641718","resolution":{"observed_at":"2026-05-16T21:48:34.423251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:2be4714cd2d2743b3a404207255139f6e373ea76828b78f2995f0ad8263e590c","observation_id":"afff3a85-eff5-47df-80c2-c0a6c721b2b3","resolution":{"observed_at":"2026-05-16T21:48:34.430755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":"2210.03629","doi":"10.48550/arxiv.2210.03629","metadata_source":"pith","pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","venue":"cs.CL","work_id":"407a2351-25f1-497d-b611-f77d0292a8e6","year":2022},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:447a0257e5f808e87ad38c30d56a897caddaf7aea3915c418635d532c8bc63bc","observation_id":"30cff53c-4f69-4892-8b5e-842d005e7555","resolution":{"observed_at":"2026-05-16T21:48:34.433996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.897515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s44286-023-00002-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Nature Chemical Engineering","work_id":"af6bcca7-0a20-4075-9a32-ab5550c89e73","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:05d232a993eb963bcaa1330b3498d931f48877bacf89ee5ebf710637cd75c50b","observation_id":"0a7d8187-c1a2-4a04-81ef-2e55e789b84e","resolution":{"observed_at":"2026-05-16T21:48:34.179219Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-024-08173-7","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Szczypiński, Jean-François Ayme, Ehsan Simaei, Thomas Fellowes, Rob Clowes, Lyubomir Kotopanov, Caitlin E","venue":"Nature","work_id":"11b56a78-d46a-4681-b7d1-c9746fead07c","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:f65223a5fec518786fd2795ad68ce25f89b7560c91978d7aedba16e54d8da4d5","observation_id":"f70da868-bce8-4aea-b8da-340e2689ea60","resolution":{"observed_at":"2026-05-16T21:48:34.176942Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc3b3914-375c-4428-a049-a04d39098a91","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:f8f0f65bca8d2a23dba624c8300a3318387e573306f5db3644d466baa3b13dce","observation_id":"e603c3ba-77f9-4cc4-a0e7-f64ac86c14d9","resolution":{"observed_at":"2026-05-16T21:48:35.193408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-023-00788-1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"M., Schwaller, P., Ortega-Guerrero, A","venue":"Nature Machine Intelligence","work_id":"7a77e612-c429-4111-a0ba-76f53a2b57b0","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:95f5fe1f92c93a8daafa36b31229c18baf7174ac48d882617f536fa66ac5e1ca","observation_id":"c444f2e5-1d85-4d02-9f60-f6bdf5a7ab5a","resolution":{"observed_at":"2026-05-16T21:48:34.181289Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T19:50:45.906804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T19:50:45.906804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-025-00994-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large language models for scientific discovery in molecular property prediction","venue":"Nature Machine Intelligence","work_id":"f6344dee-5a82-4fe0-8b84-da54b27f2893","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:ac4f50953a1daf6fc0badaea15e0b45dc5e82e4dc41f4741acfefac2333aae44","observation_id":"ee537345-f752-4b81-b1d6-3cbb2cd771b6","resolution":{"observed_at":"2026-05-16T21:48:34.185238Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41592-025-02776-2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Nature Methods","work_id":"b2f8c7c9-ee3e-4ea2-8339-9a9698d154db","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:2d07e74b5240898b498f7a5ac57db54d9dc5083e5f5d8aa51bc71ebdfb856700","observation_id":"8157938f-d834-4280-8055-3f6d762e87b7","resolution":{"observed_at":"2026-05-16T21:48:34.183304Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":"2201.11903","doi":"10.48550/arxiv.2201.11903","metadata_source":"pith","pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","venue":"cs.CL","work_id":"d1cf6693-a082-403c-ada9-dac7b96341f9","year":2022},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:9fc639715862509f9c7497b26752481c76561a64aa6148ca6083dd067277c4d0","observation_id":"6f83cdde-1ec6-4981-815c-6916632c7119","resolution":{"observed_at":"2026-05-16T21:48:34.415900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:13.648188+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":"2203.11171","doi":"10.1101/2025.04.03.646459","metadata_source":"pith","pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","venue":"cs.CL","work_id":"8c6d5a6b-b5cc-4105-9c84-9c34bb9375bb","year":2022},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:3b22f08c2f05406a4bc34bcc5bd3dae764f7f4495f5ace787a95d11c65e23091","observation_id":"efcefe1b-1ada-4635-ae5a-6f9bd7fd68b0","resolution":{"observed_at":"2026-05-16T21:48:34.427363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T18:52:42.88633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:1cd70c29c7227c98501ab0b6752e04ba489262e27630703cf5eefd45d2edefed","observation_id":"e596813c-3562-4a4c-a084-ee7faff8cbe0","resolution":{"observed_at":"2026-05-16T21:48:34.101539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09422-z","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T03:06:43.562716Z","title":"doi: 10.1038/s41586-025-09422-z","venue":"Nature","work_id":"9835b482-5032-4135-93dd-82a066677569","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:5a5b7fb5847909411f87d3b8253b28348648bc4351921f1539804963c8ae0c9a","observation_id":"c0243ecb-d07d-4dc2-ba2e-84de42be422e","resolution":{"observed_at":"2026-05-16T21:48:34.054580Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:21.094896+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1126/science.ads0018","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sofroniew, Deniz Oktay, Zeming Lin, Robert Verkuil, Vincent Q","venue":"Science","work_id":"4c9f6781-795f-4d4d-b485-afe5e965acb8","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:c90e6bb3c8ff709479d8467278ed2f6bbb2d836056a38458fb39c7212b6c24a1","observation_id":"d7ad4896-b02d-4838-9b44-96f52eee144b","resolution":{"observed_at":"2026-05-16T21:48:34.165587Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:19:51.517759+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:19:51.517759+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-08661-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Optimizing generative ai by backpropagating language model feedback","venue":"Nature","work_id":"6ee93df3-b83e-49c6-a34a-6253c1865505","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:09dce6d211a1c39242da82b8c50476b45b0335be10241bd7a7bec6f1d27fb027","observation_id":"21f1490d-d25f-4580-9681-a2d834e8ef9e","resolution":{"observed_at":"2026-05-16T21:48:34.157366Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:19:55.934443+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:19:55.934443+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-024-00832-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Augmenting large language models with chemistry tools","venue":"Nature Machine Intelligence","work_id":"8188ba9c-9068-47b2-aab7-fea0ca5aa74c","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a5b561766749c95b45f01f6070e8da130c2c85ccc34a4135c865ead9450d0182","observation_id":"1aea955e-5fcc-421d-91df-1f631e346c4e","resolution":{"observed_at":"2026-05-16T21:48:34.064570Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T07:51:16.137812+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T07:51:16.137812+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-023-06792-0","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:04:56.566982Z","title":"Autonomous chemical research with large language models","venue":"Nature","work_id":"e15cebd6-c137-47c6-975e-41b70ed20de9","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:e6fe827a58213f9626981a57a12f98923f58b8a4360c0bb35a7f808f2212424f","observation_id":"5755c56e-43b1-4364-a810-bcbbb10d99e9","resolution":{"observed_at":"2026-05-16T21:48:34.087275Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:19:55.682853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:19:55.682853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18864","last_updated":"2025-02-26T06:17:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-26T06:17:13Z","title":"Towards an AI co-scientist","version":1},"cited_work":{"arxiv_id":"2502.18864","doi":"10.3917/res.232.0099","metadata_source":"pith","pith_arxiv_id":"2502.18864","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards an AI co-scientist","venue":"cs.AI","work_id":"485486b1-a1a2-4cde-bdda-768930c403e6","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2502.18864","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:f60f59408256ed31a9a26ed698127ec5a4349090731c8cbd9e14ebdd95c56c40","observation_id":"b9b766ca-b087-4907-b0eb-21f0987dcd2f","resolution":{"observed_at":"2026-05-16T21:48:34.393084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08066","last_updated":"2025-04-10T18:44:41Z","snapshot_observed_at":"2026-08-01T14:58:15.255937Z","submitted_at":"2025-04-10T18:44:41Z","title":"The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search","version":1},"cited_work":{"arxiv_id":"2504.08066","doi":"10.48550/arxiv.2504.08066","metadata_source":"pith","pith_arxiv_id":"2504.08066","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The AI Scientist-v2: Workshop-Level Automated Scientific Discovery via Agentic Tree Search","venue":"cs.AI","work_id":"fa04f346-ee20-4e9d-bf04-3ad3569a8ed1","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2504.08066","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:831d4353657e3a0460bc7c689125078db8207324a1d0420652115d2ceba136c4","observation_id":"a6853eaa-e856-4e54-9fae-36d304c724da","resolution":{"observed_at":"2026-05-16T21:48:34.389858Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T19:23:27.206897+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T19:23:27.206897+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41586-025-09442-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Virtual Lab of AI agents designs new SARS-CoV-2 nanobodies.Nature","venue":"Nature","work_id":"069764e8-c2db-4377-aec9-b094d7237bec","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:eec268f2ba17cb1f6847c2c0dbec54867a01f7a6e3963a0a95355647bddd4047","observation_id":"1e2fe954-0c13-4eb5-9516-6d7def2bb618","resolution":{"observed_at":"2026-05-16T21:48:34.139295Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-20T17:22:33.416294+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T17:22:33.416294+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1101/2025.10.16.679418","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"bioRxiv (Cold Spring Harbor Laboratory)","work_id":"a057cb89-340b-4e73-9723-fbee5f44af4e","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:fc54b73632fc5e58e1e2d368f4c53fdb8ab4f13f95cf5e4932200f8a37cc785b","observation_id":"a5d05575-9a18-4e68-8b60-70b0c1812ca4","resolution":{"observed_at":"2026-05-16T21:48:34.149082Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-024-00843-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Nature Machine Intelligence","work_id":"0647d73b-82ab-4748-8b4d-e046ffad906f","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:be3cb22727d27269becb06b696f16e97ca03e8affd0e98d2976c29481eaa2fac","observation_id":"83c69c0a-5b55-4df2-8c2b-9d07af1bab00","resolution":{"observed_at":"2026-05-16T21:48:34.077398Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1021/acs.chemrev.4c00055","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Driving Laboratories for Chemistry and Materials Science.Chemical Reviews","venue":"Chemical Reviews","work_id":"30910688-8271-491b-8b1e-2cf70ba2fae3","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:6c9ff95cb7715e1a5fa614a028b0a22e30d4912569429031af839346b7cac874","observation_id":"d043dccf-8417-4b83-8917-3e4aa7469eaa","resolution":{"observed_at":"2026-05-16T21:48:34.069283Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T12:19:05.381539+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T12:19:05.381539+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s42256-025-01110-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"author Kitchin, J","venue":"Nature Machine Intelligence","work_id":"1e8d1dd1-e8d3-4c6c-a399-eb36a26f6975","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:8eb8591a160b656b906760665bcd8ea6d0a1271ba73a2d5d73c205f233697d41","observation_id":"4dbfdc77-6178-4673-a072-62ec0212d1b2","resolution":{"observed_at":"2026-05-16T21:48:34.167862Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"cited_work":{"arxiv_id":"2507.21046","doi":"10.48550/arxiv.2507.21046","metadata_source":"pith","pith_arxiv_id":"2507.21046","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","venue":"cs.AI","work_id":"f5de9511-98bf-411c-9eba-e8b7a914ec18","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2507.21046","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:34892bf4998de6be29cf0396cf6525a3b629877da71b12258e5a707359450761","observation_id":"8183efdb-d861-421b-af41-32ab346a75d4","resolution":{"observed_at":"2026-05-16T21:48:34.094503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T10:08:10.122082+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T10:08:10.122082+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41551-025-01463-z","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Johnson, William A","venue":"Nature Biomedical Engineering","work_id":"01eafcc8-b158-44b0-91d1-39809ac9699d","year":2026},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:f0caafd421a43c11ce52e4b046bae8540c1a86a531d9009f4854346f390f2075","observation_id":"ae2ce515-2ae1-4f8e-bccd-db46876d6b13","resolution":{"observed_at":"2026-05-16T21:48:34.081059Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-07-11T03:19:07.214544+00:00","source":"paper_reference_links","state":"open"},"event_date":"2025-12-08","event_type":"correction","notice_doi":"10.1038/s41551-025-01589-0","provenance":{"observed_at":"2026-07-11T03:07:47.241959+00:00","source":"crossref","source_record_id":"10.1038/s41551-025-01589-0->10.1038/s41551-025-01463-z:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s43588-025-00849-y","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Nature Computational Science","work_id":"f2d3baee-7b42-4e52-81af-f110ee5c40cd","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:909f9dec876f0766584ac3f382f7b1dee9677da11be3aae89243fe4aa6a7ad86","observation_id":"4f033503-7f58-4dd1-b20d-b547dfdd5da7","resolution":{"observed_at":"2026-05-16T21:48:34.084003Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.23426","doi":"10.48550/arxiv.2509.23426","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Democratizing ai scientists using tooluniverse","venue":"ArXiv.org","work_id":"e515adbd-38fb-496f-ba70-997fe71e0366","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:3b4720bcbd0b0e6f81e754d3ecc6c65edfef601e14762c863dfe8f84ca884ac9","observation_id":"07f03eb2-7fce-4928-8c9f-85b38e985c9c","resolution":{"observed_at":"2026-05-16T21:48:34.133366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-024-48998-4","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"(10) Jiang, G.; Luo, Q","venue":"Nature Communications","work_id":"ea1a98d9-8885-4aa0-b1a6-662e6742ac53","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:e226badda46c660633cea88bd2fc7800ea850b8c2766e5cfdfcb734e77d3ead4","observation_id":"6622025f-b967-4f82-9024-63fa96084adf","resolution":{"observed_at":"2026-05-16T21:48:34.136456Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T07:51:14.320633+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T07:51:14.320633+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c1583e48-6818-492b-9dc3-6fe4a38b4af8","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:76deb71a62d4e5eaea1e185201971cdc9c8f56b540254594578da77ab80bd3fe","observation_id":"ac5939bc-ad50-4f65-a51f-963cfec2128f","resolution":{"observed_at":"2026-05-16T21:48:35.134115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02824","last_updated":"2025-11-05T18:26:43Z","snapshot_observed_at":"2026-07-06T22:34:53.346702Z","submitted_at":"2025-11-04T18:50:52Z","title":"Kosmos: An AI Scientist for Autonomous Discovery","version":2},"cited_work":{"arxiv_id":"2511.02824","doi":"10.48550/arxiv.2511.02824","metadata_source":"pith","pith_arxiv_id":"2511.02824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kosmos: An AI Scientist for Autonomous Discovery","venue":"cs.AI","work_id":"f21b1a4c-dda4-447b-a222-692f1ecf62dd","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2511.02824","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:e1ffd467117fd6a74899e567ad3474d4fe6b64cef135c60b2c037861afeac016","observation_id":"71b16236-543e-4da2-ac7e-8952cb2bdbe9","resolution":{"observed_at":"2026-05-22T08:40:55.079629Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1101/2025.05.30.656746","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Carter, Xin Zhou, Matthew Wheeler, Jonathan A","venue":"bioRxiv (Cold Spring Harbor Laboratory)","work_id":"cf05f9fa-8fa2-4abe-b62a-9759bc47797d","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:787fd0407b523faf1b4a280c1885c64ef78a997b71b2787ba3143e4d77a9bc26","observation_id":"2db10bce-473a-4909-bfd8-7e9e01c06712","resolution":{"observed_at":"2026-05-16T21:48:34.160536Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.01659","last_updated":"2025-09-01T17:59:13Z","snapshot_observed_at":"2026-08-05T12:24:07.648539Z","submitted_at":"2025-09-01T17:59:13Z","title":"Physics Supernova: AI Agent Matches Elite Gold Medalists at IPhO 2025","version":1},"cited_work":{"arxiv_id":"2509.01659","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.01659","snapshot_observed_at":"2026-07-04T02:49:24.272970Z","title":"Physics Supernova: AI Agent Matches Elite Gold Medalists at IPhO 2025","venue":null,"work_id":"923f7824-d78a-40ac-bdbb-a9ee736faf03","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2509.01659","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:d86e63bc6482a3f535968ec1b6fbe4859309daf0d29ca893c883ed48165b9bab","observation_id":"4665ccbb-6984-43f9-a616-04b528763551","resolution":{"observed_at":"2026-05-16T21:48:34.380228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.01001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T11:28:04.337041Z","title":"Sciarena: An open evaluation platform for foundation models in scientific literature tasks","venue":null,"work_id":"94cc85d4-5077-4d5c-af92-f31b08320feb","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:58ce84a46e19160fb43b68f0bdc41a6c0644506ee4d36b720023b0094461689c","observation_id":"95a7e49d-c68f-48b6-b3ff-b27d0ccb3e79","resolution":{"observed_at":"2026-05-16T21:48:34.374071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title Swe-bench verified","venue":null,"work_id":"5cd2b203-26e4-4b61-9128-3b51d7b13410","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:c8094b953b324a7090650f4bc6224e596865d61094ddabd2a2ba440390cd9302","observation_id":"8a894e2a-8a35-4514-b7e3-10727f84c871","resolution":{"observed_at":"2026-05-16T21:48:35.129593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"cited_work":{"arxiv_id":"2505.23281","doi":"10.48550/arxiv.2505.23281","metadata_source":"pith","pith_arxiv_id":"2505.23281","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","venue":"cs.AI","work_id":"61e8d872-ccc7-46b8-8ec1-94008704c941","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2505.23281","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:06aa902449b180ad19ba320cb3e48eec88be0c3cf7b1a78d9dee0e4208aca902","observation_id":"5a14fbfa-cee3-4293-8761-74db70cfd251","resolution":{"observed_at":"2026-05-16T21:48:34.377051Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:19.286508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":"2406.11939","doi":"10.48550/arxiv.2406.11939","metadata_source":"pith","pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","venue":"cs.LG","work_id":"ad4ca175-a846-44ce-add1-5fd69a8d5c41","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:9f6b990d199634f5026340e25796ade9c71b587bad27ee87f8418f4a548349af","observation_id":"dfe06954-e8e9-47ef-bd0a-e0287188fce7","resolution":{"observed_at":"2026-05-16T21:48:34.399906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:23:28.73804+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12045","last_updated":"2024-06-17T19:33:08Z","snapshot_observed_at":"2026-08-02T22:19:29.043854Z","submitted_at":"2024-06-17T19:33:08Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","version":1},"cited_work":{"arxiv_id":"2406.12045","doi":"10.48550/arxiv.2406.12045","metadata_source":"pith","pith_arxiv_id":"2406.12045","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau$-bench: A Benchmark for Tool-Agent-User Interaction in Real-World Domains","venue":"cs.AI","work_id":"6a8d8dc4-0cc0-4052-8109-abbcdcd4a962","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2406.12045","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:4e1773fb08e7c2bcdb7849997ee103ad34ec3883c94a5126cf5a454ac726ff37","observation_id":"de5bfb54-62c9-4c9f-aa94-2c5bb8c53223","resolution":{"observed_at":"2026-05-16T21:48:34.128012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:21.86453+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:981fc3dd0f49b79cc4f658cddde5a5b957b69477e115b7fb2f70540f0bd98991","observation_id":"d6f5e6cc-05b8-4fe4-958a-dd25b98dc564","resolution":{"observed_at":"2026-05-16T21:48:34.112821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.09513","last_updated":"2022-10-17T07:46:47Z","snapshot_observed_at":"2026-08-02T03:10:19.073297Z","submitted_at":"2022-09-20T07:04:24Z","title":"Learn to Explain: Multimodal Reasoning via Thought Chains for Science Question Answering","version":2},"cited_work":{"arxiv_id":"2209.09513","doi":"10.48550/arxiv.2209.09513","metadata_source":"arxiv_reference","pith_arxiv_id":"2209.09513","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":"arXiv (Cornell University)","work_id":"5379429b-ef16-4b3b-b4dc-f8a0df7fa66b","year":2022},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2209.09513","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:d73051e9b82664c037370e15756e4912b0011c75916250174316ab28ca2416bf","observation_id":"cea9f1d9-0d6e-4e02-a93c-bde834d0e606","resolution":{"observed_at":"2026-05-16T21:48:34.106503Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":"2311.16502","doi":"10.48550/arxiv.2311.16502","metadata_source":"pith","pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","venue":"cs.CL","work_id":"da087b16-ea05-4064-980e-ce1d6e281d49","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:04fa7e0bcbea2a1f961f8d337cdae23792fdcd581fec77bdb5d1acf5e5fab134","observation_id":"57ed24f4-c6c1-4ae4-899f-03564cc70e2f","resolution":{"observed_at":"2026-05-16T21:48:34.143394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:e79c96bea2a7037e3adac107a19efa077f042aa8200009eb64aa0a26e4f29132","observation_id":"caa43568-44e2-46c8-a1c4-f85b36185768","resolution":{"observed_at":"2026-05-16T21:48:34.124182Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s44387-025-00019-5","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Intell.1, 14, DOI: 10.1038/s44387-025-00019-5 (2025)","venue":"npj Artificial Intelligence","work_id":"b325e4bd-3da0-428d-8e5d-3336ece82854","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:b0f7de4014c8bd2844a9dea7f7831daf70bffbef2ba2d5e1bab14670c830d8be","observation_id":"6d2225c7-b4fc-4369-a909-f7fe10b3249c","resolution":{"observed_at":"2026-05-16T21:48:34.146674Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41557-025-01815-x","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Elbeheiry, María Victoria Gil, Christina Glaubitz, Maximilian Greiner, Caroline T","venue":"Nature Chemistry","work_id":"d3ba3ad0-009d-42a0-8ba2-d7be80fc0f14","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:5f24f01af20f72e41352d870965b7aa9e719b3054fedda43198c90f600aac23e","observation_id":"eb9bae1d-f52c-4578-90fd-7daf419b1f52","resolution":{"observed_at":"2026-05-16T21:48:34.172602Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T07:51:16.448752+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T07:51:16.448752+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-07-06T21:30:18.842268Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19501","doi":"10.48550/arxiv.2505.19501","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19501","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genome-bench: A scientific reasoning benchmark from real-world expert discussions.CoRR, abs/2505.19501","venue":"ArXiv.org","work_id":"86f127ee-78d9-4c85-a383-2dcf2f767b39","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2505.19501","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:aca9995b113695121c94521c402cb1b76dea9979784f84f4a84614cca378f06e","observation_id":"836537d0-3232-4b45-9326-727cb0c321c3","resolution":{"observed_at":"2026-05-16T21:48:34.403311Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s43588-025-00836-3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Alampara, et al","venue":"Nature Computational Science","work_id":"41103ac6-a22a-4dd7-b2a5-31a8b159bfcb","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:758f4ba21822f5c3469d94447487b3b18c396efda505d915860443e70da97381","observation_id":"1c4242b2-3efd-4076-8f64-254f6546596c","resolution":{"observed_at":"2026-05-16T21:48:34.151610Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-07-11T03:19:09.174211+00:00","source":"paper_reference_links","state":"open"},"event_date":"2025-08-21","event_type":"correction","notice_doi":"10.1038/s43588-025-00869-8","provenance":{"observed_at":"2026-07-11T03:08:42.754763+00:00","source":"crossref","source_record_id":"10.1038/s43588-025-00869-8->10.1038/s43588-025-00836-3:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:d6ca34e2788ec93d6152109f3dd96df7676785c0b90ef3014ee5dd4a264bc86b","observation_id":"41a47057-3d46-43e0-b4b9-53bb251861a3","resolution":{"observed_at":"2026-05-16T21:48:34.409689Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":"2504.13837","doi":"10.48550/arxiv.2504.13837","metadata_source":"pith","pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","venue":"cs.AI","work_id":"d854765a-e664-41c0-8655-21c4bf2e0cc4","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:4519eb23f047ed32a7d91e1c7072c1868a36ff02510bdbfe5707c7967441c295","observation_id":"737a01ef-60d1-4c6a-a5a2-ed90de0e7c8c","resolution":{"observed_at":"2026-05-16T21:48:34.406506Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.002839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14901","last_updated":"2025-10-16T17:18:11Z","snapshot_observed_at":"2026-08-04T14:57:11.439686Z","submitted_at":"2025-10-16T17:18:11Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","version":1},"cited_work":{"arxiv_id":"2510.14901","doi":"10.48550/arxiv.2510.14901","metadata_source":"pith","pith_arxiv_id":"2510.14901","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reasoning with Sampling: Your Base Model is Smarter Than You Think","venue":"cs.LG","work_id":"56a35230-70da-4209-8bd7-899023fabb1b","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2510.14901","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:e3ee48567933d191eef282a4b36d019c834587f0cb4c53498cd851bb62cc4b77","observation_id":"4be5f1ed-30b2-4ee9-a173-ced6d49e7de1","resolution":{"observed_at":"2026-05-17T03:16:05.617665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07686","doi":"10.48550/arxiv.2510.07686","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stress-testing model specs reveals character differences among language models, 2025a","venue":"arXiv (Cornell University)","work_id":"356d4cfd-f519-456b-8f01-cedc6d3a40a3","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:8fb2d9efee44f5cf3cf0687e934a12967a36d2cce1a23cb2b90004131a0d4171","observation_id":"2e6f973f-fc99-4d59-a193-93b0630dcc3c","resolution":{"observed_at":"2026-05-16T21:48:34.383323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01582","last_updated":"2023-05-05T17:44:07Z","snapshot_observed_at":"2026-07-06T15:22:25.008777Z","submitted_at":"2023-05-02T16:31:35Z","title":"Interpretable Machine Learning for Science with PySR and SymbolicRegression.jl","version":3},"cited_work":{"arxiv_id":"2305.01582","doi":"10.3399/bjgp20x708941","metadata_source":"pith","pith_arxiv_id":"2305.01582","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Interpretable Machine Learning for Science with PySR and SymbolicRegression.jl","venue":"astro-ph.IM","work_id":"666d4dea-669b-423b-9bd4-e14eee78fcb4","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"cited_paper":"/paper/2305.01582","citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:4394475d74c032fa3a636749d628dfd653b7f10166296fa6ae7e8c26cdfc0854","observation_id":"82f3c756-502a-4990-92cb-1eba1dba1955","resolution":{"observed_at":"2026-05-16T21:48:34.396240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41587-025-02650-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Frontier Models for Dangerous Capabilities,","venue":"Nature Biotechnology","work_id":"5cb6b08d-8ded-4330-a7f4-f59d31d5aa02","year":2026},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:b5fa1d28ef7e58f2b9ad6faaea528cd23286cb2806e89c5cf489a3b658972c46","observation_id":"15e21fa9-ff4a-453e-b1e6-12c723136e4d","resolution":{"observed_at":"2026-05-16T21:48:34.154150Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.17495409","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7eda41ca-ed0d-472a-a905-91fea7e08279","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:cdc3448b3f5470b7e21c975764ae6a124b3189bc439ed3142f58138a4d04e413","observation_id":"9441a68a-3c93-4aca-9ed3-77866b9dac84","resolution":{"observed_at":"2026-05-16T21:48:34.116098Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Li, C","venue":null,"work_id":"1e33121e-97fa-4751-b84c-c65cc8d4271e","year":2020},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:c1201c7032fc1812fbc86a31be34059be4b9ca8ce2388d5cb4346b84731f44df","observation_id":"d518bbec-2b38-4316-b7d8-2d7f483bef08","resolution":{"observed_at":"2026-05-16T21:48:35.180952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"55a84e9d-d853-47e0-af57-07889539d513","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a3e4b9150371301f4f8429ff7a9baa884902acaff1bea18b5e1152c7ac1b311b","observation_id":"b540fc08-a9e4-4917-93b1-cd02b788d08c","resolution":{"observed_at":"2026-05-16T21:48:35.189231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c97df645-1eb3-47a4-a3c0-ce36663fbd38","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:4c9ffc84b7aca68c218b0ca91334e01aedf9f1d2d0e43d22dbe26a1be30cddc4","observation_id":"4cdd9e5e-d59a-403d-bff6-a3779c8ff0f1","resolution":{"observed_at":"2026-05-16T21:48:35.174873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1021/jacs.5c02097","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Journal of the American Chemical Society","work_id":"499888f1-e121-4234-8a54-26eb1c5ef863","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:4c49404aee7b59d391f21ea294c42f218bfacbeb539e91255520602001d4291f","observation_id":"8acfd890-e4d2-43bd-9724-059453008836","resolution":{"observed_at":"2026-05-16T21:48:34.174737Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d39450eb-11b8-4c5b-be46-cc3728ffb42a","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:561b80b95bdbd903cd1c271588b86e7267b51a6f0545269a76d3db021f69035c","observation_id":"aa83e4ec-e2c8-4be1-b880-5111b399c0e2","resolution":{"observed_at":"2026-05-16T21:48:35.187216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4135a17b-c2e0-440b-9ad7-39a050a4d4ee","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a0c23b416d754d32634e9c2d333289fbfeb2ada18af017515ee7a3cf5d8fd7c1","observation_id":"1427d0a9-b75c-4135-a5f7-fc1e77913a93","resolution":{"observed_at":"2026-05-16T21:48:35.172831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06195d91-6ab3-4377-bf9c-ff4d17f66608","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a5986630c3608b3b9902d96b57bdb30f7f0187e4b3db8d948d67ac47ddc53f4e","observation_id":"90cf00be-873a-41bf-97a7-dc7b4a812422","resolution":{"observed_at":"2026-05-16T21:48:35.176980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Meidani, K","venue":null,"work_id":"44972354-f6b3-4d6f-ba8c-d715802d1769","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:599abb0a890fdc5ac0dd7c77bb448eba7942992e262c6b35ec67fdbcf4afd23e","observation_id":"4e682a79-5aa7-44c9-99a1-b1aa09978c3d","resolution":{"observed_at":"2026-05-16T21:48:35.178982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"908bed59-dc7d-453a-9e1d-01bbd45116ef","year":2025},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a46e5e2168da19429c6408d6a6bf78c8046fdb93d5d041658a92515030d1bebb","observation_id":"70ed37a8-336f-4ec0-8141-743fb61a8a95","resolution":{"observed_at":"2026-05-16T21:48:35.182967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.12608602","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:45.648157Z","title":"doi:10.5281/zenodo.12608602 , url =","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"2c57f331-c45e-4b28-9887-1931db7da39f","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:40e200c14bfbf1057a3f75ec9fea325ec722be76e2ad1b7ff0681872640a8b41","observation_id":"9d6fb357-95b7-41e6-b473-d86fa7b84956","resolution":{"observed_at":"2026-05-16T21:48:34.073825Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.232771+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title Sde-harness: Scientific discovery evaluation framework","venue":null,"work_id":"134fd76c-3774-4202-bfb1-abc137e25500","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:633b41c3c9e203c789af2d14c4a1fd3ad741c035e565a119975c757e7ef9a5d7","observation_id":"ebb268b7-7bee-44f5-b9ff-6f6355780c66","resolution":{"observed_at":"2026-05-16T21:48:35.168351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b4d4fd9c-1576-426d-9c9a-344afbe30329","year":2021},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:5aacd0f4bb66e6afefc37af33ebba62725098984b8a64fc6642993b8533c3b4a","observation_id":"09fbd1e7-6c27-4c5c-aabd-4184207b210c","resolution":{"observed_at":"2026-05-16T21:48:35.170499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.17863/cam.16293","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Apollo (University of Cambridge)","work_id":"dbaed3fb-ca79-4b7d-9f55-ef2b06fd09f0","year":2012},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:460d3d272e998f861b17c0ebbcf9bd55a5a7a00de621d38dcba08bfdb569d607","observation_id":"b62a95cb-d2e1-4003-9f64-437ec2e2c48c","resolution":{"observed_at":"2026-05-16T21:48:34.163064Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3454274-0142-4db1-b226-3e0c32660c8b","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a3676ccde8cfa35236fd510ed67d7cc9a35a5a008270ea5e7e828c16baf39532","observation_id":"59bd17c0-1467-4167-9fdb-013cf326f4bf","resolution":{"observed_at":"2026-05-16T21:48:35.191371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"acdb8a28-82a4-4c0c-93a4-2ac4ff6c8311","year":2018},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:625c99199f4aef65c63691bb1ec5b480197f10cb4497558ee41b601e1fe16e19","observation_id":"d78db3f2-0ada-43d0-8bb9-2867cc6d431e","resolution":{"observed_at":"2026-05-16T21:48:35.163570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"& author Schuffenhauer, A","venue":null,"work_id":"1e4a11b5-a21a-459d-8329-31401049e06f","year":2009},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:a99771bae4d2644d24069a93df7d89b4635715efb1a20eccc59a1a60eae28c33","observation_id":"517cb734-461b-4064-a829-58fcfc2c2652","resolution":{"observed_at":"2026-05-16T21:48:35.165952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"title Pistachio (january 2024)","venue":null,"work_id":"aac83e69-e781-42cd-b95f-16537199eb15","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:9b1cdca209b24554a74904bd16ce3bf7492c4fb88bb9e3890d68a79050f02add","observation_id":"12144205-038a-4174-a5c7-5a3d3d3b0598","resolution":{"observed_at":"2026-05-16T21:48:35.185086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"975e9642-fb04-44a5-967d-ea16a1d88602","year":2018},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:bd9bfa0c99bff755abc282fad6519481a0b8fdcf473b7e1166c20cb7e54ccccb","observation_id":"fa129da7-8894-46e4-81fa-5510291f49ed","resolution":{"observed_at":"2026-05-16T21:48:35.150585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Yang, Z","venue":null,"work_id":"0ad9dc47-a6b1-4594-bf46-c9547704c0c6","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:4fce9ef5948c9a711332910176bb4d7b8dcaa3233fc4fad86cd5b53bd662372c","observation_id":"67e42e0a-bb22-4cc8-9db2-a26712416d61","resolution":{"observed_at":"2026-05-16T21:48:35.161678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"61c10fd3-b60a-4a94-99c4-a05d6cabe3f1","year":2022},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:0e25f70bb29cd93ac541f8423f2ebcf5f3e631f09a5b1da434b66d1765e3275b","observation_id":"96d09d07-bd51-4aeb-a748-4e732c520cc6","resolution":{"observed_at":"2026-05-16T21:48:35.146636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"& author Jung, Y","venue":null,"work_id":"55476c74-e29f-49d1-b4f0-83b4955255b2","year":2021},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:41a03f100c07cddf15afa4bd131a69ff0f931a595d4cf09853b06c6e8f122709","observation_id":"ae19da77-8fe3-4826-b1b7-8da3819b1a3b","resolution":{"observed_at":"2026-05-16T21:48:35.154718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/jcc.24437","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Journal of Computational Chemistry","work_id":"03fda39b-eb35-4a2e-8560-fbf1b00ee04d","year":2016},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:ff7b0e5956afa594c961bd97cab8a909f4bd8f2e08f8b2f99f2452a25d297ea8","observation_id":"a4a8c75a-e4ee-4849-822d-e43245495dc9","resolution":{"observed_at":"2026-05-16T21:48:34.170169Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Wang, Q","venue":null,"work_id":"7d07615d-a13d-450f-897b-084885e04af5","year":2020},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:448a545921c79938284bdbf2c1cc989f87b14ac7160d34cfb32a7c7b10c7f0da","observation_id":"779c47a7-af95-4505-a389-534278128f4d","resolution":{"observed_at":"2026-05-16T21:48:35.159437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Zhong, P","venue":null,"work_id":"dcb6ed70-a118-4b3e-ae35-e599196f39ff","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:f16b72859c18b64e7e70eff9cfff8c1af99f3cef56a05b985ac6766ce61041e9","observation_id":"a7a49271-78e7-4b55-9b20-332cdd763497","resolution":{"observed_at":"2026-05-16T21:48:35.136065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Fu, X","venue":null,"work_id":"37d74dc1-ced7-45c5-b04a-7afa1d84a62d","year":2022},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:9d6097432e3b4b1ebe31de580532b8e93e267729def18cd5cffbc66c6b7eaaeb","observation_id":"6a46dd7d-eb19-4d8e-9b16-46c0b3af1ddb","resolution":{"observed_at":"2026-05-16T21:48:35.148666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author Huang, W","venue":null,"work_id":"9d739654-b6c3-40e2-be5b-c618dd6900bb","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:2b818bd904794d1f535bc12cc7c469b4472c25fbdf54f68bf9c29928854a0901","observation_id":"2ccc3f68-6995-4f33-85b2-6bf6d9788841","resolution":{"observed_at":"2026-05-16T21:48:35.140853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b0ec8b61-6a33-4b96-86b2-b4c2bbbb601e","year":2016},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:f91a2c67717538a7283721f4dfb904231f60ef2e9b5bb0431b43434fcf8f3f38","observation_id":"f9bb2b78-9725-483b-a704-adcfcf4934b2","resolution":{"observed_at":"2026-05-16T21:48:35.142780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cb952071-5a57-4953-b20b-dc4e69700d05","year":2024},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:52f1ed1318777d7aa9c36f00af17d7568d92f8594daede6e823a5f971d97b59d","observation_id":"91ae0adf-337c-449f-b83a-489870275ac4","resolution":{"observed_at":"2026-05-16T21:48:35.138903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8d5a3443-e158-41cc-8682-f819f4f4a47a","year":2016},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:6bb776c9fd233eb33a3270f70c4be9c0bb53ab7d354f95dafbd7e541a545a59f","observation_id":"8cbd6a15-06dc-479b-b0de-cfb0cbf610a4","resolution":{"observed_at":"2026-05-16T21:48:35.144671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6775a43c-7804-4b5f-944b-897e80661d33","year":2021},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:82c0a40d8c0d764e2c42ac1ccc0110024b4c298750f5bb6bdbd68ffd98eafb2a","observation_id":"8ce00b35-6e14-4894-9eb6-ff94de626cea","resolution":{"observed_at":"2026-05-16T21:48:35.152686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a1510aad-0e79-413c-a272-cabdf9d33869","year":2023},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:2d439d17fd08d9c6f9ede3011a8afbfb7dd243ab50d703aad7f97bf75f6eb2d5","observation_id":"b74d55ca-6340-45fd-b9f4-725d0816f60a","resolution":{"observed_at":"2026-05-16T21:48:35.157325Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:31:21.766877Z","title":"\" * write output.state after.block = add.period write newline","venue":null,"work_id":"3ab3b505-d1e9-4dbf-83ee-e5fcc6437ab3","year":null},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:791dfcc2b153c5d0a08f06d82d2b252162aae49fc9ee5bfc78baf79083dfc2ff","observation_id":"f74df5ac-1fa3-44b4-8a86-c2296121324f","resolution":{"observed_at":"2026-05-16T21:48:35.132252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T19:31:21.730319Z","title":"write newline","venue":null,"work_id":"a4345bdc-698f-4dff-a245-18d59f2b1e6c","year":null},"citing_paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-16T21:47:09.588941Z"},"links":{"citing_paper":"/paper/2512.15567"},"observation_digest":"sha256:708afdafe4686b8cc1560faa6ec2f80c88b9f993f6f8a785b556f5d45b54f623","observation_id":"502fdcde-8078-414f-a302-cbbb1b7595c1","resolution":{"observed_at":"2026-05-16T21:48:35.127502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2512.15567","last_updated":"2026-05-08T01:14:00Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T16:20:03Z","title":"Evaluating Large Language Models in Scientific Discovery"},"reference_resolution":{"displayed":87,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":18,"verified_exact":53,"verified_fuzzy":14},"total_outbound_references":87},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 87 of 87 outbound references and 19 inbound Pith citation observations for arXiv:2512.15567."}