{"as_of":"2026-07-22T00:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25270a30b50ad1dcd21eb6638b6c8f097fc730dcc8c1e5d4dffd888e9d984b03","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T00:44:01.658214Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-21T06:31:05.380196+00:00","state":"measured"},{"denominator":55,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T17:09:09.167784Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T20:47:34.579097Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:7022844503b8fa078d53f221cf3a4cd8bff34cddf5c7ad087e2882f578deaede","observation_id":"72a19ef2-e197-4494-ac82-e0e76871d46d","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"reference_index":213,"source":"pdf_text","source_observed_at":"2026-05-12T08:40:40.910461Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2503.09567"},"observation_digest":"sha256:54d93e995d73d2bcd62dfd78a9786537ab511c64314bebaac2dc9c30c029546f","observation_id":"c25b27db-ccc0-4271-b56c-714685194501","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":163,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:da9469126d10f133ca0ecb443c91f30b07a7db4946039d58925d7461998ae7fc","observation_id":"57ac86d0-1350-4f84-bccc-431fd86cc74f","resolution":{"observed_at":"2026-05-18T00:02:25.462023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2509.20374","last_updated":"2026-04-26T17:39:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-19T22:21:26Z","title":"CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T15:05:37.519850Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2509.20374"},"observation_digest":"sha256:8564cd69a2dda5ac96f4d074f26f8c8f8fd359d1871fd102c52ed94cba2b5938","observation_id":"cff174b5-0057-4edf-ad18-0884207b7c46","resolution":{"observed_at":"2026-05-18T15:06:32.104836Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2509.26574","last_updated":"2026-05-08T21:22:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-30T17:34:03Z","title":"Probing the Critical Point (CritPt) of AI Reasoning: a Frontier Physics Research Benchmark","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T11:52:10.205796Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2509.26574"},"observation_digest":"sha256:5dbbc779061c62fcd6be7974e4e0c09f28211dd42327abbc4a8ab6a05d484b4e","observation_id":"000180cb-00e4-4ce2-ac62-83df23cad931","resolution":{"observed_at":"2026-05-18T11:52:35.313977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2510.20728","last_updated":"2026-04-06T14:46:30Z","snapshot_observed_at":"2026-07-06T22:33:58.663508Z","submitted_at":"2025-10-23T16:45:39Z","title":"Co-Designing Quantum Codes with Transversal Diagonal Gates via Multi-Agent Systems","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T04:28:48.400311Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2510.20728"},"observation_digest":"sha256:9a75d5e38c4d8c58739aae49cf0b794341c7d7b4159f427806e888a0c3a5cce1","observation_id":"39cbd854-f23d-4167-9e22-43d6ae7d89bb","resolution":{"observed_at":"2026-05-18T04:30:52.976368Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2601.13209","last_updated":"2026-05-02T15:26:09Z","snapshot_observed_at":"2026-07-06T22:42:08.271837Z","submitted_at":"2026-01-19T16:38:18Z","title":"AI for Mathematics: Progress, Challenges, and Prospects","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T13:24:57.923863Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2601.13209"},"observation_digest":"sha256:ec5684251b6c1481f5594890a18705a9404f2e41e674947c17486296cd54d347","observation_id":"ee92b023-b7d2-482f-bf70-ed8868aa70e3","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-13T22:02:43.946867Z","title":"Frontiermath: A benchmark for evaluating advanced mathematical reasoning in ai,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.19464","last_updated":"2026-07-17T01:47:32Z","snapshot_observed_at":"2026-07-21T23:18:49.009501Z","submitted_at":"2026-03-19T20:55:46Z","title":"Can LLMs Prove Robotic Path Planning Optimality? A Benchmark for Research-Level Algorithm Verification","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T22:02:43.946867Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2603.19464"},"observation_digest":"sha256:74d48bc51328b2d0449df45a409f9693aa3574943273c9d1ac2a5e00924b0998","observation_id":"308e4fcb-fae1-4860-b996-7d03eadb80bb","resolution":{"observed_at":"2026-07-13T22:02:43.946867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.02368","last_updated":"2026-04-21T02:53:40Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-03-27T11:28:15Z","title":"Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T23:22:53.368231Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.02368"},"observation_digest":"sha256:54d2369ea0c41bca6d9227220b5f7a290ddfd8c30762e2c4af745781279ecc8e","observation_id":"c9e23c67-577a-495e-a4d2-f5ea1c917233","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.03789","last_updated":"2026-05-30T05:07:37Z","snapshot_observed_at":"2026-07-13T12:18:08.261894Z","submitted_at":"2026-04-04T16:35:16Z","title":"Automated Conjecture Resolution with Formal Verification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T18:05:38.340467Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.03789"},"observation_digest":"sha256:ef6cfb44504159f616a66fb5bcf6831f469474e540126274c54592f66e9833fa","observation_id":"5180c4eb-610f-46eb-8faa-32218492a12c","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-13T12:18:10.165894Z","title":"Frontiermath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI.arXiv preprint arXiv:2411.04872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03789","last_updated":"2026-05-30T05:07:37Z","snapshot_observed_at":"2026-07-13T12:18:08.261894Z","submitted_at":"2026-04-04T16:35:16Z","title":"Automated Conjecture Resolution with Formal Verification","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T12:18:10.165894Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.03789"},"observation_digest":"sha256:d88968cdc1524c932932c7b4c434ffc979d2a78244db7d2b66619630441d6ef1","observation_id":"1dd9f079-99d9-4385-b390-bdd2948c03bb","resolution":{"observed_at":"2026-07-13T12:18:10.165894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.04386","last_updated":"2026-04-06T03:27:48Z","snapshot_observed_at":"2026-07-06T22:53:24.585766Z","submitted_at":"2026-04-06T03:27:48Z","title":"Automatically Generating Hard Math Problems from Hypothesis-Driven Error Analysis","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T19:39:36.819142Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.04386"},"observation_digest":"sha256:2afd62d92b7131da6296da3ae58e3af817e7f488b23ddcca42cb0eb98516cd28","observation_id":"0f9bcabb-242f-4a8a-8a44-f1e791c99e28","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.04443","last_updated":"2026-04-06T05:41:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T05:41:02Z","title":"DeonticBench: A Benchmark for Reasoning over Rules","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T20:22:03.956227Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.04443"},"observation_digest":"sha256:7d0f8d47037787395c763b147537291eababbe9c9470ab4daa1fb29322b9c5b5","observation_id":"b616c540-6143-40cb-b0b4-5de9c626106e","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.06107","last_updated":"2026-04-07T17:19:33Z","snapshot_observed_at":"2026-07-06T22:54:40.349479Z","submitted_at":"2026-04-07T17:19:33Z","title":"Artificial Intelligence and the Structure of Mathematics","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T19:12:23.402808Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.06107"},"observation_digest":"sha256:739658e1f676da9f6a1e7381c792f7387fd1c1112ea9a254c2cabf72bdc5d1cf","observation_id":"76f947a2-81ff-475f-ac0e-f6633f17f381","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:38e25451f275c447002fd0957eec06b427251c04332ae8ef407b81e3d45f90a3","observation_id":"a37c7062-38c5-463e-bf5b-5293a35583bf","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.07240","last_updated":"2026-04-08T16:06:43Z","snapshot_observed_at":"2026-07-06T22:55:33.502756Z","submitted_at":"2026-04-08T16:06:43Z","title":"$k$-server-bench: Automating Potential Discovery for the $k$-Server Conjecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:48:17.363568Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.07240"},"observation_digest":"sha256:81e33e5d632e24d3cba4aa368a22137ec229908ea1956a2ac530bf543c84182c","observation_id":"768a1353-c835-449e-96c1-b29c33efa2ea","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.11535","last_updated":"2026-05-07T11:10:15Z","snapshot_observed_at":"2026-07-06T22:59:54.573362Z","submitted_at":"2026-04-13T14:32:08Z","title":"Problem Reductions at Scale: Agentic Integration of Computationally Hard Problems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:35.395872Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.11535"},"observation_digest":"sha256:64d54a91937756b82a7993188aac0f1e2622f89eb4f5d97697861e54ca3bc52f","observation_id":"895512bc-89d5-4ec5-8bc9-57fb48e1f44f","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.16646","last_updated":"2026-04-17T19:02:54Z","snapshot_observed_at":"2026-07-06T23:03:57.199731Z","submitted_at":"2026-04-17T19:02:54Z","title":"Agentic Frameworks for Reasoning Tasks: An Empirical Study","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T08:24:51.573913Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.16646"},"observation_digest":"sha256:7bf38b546b9ce8872ccff76be0e4751015e543fe647717ac069cfcd922e633c1","observation_id":"363b1d25-5919-476f-994f-1a610104efaf","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.18936","last_updated":"2026-04-21T00:21:05Z","snapshot_observed_at":"2026-07-06T23:05:39.724237Z","submitted_at":"2026-04-21T00:21:05Z","title":"Fine-Tuning Small Reasoning Models for Quantum Field Theory","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T03:23:18.770963Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.18936"},"observation_digest":"sha256:4557a0806aa05f5c856df6b94dafe46cfdecce545ddee7d49424bc8f85b4101f","observation_id":"ce61519e-7cd9-4cef-946f-e8e6ffa34df4","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2604.21916","last_updated":"2026-04-27T04:18:43Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:57:46Z","title":"MathDuels: Evaluating LLMs as Problem Posers and Solvers","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T21:26:52.011933Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2604.21916"},"observation_digest":"sha256:0b2c7e31410f9c39ee0a7bec351c468fedc65b8898cd36e69a4ebba3e7d8b1a4","observation_id":"7cc1818a-2bf0-4657-b3a6-8b82b28eb397","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.08905","last_updated":"2026-05-09T11:57:25Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T11:57:25Z","title":"Forge: Quality-Aware Reinforcement Learning for NP-Hard Optimization in LLMs","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T02:44:33.143247Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.08905"},"observation_digest":"sha256:852a292603e013b07c0d6f67c4554ec63990fbcf86d0c1f3f66febe00c5bf7a6","observation_id":"923968c8-a34e-4d42-86a0-63c34adefdb0","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.09063","last_updated":"2026-05-19T16:12:41Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:14:22Z","title":"Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T01:53:12.708706Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.09063"},"observation_digest":"sha256:cc953bdeef03dbe19e46355bb1c2cb21f0b5df77e49dd9cfe593d95840653f10","observation_id":"5bd5622d-e6d2-4695-a04f-e7a1e94b9827","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.09063","last_updated":"2026-05-19T16:12:41Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T17:14:22Z","title":"Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T22:24:04.625823Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.09063"},"observation_digest":"sha256:7fab494b146fc70117c53ee0c49d3d9383dd1066e94a013a0cc7becff5aa5ad6","observation_id":"5d266f89-6a95-46b4-a4c1-16f6e7516e9e","resolution":{"observed_at":"2026-05-20T22:24:07.822738Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.13171","last_updated":"2026-05-13T08:33:15Z","snapshot_observed_at":"2026-07-06T23:24:47.309044Z","submitted_at":"2026-05-13T08:33:15Z","title":"Formal Conjectures: An Open and Evolving Benchmark for Verified Discovery in Mathematics","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T20:20:54.566662Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.13171"},"observation_digest":"sha256:3e898876758ffb42981d801b6b72e6bb7fe885a43ea47226f1412dccfd51448d","observation_id":"430054da-3fda-405e-bbab-74a13dba2b83","resolution":{"observed_at":"2026-05-17T00:44:01.791449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.19338","last_updated":"2026-05-19T04:20:43Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T04:20:43Z","title":"STAR-P\\'olyaMath: Multi-Agent Reasoning under Persistent Meta-Strategic Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T02:56:19.104905Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.19338"},"observation_digest":"sha256:8fa4b1d205786d02bd80df5fc2a10ffb0ac3caa7c4a9723b4d119c83402dd404","observation_id":"d2c6d8b1-7f5b-48b0-a474-40e12f42420a","resolution":{"observed_at":"2026-05-20T02:58:00.175045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.22681","last_updated":"2026-07-18T20:33:32Z","snapshot_observed_at":"2026-07-21T23:20:44.363854Z","submitted_at":"2026-05-21T16:23:36Z","title":"Scientific reasoning does not reliably translate into scientific forecasting in frontier AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-22T05:18:15.358571Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.22681"},"observation_digest":"sha256:ab112833ab7f7c723a0a9b62e396a7ff2955f86a38dced4ecd24a8684360f1c4","observation_id":"12f99899-ecf2-47ab-be40-905cbd9e37af","resolution":{"observed_at":"2026-05-22T05:21:07.455360Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.22875","last_updated":"2026-05-20T04:54:22Z","snapshot_observed_at":"2026-07-06T23:33:09.561760Z","submitted_at":"2026-05-20T04:54:22Z","title":"RMA: an Agentic System for Research-Level Mathematical Problems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T06:06:47.226726Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.22875"},"observation_digest":"sha256:c104256877222d3dfb889cd4bc67e93f94282a490ad4a4388893870f409b1b1e","observation_id":"3da02bf1-3fb3-4eff-ae75-4c9058268dee","resolution":{"observed_at":"2026-05-25T06:10:24.159655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.23007","last_updated":"2026-05-21T20:28:57Z","snapshot_observed_at":"2026-07-06T23:33:14.457450Z","submitted_at":"2026-05-21T20:28:57Z","title":"MadEvolve: Evolutionary Optimization of Trading Systems with Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T05:24:05.098181Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.23007"},"observation_digest":"sha256:74d15ffc1977aa86f122a49e65a6613c228290f8e71832b3e2c0f2aa3d8c447b","observation_id":"d8931d30-f951-4dcd-8dfe-c5b8af77d71b","resolution":{"observed_at":"2026-05-25T05:25:23.375844Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.28814","last_updated":"2026-05-27T17:59:15Z","snapshot_observed_at":"2026-07-06T23:38:19.096349Z","submitted_at":"2026-05-27T17:59:15Z","title":"Self-Improving Language Models with Bidirectional Evolutionary Search","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T12:57:28.931392Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.28814"},"observation_digest":"sha256:9b2b0029d095a55adf4e87293ee2e3b7e3e4fe87a68ed4c2553ca8cdc6852f68","observation_id":"962229af-4518-4832-8218-d9276d110c0a","resolution":{"observed_at":"2026-06-29T13:03:26.436991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2605.29548","last_updated":"2026-06-01T17:29:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-28T08:02:11Z","title":"Why Larger Models Learn More: Effects of Capacity, Interference, and Rare-Task Retention","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T08:39:14.327838Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2605.29548"},"observation_digest":"sha256:268e4375f66ed1345bc42058be6e665cd6914ae52126ba1591ae38a22f2b3e7d","observation_id":"d2a75c58-b04b-43a3-be07-bb4cf9de881c","resolution":{"observed_at":"2026-06-29T08:43:15.141444Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.00103","last_updated":"2026-05-26T09:12:30Z","snapshot_observed_at":"2026-07-06T23:40:51.363776Z","submitted_at":"2026-05-26T09:12:30Z","title":"Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T17:46:39.281623Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.00103"},"observation_digest":"sha256:6d334eea9471685b24cf868fa39f3bcce5e5de91fcea75c96a50365979efb294","observation_id":"9e5c041c-014f-41ab-b5d9-1825db7f49f9","resolution":{"observed_at":"2026-06-29T17:53:47.431723Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.01008","last_updated":"2026-05-31T04:51:27Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T04:51:27Z","title":"FVSpec: Real-World Property-Based Tests as Lean Challenges","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:05:13.012431Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.01008"},"observation_digest":"sha256:c647a75e16f2d0c492f9e80072a4d2241ce83406b62b8d3e4e2ed9e010af2938","observation_id":"d07eae8e-f869-471d-81ad-8562e008dc17","resolution":{"observed_at":"2026-06-28T17:12:25.298307Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:04ae90d56a9f2a39c60429f96a4bb755986926d2712499cc96bf0dcc6d615697","observation_id":"731c206a-b6f2-484b-b76c-575c46a49c03","resolution":{"observed_at":"2026-07-01T20:56:13.250290Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.01462","last_updated":"2026-05-31T21:46:52Z","snapshot_observed_at":"2026-07-06T23:42:02.762832Z","submitted_at":"2026-05-31T21:46:52Z","title":"An Enigma of Artificial Reason: Investigating the Production-Evaluation Gap in Large Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T16:45:33.046568Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.01462"},"observation_digest":"sha256:13190f36b48ccdd45c07ba8662defb1da68b2aedb82e117febb4127346477467","observation_id":"dd0dcb8d-b48a-49d9-b464-a09ed08527f9","resolution":{"observed_at":"2026-07-01T21:36:14.993846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.02588","last_updated":"2026-05-20T08:15:43Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-05-20T08:15:43Z","title":"Lean-GAP: A Dataset of Formalized Graduate Algebra Problems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T17:32:00.411535Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.02588"},"observation_digest":"sha256:32003021a12cd406660d6e761f3c9ea1daca932d229e2ca181fff25ed3de03cb","observation_id":"abeef3e5-3717-44f4-bdf2-0905230e334a","resolution":{"observed_at":"2026-06-30T17:34:57.542083Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.03144","last_updated":"2026-06-02T04:40:25Z","snapshot_observed_at":"2026-07-06T23:43:27.226603Z","submitted_at":"2026-06-02T04:40:25Z","title":"GTBench: A Curriculum-Grounded Benchmark for Evaluating LLMs as Mathematical Research Assistants in Graph Theory","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:19:03.670540Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.03144"},"observation_digest":"sha256:ce1828d280516566c5166bb7f990455d6d4da7ef2809d4ccf2c0a321a49af17d","observation_id":"fbfee4f5-4113-4d26-bbf3-a5866889807a","resolution":{"observed_at":"2026-07-02T03:06:30.296889Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.05400","last_updated":"2026-06-03T20:09:39Z","snapshot_observed_at":"2026-07-06T23:45:23.749718Z","submitted_at":"2026-06-03T20:09:39Z","title":"LeanMarathon: Toward Reliable AI Co-Mathematicians through Long-Horizon Lean Autoformalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T05:48:56.691155Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.05400"},"observation_digest":"sha256:977d9698a719871756119216e03cae9163391554e8c71a361bba37d7fb360d3c","observation_id":"f31297e3-a2f6-43b1-ad07-d2d819cab9ad","resolution":{"observed_at":"2026-07-02T08:36:48.761264Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.05729","last_updated":"2026-06-04T05:43:12Z","snapshot_observed_at":"2026-07-06T23:45:42.379051Z","submitted_at":"2026-06-04T05:43:12Z","title":"Automated Proving of Shannon-Type Entropy Inequalities via Fine-Tuned Language Models and Guided Tree Search","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T23:52:11.730333Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.05729"},"observation_digest":"sha256:a25a28532f1b466190aaef211686ce6a373a54749b68ee7d23d4abf6b280f7e1","observation_id":"d8702a46-4bd0-4b1f-a18b-21b44c265c7b","resolution":{"observed_at":"2026-07-02T15:27:05.514373Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.06526","last_updated":"2026-06-02T20:38:39Z","snapshot_observed_at":"2026-07-06T23:46:20.554117Z","submitted_at":"2026-06-02T20:38:39Z","title":"CrowdMath: A Dataset of Crowdsourced Mathematical Research Discussions","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-28T09:45:18.385925Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.06526"},"observation_digest":"sha256:32d914881b0986617895c04b4e9302dd320f729d748480703a480e0c09d52c87","observation_id":"ab30e99c-aef7-4f34-ab18-747f9c148845","resolution":{"observed_at":"2026-07-02T03:46:32.299057Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.07515","last_updated":"2026-06-11T16:52:41Z","snapshot_observed_at":"2026-07-06T23:47:10.030985Z","submitted_at":"2026-06-05T17:59:42Z","title":"How reliable are LLMs when it comes to playing dice?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T21:56:42.766016Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.07515"},"observation_digest":"sha256:8438a1ff2432bc0a3a53a69e83ab0e79acd31ab9d5d6595f2c6b78cc1540f1a6","observation_id":"2a7de1a8-87b1-4cf5-9585-e2d5fb46f9fa","resolution":{"observed_at":"2026-07-02T17:37:14.662833Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-06T02:04:50Z","snapshot_observed_at":"2026-07-12T14:40:28.753075Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":1},"reference_index":210,"source":"pdf_text","source_observed_at":"2026-06-27T18:39:44.696961Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:b9b76a2dcbeda67cc65b38e15f01f5d83ee387da3e49cb63cb091f9214164224","observation_id":"318f2566-3ec4-49ab-b70d-8dc68026cf77","resolution":{"observed_at":"2026-07-02T22:47:25.916162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.21228","last_updated":"2026-06-23T04:40:39Z","snapshot_observed_at":"2026-07-06T23:56:17.293417Z","submitted_at":"2026-06-19T08:47:40Z","title":"Sakana Fugu Technical Report","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-26T14:22:37.596720Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.21228"},"observation_digest":"sha256:137f6584d26ff3d2093bca6d9506824d9352808112ed214d189654cd463be3f3","observation_id":"e91a0f67-a638-4150-85f0-45cfe8d6fe91","resolution":{"observed_at":"2026-07-04T06:39:36.939254Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.21891","last_updated":"2026-06-20T05:47:37Z","snapshot_observed_at":"2026-07-06T23:56:49.977855Z","submitted_at":"2026-06-20T05:47:37Z","title":"Learning the ARTS of Search for Automated Discovery","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T12:04:13.117307Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.21891"},"observation_digest":"sha256:1910873fad839fac7a1ed1c6b52554a80abe65c5fe6b68ccbf20adb1dfda285e","observation_id":"5e59d95f-482f-47d8-b827-8ebecf666c0f","resolution":{"observed_at":"2026-07-04T08:09:41.810861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.22317","last_updated":"2026-06-21T03:15:25Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T03:15:25Z","title":"Curriculum Reinforcement Learning Can Incentivize Reasoning Capacity in LLMs Beyond the Base Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T11:10:56.755558Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.22317"},"observation_digest":"sha256:4648bc4a37daf566117d976b48e533aaa25f1664b5ab80ac5dc2367a10e5e015","observation_id":"f8d10b29-0fe4-4ea3-b166-67a56fbff509","resolution":{"observed_at":"2026-07-04T08:39:42.300162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.22337","last_updated":"2026-06-23T07:45:44Z","snapshot_observed_at":"2026-07-06T23:57:14.069903Z","submitted_at":"2026-06-21T05:03:37Z","title":"Theorist Toolbox: Tools for Agent Based LLM-assisted economic theory Research","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T10:01:18.103014Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.22337"},"observation_digest":"sha256:504db951c5aa7ac00b1d40c995a10cbab0da14c2fb98d8eed627f866137416a1","observation_id":"14626137-7b07-4b29-9dd6-d2defe38cf00","resolution":{"observed_at":"2026-07-04T09:29:43.421885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.25103","last_updated":"2026-06-23T19:19:11Z","snapshot_observed_at":"2026-07-06T23:59:37.533078Z","submitted_at":"2026-06-23T19:19:11Z","title":"Beyond Shapley: Efficient Computation of Asymmetric Shapley Values","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-25T22:56:30.582241Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.25103"},"observation_digest":"sha256:770297890f47e304d1194e7475731b8c6f48faa55e2abbda9bf921be666fc02c","observation_id":"d03d779f-a66c-45e2-8812-73b4a58be69d","resolution":{"observed_at":"2026-07-04T18:20:04.548897Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2606.28471","last_updated":"2026-06-26T14:45:57Z","snapshot_observed_at":"2026-07-07T00:02:33.644076Z","submitted_at":"2026-06-26T14:45:57Z","title":"Data and Evaluation Closed-Loop for Model Capability Enhancement","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-30T01:33:08.134048Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2606.28471"},"observation_digest":"sha256:96f7f40c0ef4d93bd0cb0eaddfa092cd1663ea0e7a29315cdd5f1128367270f7","observation_id":"02c26e77-4dcd-44f5-80b0-124a5c2740cf","resolution":{"observed_at":"2026-07-01T15:25:48.060133Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2607.01431","last_updated":"2026-07-01T19:49:49Z","snapshot_observed_at":"2026-07-07T00:06:59.129459Z","submitted_at":"2026-07-01T19:49:49Z","title":"IsoSci: A Benchmark of Isomorphic Cross-Domain Science Problems for Evaluating Reasoning versus Knowledge Retrieval in LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-03T21:12:57.721334Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.01431"},"observation_digest":"sha256:6ba8179810a741cff7610ef4c851b0ac1076cdab634981403622f5d29632c3c3","observation_id":"bb81e483-d698-401f-8a86-d526400fdf39","resolution":{"observed_at":"2026-07-03T21:18:58.261153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-12T06:00:12.267694Z","title":"FrontierMath: A benchmark for evaluating advanced mathematical reasoning in AI,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02934","last_updated":"2026-07-03T04:00:53Z","snapshot_observed_at":"2026-07-12T06:00:12.045729Z","submitted_at":"2026-07-03T04:00:53Z","title":"MatPhaseBench: A Semantics-Guided Benchmark for Materials Phase Diagrams Understanding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T06:00:12.267694Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.02934"},"observation_digest":"sha256:594a69597eed7a199be064a387335de0a011ff127b22ea5c643ee7c10eb2e3f3","observation_id":"e26a7cc6-4c92-4e53-9097-065d3beef83d","resolution":{"observed_at":"2026-07-12T06:00:12.267694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2607.06820","last_updated":"2026-07-07T21:29:59Z","snapshot_observed_at":"2026-07-11T23:18:39.117758Z","submitted_at":"2026-07-07T21:29:59Z","title":"Evaluating SageMath-Augmented LLM Agents for Computational and Experimental Mathematics","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-10T20:39:42.009312Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.06820"},"observation_digest":"sha256:19762b0f6bc57505e6fe58fe0cce7d663f2fd8289f017d8cdb530466080c725d","observation_id":"bf1d33b7-b1f6-4caa-a905-0a9e94defc9e","resolution":{"observed_at":"2026-07-10T20:47:34.580650Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2607.07040","last_updated":"2026-07-08T06:19:10Z","snapshot_observed_at":"2026-07-11T23:18:50.679052Z","submitted_at":"2026-07-08T06:19:10Z","title":"Measuring Intelligence Beyond Human Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-09T21:21:39.305904Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.07040"},"observation_digest":"sha256:1ffb15d0b024e2cc9e6fbf2f461a0eaf6d117a1273d1072000399d31e496a627","observation_id":"fad7a543-2869-4193-9615-94f21cfc5335","resolution":{"observed_at":"2026-07-09T21:26:34.386221Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2607.07779","last_updated":"2026-07-08T17:46:36Z","snapshot_observed_at":"2026-07-12T23:17:59.879344Z","submitted_at":"2026-07-08T17:46:36Z","title":"From Solvers to Research: Large Language Model-Driven Formal Mathematics at the Research Frontier","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-10T18:16:31.176239Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.07779"},"observation_digest":"sha256:f0b43234c34e7d5a4788b47c63d637efe296d253d38e788e10ff4de9078792db","observation_id":"a47f6bd2-58ca-4091-8030-fafbf5ae28aa","resolution":{"observed_at":"2026-07-10T18:17:33.708098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":"2411.04872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-10T20:47:34.579097Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","venue":"cs.AI","work_id":"ad91b1d8-7c7c-4daf-8c63-8f81bb5a810a","year":2024},"citing_paper":{"arxiv_id":"2607.07847","last_updated":"2026-07-08T18:27:40Z","snapshot_observed_at":"2026-07-12T23:18:06.552202Z","submitted_at":"2026-07-08T18:27:40Z","title":"When Does Continual Learning Require Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T16:49:00.923598Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.07847"},"observation_digest":"sha256:9e8892bebc62bb6f736cee0636f01416baacf613a7c3030ad83c5b6560cea708","observation_id":"f2ed8671-3228-4d34-8058-2387f304e2a2","resolution":{"observed_at":"2026-07-10T16:57:24.591984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-14T17:09:09.167784Z","title":"arXiv preprint arXiv:2411.04872 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09721","last_updated":"2026-06-27T21:39:08Z","snapshot_observed_at":"2026-07-16T23:17:59.521429Z","submitted_at":"2026-06-27T21:39:08Z","title":"The Ramanujan Challenge For AI","version":1},"reference_index":230,"source":"arxiv_source","source_observed_at":"2026-07-14T17:09:09.167784Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.09721"},"observation_digest":"sha256:9dbf016555c826ece79d7dcd48a4a575ceb00b51698426af40827bd2b53f4f53","observation_id":"1ae42162-0207-430e-9cfb-6f122a4d000a","resolution":{"observed_at":"2026-07-14T17:09:09.167784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-07-14T02:43:21.225324Z","title":"Frontiermath: A benchmark for evaluating advanced mathematical reasoning in AI.CoRR, abs/2411.04872, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11849","last_updated":"2026-07-13T17:38:22Z","snapshot_observed_at":"2026-07-16T23:20:03.329744Z","submitted_at":"2026-07-13T17:38:22Z","title":"AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T02:43:21.225324Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2607.11849"},"observation_digest":"sha256:80ab89174cd7eca18f0403caaee9bbb02e5fbdedf7c000db180a2d0364470ba3","observation_id":"23bbf43f-c0d0-47d9-a1f5-e31a1a0f39ef","resolution":{"observed_at":"2026-07-14T02:43:21.225324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.04872/citation-record","integrity":"/paper/2411.04872/integrity","json":"/paper/2411.04872/citation-record.json","paper":"/paper/2411.04872"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5e2dc496-fa18-47d5-a4ac-19f19351c418","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:23f20b486137e767f218cd879ad03cbc6585ad0f35a0172578d1e41e36059a08","observation_id":"39460a96-c5fa-4602-b86c-f4e3b3875d4a","resolution":{"observed_at":"2026-05-17T00:44:01.776584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"877a76df-63bd-4ed4-af21-d24219973188","year":2021},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:b357947020508f7ecfe85ce7b152b7d55104865a4afeb48b3e2f894ca0fa2cd4","observation_id":"cf80a1b0-5933-41af-aafc-d8093549bd21","resolution":{"observed_at":"2026-05-17T00:44:01.783257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"d428ff68-61a7-4024-83b4-d1b47a2ad468","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:63ee5eee44dd6fb2c90c6804ea3f5792f690a203fe93fe27d0596034b76cd61c","observation_id":"5309dc1d-68ff-4f05-ade1-2a7ea1675038","resolution":{"observed_at":"2026-05-17T00:44:01.786765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"743e28cf-6d1f-4301-a1ce-15d28821dd87","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:71dd8a9a6aa27869162af0a4f7042fe49f5cbf91b9742a3d21156119ddb140f1","observation_id":"be4f333b-bea8-4592-9273-32be998c95d4","resolution":{"observed_at":"2026-05-17T00:44:01.790311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b6a79b50-e6c0-412d-b3e0-21e76a92e058","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:2c75cbe91608719171fc304f576ab5c02da8ed87423604179d752415617a4534","observation_id":"c079aed5-3f1b-494a-bae6-bf443fe82477","resolution":{"observed_at":"2026-05-17T00:44:01.699208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d90b4247-4332-4709-9abf-a5d0101d363f","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:0e1d34bd43cf6cc60854286fe64bb5fbc4d6727db08032d38be6eb24b5e84c1f","observation_id":"9f7f2aeb-ed36-4447-958b-2a61098fbe23","resolution":{"observed_at":"2026-05-17T00:44:01.702938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7987b98e-4bea-490e-8f08-5c8f0bbf1c03","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:031ad5e8135a3510d9430d33a15c98c5bb6629ebe76065b77c5e05edd733f48b","observation_id":"2c1a2fb4-fd83-4128-81a3-58261ad21fec","resolution":{"observed_at":"2026-05-17T00:44:01.706206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"03ba4597-f1f4-4ed6-b4a3-1d09021a0362","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:19661defd519faee24e832e274b37ab0b510d0e507fe51cad3f44fbac683f234","observation_id":"3c77b4b2-5b20-4d2f-b613-2ebfc97e2dc1","resolution":{"observed_at":"2026-05-17T00:44:01.709516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature , publisher =","venue":null,"work_id":"a50d4e32-e700-4215-ac81-4c11b8cb42b8","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:7c99c8b5effa0a0b3ea88e326fffef2e6547050912ce96e6b62f174e42b52666","observation_id":"2da17ad2-2d52-4627-b3aa-8bea89bdab7b","resolution":{"observed_at":"2026-05-17T00:44:01.712633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"31cb00b3-3338-48b9-8c33-e55416b72091","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:e153038480092700be484812e6e14d94ed7b8577f243805cdf2dbd7f86769a3a","observation_id":"c868446b-73ee-4711-b2a8-fe6e8e2c5c9b","resolution":{"observed_at":"2026-05-17T00:44:01.715737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"53572ec1-8e0d-4af4-8a6b-76c63eaa09e2","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:507fe3201e57b8abb9137a795a82a813883fb65922f76d25de2fefa57f24a998","observation_id":"ac70278b-34f8-47ab-a9a6-f505cb231d04","resolution":{"observed_at":"2026-05-17T00:44:01.718881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"95b78cc0-bf5e-4d82-85cd-92243bd7fade","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:94864d5c2e4511b5204d8cfdf09c33f53a7db95d26e1a61c020e8b73f68a99d3","observation_id":"183977ef-4d2a-433b-bb34-1c1af7309b15","resolution":{"observed_at":"2026-05-17T00:44:01.721927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"66799ae6-a5ec-4da5-92e8-9a301efc5653","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:e372be83725f34d12d7a0c1198bea775dee9dcdbca7dc0f50fb8571530de8989","observation_id":"c097ccc9-30c1-4eb5-8923-fbb295536bcd","resolution":{"observed_at":"2026-05-17T00:44:01.724693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nature , publisher =","venue":null,"work_id":"67ab9dc0-e519-42e0-a798-eb4f69e22cbc","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:03be6f6208394fec86f65059e28edb524c945e7159e797d288efb1d017a43fd0","observation_id":"5aa33541-7d41-4731-86e0-483e1659e6c2","resolution":{"observed_at":"2026-05-17T00:44:01.727711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33373834-52a5-4a09-b687-1c9bfbaf2cb4","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:50c7b665c6b35ab5a3726bfd1959659bffe2d2c6bfca7818849c53f41ff065f9","observation_id":"20169156-23d9-43ac-a66f-e30a1988562f","resolution":{"observed_at":"2026-05-17T00:44:01.731161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5b7c2aa5-090a-4879-80ec-988e91ce3ff9","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:571a8c319be724380c441a2835d46c39d13c49fd7f0e4fd297c551c8235a9784","observation_id":"49f4966f-5311-4f36-906f-a78d8ef8a620","resolution":{"observed_at":"2026-05-17T00:44:01.734398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14749","last_updated":"2021-11-07T13:04:04Z","snapshot_observed_at":"2026-07-06T10:53:51.296957Z","submitted_at":"2021-03-26T21:54:36Z","title":"Pervasive Label Errors in Test Sets Destabilize Machine Learning Benchmarks","version":4},"cited_work":{"arxiv_id":"2103.14749","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.14749","snapshot_observed_at":"2026-07-04T08:49:41.632097Z","title":"Confident learning: Estimating uncertainty in dataset labels.Journal of Artificial Intelligence Research, 70:1373–1411, 2021a","venue":null,"work_id":"328e364f-cefb-4793-8bdd-481ee68746ca","year":2023},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"cited_paper":"/paper/2103.14749","citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:aa25d4630fe5ebe4a499bc22ca93849a49121ebcd88ab52b04e2335826c6f4aa","observation_id":"cb113683-04c4-4100-9fa5-7dcd2199b93e","resolution":{"observed_at":"2026-05-17T00:44:01.690041Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fa4d697e-bd6c-4c70-b0a8-61a010e43ddf","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:cb1b8149f9d7a536569c9d16684f695891617a5d0f36b5e371f628e9676b6b5c","observation_id":"f5efe89a-38c1-4cda-b0d3-d5e426d94940","resolution":{"observed_at":"2026-05-17T00:44:01.738569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b64e8b07-abd2-4c31-82d3-1a6bc199ac13","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:b62bebe9e2ad7175b0209808117bfd2ae272489e8d11377ac252c2ca7f026f75","observation_id":"ecb2761b-ec7c-4459-9f3f-362fbc8cf68b","resolution":{"observed_at":"2026-05-17T00:44:01.743211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1f4ce806-8f02-402d-addd-867e544578c5","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:c7c649738cf9d79262b5382c97a2cfecca24220357942091195dc20b0053af70","observation_id":"2ccac011-6135-4a9f-bc18-d28ad5d74592","resolution":{"observed_at":"2026-05-17T00:44:01.746652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2591accf-a719-4294-bda0-575957620379","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:65a83f23462aca8ba22c206c63b44a72afa3aeae73a6ec22c541269ef0681562","observation_id":"41001959-cce5-4d10-bb2c-844d83df24ba","resolution":{"observed_at":"2026-05-17T00:44:01.749651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b07787e6-7006-493a-bbce-6e124dc36419","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:6dc094d9a7a7f86c140e75ee6659a94464e2fd5ae04fab0a37aa7105fa645d22","observation_id":"a5280095-894f-4cae-bfc9-9b3fc95a88b1","resolution":{"observed_at":"2026-05-17T00:44:01.752545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6fe79743-5589-404e-8ad1-0bf813164a50","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:c16878bbd9f31be32c4c871b452cacd9a51563b662e14828918d0eb644acea0b","observation_id":"776e030a-3b12-4862-92ad-422680b006b0","resolution":{"observed_at":"2026-05-17T00:44:01.755642Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"985ffc6f-c69c-467e-9536-1f22a52dc40a","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:748f11ffb23b254945ce47b280b024a3f9bf1179d71dec36f584588d42983553","observation_id":"99a5fd29-758b-437d-bd9a-248f998a0b59","resolution":{"observed_at":"2026-05-17T00:44:01.758675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:da11298b260c97c8b51fc4877c735c1c8614538120c21c701b98460f3c609b79","observation_id":"f22bb72c-833d-4472-b5fa-c701bd9a23e9","resolution":{"observed_at":"2026-05-17T00:44:01.695941Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-07-11T01:37:42.666395Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:671e102ce95a0e00785c55ad0cd104665d50ee063dc7c3c9dd70887adfb9976c","observation_id":"07450d21-c93d-4329-b626-a3142cd1aa79","resolution":{"observed_at":"2026-05-17T00:44:01.684458Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:14.061878+00:00","source":"openalex_status_cache"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"225160c8-4e33-4f67-844a-7dd93d66e1c7","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:6417a209cb21f8ffccd182881011be25c51cea5d20c04101f25743cc5ec340c6","observation_id":"85c98fc7-0d24-46bb-98ab-dbb71bc6ed53","resolution":{"observed_at":"2026-05-17T00:44:01.761645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d8fccf95-fbf5-478e-ad87-9f0a7dd0a3ab","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:51797f53b2c3dd2cca2b1789a41fc3076a214650874aff9db65467a081325ae6","observation_id":"18eade63-0879-4ee7-99d4-1a3908f22e33","resolution":{"observed_at":"2026-05-17T00:44:01.765058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02554","last_updated":"2020-06-12T12:30:09Z","snapshot_observed_at":"2026-07-06T08:42:19.246046Z","submitted_at":"2019-12-05T13:10:58Z","title":"Equality of orders of a set of integers modulo a prime","version":2},"cited_work":{"arxiv_id":"1912.02554","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1912.02554","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1912.02554 , archiveprefix =","venue":null,"work_id":"fbd3bd36-dc70-4ece-91db-7a52320bb590","year":1912},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"cited_paper":"/paper/1912.02554","citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:50004003393aed8e2f7eacee9d0b4feb30b69fe13a88480ac69d577112de4928","observation_id":"57c6425c-6289-4531-b774-b58208d994f1","resolution":{"observed_at":"2026-05-17T00:44:01.679683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curves over Finite Fields Attaining the Hasse-Weil Upper Bound","venue":null,"work_id":"9d518dbc-d1bf-4ac9-b6eb-b93a57511812","year":2001},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:95f232cc72d86d48ebfb0769eb91263f3e898492e819eca3a68dfef7dff7c61f","observation_id":"473cd1cc-18a3-4f7b-9b8a-2b3dfddfdead","resolution":{"observed_at":"2026-05-17T00:44:01.769426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab6dab65-fed5-4546-97eb-5376178ff369","year":null},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:2ac3ea9241f2f415208bc0991ab0e6c560edf8ba56cfb91864a9916548aaeb41","observation_id":"3a52ed73-4240-4524-95bb-a66541497403","resolution":{"observed_at":"2026-05-17T00:44:01.773294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"91021839-013a-46c7-aa1e-56d8a90666b2","year":2024},"citing_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T00:44:01.658214Z"},"links":{"citing_paper":"/paper/2411.04872"},"observation_digest":"sha256:c1b1a1e3c35f8ed8c71a07d76c1768e7bb08f8cf529509d14d658d132aa68a77","observation_id":"becd89a7-e3cb-4383-a917-ace9399e0154","resolution":{"observed_at":"2026-05-17T00:44:01.779996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-21T06:31:05.380196+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","latest_version":7,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":1,"unresolved":0,"verified_exact":1,"verified_fuzzy":27},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-21T06:31:05.380196+00:00","source":"crossref"},{"observed_at":"2026-07-21T06:31:00.184556+00:00","source":"retraction_watch"}],"thesis":"As of 22 July 2026, this Paper Citation Record lists 32 of 32 outbound references and 55 inbound Pith citation observations for arXiv:2411.04872."}