{"as_of":"2026-08-11T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a923cf738fb88cfcb0ead512c48d00cb2056b78c8f77efcb50dc3ac20165167e","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T09:09:14.884516Z","state":"measured"},{"denominator":156,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":156,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":79,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T00:22:29.920179Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-11T00:22:29.920179Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19513","last_updated":"2024-12-27T08:09:11Z","snapshot_observed_at":"2026-08-11T00:13:53.842558Z","submitted_at":"2024-12-27T08:09:11Z","title":"Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T00:22:29.920179Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2412.19513"},"observation_digest":"sha256:754aaa4b42e373650aa848b2207725f99965e87d08611228519543a9de509e44","observation_id":"15afcf64-1beb-4bcd-9a12-3cb633a8a7d3","resolution":{"observed_at":"2026-08-11T00:22:29.920179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-10T22:37:58.412771Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01257","last_updated":"2025-01-03T16:36:12Z","snapshot_observed_at":"2026-08-10T22:29:13.931954Z","submitted_at":"2025-01-02T13:49:00Z","title":"CodeElo: Benchmarking Competition-level Code Generation of LLMs with Human-comparable Elo Ratings","version":2},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-10T22:37:58.412771Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2501.01257"},"observation_digest":"sha256:47071e1ed32d3afd7a02de57713d51ae91cb0e958f3980e5647eb5eb849f9955","observation_id":"30800675-fe33-4030-8767-e9e2aca13a71","resolution":{"observed_at":"2026-08-10T22:37:58.412771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-10T21:36:40.255920Z","title":"& Chang, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.04425","last_updated":"2025-01-08T11:18:36Z","snapshot_observed_at":"2026-08-10T21:31:04.877167Z","submitted_at":"2025-01-08T11:18:36Z","title":"End-to-End Bangla AI for Solving Math Olympiad Problem Benchmark: Leveraging Large Language Model Using Integrated Approach","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:36:40.255920Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2501.04425"},"observation_digest":"sha256:50856dd6f9bc446f7e17ab45d24a3be2050eca602fea4b885e349458af1ca499","observation_id":"2bb0e081-ff39-4c5d-9db7-e4aa955c24ef","resolution":{"observed_at":"2026-08-10T21:36:40.255920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-10T18:05:42.995015Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11651","last_updated":"2025-06-13T16:15:45Z","snapshot_observed_at":"2026-08-10T17:58:02.856512Z","submitted_at":"2025-01-20T18:33:33Z","title":"T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T18:05:42.995015Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2501.11651"},"observation_digest":"sha256:b98bd671ea2b91ff8c9e550c0992736f90b4a22acd58d41d49da31183c8562b8","observation_id":"e6f7cb30-a856-48c3-b2c4-36aabad2993d","resolution":{"observed_at":"2026-08-10T18:05:42.995015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:40:50.139345Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2501.14249"},"observation_digest":"sha256:390456ed5241a5e1f15763563887c70f0c48f9143737b21a2f78248253ffc70a","observation_id":"6e914fe3-e237-4b2a-9699-84239dbf0294","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-09T19:27:46.645948Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00334","last_updated":"2025-06-03T07:13:03Z","snapshot_observed_at":"2026-08-09T21:05:59.284722Z","submitted_at":"2025-02-01T06:42:02Z","title":"UGPhysics: A Comprehensive Benchmark for Undergraduate Physics Reasoning with Large Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T19:27:46.645948Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2502.00334"},"observation_digest":"sha256:5e5989de7dcc10c6ff604268955feb6dc920c30a8e298ad3118fd565461b669f","observation_id":"12a7c8d0-1ed8-4fc8-82b8-03ae4d6ffb86","resolution":{"observed_at":"2026-08-09T19:27:46.645948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T00:19:22.140009Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2503.04697"},"observation_digest":"sha256:0099cc444494e0ce847c600e003a850a9fcde755ffad55cb5bd28f1b4c475d7c","observation_id":"906baf4e-c8d2-41ed-9100-66a0d22d47f7","resolution":{"observed_at":"2026-05-18T00:19:22.206556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T15:15:46.255296Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2503.07536"},"observation_digest":"sha256:f230e6cee97b4c413c167a7a0c8ba5d51686027fa52aa09d211beb63aa5e529e","observation_id":"1a6b304e-0c60-4719-85e4-d978156008d5","resolution":{"observed_at":"2026-05-16T15:15:46.382972Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2503.16549","last_updated":"2026-04-18T11:44:37Z","snapshot_observed_at":"2026-08-08T08:24:44.422314Z","submitted_at":"2025-03-19T11:46:19Z","title":"MathFlow: Enhancing the Perceptual Flow of MLLMs for Visual Mathematical Problems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T22:55:34.238427Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2503.16549"},"observation_digest":"sha256:79e27e65807d3e52f4e7ca183cb03ceb9be1fbca9a79976332dfd14eaa90b305","observation_id":"b94038d3-60fe-489f-aee2-ede6b1573753","resolution":{"observed_at":"2026-05-22T22:57:13.232377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-02T16:04:50.458535Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-22T22:14:53.522206Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2503.21380"},"observation_digest":"sha256:ab01206ac76741a192c20d6b5e10ca7c111d702cd894b4467828dd4a4c13d882","observation_id":"91278f42-2e3b-46c9-a8e9-461d97f33d26","resolution":{"observed_at":"2026-05-22T22:15:11.196939Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2504.11456","last_updated":"2025-05-22T19:12:14Z","snapshot_observed_at":"2026-08-10T19:38:46.551479Z","submitted_at":"2025-04-15T17:59:51Z","title":"DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T10:31:04.728005Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2504.11456"},"observation_digest":"sha256:340aa8af163dc87b18b238a10d4b3c976c4e9faa540099c05afa893453af4053","observation_id":"85cff00c-7d90-46d5-a7ff-42656da1cbae","resolution":{"observed_at":"2026-05-16T10:31:04.794480Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-15T19:51:04.779597Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2504.20571"},"observation_digest":"sha256:878c0803f336d6ca39021e7eeb899ce1a39ba56b9d1d96585ac67b994a984a9c","observation_id":"2e341750-2138-46c8-9ec1-da57a5347267","resolution":{"observed_at":"2026-05-15T19:51:05.052431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:44:30.864841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.13988","last_updated":"2025-05-20T06:36:45Z","snapshot_observed_at":"2026-08-09T18:13:25.628969Z","submitted_at":"2025-05-20T06:36:45Z","title":"The Hallucination Tax of Reinforcement Finetuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:44:30.864841Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.13988"},"observation_digest":"sha256:c097fd5112d6b27d2feece29ba07f4ce7520bc60ab7b198b9a4b6254845b433f","observation_id":"3a56fac1-4f09-493f-ad1f-d88b1ad02e51","resolution":{"observed_at":"2026-08-07T15:44:30.864841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:39:16.630641Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14419","last_updated":"2025-05-20T14:31:15Z","snapshot_observed_at":"2026-08-09T05:18:32.061106Z","submitted_at":"2025-05-20T14:31:15Z","title":"SCOPE: Compress Mathematical Reasoning Steps for Efficient Automated Process Annotation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:39:16.630641Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.14419"},"observation_digest":"sha256:3d89df815fd38f5dd05fd9d7c8efab097bbdc9c97e4cb06ea07234f34ad4bfda","observation_id":"f67a7076-9d68-40a0-920b-580c6667ec10","resolution":{"observed_at":"2026-08-07T15:39:16.630641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:06:58.842174Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16315","last_updated":"2025-05-23T01:22:52Z","snapshot_observed_at":"2026-08-08T01:06:56.923298Z","submitted_at":"2025-05-22T07:15:08Z","title":"Incentivizing Dual Process Thinking for Efficient Large Language Model Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:58.842174Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.16315"},"observation_digest":"sha256:0b924fb48ee29d84ffbfdbd5bed3be621aca5f4b7b0381fced9f8358cf7d9510","observation_id":"ae6bea58-246b-4a2f-afdb-9148b5a5af40","resolution":{"observed_at":"2026-08-07T15:06:58.842174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T15:06:35.322184Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16400","last_updated":"2025-06-05T17:59:12Z","snapshot_observed_at":"2026-08-09T23:26:41.871607Z","submitted_at":"2025-05-22T08:50:47Z","title":"AceReason-Nemotron: Advancing Math and Code Reasoning through Reinforcement Learning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:06:35.322184Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.16400"},"observation_digest":"sha256:28f8fb8930a2976507e51d2b9c9e86fd26c7caae193039b9145b75ddfcf58cac","observation_id":"887e1314-3873-42ed-9526-052b06796094","resolution":{"observed_at":"2026-08-07T15:06:35.322184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T14:58:42.014658Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16770","last_updated":"2025-05-23T15:40:22Z","snapshot_observed_at":"2026-08-09T02:01:21.817942Z","submitted_at":"2025-05-22T15:11:57Z","title":"RBench-V: A Primary Assessment for Visual Reasoning Models with Multi-modal Outputs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:42.014658Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.16770"},"observation_digest":"sha256:18fe0297764a1aa1d242443c2ca4434484b6c799ea75f4266202a2bcf8385470","observation_id":"31ca3bd3-192a-4723-a0f4-dd4082dc77b7","resolution":{"observed_at":"2026-08-07T14:58:42.014658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T14:37:01.324509Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-08T01:06:17.935169Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.324509Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:754cda2b01a6b5fd7fdf53db54535935d822a7e18d1bc71ede41aca237698eed","observation_id":"5ee06ac6-e9c8-4669-a56a-d1e83aa8f32b","resolution":{"observed_at":"2026-08-07T14:37:01.324509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T14:34:07.262018Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18492","last_updated":"2026-06-30T15:33:33Z","snapshot_observed_at":"2026-08-10T00:16:39.106806Z","submitted_at":"2025-05-24T03:52:25Z","title":"Formally Solving Answer-Construction Problems in Lean","version":6},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:34:07.262018Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.18492"},"observation_digest":"sha256:f25da1202ec823069541cf8f6655e283b866743bb9419111608297c46cddaba6","observation_id":"2c3b15ba-1857-43f8-b4b8-5ab6c984caad","resolution":{"observed_at":"2026-08-07T14:34:07.262018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T14:18:17.780680Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19405","last_updated":"2025-05-26T01:42:37Z","snapshot_observed_at":"2026-08-10T05:26:16.492618Z","submitted_at":"2025-05-26T01:42:37Z","title":"CoTGuard: Using Chain-of-Thought Triggering for Copyright Protection in Multi-Agent LLM Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:17.780680Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.19405"},"observation_digest":"sha256:7cb2688ccafc1f5aa0126d98f79f9d31db91eda98890c112bd5a0bae801819a9","observation_id":"cb9f2095-3250-48b0-8e20-4e991cea372b","resolution":{"observed_at":"2026-08-07T14:18:17.780680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T13:41:29.732447Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21178","last_updated":"2025-05-27T13:29:51Z","snapshot_observed_at":"2026-08-07T13:30:52.067664Z","submitted_at":"2025-05-27T13:29:51Z","title":"Walk Before You Run! Concise LLM Reasoning via Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:41:29.732447Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.21178"},"observation_digest":"sha256:26be2274ffb3a1139c90723d814b38e242566c77aef0321be86153fe7c4e6c57","observation_id":"a8570983-096a-48d2-96c9-cb11b5ddd572","resolution":{"observed_at":"2026-08-07T13:41:29.732447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T13:05:25.427253Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22756","last_updated":"2025-05-28T18:18:49Z","snapshot_observed_at":"2026-08-10T01:26:26.516912Z","submitted_at":"2025-05-28T18:18:49Z","title":"Decomposing Elements of Problem Solving: What \"Math\" Does RL Teach?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:05:25.427253Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.22756"},"observation_digest":"sha256:933ac8585b811319d40ca71863d837347bcaf6f2b4c07e569b9bf655a72dad76","observation_id":"69415067-5e5a-4773-98af-3df7ece59e28","resolution":{"observed_at":"2026-08-07T13:05:25.427253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2505.23281","last_updated":"2026-01-14T21:39:58Z","snapshot_observed_at":"2026-08-02T10:05:44.330694Z","submitted_at":"2025-05-29T09:28:06Z","title":"MathArena: Evaluating LLMs on Uncontaminated Math Competitions","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T00:10:14.812539Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.23281"},"observation_digest":"sha256:44c0df3b2903c5b7804eb3ab234ba022170cbf637bfcb1da1254c61e540c6dba","observation_id":"07659698-598a-4887-90eb-6701309475c2","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T10:42:38.944246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04611","last_updated":"2025-06-05T04:02:17Z","snapshot_observed_at":"2026-08-09T14:45:17.460081Z","submitted_at":"2025-06-05T04:02:17Z","title":"Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:38.944246Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.04611"},"observation_digest":"sha256:ff463550b100c212722e2f87f5d5f4dfc4c30b01bf53188a6a27bba7e2ae1e93","observation_id":"35e7b365-250a-4634-b96e-a7e534e7b8db","resolution":{"observed_at":"2026-08-07T10:42:38.944246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T05:26:22.086147Z","title":"Omni-MATH: A universal Olympiad level mathematic benchmark for large language models.ArXiv, abs/2410.07985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08007","last_updated":"2025-06-09T17:59:53Z","snapshot_observed_at":"2026-08-10T06:19:15.846428Z","submitted_at":"2025-06-09T17:59:53Z","title":"Reinforcement Pre-Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:22.086147Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.08007"},"observation_digest":"sha256:0b5b81b99624aea1ebe5131698d53c3752100fa774362bc97ba29cbdf36505de","observation_id":"e711829c-0ac3-47de-a042-751ba8441949","resolution":{"observed_at":"2026-08-07T05:26:22.086147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T01:08:20.862537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11902","last_updated":"2025-06-13T15:52:37Z","snapshot_observed_at":"2026-08-07T00:58:51.821987Z","submitted_at":"2025-06-13T15:52:37Z","title":"TreeRL: LLM Reinforcement Learning with On-Policy Tree Search","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T01:08:20.862537Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.11902"},"observation_digest":"sha256:9dbbb82895376fd68d8a29682bdeb6cd0769d1f9364afbee1672b92b1a5ca188","observation_id":"d7d0511f-bc7d-4b3f-9910-c310f4ad58b5","resolution":{"observed_at":"2026-08-07T01:08:20.862537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T00:40:17.637897Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12909","last_updated":"2025-06-15T16:57:14Z","snapshot_observed_at":"2026-08-09T08:48:01.044046Z","submitted_at":"2025-06-15T16:57:14Z","title":"SciDA: Scientific Dynamic Assessor of LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:17.637897Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2506.12909"},"observation_digest":"sha256:af5f773b159be38c6ea6dfdf76202dfa535b847b35001bdcf67318f657a2b36e","observation_id":"7c5f84c5-589f-4ffe-9226-2f2ca8fa44f7","resolution":{"observed_at":"2026-08-07T00:40:17.637897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T19:14:14.957669Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06181","last_updated":"2025-07-08T17:03:39Z","snapshot_observed_at":"2026-08-07T16:09:15.554628Z","submitted_at":"2025-07-08T17:03:39Z","title":"CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:14.957669Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2507.06181"},"observation_digest":"sha256:2999fe5641da9a7e1435fa963f5d6bed8c6dc65eec3022de2362145fdaaae57b","observation_id":"62e2253e-bac5-43a5-9fd5-69693d221042","resolution":{"observed_at":"2026-08-06T19:14:14.957669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T18:15:37.080727Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-08-06T18:06:40.369641Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T18:15:37.080727Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2507.08794"},"observation_digest":"sha256:349663283e6c9cd40ec108f3b34fba9f692f49a894739dd855d7a3a660bc2c8c","observation_id":"fa384924-2e54-4492-a8df-de4af4faa6ab","resolution":{"observed_at":"2026-08-06T18:15:37.080727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T17:53:47.832078Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-10T21:22:23.649310Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T17:53:47.832078Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:106569b244aeeb97c46336fb8c1c7fb5a173c7cbf5a46cd7dddc7d5a12104940","observation_id":"32029885-2627-44ca-a02e-fa8a0510044d","resolution":{"observed_at":"2026-08-06T17:53:47.832078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T17:35:31.417001Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10541","last_updated":"2025-07-15T06:16:53Z","snapshot_observed_at":"2026-08-09T05:13:41.910639Z","submitted_at":"2025-07-14T17:58:47Z","title":"REST: Stress Testing Large Reasoning Models by Asking Multiple Problems at Once","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:35:31.417001Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2507.10541"},"observation_digest":"sha256:ea02687778a1f4020e18a3914fde6bafb3b0217270301406c3f24e0ae4106696","observation_id":"06093aef-6291-4c7e-aa5b-3a6027b33ad1","resolution":{"observed_at":"2026-08-06T17:35:31.417001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T16:44:49.647176Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12856","last_updated":"2025-09-06T23:54:03Z","snapshot_observed_at":"2026-08-09T00:47:01.931226Z","submitted_at":"2025-07-17T07:26:54Z","title":"Supervised Fine Tuning on Curated Data is Reinforcement Learning (and can be improved)","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T16:44:49.647176Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2507.12856"},"observation_digest":"sha256:f4e8c1d111effb8f50c44457e5f4a1d5ad8683d50ff4f4163e2aee956fcbb110","observation_id":"0c4b594e-f0a2-43cc-8651-0f6f4b6a0a1d","resolution":{"observed_at":"2026-08-06T16:44:49.647176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-06T05:11:53.696502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02208","last_updated":"2025-08-05T14:01:00Z","snapshot_observed_at":"2026-08-07T19:28:14.861679Z","submitted_at":"2025-08-04T08:59:36Z","title":"Proof2Hybrid: Automatic Mathematical Benchmark Synthesis for Proof-Centric Problems","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:11:53.696502Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2508.02208"},"observation_digest":"sha256:c504c0deb26a89993e6f8c1e071258d0c7d355e41f1b8f66fd02f03a6cdfcf06","observation_id":"400cd132-617b-436b-a6b7-43a1cc4c6d71","resolution":{"observed_at":"2026-08-06T05:11:53.696502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T21:55:07.854608Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark for Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07785","last_updated":"2025-08-11T09:15:36Z","snapshot_observed_at":"2026-08-09T17:03:23.397293Z","submitted_at":"2025-08-11T09:15:36Z","title":"Grove MoE: Towards Efficient and Superior MoE LLMs with Adjugate Experts","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T21:55:07.854608Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2508.07785"},"observation_digest":"sha256:58e3918f9235738e5457aa02a4868c72acb02b2e6554feec2d579d4d0061266f","observation_id":"46efc729-4bcc-469c-9444-c125fa14dbf2","resolution":{"observed_at":"2026-08-05T21:55:07.854608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T12:28:03.943989Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01619","last_updated":"2025-09-01T16:56:16Z","snapshot_observed_at":"2026-08-10T21:58:26.227754Z","submitted_at":"2025-09-01T16:56:16Z","title":"Throttling Web Agents Using Reasoning Gates","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:03.943989Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2509.01619"},"observation_digest":"sha256:0f0bc8b735b7165fdd2a0431667b9d76ec92fd92b9c8eb6948b600a0abc3f7bb","observation_id":"b3ec06ee-2212-451f-a16d-175cb0800d5e","resolution":{"observed_at":"2026-08-05T12:28:03.943989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T23:12:10.137275Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06770","last_updated":"2025-09-13T00:41:46Z","snapshot_observed_at":"2026-08-10T18:13:58.056032Z","submitted_at":"2025-09-08T14:54:31Z","title":"Another Turn, Better Output? A Turn-Wise Analysis of Iterative LLM Prompting","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T23:12:10.137275Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2509.06770"},"observation_digest":"sha256:c4689d7b97b2b05745e8a7de800d395065cb417783b2025af03a27b4c8bcdab1","observation_id":"98543ed1-8fd0-45c8-9acf-285ac669280c","resolution":{"observed_at":"2026-08-04T23:12:10.137275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T21:54:48.183408Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.07711","last_updated":"2025-09-09T13:13:51Z","snapshot_observed_at":"2026-08-07T23:36:53.104584Z","submitted_at":"2025-09-09T13:13:51Z","title":"RIMO: An Easy-to-Evaluate, Hard-to-Solve Olympiad Benchmark for Advanced Mathematical Reasoning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T21:54:48.183408Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2509.07711"},"observation_digest":"sha256:a60e495c274d3c93a21081a7d919445ded0c8a8b9cc3994729f365ab508b2187","observation_id":"4aca38e9-be89-4ee7-a789-2e9140c49eef","resolution":{"observed_at":"2026-08-04T21:54:48.183408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T17:57:52.348384Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.14257","last_updated":"2026-07-23T12:32:53Z","snapshot_observed_at":"2026-08-05T11:19:48.609021Z","submitted_at":"2025-09-12T15:34:07Z","title":"Student-Centered Distillation Narrows the Agentic Gap Between Small and Large LLMs","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T17:57:52.348384Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2509.14257"},"observation_digest":"sha256:975189dadcef679e112b40e6919fafea1ffef18440c27a0e5fda10a4b69598f9","observation_id":"4c49559d-194a-47fc-bfaf-fecdf23671ac","resolution":{"observed_at":"2026-08-04T17:57:52.348384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2509.17677","last_updated":"2026-05-02T16:35:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T12:20:27Z","title":"EngiBench: A Benchmark for Evaluating Large Language Models on Engineering Problem Solving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T15:08:03.793304Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2509.17677"},"observation_digest":"sha256:076738a62c3fac49a2324ba2ad5f2bf7e2b0ddc67126ff2aebb8c6c51520c8f7","observation_id":"dfd12c5a-cb70-4bee-8fb7-e4975cf227cf","resolution":{"observed_at":"2026-05-18T15:11:32.661126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T10:36:23.280848Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.09517","last_updated":"2026-07-02T09:56:45Z","snapshot_observed_at":"2026-08-08T00:15:14.362197Z","submitted_at":"2025-10-10T16:28:43Z","title":"StatEval: A Comprehensive Benchmark for Large Language Models in Statistics","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T10:36:23.280848Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2510.09517"},"observation_digest":"sha256:6483b6915e5ed657932ec845f40dbbbdc9a837986e15ac8f41c01d87630275cc","observation_id":"c4988a27-d134-48c3-8ddb-236d8af9ec9e","resolution":{"observed_at":"2026-08-04T10:36:23.280848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-04T08:55:58.581084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.18383","last_updated":"2026-06-18T07:59:59Z","snapshot_observed_at":"2026-08-08T04:40:12.618095Z","submitted_at":"2025-10-21T08:03:14Z","title":"MENTOR: Reinforcement Learning via Flexible Teacher-Optimized Rewards for Tool-Use Distillation","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T08:55:58.581084Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2510.18383"},"observation_digest":"sha256:533d16444f6b24ba271669ccc945d7cbd0ce3535de476f99376bdd5f5bcb1c75","observation_id":"06dfca44-1c00-4d8c-8ece-9b7bb9ab5c00","resolution":{"observed_at":"2026-08-04T08:55:58.581084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2512.15745","last_updated":"2025-12-24T03:46:46Z","snapshot_observed_at":"2026-08-10T07:50:38.265616Z","submitted_at":"2025-12-10T09:26:18Z","title":"LLaDA2.0: Scaling Up Diffusion Language Models to 100B","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-14T18:53:20.911374Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2512.15745"},"observation_digest":"sha256:8f316d5640e808d0dbace9a1b9529fc0f931ed096f6eeaea1d3dd9b2aa729ef5","observation_id":"17d1b9ca-423f-438e-a586-6552ca628b97","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2601.18832","last_updated":"2026-05-09T13:17:24Z","snapshot_observed_at":"2026-07-06T22:43:07.053570Z","submitted_at":"2026-01-25T18:16:17Z","title":"The Geometric Reasoner: Manifold-Informed Latent Foresight Search for Long-Context Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T10:42:33.579501Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2601.18832"},"observation_digest":"sha256:7b2ac244bf519a85896c213b4d442494f1a657985177bfedca76663c9f20abe0","observation_id":"7b1cd48c-cbdb-468f-9303-5e6e6d6268d3","resolution":{"observed_at":"2026-05-16T10:42:45.214512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-03T05:32:42.552709Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02192","last_updated":"2026-05-26T02:43:34Z","snapshot_observed_at":"2026-08-09T04:10:49.998392Z","submitted_at":"2026-02-02T14:57:53Z","title":"ECHO-2: A Large-Scale Distributed Rollout Framework for Cost-Efficient Reinforcement Learning","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T05:32:42.552709Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2602.02192"},"observation_digest":"sha256:d0fe209415a47a98fc3ecf1ccff306a5abfb834ddf5ff8bb9eae59569ae880f6","observation_id":"e0d579c9-2615-42c2-8439-a081d552c22b","resolution":{"observed_at":"2026-08-03T05:32:42.552709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-02T20:05:56.217637Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-06T03:16:28.646628Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.217637Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:d32d3673866cbbe3b3aef276c2218a11bda164870f6db7aa4e606d2c88249c37","observation_id":"8dd39d68-61f9-42c5-a67e-6b7a1480586d","resolution":{"observed_at":"2026-08-02T20:05:56.217637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-14T21:00:05.911327Z","title":"Alireza Ghafarollahi and Markus J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.14771","last_updated":"2026-05-31T08:16:27Z","snapshot_observed_at":"2026-08-07T17:32:45.832131Z","submitted_at":"2026-03-16T03:12:18Z","title":"OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T21:00:05.911327Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2603.14771"},"observation_digest":"sha256:cad77a7e3745a536082c733fc2156f306fe6090a8c35c79fb693e983904a7243","observation_id":"ab5b8ce9-1ab1-4587-93b8-4af6cc0e48a2","resolution":{"observed_at":"2026-07-14T21:00:05.911327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-14T19:59:59.030585Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.00137","last_updated":"2026-07-10T22:46:45Z","snapshot_observed_at":"2026-08-04T07:28:22.927886Z","submitted_at":"2026-03-31T18:42:36Z","title":"Open, Reliable, and Collective: A Community-Driven Framework for Tool-Using AI Agents","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-14T19:59:59.030585Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.00137"},"observation_digest":"sha256:c632b4982fa55fb9f6c8a1c648588661526c851caada7d4a435723734a5bef79","observation_id":"db0b71ae-c859-4823-9861-72ff92aa634a","resolution":{"observed_at":"2026-07-14T19:59:59.030585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:02:42.607682Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.06802"},"observation_digest":"sha256:ad2eb32b2f715b7ecfefe5ef410651b9725e902f95de59f09a17412962067122","observation_id":"a524c0e0-bb4c-4317-bf1a-13eaff005a87","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:640281e4c243657991b91aa7dbcf40625fff5477a9de3dad1ccf495a267d9755","observation_id":"282951e6-a92a-4ea0-b2db-4fbf7f691e22","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.18584","last_updated":"2026-07-29T01:04:08Z","snapshot_observed_at":"2026-08-02T23:45:38.427699Z","submitted_at":"2026-04-20T17:59:49Z","title":"MathNet: a Global Multimodal Benchmark for Mathematical Reasoning and Retrieval","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T04:09:46.616019Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.18584"},"observation_digest":"sha256:d4b28d176c8536e114483099365ccd8520b9618015cfa7b6096aeeb23321a697","observation_id":"93bd2711-d30d-48f5-afb6-351a5c074111","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.19087","last_updated":"2026-04-21T04:59:37Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T04:59:37Z","title":"OLLM: Options-based Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T02:04:12.174834Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.19087"},"observation_digest":"sha256:963cf632f5449c5c613a00f378e0c44fc4aa72df81ccf742884a0d4f5db9c3b0","observation_id":"838ade7f-4b5b-4def-8cd6-70bb4f0a10e2","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.20183","last_updated":"2026-06-02T10:46:47Z","snapshot_observed_at":"2026-08-02T22:19:27.963593Z","submitted_at":"2026-04-22T04:55:31Z","title":"Dual-Cluster Memory Agent: Resolving Multi-Paradigm Ambiguity in Optimization Problem Solving","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-10T00:37:55.147350Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.20183"},"observation_digest":"sha256:2e3a78e9380161765752752a030aadc14e7920e4f54e08814bb580cdf89f5ba7","observation_id":"f1c004be-7c19-4585-9da1-f9a2e6d475f6","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.21510","last_updated":"2026-04-23T10:12:32Z","snapshot_observed_at":"2026-08-11T05:26:16.021529Z","submitted_at":"2026-04-23T10:12:32Z","title":"OptiVerse: A Comprehensive Benchmark towards Optimization Problem Solving","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-09T22:04:19.654714Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.21510"},"observation_digest":"sha256:2e47bfadce9e23552c303859f036fc1c991a1cbbcaecdb80202f02e972d4a5fa","observation_id":"4cd45cc3-8a0d-497b-a96f-578296a69bb5","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2604.22597","last_updated":"2026-04-24T14:25:01Z","snapshot_observed_at":"2026-07-06T23:08:56.419589Z","submitted_at":"2026-04-24T14:25:01Z","title":"Rethinking Math Reasoning Evaluation: A Robust LLM-as-a-Judge Framework Beyond Symbolic Rigidity","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-08T11:45:54.181019Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2604.22597"},"observation_digest":"sha256:9f4f18c25139292fa6f6b177759a947d65a47baeafb529f38eeab28e651e680b","observation_id":"ca08261e-a418-411e-ba16-d09ca7c1cfa7","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.00365","last_updated":"2026-05-01T03:02:44Z","snapshot_observed_at":"2026-08-04T01:52:07.956241Z","submitted_at":"2026-05-01T03:02:44Z","title":"Uniform-Correct Policy Optimization: Breaking RLVR's Indifference to Diversity","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T19:56:39.465133Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.00365"},"observation_digest":"sha256:015d0cd25fb4d05a4aacaf3cbdfd130add50a4ed0dd74a4c55a5bcd117cd2e1e","observation_id":"282031cd-6c11-4d82-b87c-0e9cc8b09057","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.02395","last_updated":"2026-06-20T01:28:53Z","snapshot_observed_at":"2026-08-03T02:08:50.166202Z","submitted_at":"2026-05-04T09:36:57Z","title":"Verifiable Counterfactual Supervision for Process Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T19:24:18.022593Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.02395"},"observation_digest":"sha256:bb00e0b915621ad0d744dec9ce456610278190aa308f5bb456cb176e30d5d02c","observation_id":"df0b4dbe-0944-4a03-9b9b-33ac3c1ab829","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.04992","last_updated":"2026-05-06T14:52:22Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T14:52:22Z","title":"You Snooze, You Lose: Automatic Safety Alignment Restoration through Neural Weight Translation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-08T17:02:20.836208Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.04992"},"observation_digest":"sha256:6ccd8e6dcb4bb972528df09c31163d285df9ebd4d9c75d6ef29286d2ed4f1b6f","observation_id":"9bc3e4fd-85be-4e4a-a740-1c965bd41702","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.06116","last_updated":"2026-05-07T12:26:56Z","snapshot_observed_at":"2026-08-05T05:40:12.122604Z","submitted_at":"2026-05-07T12:26:56Z","title":"Policy-Guided Stepwise Model Routing for Cost-Effective Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T10:29:23.538806Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.06116"},"observation_digest":"sha256:57daea26982731a3b21f537a23a1249126bb5ddc83e0a6f6c69c5b7015b7e376","observation_id":"cb507dec-0fa6-4004-94fb-048b23aa4fc6","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.08686","last_updated":"2026-05-09T04:51:42Z","snapshot_observed_at":"2026-07-06T23:20:52.521341Z","submitted_at":"2026-05-09T04:51:42Z","title":"Iterative Critique-and-Routing Controller for Multi-Agent Systems with Heterogeneous LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T01:10:03.459912Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.08686"},"observation_digest":"sha256:f2b2c37b118560cf26d5b8e0d5ed01ee5529366f1fb9d2398602411e199c773e","observation_id":"53ef6107-7bd0-4e64-a5f9-2b8924308ecf","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.09292","last_updated":"2026-05-10T03:38:37Z","snapshot_observed_at":"2026-07-06T23:21:26.017420Z","submitted_at":"2026-05-10T03:38:37Z","title":"Beyond Accuracy: Evaluating Strategy Diversity in LLM Mathematical Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T04:30:29.268117Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.09292"},"observation_digest":"sha256:863e3efc3d0c9421a83f3466c90c6c9a621326ca02bc77a0618384bdf66a174b","observation_id":"fdf3d0ef-00a8-4fef-aa75-ada9cc889f2b","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.09544","last_updated":"2026-05-10T13:56:46Z","snapshot_observed_at":"2026-07-31T07:40:23.585067Z","submitted_at":"2026-05-10T13:56:46Z","title":"TIDE-Bench: Task-Aware and Diagnostic Evaluation of Tool-Integrated Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T02:47:31.830410Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.09544"},"observation_digest":"sha256:df4a7a221777ffb087bdd8dd4698b0c84a758a913cb72420ba913a5bc5106a59","observation_id":"af13ff09-c550-4d0e-98ec-439e0bb4be80","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.11625","last_updated":"2026-05-12T06:51:31Z","snapshot_observed_at":"2026-08-10T23:12:21.920617Z","submitted_at":"2026-05-12T06:51:31Z","title":"Nice Fold or Hero Call: Learning Budget-Efficient Thinking for Adaptive Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:31:21.377700Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.11625"},"observation_digest":"sha256:7f96c170e148093b23d6593eeefb7a7247a6accf3a7d9de60fd0bd41790872a8","observation_id":"cc48f11c-e718-463d-919b-7b742f5c0ecd","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.12524","last_updated":"2026-04-07T01:19:41Z","snapshot_observed_at":"2026-08-04T13:57:35.684744Z","submitted_at":"2026-04-07T01:19:41Z","title":"Stress-Testing the Reasoning Competence of LLMs With Proofs Under Minimal Formalism","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-14T21:03:13.407192Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.12524"},"observation_digest":"sha256:992683b154ec3bacfdf50b53c5c914c5044753b0046ea60b25ef699faf8dfe38","observation_id":"e12b708f-6244-40cb-8a63-c6f760dcef65","resolution":{"observed_at":"2026-05-15T09:09:15.216863Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.22875","last_updated":"2026-05-20T04:54:22Z","snapshot_observed_at":"2026-08-08T18:16:45.579144Z","submitted_at":"2026-05-20T04:54:22Z","title":"RMA: an Agentic System for Research-Level Mathematical Problems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T06:06:47.226726Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.22875"},"observation_digest":"sha256:ff1f646b4b59892fd4fae61379946bc0ce14ffcd2d73449c251d679a20fbb518","observation_id":"362cf041-0fe3-45e8-93cd-7629f955998b","resolution":{"observed_at":"2026-05-25T06:10:24.176711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.23904","last_updated":"2026-05-25T17:58:16Z","snapshot_observed_at":"2026-08-05T06:54:08.846880Z","submitted_at":"2026-05-22T17:59:50Z","title":"SkillOpt: Executive Strategy for Self-Evolving Agent Skills","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T03:51:49.812710Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.23904"},"observation_digest":"sha256:bc741e3cd5329adde0674ed78b63bf0dd426beaa0868b6c4e583e8268dcb67e8","observation_id":"4b75cfb3-a1ca-458a-bf81-03c02e72d9f7","resolution":{"observed_at":"2026-05-25T03:55:21.082658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.23904","last_updated":"2026-05-25T17:58:16Z","snapshot_observed_at":"2026-08-05T06:54:08.846880Z","submitted_at":"2026-05-22T17:59:50Z","title":"SkillOpt: Executive Strategy for Self-Evolving Agent Skills","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T16:26:23.130418Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.23904"},"observation_digest":"sha256:abe7efee750e334f18f35559cb3089d5de8592874da1e390c2d4f039987c5b9e","observation_id":"f66cc439-9b5f-4175-9773-67ea13d92506","resolution":{"observed_at":"2026-06-30T16:35:12.863669Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.26971","last_updated":"2026-05-26T12:57:12Z","snapshot_observed_at":"2026-08-07T18:23:52.993798Z","submitted_at":"2026-05-26T12:57:12Z","title":"RLVR Datasets and Where to Find Them: Tracing Data Lineage for Better Training Data","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T19:34:12.081362Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.26971"},"observation_digest":"sha256:486ade7ce7ac9ccd25906b9178db235a06a419c1f517e8eac64b031be7ab7c96","observation_id":"90451569-2903-46be-946b-89165f4f4bdc","resolution":{"observed_at":"2026-06-29T19:43:55.098336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2605.28070","last_updated":"2026-05-27T07:28:25Z","snapshot_observed_at":"2026-08-03T11:47:22.689668Z","submitted_at":"2026-05-27T07:28:25Z","title":"Bridging the Detection-to-Abstention Gap in Reasoning Models under Insufficient Information","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T12:37:16.138816Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2605.28070"},"observation_digest":"sha256:89251650015cbf75cf69adcc8be7e4c8a89a2fdee399fc3ecbfae411c3282145","observation_id":"17200321-6e33-417a-8953-6feca06a231d","resolution":{"observed_at":"2026-06-29T12:43:25.795466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":1},"reference_index":219,"source":"pdf_text","source_observed_at":"2026-06-27T18:39:44.696961Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:e7fc0947f8a04102b3893bbf0a5b51ac339bda235cf4f37725e3937b9a607666","observation_id":"377fb678-6ebb-41f5-a322-7c1f5ba8d447","resolution":{"observed_at":"2026-07-02T22:47:26.006683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-02T12:05:18.284698Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.08728","last_updated":"2026-07-26T11:27:42Z","snapshot_observed_at":"2026-08-02T12:04:58.846884Z","submitted_at":"2026-06-07T16:50:07Z","title":"Artificial Intelligence for Mathematical Reasoning: An Integrated Survey of Language Models, Neuro-symbolic Systems, and Verified Discovery","version":4},"reference_index":221,"source":"pdf_text","source_observed_at":"2026-08-02T12:05:18.284698Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2606.08728"},"observation_digest":"sha256:ac0a8b07e01472dcc5b1f5acab066120c71ca968afa00d1f5a3dcb6eb3b47c99","observation_id":"38de89c2-d281-47f0-ae08-e4f395a9ff85","resolution":{"observed_at":"2026-08-02T12:05:18.284698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2606.10403","last_updated":"2026-06-11T09:33:19Z","snapshot_observed_at":"2026-07-31T16:50:09.777225Z","submitted_at":"2026-06-09T04:25:44Z","title":"KCSAT-ML: Probing Reasoning Models with Nationwide-Cohort Human Difficulty","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T13:07:59.509660Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2606.10403"},"observation_digest":"sha256:825fbd19f3c20e8da9ed784d0bde0bc836106adc978a2d1ea01179eb049c23a4","observation_id":"79c3b2ca-0396-4c14-ae59-cdf5706853f7","resolution":{"observed_at":"2026-06-27T13:10:55.958616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2606.28186","last_updated":"2026-08-07T19:15:46Z","snapshot_observed_at":"2026-08-11T08:12:37.965730Z","submitted_at":"2026-06-26T15:32:17Z","title":"Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T03:58:32.372896Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2606.28186"},"observation_digest":"sha256:8546c9f44ac8f4f5a53861bdaa47674d397602dd1b965e5ce5d88ab7f7ddc8e7","observation_id":"2aecc018-1a2a-4a5e-8c03-b6b612e973a6","resolution":{"observed_at":"2026-07-01T17:15:51.636611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-14T17:12:24.565155Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.28186","last_updated":"2026-08-07T19:15:46Z","snapshot_observed_at":"2026-08-11T08:12:37.965730Z","submitted_at":"2026-06-26T15:32:17Z","title":"Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T17:12:24.565155Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2606.28186"},"observation_digest":"sha256:1d751ef98d8e200f1763d894f0e3bdfb2335e71b144053560c47ed3f8e10afcc","observation_id":"b4d53ea3-6e0a-436d-82fe-6f0fc22e85eb","resolution":{"observed_at":"2026-07-14T17:12:24.565155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2410.07985","doi":"10.48550/arxiv.2410.07985","metadata_source":"pith","pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","venue":"cs.CL","work_id":"8c4a2a23-9139-4a53-84de-60b6f027ae02","year":2024},"citing_paper":{"arxiv_id":"2606.31002","last_updated":"2026-06-30T00:27:53Z","snapshot_observed_at":"2026-08-01T10:19:09.703226Z","submitted_at":"2026-06-30T00:27:53Z","title":"Beyond Compilation: Evaluating Faithful Natural-Language-to-Lean Statement Formalization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-01T00:58:00.053021Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2606.31002"},"observation_digest":"sha256:a4741e921a6299020cc286dd4a8dbd8cf448b154f896c6368e337b9f93e3b2fc","observation_id":"604b69a1-63f9-41af-9cbd-e914229b0396","resolution":{"observed_at":"2026-07-01T13:15:45.420152Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-14T07:09:11.486851Z","title":"Omni- MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11089","last_updated":"2026-07-13T04:57:22Z","snapshot_observed_at":"2026-08-08T16:48:12.820648Z","submitted_at":"2026-07-13T04:57:22Z","title":"OS-Pruner: Pruning Chains-of-Thought of Reasoning Models via Optimal Stopping","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T07:09:11.486851Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.11089"},"observation_digest":"sha256:44509219e1a298a8ab59214fd2ec5e9cb760c74c4c53efe544ed5d70a0b44328","observation_id":"54ae2a75-170f-4185-8607-c99e59f0dca6","resolution":{"observed_at":"2026-07-14T07:09:11.486851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-07-14T02:43:21.225324Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.CoRR, abs/2410.07985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11849","last_updated":"2026-07-13T17:38:22Z","snapshot_observed_at":"2026-07-16T23:20:03.329744Z","submitted_at":"2026-07-13T17:38:22Z","title":"AdvancedMathBench: A Benchmark Suite for Advanced Mathematical Proof Generation and Verification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T02:43:21.225324Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.11849"},"observation_digest":"sha256:69f37112c49520ef34cc2c4d1cd67dcc766a3c87208d78e87bdf64cb6d95b8df","observation_id":"96536195-28b5-464e-870e-60c9d5909ec8","resolution":{"observed_at":"2026-07-14T02:43:21.225324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-01T23:34:06.382219Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.382219Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:b191049ab53d5d44ffc8adf11643944249eef890fcc6fb5a9a9b2b50671e1d13","observation_id":"5f3ef200-f229-4067-a7f3-498e6f885606","resolution":{"observed_at":"2026-08-01T23:34:06.382219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-01T12:54:32.701608Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19313","last_updated":"2026-07-21T17:28:40Z","snapshot_observed_at":"2026-08-07T08:18:38.032175Z","submitted_at":"2026-07-21T17:28:40Z","title":"Off-Context GRPO: Learning to Reason on Hard Problems using Privileged Information","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T12:54:32.701608Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.19313"},"observation_digest":"sha256:13d780e17bebfed93881214ce78f5645d08916d019d7964243d94c38cdb1f60f","observation_id":"95d6c613-43c4-4846-8694-4ff07d2545a9","resolution":{"observed_at":"2026-08-01T12:54:32.701608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-02T07:14:52.979212Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models.arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20543","last_updated":"2026-07-12T17:17:18Z","snapshot_observed_at":"2026-08-11T03:45:15.352446Z","submitted_at":"2026-07-12T17:17:18Z","title":"When RLVR Shrinks the Reasoning Boundary: Diagnosing Pass@k Inversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T07:14:52.979212Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.20543"},"observation_digest":"sha256:9967406af77baf3d068b0fcce0a324ab53d5eb731c830c79b16f2f9f3536faaa","observation_id":"c4263efc-e780-4a88-91e7-e55119155782","resolution":{"observed_at":"2026-08-02T07:14:52.979212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.07985/citation-record","integrity":"/paper/2410.07985/integrity","json":"/paper/2410.07985/citation-record.json","paper":"/paper/2410.07985"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.104674Z","title":"2021 , eprint=","venue":null,"work_id":"0d46a05b-859d-423c-ae95-e7bb4f120561","year":2021},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:05c9b11b23ad8317441d9040fac25b37826f62338320313665f9cf43e9f399ee","observation_id":"111cc7e6-2451-4361-aa0d-ca88ac5a2b0e","resolution":{"observed_at":"2026-05-15T09:09:15.117310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:58.127656Z","title":"2021 , eprint=","venue":null,"work_id":"96984740-1b0a-4e03-9a02-9a0f6b7c8314","year":2021},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:dd31b9f8faa833d819f40a8c6a6340b66267e51a8a9861c5af366beed5ec1ebd","observation_id":"e9aeaf62-f410-429f-9999-35287294270d","resolution":{"observed_at":"2026-05-15T09:09:15.150144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"b4fa534b-c783-45a0-b643-85cee2c4d782","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:fa6d0022eea96af8fa1fe436e8812958f34bfb0b79c5e348d72657026c30f439","observation_id":"3af6d83b-34fc-4a7a-85f1-b2e1da473f04","resolution":{"observed_at":"2026-05-15T09:09:15.152511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"70cbb291-0c52-4b71-9a74-14949ec2d28b","year":2022},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:81f79bbc6915ddd7e6afba7846f4115fc77efc73cc7dda707c10b1a935ae112c","observation_id":"505469b3-8300-4c43-842f-44e6e7ce5d39","resolution":{"observed_at":"2026-05-15T09:09:15.154937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"186db717-bd16-4a71-9357-e93fdf5c2941","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:95cffda4be9d21771f28ad1a04b4c09dea6d90e577b41f67ec4bcd63fbbddea9","observation_id":"589dd251-4d28-460a-a33e-6d168d24bb01","resolution":{"observed_at":"2026-05-15T09:09:15.157422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.034407Z","title":"2024 , eprint=","venue":null,"work_id":"526b0da3-e7c6-4fc5-8628-e8c06c90b508","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:b16a3fe7608c82f6ff63531b76d395cfdf878ee3009952d53ec9c7277a14ce97","observation_id":"c6d9f78e-e229-40f4-896a-0c92ffbe1de5","resolution":{"observed_at":"2026-05-15T09:09:15.159911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"5fa6b1f2-baaa-4ba8-b194-c1df7fe1fbbb","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:49496962694a45af7fe003fe56b7614e06a79ca275357e5c1b17cef9c26fda78","observation_id":"7b13af36-1990-4106-9565-642bbbdbed9d","resolution":{"observed_at":"2026-05-15T09:09:15.162210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"108616be-bb68-41fb-9b9e-d9f1865670d9","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:b6f258041f3fe6f13241c32217163734947ddf8258d30865e62d492c57ea94ff","observation_id":"9e155c53-2963-40f3-94ab-6a628b2580f0","resolution":{"observed_at":"2026-05-15T09:09:15.164666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"7fc19257-089d-49ca-bc9b-866a320e281d","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:93b7299dd92791175b9bd768be4d90e559af8ea7a85b68c4daa6e741e89f51e2","observation_id":"3c47b969-6e11-404f-b692-08b0e7f5e12c","resolution":{"observed_at":"2026-05-15T09:09:15.167404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"c69e4d8e-ef0d-4917-9a54-8af14038aec1","year":2022},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:5ea0e1f208ed1174e3c4affb3c8962da3a419da07861366bd24ac4de4710772c","observation_id":"12844f27-7b36-4e0f-a029-e27d43e9de05","resolution":{"observed_at":"2026-05-15T09:09:15.169670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:43:31.649162Z","title":"Nature , volume=","venue":null,"work_id":"e3d6122a-c816-4a08-8685-9f54dfe74ef1","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:2553828cbf7d8865745af8b12c27d6c07e68c3066a48fd3e58899ba3b268aee2","observation_id":"642ec3fe-198c-440f-b011-7be415e9772f","resolution":{"observed_at":"2026-05-15T09:09:15.173492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hugging Face repository , howpublished =","venue":null,"work_id":"981a496b-b38b-40e3-a90d-831f624f8a21","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:1d645e97dd27b177492a951450cd4980873ad174e26396b75237c93956aa3ba6","observation_id":"50dc1e93-050b-4592-bd36-586791f598f7","resolution":{"observed_at":"2026-05-15T09:09:15.176750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , journal=","venue":null,"work_id":"89e93bf9-0198-4521-8112-cdeca6990dd3","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:09bf6b8954243e85db2edefb8d27dfcd6b96eb16c16af6fb13c3367cbe3b934c","observation_id":"d485c82f-a1ce-4ae3-b53c-af0ba529e8ff","resolution":{"observed_at":"2026-05-15T09:09:15.179645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"766e90f3-4fea-4158-9d32-55b9c48d32b3","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:e98654dfba098963e74fffcf05b2765f2f501e7d92003fe9725ed5511e1777bb","observation_id":"e3d42753-0873-4f37-bad3-b09685b7b503","resolution":{"observed_at":"2026-05-15T09:09:15.182379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:56:41.291693Z","title":"2023 , eprint=","venue":null,"work_id":"da2c3de9-a493-4a82-8417-09457101e16d","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:0520b79c5b955197dfccf4e302d58855e8f979f9665c08fb4d8fc743a2decb30","observation_id":"f52c174f-8e6a-4658-9266-560fa96a752f","resolution":{"observed_at":"2026-05-15T09:09:15.185389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"ac0d2df2-c619-4805-be47-d534c7b52cac","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:ba64438f139de80a3a00a40bab4f75a22de3f03e3e4c382ab72d4802193c11b4","observation_id":"754cb1f7-23a0-479e-93f7-77da931dd116","resolution":{"observed_at":"2026-05-15T09:09:15.188878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d226a85c-a0b3-4cbc-a53d-446f2f46d53f","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:9a7e4727d500f2f3cc6e95c035afb26df9d40e66de1f74792efe2598a0c0c2cd","observation_id":"366d2d5f-a2f8-4c43-a123-f5d006708522","resolution":{"observed_at":"2026-05-15T09:09:15.191825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of the American statistical Association , volume=","venue":null,"work_id":"6ebbad1c-1b04-4260-88cf-b17313ee46eb","year":1970},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:524bea41ac0e59eb6ab5d83f4f0880add2a9f192e69623f8fcf6992233f01816","observation_id":"6ea17305-02fe-442e-b22d-4cd4e769fd1a","resolution":{"observed_at":"2026-05-15T09:09:15.194968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T23:15:44.778861Z","title":"2023 , url=","venue":null,"work_id":"20acb4a6-31ba-4fe0-a7ef-9a3b4d6b2b96","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:85db4e399c4e960eb8f289cb1869f77d613ed86586eadf5f2b770defa27f3638","observation_id":"f5c263ef-df71-4895-b674-4f1e1af72780","resolution":{"observed_at":"2026-05-15T09:09:15.197398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.312046Z","title":"2024 , eprint=","venue":null,"work_id":"5d2e552d-b147-4a2f-a8b9-b67ce57e6e7f","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:7f9c42767ed49eb907367b03b39071d6aa4dd780ea015234c7fad6e7d399d450","observation_id":"adddf800-f79b-437f-94f4-5494c36538ea","resolution":{"observed_at":"2026-05-15T09:09:15.199781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T13:16:16.372377Z","title":"2024 , eprint=","venue":null,"work_id":"c340eca6-fc11-45b6-a0d7-068752a731c8","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:97d56a687c755e01a8d4af337e67585b4d69e893f067e1b2437af6cdc1f0a574","observation_id":"a3a10510-fd94-4695-a29b-e60e04daffcc","resolution":{"observed_at":"2026-05-15T09:09:15.202197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.700327Z","title":"2024 , eprint=","venue":null,"work_id":"94860f33-c1e9-46de-b7ef-cdfde74468a5","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:60205d13ad233b4d3009e97e9e3895719124efb73959ff98f0c2eff288b923da","observation_id":"706739d1-378b-48fe-9511-b442ee8857c0","resolution":{"observed_at":"2026-05-15T09:09:15.204467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"bb080f0c-bece-4c51-ae0d-1de95d2fd238","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:d80f85f644b88c8f4d9e5e5584c09ed6beaa959d8ce6f5b1ea29e0f187ca5732","observation_id":"bf6928b8-9e69-447e-9d7a-06c97cde6188","resolution":{"observed_at":"2026-05-15T09:09:15.206638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"4ff8e4b0-710e-4f9c-a058-8042a5621ef5","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:7769f656054c8dedbebaad4620a7d46975a2be548ed0bf567bb52dc97269f34b","observation_id":"57804fda-d753-418c-8e5b-7738767212dc","resolution":{"observed_at":"2026-05-15T09:09:15.208772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.054772Z","title":"2024 , eprint=","venue":null,"work_id":"e040c14f-069a-47ce-99eb-256217096a07","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:f7fccae5485a4c06fe37d967a548ea1014f261743f6c5f468c9b62c1a4997b4f","observation_id":"0a304a85-e77f-4e5f-b010-f4b0c4fe4440","resolution":{"observed_at":"2026-05-15T09:09:15.211792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"5d9088f5-c8a6-4a68-969e-6a73e90b8f88","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:51d096795db2814992450e89e724b1f54b6ba582b6444c1bae1c4fccfc6d22a9","observation_id":"5af3e1bf-e4e6-44db-a025-42db2db54a46","resolution":{"observed_at":"2026-05-15T09:09:15.213928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"a46bc8c6-7b39-4136-9672-e2737d702c7a","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:0367adad76364d5666d1004afe7d22c7ab75ac91ebb9112227e30669dc587265","observation_id":"43125d1c-8e83-489a-95e5-c2b4f1dd63b5","resolution":{"observed_at":"2026-05-15T09:09:15.215972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"90020d4d-feab-497e-b441-2a5382a806de","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:dd0ff09f7a4c148e4ad43830775b687a22adaac5c1aea175efd555ac567df0f8","observation_id":"6d6e929d-b0dd-47b2-98d3-d2aad9758169","resolution":{"observed_at":"2026-05-15T09:09:15.094323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.894664Z","title":"2024 , eprint=","venue":null,"work_id":"378133d9-32d0-4c37-bf89-288d3c5f8907","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:83cd0a0674751505fc7d05fe6be1b8416767d1e4e2b6dbcac369b920919d8077","observation_id":"249eeee5-f771-4c02-9941-a345786ecd45","resolution":{"observed_at":"2026-05-15T09:09:15.096947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.813628Z","title":"2024 , eprint=","venue":null,"work_id":"a89a4563-79a1-421b-94b6-2cf0795d3c66","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:3d5a83354546937eecdddd19b9a48f7b5365adb8dc157e61ac50c78c4b9df808","observation_id":"93c1207e-74cc-44d3-a4ae-0b2981a7c2a5","resolution":{"observed_at":"2026-05-15T09:09:15.099259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4bcf6f98-de2f-4783-9b87-e6e707cc0fdc","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:67f832749b6a7af773fd4a00c6d3929bc61645ac647ac40a5b7f4d35d6b1776a","observation_id":"f3cf1fc6-0ed7-4a76-877b-80afac2210a7","resolution":{"observed_at":"2026-05-15T09:09:15.101389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.336458","doi":"10.1109/tai.2024.3364586","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Iterative Optimizing Framework for Radiology Report Summarization With ChatGPT , volume=","venue":"IEEE Transactions on Artificial Intelligence","work_id":"f9bd74c9-45d0-470e-ac4f-3110846d358b","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:9ad1109b9c40f321937b9762bae8e5a665e2401f537930e787157d19a79e4479","observation_id":"8d83c05e-14f3-4525-ae54-d39510b7ac8d","resolution":{"observed_at":"2026-05-15T09:09:14.981330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"d95f1d57-adb3-4f93-84f6-1c8c6cd08eed","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:50c2d8392d7b950396e8823a361de7ec06253002ddb627268ce71af61352e32d","observation_id":"9fa867a5-85c0-4392-8a3f-bd22735b11e9","resolution":{"observed_at":"2026-05-15T09:09:15.103601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"bea5314a-2ac0-454c-919d-32ef25a4c33c","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:bd8ea3ae42c0f4e768b69fda2140e03133c0272dc0656c7411569881faaf8823","observation_id":"09c0cc3f-75bd-41ab-aa35-54d484f05674","resolution":{"observed_at":"2026-05-15T09:09:15.105832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fa4d697e-bd6c-4c70-b0a8-61a010e43ddf","year":null},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:669b1b26175af8ad23952a6aa657c0b1689dea5306708dcc5d61adccd708cbbb","observation_id":"7a97d095-6e60-46b8-8736-271fc0467445","resolution":{"observed_at":"2026-05-15T09:09:15.108004Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"f35b2f19-f566-4f9b-8839-c0cb9440cb93","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:d85b10a71ed9d31f905251f65b9e99ebb7cad41b7f944a951a11ee70ddb08fab","observation_id":"ad6e1c53-3095-41f6-965e-f75d0ed9d5e1","resolution":{"observed_at":"2026-05-15T09:09:15.110403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca35e716-7837-46fb-b1fc-6a5967dccf5d","year":null},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:2b1e31bbf86e9ba66457288a50aecfa7230e993a2b1c1dc5d49f355b1e0f73fe","observation_id":"756c2935-d152-4b32-9643-c94dc7c26072","resolution":{"observed_at":"2026-05-15T09:09:15.112558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , publisher=","venue":null,"work_id":"4233608a-b799-466a-8e0a-a6151a8cc58a","year":2017},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:8a78ec7a352599e58e61bec59dedbab162b2808b82ed1e4c807ac047d3d9456c","observation_id":"02aa4479-120f-4bd4-9a46-c054b88a38a9","resolution":{"observed_at":"2026-05-15T09:09:15.115053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"8dc54a1b-32a8-43ac-b58b-98bdf7a6cc38","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:7caa7ba03d7155881b2b33becf483a317dbeb9b38dbe192deee133b2f0ad456d","observation_id":"4e1d2122-6d4f-44de-b677-8d883edf776c","resolution":{"observed_at":"2026-05-15T09:09:15.147956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"8725ea5a-f5c1-4d71-ba09-8dbd5ab7565b","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:3a61611e707f7849170ed5e11bdc87689d1487f0a9ea116d9c019f0ac5cd0726","observation_id":"2c09868b-e5cb-401f-8cff-d0ebf2cb2936","resolution":{"observed_at":"2026-05-15T09:09:15.119504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , howpublished =","venue":null,"work_id":"ac720b36-1fc5-4e5e-88f2-c6afdf6bb63a","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:adfe02877f432088360f0e4f04f538600d2758e3323003d4f5221334bfb02cc7","observation_id":"0af20043-a3a2-47ad-833c-293a8b067571","resolution":{"observed_at":"2026-05-15T09:09:15.121912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , howpublished =","venue":null,"work_id":"429a7def-3ae5-4748-8210-e09e53dd3227","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:31dad90913959d62b32df4970ad0682d0312924141d20fe87a93e057af7491d7","observation_id":"a776d289-69a4-4f03-ba6a-fe9c4860b581","resolution":{"observed_at":"2026-05-15T09:09:15.124416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:17cd68c4c2a0502d541aaccf1b625eeb6489ccd5bf062da5c6d9bd0eb687f668","observation_id":"c9de084d-101d-42eb-bbe8-1a268c138f4f","resolution":{"observed_at":"2026-05-15T09:09:15.020097Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathstral","venue":null,"work_id":"ff29e25b-d2fc-430a-bbe8-cbc2bc776817","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:aa62a258ee3c666dd6b2c9bc5acca55a43dad1f34715e76cdc39df95fa8e2bd8","observation_id":"c6123048-fa25-469c-8661-199bd963979f","resolution":{"observed_at":"2026-05-15T09:09:15.126660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.5","venue":null,"work_id":"49e242e1-a5b8-4cf8-86b8-57de052d2301","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:5d95338c8187c9e6398a5fea8b7e507a05b392802096ef8796abf69b1ea4b136","observation_id":"6c182db5-ea1b-4417-be5b-c356e81147b9","resolution":{"observed_at":"2026-05-15T09:09:15.129028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15074","last_updated":"2023-10-23T11:55:58Z","snapshot_observed_at":"2026-08-03T17:43:44.363296Z","submitted_at":"2023-05-24T11:55:59Z","title":"Have LLMs Advanced Enough? A Challenging Problem Solving Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.15074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15074","snapshot_observed_at":"2026-07-07T23:54:18.637108Z","title":"G., et al","venue":"cs.CL","work_id":"a26d85ca-3a24-4fd9-ab95-8e7337e3acc1","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2305.15074","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:545a4bbe9ea1bfad89f11fa84c37c82af02f406dc6a8ad82ec64039062c71d57","observation_id":"dcdd4251-351b-4034-a861-a2f72e6272b3","resolution":{"observed_at":"2026-05-15T09:09:15.030511Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12433","last_updated":"2023-02-24T03:28:46Z","snapshot_observed_at":"2026-08-08T08:53:38.852270Z","submitted_at":"2023-02-24T03:28:46Z","title":"ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics","version":1},"cited_work":{"arxiv_id":"2302.12433","doi":"10.48550/arxiv.2302.12433","metadata_source":"arxiv_reference","pith_arxiv_id":"2302.12433","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proofnet: Autoformalizing and formally proving undergraduate-level mathematics","venue":"arXiv (Cornell University)","work_id":"d5be73f4-5f56-4254-94ca-01e3bba69c3c","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2302.12433","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:3890417212f149b452c646b2cf7456ba350135f4b398981fac9a414e0cd15c3c","observation_id":"718c13df-d833-4de6-92f7-37674a21ecbe","resolution":{"observed_at":"2026-05-15T09:09:15.036018Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T04:49:09.745563+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T04:49:09.745563+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10631","last_updated":"2024-03-15T19:14:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-16T17:54:07Z","title":"Llemma: An Open Language Model For Mathematics","version":3},"cited_work":{"arxiv_id":"2310.10631","doi":"10.48550/arxiv.2310.10631","metadata_source":"pith","pith_arxiv_id":"2310.10631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llemma: An Open Language Model For Mathematics","venue":"cs.CL","work_id":"c0820dec-60a1-4f0c-beda-4516eb8e89c9","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2310.10631","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:14505da3834791bd6c2d29b3263218155891ffc385c8ea88550dbe541d173566","observation_id":"38fd9800-16e8-4cc8-bc16-d25f807c602d","resolution":{"observed_at":"2026-05-19T08:17:47.048289Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-21T13:53:00.912171+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T13:53:00.912171+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distribution of residual autocorrelations in autoregressive-integrated moving average time series models","venue":null,"work_id":"3594abb6-9f89-45a8-80e2-43ff1cbe903c","year":1970},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:b571f3bd44bd35b3999e349b360bc85448e149620630ef05d37ebd438976c9d3","observation_id":"345a8872-941e-40c6-a086-813961ca63e8","resolution":{"observed_at":"2026-05-15T09:09:15.131469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":"2403.04132","doi":"10.1007/s11336-009-9136-x","metadata_source":"pith","pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","venue":"cs.AI","work_id":"a1eb83da-5727-4b63-977f-81c6fdd33936","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:b201e9ed9803584c24a6a3889860ea6d0a47ee8747bf4eb651a7ba15124d0667","observation_id":"200f367c-3777-429e-bee8-0ac5ee91faeb","resolution":{"observed_at":"2026-05-15T09:09:15.078017Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:1e7c968d11be7c640b3347513111d104d7428ca7654c732054322cbaa1cead88","observation_id":"41b902db-e93b-49dc-95fa-b5941b896d78","resolution":{"observed_at":"2026-05-15T09:09:15.084609Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11931","last_updated":"2024-06-17T13:51:35Z","snapshot_observed_at":"2026-08-07T06:30:25.302107Z","submitted_at":"2024-06-17T13:51:35Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","version":1},"cited_work":{"arxiv_id":"2406.11931","doi":"10.48550/arxiv.2406.11931","metadata_source":"pith","pith_arxiv_id":"2406.11931","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-Coder-V2: Breaking the Barrier of Closed-Source Models in Code Intelligence","venue":"cs.SE","work_id":"713a39be-8c4e-4ee3-8671-11cf9379262f","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2406.11931","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:e420815f15c7aec4cae9faa3538587c378d636c18565c3577bc9b5fe66e5974b","observation_id":"55910282-9409-4c43-9999-233ff335fcb5","resolution":{"observed_at":"2026-05-16T01:06:07.964742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/b97682","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Problem-Solving Strategies","venue":"Problem books in mathematics","work_id":"052da58a-bfc1-4ccd-91a1-f7db32eea11b","year":1998},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:818d50585aa9a865fc7279ce2d54b24fde1f5085558fe4f5f8c8ac3aa98bd2aa","observation_id":"9ca48e62-59a7-42c7-a127-2ce6a7806efe","resolution":{"observed_at":"2026-05-15T09:09:14.975632Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18321","last_updated":"2024-06-26T13:02:35Z","snapshot_observed_at":"2026-08-07T23:35:19.761147Z","submitted_at":"2024-06-26T13:02:35Z","title":"MathOdyssey: Benchmarking Mathematical Problem-Solving Skills in Large Language Models Using Odyssey Math Data","version":1},"cited_work":{"arxiv_id":"2406.18321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.18321","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"org/abs/2406.18321","venue":null,"work_id":"2023a0a2-fc70-4ada-8f9b-7b1e5ac05dc4","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2406.18321","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:79112b12cc8796e98bf0ec9a1d265cb199db3b070a1527d305a85364d6977d81","observation_id":"ed9b2a01-ae68-458c-8954-79d7f91a31ce","resolution":{"observed_at":"2026-05-15T09:09:14.987082Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14024","last_updated":"2024-10-18T06:59:24Z","snapshot_observed_at":"2026-08-10T07:28:10.183660Z","submitted_at":"2024-06-20T06:42:27Z","title":"LLM Critics Help Catch Bugs in Mathematics: Towards a Better Mathematical Verifier with Natural Language Feedback","version":4},"cited_work":{"arxiv_id":"2406.14024","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.14024","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv:2406.14024","venue":null,"work_id":"b8a7626e-ea9b-43ef-b087-69fd533b7413","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2406.14024","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:83d26930c6a7a679931a887a1fa4ed10ce23b36972f88492af57d46884997cf4","observation_id":"174bd1a2-1c24-4758-98fe-7cd4aa632bd7","resolution":{"observed_at":"2026-05-15T09:09:14.991946Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:75e95311fa90ef384f2f0b53fe1c8e52a39b0da4345ce7f992970eb59390547e","observation_id":"36ffdc63-201c-4d1f-88d0-2d8df8affe94","resolution":{"observed_at":"2026-05-15T09:09:14.996702Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:138297d16147518446824baa5f3bb69e2e6c1c4bcefb670d0765df483f68cccd","observation_id":"089a28c4-3dbf-4bf2-ba7f-979b43201aa9","resolution":{"observed_at":"2026-05-15T09:09:15.001647Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12753","last_updated":"2025-03-06T12:55:25Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:20:53Z","title":"OlympicArena: Benchmarking Multi-discipline Cognitive Reasoning for Superintelligent AI","version":2},"cited_work":{"arxiv_id":"2406.12753","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12753","snapshot_observed_at":"2026-07-03T05:57:41.685515Z","title":"arXiv preprint arXiv:2406.12753 , year=","venue":null,"work_id":"5d74b517-9d7e-41f0-ac0f-52ac4de39560","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2406.12753","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:725e42c099fdb8da6fb2e1e977dfb2513e5dfd0df29f124e97cb8dcc9b98d542","observation_id":"e1fe4b74-821d-4190-b2de-d826281acc9a","resolution":{"observed_at":"2026-05-15T09:09:15.006579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":"2409.12186","doi":"10.48550/arxiv.2409.12186","metadata_source":"pith","pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Coder Technical Report","venue":"cs.CL","work_id":"09ba463d-6377-4017-9801-444ffb94b056","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:e3e6495f8f86c002505b45a029ee93372aaa9111d661fce516b684e9cbfa4c6f","observation_id":"02d4b553-6a98-4c4a-9895-575d3465edef","resolution":{"observed_at":"2026-05-15T09:09:15.011138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:18:55.772185+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.14858","last_updated":"2022-07-01T02:15:12Z","snapshot_observed_at":"2026-08-05T15:41:22.691461Z","submitted_at":"2022-06-29T18:54:49Z","title":"Solving Quantitative Reasoning Problems with Language Models","version":2},"cited_work":{"arxiv_id":"2206.14858","doi":"10.48550/arxiv.2206.14858","metadata_source":"pith","pith_arxiv_id":"2206.14858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Solving Quantitative Reasoning Problems with Language Models","venue":"cs.CL","work_id":"17214d12-1ca8-4186-806d-53c6715383a0","year":2022},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2206.14858","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:c0130b08c272f8444aeca48bc8ffa17e6c23ef31fc9970b6cb18616fb0329081","observation_id":"b936ff09-3887-48b4-9ff5-c3e429fdd334","resolution":{"observed_at":"2026-05-15T09:09:15.015382Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:08.21276+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:08.21276+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Numinamath","venue":null,"work_id":"fab47ee8-c731-47ba-a71f-952fd1a51b03","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:de9fc64162122796592609089dd35dead7f42e6c35979c7ca9def00e4e65dd6f","observation_id":"f606ce41-2851-4a0d-a558-cd6fd85cf1f8","resolution":{"observed_at":"2026-05-15T09:09:15.133576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06961","last_updated":"2024-06-09T01:47:26Z","snapshot_observed_at":"2026-08-07T14:15:56.254940Z","submitted_at":"2024-01-13T03:18:16Z","title":"CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities","version":2},"cited_work":{"arxiv_id":"2401.06961","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.06961","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Champ: A competition-le vel dataset for ﬁne-grained analyses of llms’ mathematical reasoning capabilities","venue":null,"work_id":"c6d74fff-1aed-4092-8218-cf34336a5356","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2401.06961","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:aa2c16eda713504334da32c1128a0db8c42eed60863b817c2bd06c1a142b6297","observation_id":"dffef66e-f120-4612-9347-99c579b7279a","resolution":{"observed_at":"2026-05-15T09:09:15.024469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4 technical report","venue":null,"work_id":"5bcbade3-7c67-4224-930c-1da9a3e5c5f1","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:5d261056efbcccb08340e46cbe85a6663372d531c46f4074f89baacff7bb4c06","observation_id":"e9627305-6f7f-45f6-9fe3-6b5438bff278","resolution":{"observed_at":"2026-05-15T09:09:15.136344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to reason with llms","venue":null,"work_id":"f70d82c2-c254-4c97-8869-d5074cfb5f50","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:f139de89e753e054b15140db2cf8cd29b7e4fe3e8e6ce0490b3c04e4dd21b2a1","observation_id":"67f2e29f-5fbb-41e7-a92b-897233ffd297","resolution":{"observed_at":"2026-05-15T09:09:15.138543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":"2308.12950","doi":"10.48550/arxiv.2308.12950","metadata_source":"pith","pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Code Llama: Open Foundation Models for Code","venue":"cs.CL","work_id":"e73bffa4-7620-47ac-9327-259a60db52ca","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:522ee8f96f48d43cd4d53c8fb0943f64f7668964478ac17402924eb0b0642130","observation_id":"cc2dce73-a10a-48bd-ade3-79fe29458d89","resolution":{"observed_at":"2026-05-15T09:09:15.045633Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:36.742994+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:88be68552fd8ef6d2f276f2b56bb2320a6d4c504f397db031fea7d651eddb3e8","observation_id":"372f2faa-7aed-4b5f-8ab0-6b23354cbcab","resolution":{"observed_at":"2026-05-15T09:09:15.049967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Solving olympiad geometry without human demonstrations","venue":null,"work_id":"2a9773df-26bd-464b-bdfd-ba621c8346ab","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:31a3d3b7adf1fe8b8a472893712b9ebcb9c795e1a8412334a6d172355d31abed","observation_id":"8a75b2ab-cca7-4914-ac35-87d091de9a1e","resolution":{"observed_at":"2026-05-15T09:09:15.141280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"cited_work":{"arxiv_id":"2312.08935","doi":"10.48550/arxiv.2312.08935","metadata_source":"pith","pith_arxiv_id":"2312.08935","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","venue":"cs.AI","work_id":"fb547990-d48e-4ba3-a047-af1e506e8290","year":2023},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2312.08935","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:789fc49bdd7f9c0c498d4575032635845dcf32f48edaa7955264a837933101ea","observation_id":"817fd360-ae84-4c74-a0cf-b7d6cf23ac86","resolution":{"observed_at":"2026-05-15T09:09:15.058502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Preserving in-context learning ability in large language model fine-tuning","venue":null,"work_id":"d5671bdc-ac7d-412f-b9a1-a6dbbe7afbf0","year":2022},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:49357706452606b076f69805434a2553b363dec5aeee0bca17bf4ee03ee86be2","observation_id":"5500fd44-6682-4a2d-8452-5aca098e8a37","resolution":{"observed_at":"2026-05-15T09:09:15.143700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-09T17:21:02.287748Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":"2404.18824","doi":"10.48550/arxiv.2404.18824","metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"input\": {","venue":"arXiv (Cornell University)","work_id":"0b8337c0-cbf0-49a5-abeb-b4b3c990d133","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:6d2bfade3f50a5c12e0f38ec8e10911ed5be6a5c4537d4a2e77c4a3c296781a4","observation_id":"35845f36-317b-421a-94c2-f2807d182c79","resolution":{"observed_at":"2026-05-15T09:09:15.062242Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":"2407.10671","doi":"10.18653/v1/2024.naacl-long.246","metadata_source":"pith","pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2 Technical Report","venue":"cs.CL","work_id":"a1857881-ab9b-4b80-9b5f-9ae4b5c2566d","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:f54d715bc07e17a284e02eae722ab27843e18a3771cf778e63c20159f66b8e21","observation_id":"136e4829-a1bb-4adb-b945-fd2378d31e71","resolution":{"observed_at":"2026-05-15T09:09:15.065363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":"2409.12122","doi":"10.18653/v1/2025.emnlp-main.712","metadata_source":"pith","pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","venue":"cs.CL","work_id":"a097c5d4-6d32-46ee-9826-57d532bbfc9c","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:b84e397919a146b5374083cb6a69208ca37f12edf814540030592715352b8f0a","observation_id":"4c88fc30-871c-45d3-a12d-950f9e21c535","resolution":{"observed_at":"2026-05-15T09:09:15.068275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12809","last_updated":"2024-06-18T17:25:47Z","snapshot_observed_at":"2026-08-10T17:33:03.610933Z","submitted_at":"2024-06-18T17:25:47Z","title":"Can Large Language Models Always Solve Easy Problems if They Can Solve Harder Ones?","version":1},"cited_work":{"arxiv_id":"2406.12809","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12809","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can large language models always solve easy problems if they can solve harder ones?, 2024 c","venue":null,"work_id":"2e33a49a-4f09-4fbb-9071-ebb7fc0126d7","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2406.12809","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:9567215fab2e555e83db7f0bebf4a3adb7a8a992a51beb8fbd7f9db2595d2b99","observation_id":"f8baea53-1534-4f46-8b4d-0b2b7d06328e","resolution":{"observed_at":"2026-05-15T09:09:15.071639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06332","last_updated":"2024-05-24T07:09:21Z","snapshot_observed_at":"2026-08-10T07:06:15.150032Z","submitted_at":"2024-02-09T11:22:08Z","title":"InternLM-Math: Open Math Large Language Models Toward Verifiable Reasoning","version":2},"cited_work":{"arxiv_id":"2402.06332","doi":"10.48550/arxiv.2402.06332","metadata_source":"pith","pith_arxiv_id":"2402.06332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Internlm-math: Open math large language models toward verifiable reasoning","venue":"cs.CL","work_id":"da7fe877-735e-4436-9e53-837121a0b2d0","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2402.06332","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:438a01ec0c0a2445cceb4ecfc2cd55d63c96f574f837916dac890a89ed1c8dad","observation_id":"ee60e291-cb29-4f52-9319-9e737ce448b5","resolution":{"observed_at":"2026-05-15T09:09:15.075148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The art and craft of problem solving","venue":null,"work_id":"aa5f627c-7a25-4733-902b-5f3a7816d1fb","year":2017},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:d9c83dbeeb8f81d5ae465f534b2b88a3596468f80b6e94a7db1397c06f11a907","observation_id":"3e027ceb-a0f1-4b9e-8ad4-8990c7b47dd4","resolution":{"observed_at":"2026-05-15T09:09:15.145821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:2b0b009f5f1340736f3a1c7d82ffbfe827f22a0317e34129ca7c441ed1e0823c","observation_id":"25abb680-ff6a-40a1-8d0d-78b693ab81ef","resolution":{"observed_at":"2026-05-17T01:29:30.364997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00110","last_updated":"2022-02-28T06:03:23Z","snapshot_observed_at":"2026-08-11T08:16:22.316876Z","submitted_at":"2021-08-31T23:21:12Z","title":"MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics","version":2},"cited_work":{"arxiv_id":"2109.00110","doi":"10.48550/arxiv.2109.00110","metadata_source":"pith","pith_arxiv_id":"2109.00110","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics","venue":"cs.AI","work_id":"a2b8fa24-3524-46cc-b33e-a2f51303d17d","year":2021},"citing_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-15T09:09:14.884516Z"},"links":{"cited_paper":"/paper/2109.00110","citing_paper":"/paper/2410.07985"},"observation_digest":"sha256:9d0989a8dae0e0efcda093036c87e9b65281967c117c95608002a9757abbf723","observation_id":"218aff1b-80eb-48ba-8f6f-138e2144ab7d","resolution":{"observed_at":"2026-05-16T20:03:04.481585Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T07:44:25.135572Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":8,"parse_uncertain":0,"unresolved":2,"verified_exact":19,"verified_fuzzy":48},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 79 inbound Pith citation observations for arXiv:2410.07985."}