{"as_of":"2026-08-21T10:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8dbbca520424e0fa3b4954c1d067cd9a247e1947d7e82db90e4eb061e12bf911","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:05:57.763677Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:18:57.472922Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"cited_work":{"arxiv_id":"2602.24173","doi":"10.48550/arxiv.2602.24173","metadata_source":"pith","pith_arxiv_id":"2602.24173","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lemmabench: A live, research-level benchmark to evaluate LLM capabilities in mathematics.CoRR, abs/2602.24173","venue":"cs.AI","work_id":"4875c01b-d97f-4405-9cb1-383dbc6ff28f","year":2026},"citing_paper":{"arxiv_id":"2604.17484","last_updated":"2026-04-19T15:17:28Z","snapshot_observed_at":"2026-08-18T08:02:27.511452Z","submitted_at":"2026-04-19T15:17:28Z","title":"Matlas: A Semantic Search Engine for Mathematics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T05:32:30.216388Z"},"links":{"cited_paper":"/paper/2602.24173","citing_paper":"/paper/2604.17484"},"observation_digest":"sha256:db71f403580ecb511996de81a965f34bfb084771a75c92fd27edda887a9c24bd","observation_id":"6390744e-bf5f-4833-b8f9-ae9a27e484e0","resolution":{"observed_at":"2026-06-23T04:13:44.884775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"cited_work":{"arxiv_id":"2602.24173","doi":"10.48550/arxiv.2602.24173","metadata_source":"pith","pith_arxiv_id":"2602.24173","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lemmabench: A live, research-level benchmark to evaluate LLM capabilities in mathematics.CoRR, abs/2602.24173","venue":"cs.AI","work_id":"4875c01b-d97f-4405-9cb1-383dbc6ff28f","year":2026},"citing_paper":{"arxiv_id":"2605.10379","last_updated":"2026-06-25T12:27:46Z","snapshot_observed_at":"2026-08-12T22:02:49.512509Z","submitted_at":"2026-05-11T11:23:36Z","title":"Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T04:46:50.177357Z"},"links":{"cited_paper":"/paper/2602.24173","citing_paper":"/paper/2605.10379"},"observation_digest":"sha256:aae42b256dbb3b49efa41c7220ed04884cb0a3e6b092616e3ea9c2f4d288a727","observation_id":"885b33b1-fbbf-463d-8208-520b4b720156","resolution":{"observed_at":"2026-06-23T04:13:44.884775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"cited_work":{"arxiv_id":"2602.24173","doi":"10.48550/arxiv.2602.24173","metadata_source":"pith","pith_arxiv_id":"2602.24173","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lemmabench: A live, research-level benchmark to evaluate LLM capabilities in mathematics.CoRR, abs/2602.24173","venue":"cs.AI","work_id":"4875c01b-d97f-4405-9cb1-383dbc6ff28f","year":2026},"citing_paper":{"arxiv_id":"2605.10379","last_updated":"2026-06-25T12:27:46Z","snapshot_observed_at":"2026-08-12T22:02:49.512509Z","submitted_at":"2026-05-11T11:23:36Z","title":"Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T22:38:26.111517Z"},"links":{"cited_paper":"/paper/2602.24173","citing_paper":"/paper/2605.10379"},"observation_digest":"sha256:4c0d1a9c193c93ce847069079c1697ed12a201059ab89daae43b1595af7f4084","observation_id":"bfbab266-10e3-4576-9ce2-eaa731f6d5b0","resolution":{"observed_at":"2026-06-30T22:45:06.686133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.24173","snapshot_observed_at":"2026-08-01T18:16:48.945820Z","title":"Peyronnet, F","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17388","last_updated":"2026-07-19T19:22:40Z","snapshot_observed_at":"2026-08-19T00:15:32.407118Z","submitted_at":"2026-07-19T19:22:40Z","title":"Mathematical Discovery in the Wild: AI-Guided Proofs in Banach Space Theory","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T18:16:48.945820Z"},"links":{"cited_paper":"/paper/2602.24173","citing_paper":"/paper/2607.17388"},"observation_digest":"sha256:b06bea85d79038555742826db01c5601845732ec6eede3d9a644a59016d5b8ac","observation_id":"2bdf5c23-3566-46c9-9948-3e184d546ea8","resolution":{"observed_at":"2026-08-01T18:16:48.945820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.24173","snapshot_observed_at":"2026-08-11T15:30:26.831491Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics.arXiv preprint arXiv:2602.24173, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09538","last_updated":"2026-08-13T16:11:12Z","snapshot_observed_at":"2026-08-19T01:22:14.174611Z","submitted_at":"2026-08-10T12:36:16Z","title":"TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T15:30:26.831491Z"},"links":{"cited_paper":"/paper/2602.24173","citing_paper":"/paper/2608.09538"},"observation_digest":"sha256:e3f12e86c1810c22e1bfd651dbec986af179508e97e4b8619535c0dac3c8e0f8","observation_id":"09bfc06c-4615-4380-9c3b-14c7f4713fad","resolution":{"observed_at":"2026-08-11T15:30:26.831491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.24173","snapshot_observed_at":"2026-08-14T04:18:57.472922Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics.arXiv preprint arXiv:2602.24173, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.09538","last_updated":"2026-08-13T16:11:12Z","snapshot_observed_at":"2026-08-19T01:22:14.174611Z","submitted_at":"2026-08-10T12:36:16Z","title":"TCS-BENCH: Benchmarking State-of-the-Art Generative AI Theoretical Computer Science Research Ability","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:18:57.472922Z"},"links":{"cited_paper":"/paper/2602.24173","citing_paper":"/paper/2608.09538"},"observation_digest":"sha256:60be73fb5a167912d8ce815c870646c8b440b5c5166af84a036175b3dee8c1d8","observation_id":"5bfab0a4-9441-483f-8d3e-91a279737295","resolution":{"observed_at":"2026-08-14T04:18:57.472922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.24173/citation-record","integrity":"/paper/2602.24173/integrity","json":"/paper/2602.24173/citation-record.json","paper":"/paper/2602.24173"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:55.148361Z","title":"First proof","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.148361Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:f1674a1c8e1996a434c31a1a64df280f2eb31e4841e313f06b85f502839b4c1b","observation_id":"b4a44422-80b4-49ec-9128-de16d7991e5a","resolution":{"observed_at":"2026-08-02T20:05:55.148361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:55.615415Z","title":"Fel’s conjecture on syzygies of numerical semigroups.arXiv preprint arXiv:2602.03716,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.615415Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:dd91fa25a47fc2bbf94af6e395ca452f7bbc76003bfc68dd7e5041fd48c3f7d4","observation_id":"e302ccb0-f7e8-4004-967b-440bdb69e627","resolution":{"observed_at":"2026-08-02T20:05:55.615415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T20:05:55.728815Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.728815Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:fa04966e5256afbdf77ea194e1aecbbfe06810bbee6831651ad7b54d45811a0e","observation_id":"8ae5b453-b8a4-4110-bdcf-2ee28a0d2051","resolution":{"observed_at":"2026-08-02T20:05:55.728815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.03065","last_updated":"2025-09-03T06:50:47Z","snapshot_observed_at":"2026-08-12T21:59:41.882248Z","submitted_at":"2025-09-03T06:50:47Z","title":"Mathematical research with GPT-5: a Malliavin-Stein experiment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.03065","snapshot_observed_at":"2026-08-02T20:05:55.919446Z","title":"Mathematical research with gpt-5: a malliavin-stein experiment.arXiv preprint arXiv:2509.03065,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.919446Z"},"links":{"cited_paper":"/paper/2509.03065","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:22b5768c0e96251b4d39e43f02998361e52d1f7712c2aa48a119eb73cd976f3e","observation_id":"5cb223fe-f231-4995-872c-325d810d418e","resolution":{"observed_at":"2026-08-02T20:05:55.919446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:56.031583Z","title":"Project aletheia: Verifier-guided distillation of back- tracking for small language models.arXiv preprint arXiv:2601.14290,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.031583Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:d750d13f89ed539be1d478cf8069af41c9853bdb82c696754a7e3da15134d6f5","observation_id":"96b6abe5-5624-4b03-9b09-ca2fc3f0c8e9","resolution":{"observed_at":"2026-08-02T20:05:56.031583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:56.105644Z","title":"Semi-autonomous mathematics discovery with gemini: A case study on the erd\\h {o} s problems.arXiv preprint arXiv:2601.22401,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.105644Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:f4424acc5cb8c634ef59bc8165aa7accb6ff6851dc4cc524c7532722b2f3b5a5","observation_id":"2cc79098-c4a3-4ac1-86f3-63d55d613da1","resolution":{"observed_at":"2026-08-02T20:05:56.105644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-16T19:47:24.627230Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-02T20:05:56.217637Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.217637Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:bd26811c2c49dab1b0a21dfeab09c02fdbaabc0d15a0dd17b62b89fb7ad1ae31","observation_id":"8dd39d68-61f9-42c5-a67e-6b7a1480586d","resolution":{"observed_at":"2026-08-02T20:05:56.217637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-02T20:05:56.402050Z","title":"Daya Guo, Dejian Yang, Haowei Zhang, Junxiao Song, Ruoyu Zhang, Runxin Xu, Qihao Zhu, Shirong Ma, Peiyi Wang, Xiao Bi, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.402050Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:21cf66cbda6c219807c051ecbee00ce84e88a2b124b54a49f2d24e575588c94b","observation_id":"32b11f53-8652-454d-89ae-f51e74600799","resolution":{"observed_at":"2026-08-02T20:05:56.402050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-08-21T04:25:41.592030Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-02T20:05:56.471045Z","title":"Measuring mathematical problem solving with the math dataset.arXiv preprint arXiv:2103.03874,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.471045Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:80ca730da8230c8dbe7528091e622873e9e4cff0ae6c6f0cf2bdafcb8b902173","observation_id":"4df45a2d-1699-4b58-90ae-65099674c7b2","resolution":{"observed_at":"2026-08-02T20:05:56.471045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:56.544138Z","title":"Gemini 2.5 pro capable of winning gold at imo 2025.arXiv preprint arXiv:2507.15855,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.544138Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:89694ecc4e7c01f35e5f2daf43459cadbcec9c8b0b6cf433bf70ac268204844e","observation_id":"463fff06-97bf-4fc4-8513-52619fd05d02","resolution":{"observed_at":"2026-08-02T20:05:56.544138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:56.621707Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.621707Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:582e33f55d5b4a85d9fc08da0fc91ac0fdf939b9ee7a1263ce0f046b5d150066","observation_id":"9e9d4597-38d2-4e48-b861-593460e336d3","resolution":{"observed_at":"2026-08-02T20:05:56.621707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04295","last_updated":"2023-12-05T08:38:01Z","snapshot_observed_at":"2026-08-19T14:55:35.445200Z","submitted_at":"2023-09-08T12:34:28Z","title":"FIMO: A Challenge Formal Dataset for Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04295","snapshot_observed_at":"2026-08-02T20:05:56.734724Z","title":"Fimo: A challenge formal dataset for automated theorem proving.arXiv preprint arXiv:2309.04295,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.734724Z"},"links":{"cited_paper":"/paper/2309.04295","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:d0927281ffbebb35d8e3fb4140a73d192c86af1a8599edd9e30e52fb2af8533e","observation_id":"8222b21f-bb37-4562-80e6-bb10c20254ca","resolution":{"observed_at":"2026-08-02T20:05:56.734724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.01400","last_updated":"2026-05-07T06:57:24Z","snapshot_observed_at":"2026-08-04T20:04:02.250085Z","submitted_at":"2026-01-04T06:40:25Z","title":"EternalMath: A Living Benchmark of Frontier Mathematics that Evolves with Human Discovery","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.01400","snapshot_observed_at":"2026-08-02T20:05:56.850393Z","title":"Eternalmath: A living benchmark of frontier mathematics that evolves with human discovery.arXiv preprint arXiv:2601.01400,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.850393Z"},"links":{"cited_paper":"/paper/2601.01400","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:6d22bb2a32835a5c14474bbe665ccd202833205da16d4cf18f0d160418f79fc6","observation_id":"d8b06253-5a78-4153-b850-e996b538acd9","resolution":{"observed_at":"2026-08-02T20:05:56.850393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07957","last_updated":"2024-07-09T19:28:30Z","snapshot_observed_at":"2026-08-16T14:52:52.444645Z","submitted_at":"2023-10-12T00:50:24Z","title":"A New Approach Towards Autoformalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07957","snapshot_observed_at":"2026-08-02T20:05:56.925031Z","title":"Nilay Patel, Rahul Saha, and Jeffrey Flanigan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.925031Z"},"links":{"cited_paper":"/paper/2310.07957","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:557ea5f9e25ca52c0b268cbd4bab898cb7b845f0427b046005e26fe85a2d2534","observation_id":"8c299cee-ab77-4d19-ba3b-1aeaa3a436e9","resolution":{"observed_at":"2026-08-02T20:05:56.925031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10910","last_updated":"2025-06-12T17:22:37Z","snapshot_observed_at":"2026-08-08T22:49:29.831091Z","submitted_at":"2025-06-12T17:22:37Z","title":"Magistral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10910","snapshot_observed_at":"2026-08-02T20:05:56.999962Z","title":"Magistral.arXiv preprint arXiv:2506.10910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.999962Z"},"links":{"cited_paper":"/paper/2506.10910","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:0660beb60cda89a0801f1036ddde13537c4fba7e0e84cfcfe07c060c781d0280","observation_id":"44806c9e-e9ac-4a7b-916d-e5f39cb499c4","resolution":{"observed_at":"2026-08-02T20:05:56.999962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.082986Z","title":"Extremal descendant integrals on moduli spaces of curves: An inequality discov- ered and proved in collaboration with ai.arXiv preprint arXiv:2512.14575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.082986Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:33bbab6dddc33a3a3b96f771cd8aeb5a8135eeff0311aad8f71b87f3cdb0b3f9","observation_id":"420d03a2-9d74-441d-a403-17f7909c3de9","resolution":{"observed_at":"2026-08-02T20:05:57.082986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.153967Z","title":"Resolution of erd \\h {o} s problem# 728: a writeup of aristotle’s lean proof.arXiv preprint arXiv:2601.07421,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.153967Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:54aacd8d8fae6d0dbc8454afb6d916a1f4ce3566fb2fbe6913c678e6a2aa31ca","observation_id":"0e6a5a56-523d-4b27-ab0d-e3d05e2dcf9b","resolution":{"observed_at":"2026-08-02T20:05:57.153967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21380","last_updated":"2026-04-12T10:37:12Z","snapshot_observed_at":"2026-08-14T15:42:28.805307Z","submitted_at":"2025-03-27T11:20:17Z","title":"Challenging the Boundaries of Reasoning: An Olympiad-Level Math Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21380","snapshot_observed_at":"2026-08-02T20:05:57.230480Z","title":"Challenging the boundaries of reasoning: An olympiad-level math benchmark for large language models.arXiv preprint arXiv:2503.21380,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.230480Z"},"links":{"cited_paper":"/paper/2503.21380","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:84a7f148affde429c9ba26c8faeb067645f533a67459b60783a4b7623cf25166","observation_id":"d0843425-eb41-4a5c-8872-974e20d21a22","resolution":{"observed_at":"2026-08-02T20:05:57.230480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.01346","last_updated":"2025-10-10T20:12:14Z","snapshot_observed_at":"2026-08-20T12:27:32.948068Z","submitted_at":"2025-10-01T18:21:13Z","title":"Aristotle: IMO-level Automated Theorem Proving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.01346","snapshot_observed_at":"2026-08-02T20:05:57.347754Z","title":"George Tsoukalas, Jasper Lee, John Jennings, Jimmy Xin, Michelle Ding, Michael Jennings, Ami- tayush Thakur, and Swarat Chaudhuri","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.347754Z"},"links":{"cited_paper":"/paper/2510.01346","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:4c5a892b69a900545376d1bb95e40524c20c8d9b67b5735de4b05b141441da63","observation_id":"2cb2768c-e514-4e27-9729-23ed8f151c19","resolution":{"observed_at":"2026-08-02T20:05:57.347754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.389635Z","title":"Uniqueness of the canonical reciprocal cost.arXiv preprint arXiv:2602.05753,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.389635Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:25fa97b9de6f81996f5dfe070c57f526b56c5e6f8e1a106645bbe7baac594752","observation_id":"fe28aa3a-fe9e-4d03-8dbe-4ebbf99dc756","resolution":{"observed_at":"2026-08-02T20:05:57.389635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18824","last_updated":"2024-04-29T16:05:36Z","snapshot_observed_at":"2026-08-19T12:22:52.652329Z","submitted_at":"2024-04-29T16:05:36Z","title":"Benchmarking Benchmark Leakage in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18824","snapshot_observed_at":"2026-08-02T20:05:57.424441Z","title":"Benchmarking benchmark leakage in large language models.arXiv preprint arXiv:2404.18824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.424441Z"},"links":{"cited_paper":"/paper/2404.18824","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:e914e3efaade02a169d16ddd19e7e4b728825213df767df1c8cd5a89dd18dba7","observation_id":"d9ccfd0b-1ad1-45a5-8e21-17c30ff436fd","resolution":{"observed_at":"2026-08-02T20:05:57.424441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.481014Z","title":"Realmath: A continuous benchmark for evaluating language models on research-level mathematics.arXiv preprint arXiv:2505.12575,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.481014Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:af92dafe6b52a40e2d011386e2f779cd3eb8c2742582ae9560c52934062f05f3","observation_id":"5eac8e4e-5ca0-47f2-8189-2041801c181c","resolution":{"observed_at":"2026-08-02T20:05:57.481014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00110","last_updated":"2022-02-28T06:03:23Z","snapshot_observed_at":"2026-08-20T12:19:00.247030Z","submitted_at":"2021-08-31T23:21:12Z","title":"MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00110","snapshot_observed_at":"2026-08-02T20:05:57.525719Z","title":"Minif2f: a cross-system benchmark for formal olympiad-level mathematics.arXiv preprint arXiv:2109.00110,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.525719Z"},"links":{"cited_paper":"/paper/2109.00110","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:4b0599248f6ecf600b68a587d209780fd397074416bc0e460359076938a43ec7","observation_id":"cb11242e-4088-4b52-95ec-85022a328c70","resolution":{"observed_at":"2026-08-02T20:05:57.525719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.581966Z","title":"In natural language, one can cite for instance GSM8k Cobbe et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.581966Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:0d9b8e4569885ae16899df9caa04e7df441dca6c6e46d3fc5898fa44d055c5c5","observation_id":"62f2f82f-4e04-4cea-ab55-ced4f98ea4b1","resolution":{"observed_at":"2026-08-02T20:05:57.581966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.652609Z","title":"These benchmarks were often used to evaluate LLM capa- bilities to the point of being the staple of evaluation for mathematical abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.652609Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:63220d3829e24020629696c0e25266f78b02a480b4937638b5b33e62351c2d12","observation_id":"273c339d-f90d-4ed3-804a-2eb088a8f409","resolution":{"observed_at":"2026-08-02T20:05:57.652609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.696600Z","title":"A very large dataset of competition problems was created by the Numina project LI et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.696600Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:a43dcf53271e8bfa85b93867dd5daa6d71a9fa0dd3aebbcd1e923801fc4d8fdd","observation_id":"cf8406b6-1513-4047-8231-f648600ab3d5","resolution":{"observed_at":"2026-08-02T20:05:57.696600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.740526Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.740526Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:48f7002d62ec7ae8fa141777190ddbd9d6696652c531027d84ed15a5894fcd37","observation_id":"6b16f78f-ae04-4493-a4d2-ee2ff5932a2f","resolution":{"observed_at":"2026-08-02T20:05:57.740526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:57.763677Z","title":"It is worth mentioning that other benchmarks exist in formal language, also focusing on middle school to undergraduate level problems such as miniF2F Zheng et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:57.763677Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:ceee3ec6d2d9de184c622de995c2c392bc1b9a1db64c45b91980936a6d9a2a6a","observation_id":"bfb152b7-01a2-4982-a54b-3e17cb0c6bb4","resolution":{"observed_at":"2026-08-02T20:05:57.763677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.05893","last_updated":"2026-06-30T14:37:55Z","snapshot_observed_at":"2026-08-15T17:48:33.008063Z","submitted_at":"2026-02-05T17:12:20Z","title":"Objective-Function Free Multi-Objective Optimization: Rate of Convergence and Performance of an Adagrad-like algorithm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.05893","snapshot_observed_at":"2026-08-02T20:05:55.775362Z","title":"Objective-function free multi- objective optimization: Rate of convergence and performance of an adagrad-like algorithm.arXiv preprint arXiv:2602.05893,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.775362Z"},"links":{"cited_paper":"/paper/2602.05893","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:451ed1cf8ae66711535a6f38734e605506773fa00669326b8dfe4eb9cbe7541f","observation_id":"9c804fa9-6c49-48b6-acbf-b8220346b0f3","resolution":{"observed_at":"2026-08-02T20:05:55.775362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:56.808051Z","title":"Numina-lean-agent: An open and general agentic reasoning system for formal mathematics.arXiv preprint arXiv:2601.14027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:56.808051Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:94b9bd06cc147128d6f923448b5a6353e02783c9dd8e02b4f261928dcab9e3ac","observation_id":"b4d33a85-59b1-4d0d-8c67-c684348360f9","resolution":{"observed_at":"2026-08-02T20:05:56.808051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13319","last_updated":"2019-05-30T21:28:12Z","snapshot_observed_at":"2026-08-16T02:16:32.508169Z","submitted_at":"2019-05-30T21:28:12Z","title":"MathQA: Towards Interpretable Math Word Problem Solving with Operation-Based Formalisms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13319","snapshot_observed_at":"2026-08-02T20:05:55.301028Z","title":"Mathqa: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.301028Z"},"links":{"cited_paper":"/paper/1905.13319","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:3fcfd263ab83b24f977d6006ddb2d91f0b9f5291fffca46ba0072499e6b858df","observation_id":"f77057cf-3be0-4168-88c8-5e257064ae1c","resolution":{"observed_at":"2026-08-02T20:05:55.301028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00566","last_updated":"2024-11-01T13:23:58Z","snapshot_observed_at":"2026-08-19T19:13:51.817977Z","submitted_at":"2024-11-01T13:23:58Z","title":"PatternBoost: Constructions in Mathematics with a Little Help from AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00566","snapshot_observed_at":"2026-08-02T20:05:55.466316Z","title":"Patternboost: Constructions in mathematics with a little help from ai.arXiv preprint arXiv:2411.00566,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.466316Z"},"links":{"cited_paper":"/paper/2411.00566","citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:75bec2fe3e57ff71ffbdb3ff68d568b0008c2ac279315c1585faa7f790336f9f","observation_id":"48f178d5-08d6-4a96-8228-bbc78a47f290","resolution":{"observed_at":"2026-08-02T20:05:55.466316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T20:05:55.234189Z","title":"Semantic search over 9 million mathematical theorems.arXiv preprint arXiv:2602.05216,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T20:05:55.234189Z"},"links":{"citing_paper":"/paper/2602.24173"},"observation_digest":"sha256:2d2648548886d396bb58717223f4ed8bbb7e89d102abca08cce0d07438ba6d06","observation_id":"4fc9ff95-a058-4bab-8b31-82b8715a7c66","resolution":{"observed_at":"2026-08-02T20:05:55.234189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.24173","last_updated":"2026-06-22T14:14:54Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T15:21:27.324635Z","submitted_at":"2026-02-27T16:52:52Z","title":"LemmaBench: A Live, Research-Level Benchmark to Evaluate LLM Capabilities in Mathematics"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 6 inbound Pith citation observations for arXiv:2602.24173."}