{"as_of":"2026-08-18T20:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f6ec265a85cb4ffa3b7d08d4b0c144d254ec4d0d98c98d19fae2e58be5b438b","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:18:04.034797Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T05:44:33.099337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"cited_work":{"arxiv_id":"2602.20629","doi":"10.48550/arxiv.2602.20629","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Open MIND","work_id":"837f9682-fedd-4c47-9224-5137684fab79","year":2026},"citing_paper":{"arxiv_id":"2605.10379","last_updated":"2026-06-25T12:27:46Z","snapshot_observed_at":"2026-08-12T22:02:49.512509Z","submitted_at":"2026-05-11T11:23:36Z","title":"Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-12T04:46:50.177357Z"},"links":{"cited_paper":"/paper/2602.20629","citing_paper":"/paper/2605.10379"},"observation_digest":"sha256:a34a5b0af6a4ee068e7d80daa62d7410ab69d68b02e178bcbb91b55308ea78cd","observation_id":"492f8f4c-38d1-4d7c-a3ff-bb7b2e68b861","resolution":{"observed_at":"2026-07-07T03:18:53.720593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:59.101321+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:59.101321+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"cited_work":{"arxiv_id":"2602.20629","doi":"10.48550/arxiv.2602.20629","metadata_source":"arxiv_reference","pith_arxiv_id":"2602.20629","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Open MIND","work_id":"837f9682-fedd-4c47-9224-5137684fab79","year":2026},"citing_paper":{"arxiv_id":"2605.10379","last_updated":"2026-06-25T12:27:46Z","snapshot_observed_at":"2026-08-12T22:02:49.512509Z","submitted_at":"2026-05-11T11:23:36Z","title":"Not All Proofs Are Equal: Evaluating LLM Proof Quality Beyond Correctness","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T22:38:26.111517Z"},"links":{"cited_paper":"/paper/2602.20629","citing_paper":"/paper/2605.10379"},"observation_digest":"sha256:e49fe61e4d912562291a728073665af0ee121975bbf9ad92998f07edafbbb026","observation_id":"680b7fbe-ccce-4dd1-8ee6-4b057db4ffa4","resolution":{"observed_at":"2026-07-07T03:18:53.720593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-13T23:49:59.101321+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T23:49:59.101321+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.20629","snapshot_observed_at":"2026-07-12T05:44:33.099337Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.02972","last_updated":"2026-07-03T05:28:43Z","snapshot_observed_at":"2026-08-15T23:11:47.121552Z","submitted_at":"2026-07-03T05:28:43Z","title":"A Scalable Approach to Evaluating Moral Sensitivity in LLMs","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-07-12T05:44:33.099337Z"},"links":{"cited_paper":"/paper/2602.20629","citing_paper":"/paper/2607.02972"},"observation_digest":"sha256:35661c6d05ca84884e44c3c3cfcb0ba15864793931955146d4d7b90fc58ebfbe","observation_id":"18da3e37-f0bd-495f-b826-7288dbc0102c","resolution":{"observed_at":"2026-07-12T05:44:33.099337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.20629/citation-record","integrity":"/paper/2602.20629/integrity","json":"/paper/2602.20629/citation-record.json","paper":"/paper/2602.20629"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.028080Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.028080Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:3259a5d4e917126953ef3c74bb2fa01009e1bb7a7a8caa0794b52742bd6fdaf2","observation_id":"823e46f8-6b12-4c13-8a04-f35076b474e2","resolution":{"observed_at":"2026-08-02T21:18:00.028080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.095450Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.095450Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:7babb533a2303d9c574bf8274b7e463094c8235cbe3d2d14fa73c0a2e9c5c1e3","observation_id":"71b434c8-f418-448f-a43d-cab9ca6efe4c","resolution":{"observed_at":"2026-08-02T21:18:00.095450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.156429Z","title":"W., Keutzer, K., and Gholami, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.156429Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:74d850f64abc7d6bd6bcc53168af04b8f2960809ba2210981b02b30901500e74","observation_id":"a214a5ff-e6b1-4aae-9b70-6a1422b6c415","resolution":{"observed_at":"2026-08-02T21:18:00.156429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.254788Z","title":"Analysis: An Introduction","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.254788Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:e0e5deace23e341da56ba45c3432ee419f575e5c2d8627ee55ce2fea692acbdc","observation_id":"4038bffb-dc9d-4c3e-9f82-90084f56cd57","resolution":{"observed_at":"2026-08-02T21:18:00.254788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.330783Z","title":"and Zastawniak, T","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.330783Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:c267cf6e31e8d2298f7db77d9a3591df0a3f2b5306a610aaee54ef382751a335","observation_id":"d7b984f8-24e4-4a0d-a97e-d191e2fdd598","resolution":{"observed_at":"2026-08-02T21:18:00.330783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.400505Z","title":"Stop summation: Min-form credit assignment is all process reward model needs for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.400505Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:91013e790cc86f0ce58942907c5e915de0cccf362e7299c7345e2df0b82fea19","observation_id":"1ad1334e-4ff0-48fb-a4c4-b12cf92f7cb6","resolution":{"observed_at":"2026-08-02T21:18:00.400505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.476118Z","title":"U-MATH : A university-level benchmark for evaluating mathematical skills in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.476118Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:2d23f5739380b5853a47638dad581f24c30c9d40d9ec84829c8a3b7c1f4a43ac","observation_id":"a8748a5b-1243-4c3b-80d3-cea3d1d60de0","resolution":{"observed_at":"2026-08-02T21:18:00.476118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-02T21:18:00.574531Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.574531Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:2e20bcfcf2b0bee2657db6cf6403ac2cb52894bd69cd3f7c481bd72fca7da07c","observation_id":"edb0e50d-7403-446c-8d1a-8a713b02f0aa","resolution":{"observed_at":"2026-08-02T21:18:00.574531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.675070Z","title":null,"venue":null,"work_id":null,"year":1961},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.675070Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:c71fff21d8a89db14a85689d23f786756e8cb82b32901374eed4252f330f7406","observation_id":"f4cd5d79-af42-448c-802d-ec619a407558","resolution":{"observed_at":"2026-08-02T21:18:00.675070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.752228Z","title":"The Lean theorem prover (system description)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.752228Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:826d86d3456f14f7bf52ed73a24584d41921b34b02645588c61e9207047d0fbd","observation_id":"e848e829-fd52-4441-883a-00bcd7e234b8","resolution":{"observed_at":"2026-08-02T21:18:00.752228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.859238Z","title":"D., Nikolova, K., Georgiev, N., Kalinkova, V., and Ismoldayev, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.859238Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:818c76978dc5f6209a872e2d99e7efcb926704f44755b39c65fdc2c57163abab","observation_id":"7443fbf5-5637-40ca-a343-a8dcf864bbb7","resolution":{"observed_at":"2026-08-02T21:18:00.859238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:00.969443Z","title":"Graph Theory, volume 173 of Graduate Texts in Mathematics","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:00.969443Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:f8bb6ee27f85c72d9ba74b342f5ed31a51b7c1a4a28fd884181293e6700fbfc7","observation_id":"b05a3079-dbfe-451a-822f-2fdf7a2807fd","resolution":{"observed_at":"2026-08-02T21:18:00.969443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.068658Z","title":null,"venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.068658Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:0ae389c2ca7753e7816c249f966b3f9a920f1fa49b57ac64796fe33309303434","observation_id":"8df2e43a-81ed-4f51-86c1-8d7ca34319c7","resolution":{"observed_at":"2026-08-02T21:18:01.068658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.136138Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.136138Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:d882b5d38e3028f391adcc7810c5ba3011a2812bd47ec61aa0e4931dd3d22cef","observation_id":"b086e352-bd30-462a-82bf-04eb6f206894","resolution":{"observed_at":"2026-08-02T21:18:01.136138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.210349Z","title":"Algorithms","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.210349Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:6d31238b80d09cbd8bf53b8bc04a24c1565eb9d9b6ef9570cd0e000a9872e06d","observation_id":"dd05b09b-89ea-4dc8-aef8-c0a5580faefc","resolution":{"observed_at":"2026-08-02T21:18:01.210349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09170","last_updated":"2024-06-13T14:31:19Z","snapshot_observed_at":"2026-08-16T13:43:19.273166Z","submitted_at":"2024-06-13T14:31:19Z","title":"Test of Time: A Benchmark for Evaluating LLMs on Temporal Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09170","snapshot_observed_at":"2026-08-02T21:18:01.280536Z","title":"Test of time: A benchmark for evaluating LLMs on temporal reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.280536Z"},"links":{"cited_paper":"/paper/2406.09170","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:2055a8bf41271a1cee573e7cf7af0645010079ac85ab62a87974c82d9550205e","observation_id":"526f11c0-2670-4579-98da-bf6a8271bf3f","resolution":{"observed_at":"2026-08-02T21:18:01.280536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04872","last_updated":"2025-12-23T02:23:47Z","snapshot_observed_at":"2026-08-13T13:45:44.430193Z","submitted_at":"2024-11-07T17:07:35Z","title":"FrontierMath: A Benchmark for Evaluating Advanced Mathematical Reasoning in AI","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04872","snapshot_observed_at":"2026-08-02T21:18:01.374648Z","title":"F., Denain, J.-S., Ho, A., Santos, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.374648Z"},"links":{"cited_paper":"/paper/2411.04872","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:9ddda2e9fcd862ad78d9c9ebb782c6ac53009e4cdfa5071ddb534aedaf2e8c8a","observation_id":"6e6d869f-eb4c-4f57-9385-cd585674287b","resolution":{"observed_at":"2026-08-02T21:18:01.374648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.432635Z","title":"L., Knuth, D","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.432635Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:c3a2d3468403f04837b176b035330c04fe61c6612c47f1d37e60e37dd47883b8","observation_id":"d4d0de98-7073-42af-9e63-3e2584bff874","resolution":{"observed_at":"2026-08-02T21:18:01.432635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.526953Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.526953Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:58df06243fe6f8945c058b6a3836fd49a2e4f75898d5c9ced5b66c0280b7558d","observation_id":"adb61b36-c9fc-4952-a7b5-d5f6a1c73651","resolution":{"observed_at":"2026-08-02T21:18:01.526953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.600073Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.600073Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:ae21a3d6ac7b9bdbb17f8b02a20264c3efd7011074175479d189ff7d2d57e743","observation_id":"bb9a1ae6-b37b-49df-a2e1-c7996c32c7a5","resolution":{"observed_at":"2026-08-02T21:18:01.600073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.646630Z","title":"A rosetta stone for AI benchmarks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.646630Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:58e20896c963209e56d22a419c3634e6a60810df1fea2f46b89758a1b25579a9","observation_id":"896db4d2-7183-4b37-a7b4-ee5b1200ce00","resolution":{"observed_at":"2026-08-02T21:18:01.646630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.712711Z","title":"and Rosen, M","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.712711Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:8588f77b7d1a0ad6b8f43b116439b365bb354489baf3f62011e2bff1089cc7c4","observation_id":"6228f483-e8f7-43f5-8fc1-003298e782ba","resolution":{"observed_at":"2026-08-02T21:18:01.712711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.801773Z","title":"Z., Sahai, S., and Leong, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.801773Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:2653c54b1ad59310162d74129fd37ac797aea9a56b428ce5e75390b7cb7ee5b9","observation_id":"878f1a1f-ee9a-4f1f-a2cd-ca9b894db637","resolution":{"observed_at":"2026-08-02T21:18:01.801773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.862136Z","title":"Probability Theory: A Comprehensive Course","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.862136Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:7aec0cfd1c672cfcd4179ebdc559952e94fb38b3031c569f8740917119a73524","observation_id":"fd6f9f29-9663-40f1-abd2-5f4527a2ecb9","resolution":{"observed_at":"2026-08-02T21:18:01.862136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:01.930387Z","title":"No free labels: Limitations of LLM -as-a-judge without human grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:01.930387Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:71031bf100d4a5607b2887ab0ce25d655a1489767d53add1bd7b8b4f767b8eff","observation_id":"17c9f268-3cb3-46e8-9924-38777a67f496","resolution":{"observed_at":"2026-08-02T21:18:01.930387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.025323Z","title":"Grading scale impact on LLM -as-a-judge: Human- LLM alignment is highest on 0-5 grading scale","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.025323Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:f4045fdccb57161d8e922bde31f8544cde6a0943da75fa9a04d7f85373452cef","observation_id":"586f2b6c-f143-4e00-af12-5de1aae16d3d","resolution":{"observed_at":"2026-08-02T21:18:02.025323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.092659Z","title":"S., Zhang, H., Zhuang, V., Zaharia, M., and Min, S","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.092659Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:7035003db9b388f13217ffb20a8df29779fe0a9a9d60b22b6a4b8999d32ec801","observation_id":"c0574767-f252-41f1-b5e5-dae9cccdeb21","resolution":{"observed_at":"2026-08-02T21:18:02.092659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01995","last_updated":"2025-04-10T20:43:23Z","snapshot_observed_at":"2026-08-16T14:24:50.910862Z","submitted_at":"2025-04-01T00:10:10Z","title":"Brains vs. Bytes: Evaluating LLM Proficiency in Olympiad Mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01995","snapshot_observed_at":"2026-08-02T21:18:02.170342Z","title":"Brains vs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.170342Z"},"links":{"cited_paper":"/paper/2504.01995","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:d5caf023c526daa02721f30426ae73842dccabf865c2837baa4b81096175238c","observation_id":"2de0f02c-fc26-472a-9da4-f3ae07e2778d","resolution":{"observed_at":"2026-08-02T21:18:02.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.267945Z","title":"RefGrader : Automated grading of mathematical competition proofs using agentic workflows","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.267945Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:1751b4472aad28b8fe00ef7a8878c59397aa4ef80e8f36dd8a16b82448733a6e","observation_id":"32010958-c6f4-4d70-9020-d7a2fee0095f","resolution":{"observed_at":"2026-08-02T21:18:02.267945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.351440Z","title":"Scaling generative verifiers for natural language mathematical proof verification and selection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.351440Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:301e2d878e5abc007907e5be4005861597c22fd9fc5d8169159a1c1e99901ce7","observation_id":"5e484d45-2bac-4484-972d-fdcf928d5721","resolution":{"observed_at":"2026-08-02T21:18:02.351440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.458595Z","title":"and Ne s et r il, J","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.458595Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:8d0c512c872fda385db7abfc354c9a3daf90d4ef0850325a9beddf2eb0bfab25","observation_id":"ac8d2d33-3ecd-4f73-8cfb-37ddf7485811","resolution":{"observed_at":"2026-08-02T21:18:02.458595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.528262Z","title":"and Raghavan, P","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.528262Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:6a0d62a36fdf352b504828f82ec17baeeecb14cb72f6c961abf53d1d25fb32a5","observation_id":"c7f4a3a1-f9a2-46ee-b4ea-88292f2d1f25","resolution":{"observed_at":"2026-08-02T21:18:02.528262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.597956Z","title":"S., and Montgomery, H","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.597956Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:d0200b0fc3c4a384b96d5ce855a15d0aec90979f4b8bc6212f14416c628fcce4","observation_id":"08b015f0-5bdf-4e99-94ba-0b9b8f2794f6","resolution":{"observed_at":"2026-08-02T21:18:02.597956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21934","last_updated":"2025-09-04T19:36:32Z","snapshot_observed_at":"2026-08-16T12:46:09.609350Z","submitted_at":"2025-03-27T19:21:05Z","title":"Proof or Bluff? Evaluating LLMs on 2025 USA Math Olympiad","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21934","snapshot_observed_at":"2026-08-02T21:18:02.701570Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.701570Z"},"links":{"cited_paper":"/paper/2503.21934","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:acd02beee68fe6a9fb1c9e8a1a217fe8b4a5c141de4e0adad25bf8dedc396d29","observation_id":"0035540d-fb83-4987-bc0c-cb155b3a6f18","resolution":{"observed_at":"2026-08-02T21:18:02.701570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.769988Z","title":"BrokenMath : A benchmark for sycophancy in theorem proving with LLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.769988Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:ffe8da2b7ae5dd05e9fc59503521c8a4a1e9c37420197fbbbc006b85045a98b2","observation_id":"f35dc2e2-e4ea-4f4b-8f33-db5468070c85","resolution":{"observed_at":"2026-08-02T21:18:02.769988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.07795","last_updated":"2026-05-30T17:04:27Z","snapshot_observed_at":"2026-08-15T09:08:17.333981Z","submitted_at":"2025-12-08T18:26:58Z","title":"ReasonBENCH: Benchmarking the (In)Stability of LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.07795","snapshot_observed_at":"2026-08-02T21:18:02.833491Z","title":"ReasonBENCH : Benchmarking the (in)stability of LLM reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.833491Z"},"links":{"cited_paper":"/paper/2512.07795","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:0deda5376cf5b2e096822a3dff7d34b38241c4e6edd22a7317654bba522f8235","observation_id":"c4d4fa90-c084-4bdb-9bf1-af126d323a7d","resolution":{"observed_at":"2026-08-02T21:18:02.833491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.905609Z","title":"Yale-QEDBench : Code and dataset for quantifying the alignment gap in automated evaluation of university-level mathematical proofs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.905609Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:3aab0c5175a5c5e47d873b14d1e32d6fcb392f63ae3e85d4a781ed325801f0fe","observation_id":"b60c8a8d-2af9-4dc5-8ddc-dcdc603f59eb","resolution":{"observed_at":"2026-08-02T21:18:02.905609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:02.979503Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:02.979503Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:8430ac1ecef3492e9b1cdb0630fb1a8b501bb31c75e43ca2e391294ae345781f","observation_id":"d5ed46a8-b710-4928-b0ae-f517b72e0498","resolution":{"observed_at":"2026-08-02T21:18:02.979503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.26076","last_updated":"2026-07-09T16:12:00Z","snapshot_observed_at":"2026-08-17T22:12:15.229514Z","submitted_at":"2025-09-30T10:50:37Z","title":"IMProofBench: Benchmarking AI on Research-Level Mathematical Proof Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.26076","snapshot_observed_at":"2026-08-02T21:18:03.059645Z","title":"S., Sun, Z., Teichmann, J., Thomas, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.059645Z"},"links":{"cited_paper":"/paper/2509.26076","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:7c82c9c38abfe5514054fd4540b4a920e1cc725a92d754218e9848336425f442","observation_id":"1f8abaf7-22a3-46b4-8828-108f2c723af3","resolution":{"observed_at":"2026-08-02T21:18:03.059645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10839","last_updated":"2024-12-19T15:25:41Z","snapshot_observed_at":"2026-08-16T13:25:12.505729Z","submitted_at":"2024-08-20T13:34:17Z","title":"Benchmarking Large Language Models for Math Reasoning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10839","snapshot_observed_at":"2026-08-02T21:18:03.146717Z","title":"o zl \\\"u kl \\","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.146717Z"},"links":{"cited_paper":"/paper/2408.10839","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:7aa2f59c7f2fa3d9efef500c34c2c23e79abf5d3f8785b48bdf338f5719de524","observation_id":"913b81ff-ad3d-4393-9a90-73dccc64e506","resolution":{"observed_at":"2026-08-02T21:18:03.146717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06941","last_updated":"2025-11-20T00:19:24Z","snapshot_observed_at":"2026-08-09T21:19:24.140229Z","submitted_at":"2025-06-07T22:42:29Z","title":"The Illusion of Thinking: Understanding the Strengths and Limitations of Reasoning Models via the Lens of Problem Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06941","snapshot_observed_at":"2026-08-02T21:18:03.245527Z","title":"The illusion of thinking: Understanding the strengths and limitations of reasoning models via the lens of problem complexity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.245527Z"},"links":{"cited_paper":"/paper/2506.06941","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:05d828e2c5a875a9bea6af443e5110939b9c58f259d675d5a2b64265b526495a","observation_id":"fb9209c6-3750-4404-a047-bd86abebee1e","resolution":{"observed_at":"2026-08-02T21:18:03.245527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:03.340532Z","title":"A Computational Introduction to Number Theory and Algebra","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.340532Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:89c81819c671d76480e7012076d09cc97df5590bc44fffa3d9e9c1368af69ce7","observation_id":"7924858e-51e8-4dc8-809b-76288cd38f51","resolution":{"observed_at":"2026-08-02T21:18:03.340532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:03.418451Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.418451Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:67c6e4ce918161adcb48d52cb7ee952f355b1253b393697206cdc8901a6ceb14","observation_id":"b5eae475-91bd-4692-a2ef-b93c6307278c","resolution":{"observed_at":"2026-08-02T21:18:03.418451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:03.478809Z","title":"From calculation to adjudication: Examining LLM judges on mathematical reasoning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.478809Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:5aa6d415b2e41b76550331af48c489f42cd6770502248e6307f2a466865f4781","observation_id":"fd18ce12-afc2-48fc-9bab-6da92ae147aa","resolution":{"observed_at":"2026-08-02T21:18:03.478809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:03.593708Z","title":"Ordinary Differential Equations and Dynamical Systems, volume 140 of Graduate Studies in Mathematics","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.593708Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:49b00e1fbc7fc6002e7638549e338c45f5aca4f051e58757fe005e39094106db","observation_id":"a7b8f2ba-a924-4d1f-a9c4-594111c1ffc3","resolution":{"observed_at":"2026-08-02T21:18:03.593708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-08-02T21:18:03.669960Z","title":"S., Naidu, S., Hegde, C., LeCun, Y., Goldstein, T., Neiswanger, W., and Goldblum, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.669960Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:ec4115369e5c180f29540e9b1cb9e7d7ff662171c039562f37b38761b922aec2","observation_id":"97704c96-41b7-4f0b-9b25-644efea1b5dc","resolution":{"observed_at":"2026-08-02T21:18:03.669960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:03.731342Z","title":"D., Leng, C., and Liu, F","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.731342Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:bfdc75c19ec7c779ebd04820d321d5e4fe76a994d42675a02a275bddd005503c","observation_id":"7946e161-cc25-4a5b-885b-7f6d809d0f0d","resolution":{"observed_at":"2026-08-02T21:18:03.731342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-17T12:00:23.281116Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-02T21:18:03.784064Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.784064Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:6aace6823772fb751c92c69ae936540dcac3e558842b0626e9d29d28859a7308","observation_id":"0792537d-098d-437d-8ae2-b3128e394508","resolution":{"observed_at":"2026-08-02T21:18:03.784064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.08794","last_updated":"2026-06-11T04:21:36Z","snapshot_observed_at":"2026-08-17T18:32:55.983199Z","submitted_at":"2025-07-11T17:55:22Z","title":"One Token to Fool LLM-as-a-Judge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.08794","snapshot_observed_at":"2026-08-02T21:18:03.858801Z","title":"One token to fool LLM -as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.858801Z"},"links":{"cited_paper":"/paper/2507.08794","citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:8e979bb634292198f946c2d6bc9aac0ad859730b241558e5fdd38e1c66b9aea2","observation_id":"0ac07f8c-b302-4334-9815-8be635115515","resolution":{"observed_at":"2026-08-02T21:18:03.858801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:03.931054Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:03.931054Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:a8c7ee8fabcff532ccd3f7679df68f8cbf60f1407a82c2fa0c3c1db183a86a89","observation_id":"7870a2a1-3c16-4b57-8bb4-c1f57e856d61","resolution":{"observed_at":"2026-08-02T21:18:03.931054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:18:04.034797Z","title":"Unmasking reasoning processes: A process-aware benchmark for evaluating structural mathematical reasoning in LLMs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-02T21:18:04.034797Z"},"links":{"citing_paper":"/paper/2602.20629"},"observation_digest":"sha256:553413473fcf4ca54f01ac1b305572ee50011965c68526c3ed00671666c0faf4","observation_id":"bdb3bfc1-bea4-4fd5-80f9-6a8738c50063","resolution":{"observed_at":"2026-08-02T21:18:04.034797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.20629","last_updated":"2026-07-06T08:57:26Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T05:01:11.747853Z","submitted_at":"2026-02-24T07:23:28Z","title":"QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2602.20629."}