Pith. sign in

Paper Citation Record · LEDGER

Psychometric-Based Evaluation for Theorem Proving with Large Language Models

As of 24 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2502.00855.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.00855 v1

Coverage vector

measured 51 of 51 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T17:36:09.728402Z

measured 51 of 51 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

51 of 51 outbound references displayed

  • verified exact1
  • verified fuzzy11
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 46adc04e-6384-4ba7-8012-b5d099c8852a · outbound

This paper cites A Comprehensive Overview of Large Language Models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models A Comprehensive Overview of Large Language Models

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.570661Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.570661Z digest=sha256:efcabc565f851871e4c872076e1689c5bd379c1d8516a4d55ca5b4192560d115

Observation d09e761d-77e3-4767-b373-dd821fc42455 · outbound

This paper cites A Survey of Large Language Models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models A Survey of Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.575829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.575829Z digest=sha256:4ea46776b9b4a687b87cedc3d39371fbac005c83b7338e3438aa847c71d0f157

Observation 196b91ae-25b8-4233-9d40-4719144d5489 · outbound

This paper cites Formal Mathematical Reasoning: A New Frontier in AI.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Formal Mathematical Reasoning: A New Frontier in AI

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.579223Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.579223Z digest=sha256:468205b68eff178d69e7b22d9603a33741344ab42df10b30d6ceb9cb10b01d1d

Observation a792a89c-122f-401b-ac54-8d560c2bc5bc · outbound

This paper cites Large Language Models for Mathematical Reasoning: Progresses and Challenges.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Large Language Models for Mathematical Reasoning: Progresses and Challenges

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.582966Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.582966Z digest=sha256:f9feedbac20863fb9c882439345765add3fec0f428c82eb29ceba43133fa5938

Observation 216c546e-e74a-47a8-ad92-f6e0602a77da · outbound

This paper cites an unresolved cited work.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Unresolved cited work

Reference 5

Resolution
unresolved
raw_fallback, observed 2026-08-09T17:36:10.338408Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.586909Z digest=sha256:9669bb97ae37406d9bbafe00a400d008f8fa7e8b3584f2120033e74c7b23ddcc

Observation 724b3397-60c7-492f-8a31-f7ab8e55b027 · outbound

This paper cites LEGO-Prover: Neural Theorem Proving with Growing Libraries.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models LEGO-Prover: Neural Theorem Proving with Growing Libraries

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.590116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.590116Z digest=sha256:8794e4f3a13604998c0bf1688f637e11d2dea95fb4b548e5dca247e10a5b1b74

Observation aa175261-3913-4a31-b455-920faa242b10 · outbound

This paper cites Evaluating Mathematical Reasoning Beyond Accuracy.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Evaluating Mathematical Reasoning Beyond Accuracy

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.593630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.593630Z digest=sha256:fb77c7b1ac41fd5fa83024a30b310ab1ba53752f46658e45a700d351a1efe9db

Observation a96324a1-090c-460b-9c6f-6ba5004baa86 · outbound

This paper cites The lean 4 theorem prover and programming language.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models The lean 4 theorem prover and programming language

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.597364Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.597364Z digest=sha256:f28a5ef2574f843a5615763f2bc6627d1a6e7e4cb197f8a674fc54279883077d

Observation a0b5dd55-cb6d-4b01-8b33-2a281145c171 · outbound

This paper cites Isabelle: A generic theorem prover.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Isabelle: A generic theorem prover

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.600543Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.600543Z digest=sha256:4924926c8b3eac36ee9c058fc949867b85509572be14513861d2309db3c318c0

Observation 4719425c-dcbb-4594-b15b-5a0e8466dbe1 · outbound

This paper cites The coq proof assistant a tutorial.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models The coq proof assistant a tutorial

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.603515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.603515Z digest=sha256:44fc77e18f8e454e83bccaad7bc06dcc327b7bdeb8bbca1b77365894daf38469

Observation 9c63c7c0-c915-40f5-959a-5cab0960a528 · outbound

This paper cites Leandojo: Theorem proving with retrieval-augmented language models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Leandojo: Theorem proving with retrieval-augmented language models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.606594Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.606594Z digest=sha256:78494b67a96f6c0258331ee06e8745d02b3b06d8a2779b407018725d4f5189c7

Observation 9b0fda7f-b129-4043-a78a-994dc9aa6a37 · outbound

This paper cites Thor: Wielding hammers to integrate language models and automated theorem provers.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Thor: Wielding hammers to integrate language models and automated theorem provers

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.609615Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.609615Z digest=sha256:3e8969c3ed3251fcea27ab6218691c943d46317192dae4ffed07e667ddd2fd7b

Observation 9dfd4d5c-5d14-4ec0-b538-ab945a6f4055 · outbound

This paper cites Draft, Sketch, and Prove: Guiding Formal Theorem Provers with Informal Proofs.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Draft, Sketch, and Prove: Guiding Formal Theorem Provers with Informal Proofs

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.612982Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.612982Z digest=sha256:1010c6af7367b71769226d19f2f0314e3030c5ff42745296b4d61a209cf7a83d

Observation 33370f08-92ce-4669-a42f-ae96a93c6fee · outbound

This paper cites Baldur: Whole-proof generation and repair with large language models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Baldur: Whole-proof generation and repair with large language models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.616356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.616356Z digest=sha256:3e4f35f8a5b934b3f038b4333bd06d186b3bbdcc99ce6e775e60a1663001a9bc

Observation e0b55614-0113-486b-b881-35b0610bcf86 · outbound

This paper cites TheoremLlama: Transforming General-Purpose LLMs into Lean4 Experts.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models TheoremLlama: Transforming General-Purpose LLMs into Lean4 Experts

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.619286Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.619286Z digest=sha256:82ed5a140998a127d0e29985c48847a490b232819b9434f3e1333966feaab45f

Observation 401c5ced-95d8-44dd-a157-a5ad13ebd946 · outbound

This paper cites MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.622596Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.622596Z digest=sha256:dcecc6f5a22902f6d1bb84ff82e7c81b1ae9e56756d8b9106f223031e8294ec7

Observation 343d4693-79a4-4615-94f8-8ab3181eddb1 · outbound

This paper cites Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.199928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.625662Z digest=sha256:f96b5465765c6091ba015bfd295ae3616b87ea5a55f28f7d7be7a49da05725f2

Observation 5a350cd1-9f03-44ba-9458-0bbdcf69b8ce · outbound

This paper cites LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.628897Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.628897Z digest=sha256:449851d3a5345f3e24dbf4a402b5ade9abe8f8a58f0fe923818cc2cd157ad644

Observation 50f8e8cb-e477-46cc-b372-20167b0f48ea · outbound

This paper cites An Empirical Evaluation of LLMs for Solving Offensive Security Challenges.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models An Empirical Evaluation of LLMs for Solving Offensive Security Challenges

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.632242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.632242Z digest=sha256:eb1c1d0f16166ecc02c8cc33fd9c59247af9ff49a2eaa3d6f3359de8d1ae2fa6

Observation 8d72be25-55bf-4215-8434-89bde6f7f85f · outbound

This paper cites Cladder: Assessing causal reasoning in language models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Cladder: Assessing causal reasoning in language models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.635508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.635508Z digest=sha256:4fc6a5d0a3aa236ab5ed8952a269e5b333db86299c61e86c3e920a22f27b3dff

Observation 8f438116-dd13-4aac-bbbf-21fd26c5fcbc · outbound

This paper cites Using llms to facilitate formal verification of rtl.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Using llms to facilitate formal verification of rtl

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.184417Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.638581Z digest=sha256:4f49fd964e272135e97e8a4c238deb8124813840bbcce6a7e96c67b39ac64c65

Observation e398a153-d0d9-43ab-8532-405143c50ea3 · outbound

This paper cites Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.641336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.641336Z digest=sha256:cad1884503884f27643e77bd26b6083dbd331963069eb0e077196fd7e63f7720

Observation 4ad8c173-7105-47c4-b0e0-307126fad0a3 · outbound

This paper cites Evaluating llms’ mathematical reasoning in financial document question answering.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Evaluating llms’ mathematical reasoning in financial document question answering

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.644561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.644561Z digest=sha256:3d32255dbb270ff1f9896a639e29b05b011a6d49f570c8deb7de0abef7ba0853

Observation 68778ea7-cdff-46c2-b429-b893d4500153 · outbound

This paper cites Position: AI Evaluation Should Learn from How We Test Humans.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Position: AI Evaluation Should Learn from How We Test Humans

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.647330Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.647330Z digest=sha256:0ed6296943d98883552667771a9088af31bdf7cec4b02f9bd457e79ad4f1a53b

Observation 2673de03-43d8-4b24-994f-5e7c47ea5911 · outbound

This paper cites tinyBenchmarks: evaluating LLMs with fewer examples.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models tinyBenchmarks: evaluating LLMs with fewer examples

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.650394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.650394Z digest=sha256:5785ab6627cfebe2ddb9030ddcaabaf31399dd3cdf07b10a0c1009f77a7b595c

Observation 87a1d1c7-2a9d-4572-9231-8c09383047a7 · outbound

This paper cites S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.653389Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.653389Z digest=sha256:036dc46c208df70501804ffa0e936536e16edbbb59bafe5da2883a82a07eeb64

Observation 78fc73ac-c379-4366-8b99-5625f369895e · outbound

This paper cites Psychometrics: an introduction.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Psychometrics: an introduction

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.168668Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.656619Z digest=sha256:0fa0c9012ed42b5820dfac543e9632b3bb74220817f54e81c66bd8ee914dd6cc

Observation 47d6942f-f917-4de4-a709-6d24bcb45c04 · outbound

This paper cites Diagnostic measurement: Theory, methods, and applications.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Diagnostic measurement: Theory, methods, and applications

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.159834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.659369Z digest=sha256:b072302420bf9d6ac0e35a057c24456e8efbe3e0e2d61e9550a4ec8cbd4d5f38

Observation 85cbad2c-13ad-41cd-84cb-c09283918815 · outbound

This paper cites A brief introduction to evidence-centered design.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models A brief introduction to evidence-centered design

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.150856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.662336Z digest=sha256:c6f76985d3b2f3db109c8887312a38186cdca9ea1681f0199de9b15e4461590e

Observation fe1e5f72-840f-423a-ab35-605ab3140e3a · outbound

This paper cites The basics of item response theory.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models The basics of item response theory

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.665270Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.665270Z digest=sha256:40dc5ca83f1e1daed55229706c57b9e4284ce3ccfec57a1a5216a9eec2649f5a

Observation ad463b42-6011-4d1c-b99e-f144a7832e5c · outbound

This paper cites Item response theory for psychologists, 2004.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Item response theory for psychologists, 2004

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.136025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.668171Z digest=sha256:d74d1d4ebb41dccf99743a92bb082c10b602837c50e122b67b5362ecde99038f

Observation 1896d037-6f6a-41db-9854-1a75eea3dde7 · outbound

This paper cites MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.670922Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.670922Z digest=sha256:d3e40f42a2cb8c26c93dc096ab35d889160427a55035735b038ec4d884e19317

Observation 700bd2d3-198a-429f-a4b0-079ebb0cdfff · outbound

This paper cites DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.674013Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.674013Z digest=sha256:8baa8ff8117e2d5301cd80a013fa936a6c63c771384e37a2266b0bc592577a17

Observation 71011636-bb2e-40ab-8946-2254b05067d1 · outbound

This paper cites an unresolved cited work.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Unresolved cited work

Reference 34

Resolution
unresolved
raw_fallback, observed 2026-08-09T17:36:10.126584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.677295Z digest=sha256:eb4c69f427d2e4b7785c0591a7edcf70f1db7e0800de4a0daac5eabc3d498779

Observation c6c94b34-ba09-4f4a-b1c9-104b90a3ff31 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.680237Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.680237Z digest=sha256:2bdac79a9b019d08ab2b1b42dc9daee400ea9c8977cdc27e20a026aa7aa12e2e

Observation 081c51c7-9493-4b03-b3ea-a873f45d064d · outbound

This paper cites Item response theory.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Item response theory

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.683350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.683350Z digest=sha256:6693873d85682b9953a2f7473e95a08be04354cbd413b83c64ae5ee54cbbace7

Observation 85011a5e-a23a-4f63-b776-710aa2781705 · outbound

This paper cites A tutorial on fisher information.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models A tutorial on fisher information

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.111480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.686436Z digest=sha256:5d6c741921056fc44a62a6fbf67c83604d1315932607b9d8fb60bcf739de26a0

Observation a57fdb7d-a90b-4869-9f32-dcfbd4540ea1 · outbound

This paper cites Codegeex: A pre-trained model for code generation with multilingual benchmarking on humaneval-x.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Codegeex: A pre-trained model for code generation with multilingual benchmarking on humaneval-x

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.102147Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.689427Z digest=sha256:42f89c43a9d8726ad9c137bafcd2bc96ed3c9067ad79b52a3da43681f5e80a9e

Observation e48c24e9-070d-45a2-8416-70530b903c9d · outbound

This paper cites Jiang, Jia Deng, Stella Biderman, and Sean Welleck.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Jiang, Jia Deng, Stella Biderman, and Sean Welleck

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.692301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.692301Z digest=sha256:d107cd846076ea5babf3a5017ff5cc42769d96df268467a4a03f9e33fe6d235f

Observation 45a75fc9-f008-44f9-b42a-4806fb871dbc · outbound

This paper cites Theoremllama: Transforming general-purpose llms into lean4 experts, 2024.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Theoremllama: Transforming general-purpose llms into lean4 experts, 2024

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.087594Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.695142Z digest=sha256:49c7d86d50e54f017fb710cf6dd427a47d89d92f01a28daaf7017ece9e21e7b8

Observation a526a880-7541-4b2e-8e37-bb6dc2793119 · outbound

This paper cites Code Llama: Open Foundation Models for Code.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Code Llama: Open Foundation Models for Code

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.697940Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.697940Z digest=sha256:c94e3e4188dd72f4bf54b04f70e42a3f8a21e613d71e2a968ba0511d7c780d83

Observation c3e68a2c-1051-4db1-8559-8c665027fa83 · outbound

This paper cites Qwen2 Technical Report.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Qwen2 Technical Report

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.701260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.701260Z digest=sha256:07700b5c7196f5775d4527a5b5e479f8ad8a1e7952664e1664dca13a75c21dc3

Observation 34fdb993-c71c-49ec-b219-148b407bb726 · outbound

This paper cites Qwen2.5-Coder Technical Report.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Qwen2.5-Coder Technical Report

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.704602Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.704602Z digest=sha256:02b287599ee4ff0f59a2cef332317f96c57a3d8e39383df989a509044b86ea02

Observation 9b1b55d0-395b-4a56-b449-b2552450d9e8 · outbound

This paper cites Lisa: Language models of isabelle proofs.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Lisa: Language models of isabelle proofs

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.707633Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.707633Z digest=sha256:7b4c74b802f273b2904d5b21477f491e89889ec0081ed63cdbfda084c530e897

Observation 47a8011d-b6bd-46a0-a65c-0c78c83290c4 · outbound

This paper cites ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-09T17:36:09.710677Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T17:36:09.710677Z digest=sha256:fbde49e802acb0050c63fa7077b7b7ddad01411166ce226880c1be61b91bb9ad

Observation cc6b863d-1272-4197-a4af-98b0f0d62e0b · outbound

This paper cites an unresolved cited work.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Unresolved cited work

Reference 46

Resolution
unresolved
raw_fallback, observed 2026-08-09T17:36:10.071927Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.713621Z digest=sha256:f3b8f69fb96241d96409617d1b480eb794c75a62af7956f6c6dcaba1ad63651f

Observation ccc95c8b-89dd-4762-b411-bbb3302c9cc5 · outbound

This paper cites A.2 Theorem Categories The theorems in miniF2F are classified using multiple criteria.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models A.2 Theorem Categories The theorems in miniF2F are classified using multiple criteria

Reference 47

Resolution
verified exact
raw_fallback, observed 2026-08-09T17:36:09.826170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.716426Z digest=sha256:1b8ac30c147a551b6c9042c58dae6c26e2aaf6d52fed5437a3ff8c4c7d4f8109

Observation 1305f129-dd40-4bd0-b677-d1563d2588b8 · outbound

This paper cites an unresolved cited work.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Unresolved cited work

Reference 48

Resolution
unresolved
raw_fallback, observed 2026-08-09T17:36:10.062820Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.719406Z digest=sha256:6f97c1931693c366111fda2ae2166dec3a7c916e0a72fa8ec0e393a093cf95ad

Observation 84e96882-466d-4eba-9803-81063e4eb9da · outbound

This paper cites This is because, in the miniF2F design, the test set is reserved for evaluation, while the validation set may have been used during model training [32].

Psychometric-Based Evaluation for Theorem Proving with Large Language Models This is because, in the miniF2F design, the test set is reserved for evaluation, while the validation set may have been used during model training [32]

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.054541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.722439Z digest=sha256:d7d23f1edda3f0bc7a99b92ad84865ad923a6400a04a006bc898cb6681464eba

Observation fbc1cf20-f683-405d-934f-a7e8adb54c62 · outbound

This paper cites This is because competition problems tend to be more complex, but their higher complexity also leads to a lower discrimination.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models This is because competition problems tend to be more complex, but their higher complexity also leads to a lower discrimination

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T17:36:10.046114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.725413Z digest=sha256:bc60f8a32da62eef033e225660f8178afcea1f3403149f942e8b126f17d7f568

Observation 73b796a4-de88-45db-8199-08e445c71525 · outbound

This paper cites an unresolved cited work.

Psychometric-Based Evaluation for Theorem Proving with Large Language Models Unresolved cited work

Reference 51

Resolution
unresolved
raw_fallback, observed 2026-08-09T17:36:10.037359Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-08-09T17:36:09.728402Z digest=sha256:c11fe0b52d376983b0ff631ecd21531208a6af50e923d9cc32d1756e75c2bc6a

Pith citing papers

No inbound Pith citation observations are available.