Pith. sign in

Paper Citation Record · LEDGER

PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2501.03124.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.03124 v5

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 17 of 17 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 17 of 17 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:27:39.822263Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T00:37:30.074521Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation f3cb51d7-1b83-495d-bf7c-ca1282b5ae79 · inbound

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning cites this paper.

Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 173

Resolution
verified exact
arxiv_id, observed 2026-05-23T04:32:33.020711Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-05-23T04:30:38.804702Z digest=sha256:b1272f1f96d11cb46516eee88734ba2fd5155cc68fb12be11b5f2286f248fd02

Observation c5c0f5c7-b262-492c-a499-18a3a9c475af · inbound

System-1.5 Reasoning: Traversal in Language and Latent Spaces with Dynamic Shortcuts cites this paper.

System-1.5 Reasoning: Traversal in Language and Latent Spaces with Dynamic Shortcuts PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T14:27:39.822263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:27:39.822263Z digest=sha256:faeac8901dac2c8aa607332896a960169b96a70608d1b540f190f6f7e3a0f7e1

Observation 58760b42-ef1c-4624-b54b-aa01c9a01cad · inbound

Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision cites this paper.

Error Typing for Smarter Rewards: Improving Process Reward Models with Error-Aware Hierarchical Supervision PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:14:19.989779Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:14:19.989779Z digest=sha256:1e0d67fa7be57d67c657f6a583eef59e90b3790709adc1dbed78c4d4e478502a

Observation c4fe288e-8194-4497-8688-e4265491cd41 · inbound

Step-Wise Formal Verification for LLM-Based Mathematical Problem Solving cites this paper.

Step-Wise Formal Verification for LLM-Based Mathematical Problem Solving PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:48:58.204424Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T13:48:58.204424Z digest=sha256:a7bbbf5970848e3e0736b8c3b6ae498f171163f582763addcd66a96038abcb7b

Observation 495b41d2-2427-436a-9c92-bc82e99c77d2 · inbound

PixelThink: Towards Efficient Chain-of-Pixel Reasoning cites this paper.

PixelThink: Towards Efficient Chain-of-Pixel Reasoning PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T12:45:45.805388Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:45:45.805388Z digest=sha256:3fcf32f3ea350bb961b167755edc4932b804a0f414309d5d2586c3c24f601ad3

Observation 22ae8d7f-691c-417f-975f-b2e50f5f1b5c · inbound

Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively cites this paper.

Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T12:11:45.058024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T12:11:45.058024Z digest=sha256:2722efead8b053b8c2c42f6dd3a17aaa2cd87090639c70d67353e5cfb7d837aa

Observation 1497c494-db3c-49fd-a62e-91d9c355b02a · inbound

RewardBench 2: Advancing Reward Model Evaluation cites this paper.

RewardBench 2: Advancing Reward Model Evaluation PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-05-19T11:22:16.761375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-19T11:18:03.965711Z digest=sha256:9f8f636c4404a7a94d22f517a8de440fb8aaa30b26bf732107afcc69c174d201

Observation af15ffc1-4b55-4d7b-893f-55462028cbe3 · inbound

Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models cites this paper.

Self-Correction Bench: Uncovering and Addressing the Self-Correction Blind Spot in Large Language Models PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T20:29:00.154021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T20:29:00.154021Z digest=sha256:796ca3232038a9f82563c37aa1b4bb00e0dc2a3983bfe9b44d38221e855c5da3

Observation cf571c63-c71a-4caa-946a-eea22154689b · inbound

Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models cites this paper.

Step-level Verifier-guided Hybrid Test-Time Scaling for Large Language Models PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T15:37:24.928392Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T15:37:24.928392Z digest=sha256:d05db23c06d939910424313ca04a7b08cc27ec6c52e241fd97b12533eef3f6bb

Observation e5dbde34-2e51-4319-ae54-75709c18902c · inbound

GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning cites this paper.

GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T00:59:53.215356Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-06T00:59:53.215356Z digest=sha256:23adaa984b99536e0c90d329ac4e1794d57eb1a557ebb05eb544efc5f7200b5c

Observation 8405bc8a-abd0-4739-b46f-0993e3b2409e · inbound

Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting cites this paper.

Mitigating Think-Answer Mismatch in LLM Reasoning Through Noise-Aware Advantage Reweighting PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T23:10:24.513775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T23:10:24.513775Z digest=sha256:c682da476bad2ecd73bc5328b34e98630667f2116659cdbebb56a18d1612341b

Observation e0312c8b-6a8a-4d40-8800-37cb59664f0f · inbound

AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models cites this paper.

AURA: Affordance-Understanding and Risk-aware Alignment Technique for Large Language Models PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T22:58:50.210843Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:58:50.210843Z digest=sha256:84ec623274d8071975919fb4b8bb55dbc69ba5c2edfeff78e463b9f6dc06e771

Observation 7464e93f-84fc-44e9-a514-0b3aa0c65612 · inbound

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models cites this paper.

MME-SCI: A Comprehensive and Challenging Science Benchmark for Multimodal Large Language Models PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T18:53:05.114132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:53:05.114132Z digest=sha256:ea1e48976e87ba3f321ae241ee7a5811d184971fb2ae8c3b781143ca8a4f55a0

Observation f5835ae8-14e8-4b42-88d8-b6c4aca44a57 · inbound

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation cites this paper.

Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 94

Resolution
unresolved
no resolver link, observed 2026-08-03T03:04:44.374832Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T03:04:44.374832Z digest=sha256:d59a82597170edd33757e61b25d4aed3b938799cd83238366a79ca68f8352d0d

Observation 86e8c7d4-5a21-4c29-9cdc-f35c797c9d59 · inbound

Scalable Token-Level Hallucination Detection in Large Language Models cites this paper.

Scalable Token-Level Hallucination Detection in Large Language Models PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 56

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:52:22.372438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-05-13T05:49:23.534294Z digest=sha256:c41d74109932503d2ab2b4b8ff5fd25802e49c754a90f0805c7e4c41730509b4

Observation 9e70fa15-b526-49f0-a0aa-f0678415e98a · inbound

Self-evolving LLM agents with in-distribution Optimization cites this paper.

Self-evolving LLM agents with in-distribution Optimization PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 54

Resolution
metadata mismatch
arxiv_id, observed 2026-07-02T16:57:09.539333Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T22:18:27.021136Z digest=sha256:64f9af46af2937e1747a19205fc3e4a42c6a30b1dd24b19ed537ad2ce4bae043

Observation 1df5a118-8c41-40d7-8d8d-60c56b63667b · inbound

The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning cites this paper.

The Hidden Bias of Process Reward Models:PRISM for Rewarding the Right Reasoning PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models

Reference 7

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T00:37:30.076523Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=arxiv_source observed=2026-06-27T17:07:06.227106Z digest=sha256:58a34c01045db40c7e92ac9d715d2034b506f0ab2965466793761f0416c4d069