Pith. sign in

Paper Citation Record · LEDGER

VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2411.17451.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.17451 v2

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 5 of 5 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T13:24:39.696801Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

2
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 45b3665e-75b0-4ddd-b286-cf514d4af1b8 · inbound

Unified Reward Model for Multimodal Understanding and Generation cites this paper.

Unified Reward Model for Multimodal Understanding and Generation VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-14T00:44:30.937637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-14T00:44:30.558048Z digest=sha256:a14166ced3743ea409f699f5be5db38e284b477851213d648d140c4162ff6b11

Observation a47a3280-bb79-4785-b7ff-8a93183828c4 · inbound

Reinforcement Learning from Human Feedback cites this paper.

Reinforcement Learning from Human Feedback VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Reference 105

Resolution
verified exact
arxiv_id, observed 2026-05-22T19:32:01.194932Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-22T19:27:40.991325Z digest=sha256:d1f7e7b6fb5e42083dc0247750cce35612bff1ef5151d76f35ae4897ed24a762

Observation abd565f7-0142-4d59-aa9c-f1161f838f38 · inbound

RewardBench 2: Advancing Reward Model Evaluation cites this paper.

RewardBench 2: Advancing Reward Model Evaluation VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-05-19T11:22:16.810618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=pdf_text observed=2026-05-19T11:18:03.965711Z digest=sha256:4494240b0968f91f5a142dac3068ca224de57590a3fb7b3c5b10b2e6b6581dc5

Observation de18d49c-57ed-402f-a32f-3de92e04252b · inbound

LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model cites this paper.

LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T13:24:39.696801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T13:24:39.696801Z digest=sha256:7507abbe05cb18b4a74a598456ccd74bd47ba789032e9247e6563f5abf7c970d

Observation 35a99e2e-16d4-4109-8098-4ff0b1785f3f · inbound

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents cites this paper.

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents VL-RewardBench: A Challenging Benchmark for Vision-Language Generative Reward Models

Reference 31

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T06:05:28.943625Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-07-01T05:59:13.631078Z digest=sha256:4173c0e8c6032b48f9327ea60da846066a0ee191d59304cf1a2ad177d47d6d54