Pith. sign in

Paper Citation Record · LEDGER

AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2410.21259.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2410.21259 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 5 of 5 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-06T06:34:29.942622+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T10:53:06.140763Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T00:39:16.763538Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 9861685b-8ecc-4ebf-84cd-ae559635bbee · inbound

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling cites this paper.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.140763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.140763Z digest=sha256:b4406e59d8e7802ff29220aa5185fe2b1ebad56e830487e8e1a95a74ee2d791b

Observation 354f2864-ae19-4f89-9384-8c94d5f5c920 · inbound

Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era cites this paper.

Generative Models for Synthetic Data: Transforming Data Mining in the GenAI Era AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T15:43:12.626532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T15:43:12.626532Z digest=sha256:dccfea3e8a6810a21b7b2935e6054f3b99b243e135cb60714c0903cb490ee36c

Observation 4e9c706f-0a7b-46b1-af29-0dc823b69cce · inbound

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models cites this paper.

PolicyLLM: Towards Excellent Comprehension of Public Policy for Large Language Models AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T09:31:03.326869Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-10T15:59:34.133124Z digest=sha256:24dae1c6c6f608e4a26dbf82563af93f59f287f12d5ac41acf4a081848a9be34

Observation a9a61a10-e1bd-469c-8826-97563c5e681c · inbound

SkillGen: Verified Inference-Time Agent Skill Synthesis cites this paper.

SkillGen: Verified Inference-Time Agent Skill Synthesis AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:17:23.039581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-05-13T06:14:28.614825Z digest=sha256:6537df9294f8f65be12da133a3cb41fa06d6e56ed9b50d9064ae6b183e247827

Observation 461ef548-fc35-4fd6-9a73-beecdad8ad8e · inbound

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation cites this paper.

REKEY: Metadata-Grounded Visual-Key Regeneration for Contamination-Resilient VQA Evaluation AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T00:39:16.765637Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.

source=pdf_text observed=2026-06-26T21:06:09.166363Z digest=sha256:321eb942d1bacf3a6399c5b09cbe6bccac95c3734d66f3e7e8712a558a6606da