Pith. sign in

Paper Citation Record · LEDGER

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning

As of 10 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 2 inbound Pith citation observations for arXiv:2502.01616.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.01616 v1

Coverage vector

measured 15 of 15 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T14:52:27.301719Z

measured 17 of 17 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-03T12:29:40.316336Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T12:38:07.209843Z

Reference resolution

15 of 15 outbound references displayed

  • verified exact1
  • verified fuzzy3
  • unresolved11
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 89384354-e872-455e-bf1e-cc4fd718b371 · outbound

This paper cites PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.258667Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.258667Z digest=sha256:58d1200bfbfbd1a0fe605121cadf7ed869b1db6138b4c37648ff17e69fdf7f5d

Observation dbb1aac8-dc7b-4ed0-ac89-f2ea6a603a04 · outbound

This paper cites Observations are captured from Camera 2 and rendered as 300 × 300 images.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Observations are captured from Camera 2 and rendered as 300 × 300 images

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:52:27.527087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.296742Z digest=sha256:937c8bd02b85c5ff1b466284c6ba9e9ec8f6348eb7b2bb3180cfc0269a67da1d

Observation 77236849-523e-4e1c-b1f1-6242a4f10ca2 · outbound

This paper cites Self-Instruct: Aligning Language Models with Self-Generated Instructions.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Self-Instruct: Aligning Language Models with Self-Generated Instructions

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.285507Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.285507Z digest=sha256:fed235ea746a6797381de20ef45347bf87b10f8bcc522533b8ea48d5fe63d3cf

Observation af46d44e-5259-47e5-8105-601d6c61ea28 · outbound

This paper cites Language to Rewards for Robotic Skill Synthesis.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Language to Rewards for Robotic Skill Synthesis

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.291056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.291056Z digest=sha256:d4035f5cb21880c216e1dd6eeff47a190542bda1ebafc513f7245b27f143b56f

Observation 1a9940bf-a6dd-433e-b83f-9670b9018ae3 · outbound

This paper cites RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning RIME: Robust Preference-based Reinforcement Learning with Noisy Preferences

Reference 1952

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.233425Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.233425Z digest=sha256:c22f964f876b3b9e1eb21a171a232ec779b1e593e7a22c1cda9d275982eb7e5a

Observation bda703ef-bb9d-483f-997b-2915c27a2829 · outbound

This paper cites Language Reward Modulation for Pretraining Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Language Reward Modulation for Pretraining Reinforcement Learning

Reference 2004

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.228163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.228163Z digest=sha256:465df87a0d60061f03967e78d458ccfd59b92963d29614de2621a64ff80d4403

Observation 52287843-3473-4c86-9fc4-9eb2057dcd50 · outbound

This paper cites AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos

Reference 2009

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.279746Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.279746Z digest=sha256:cb954acacde0597e2081ae0ec2a3ede484bc3b011d3af64da82a53d61e3ed1c4

Observation b38c1319-5ace-4761-a5d0-bd20207763c1 · outbound

This paper cites FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning FuRL: Visual-Language Models as Fuzzy Rewards for Reinforcement Learning

Reference 2016

Resolution
verified exact
local_arxiv, observed 2026-08-09T14:52:27.463179Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.243627Z digest=sha256:3301c35870e1911a284d158e8425904b39b62e7f8324d02661efd4905c8ff637

Observation 0ed0ae6f-3252-4204-8da8-5239a319dd4d · outbound

This paper cites an unresolved cited work.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Unresolved cited work

Reference 2018

Resolution
unresolved
raw_fallback, observed 2026-08-09T14:52:27.541954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.249102Z digest=sha256:97994324bb3b44da0ca96e774c1660e2d752ecff5c2adb5a12e42beab05850f6

Observation a09a5944-7778-4f91-a051-5a4b14dfcfad · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.263884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.263884Z digest=sha256:74d659a509f15005c0a2be591869b9b005fb60542f73557bbf6af862cac83d20

Observation 5df212af-6864-4c05-bcde-c381e175389c · outbound

This paper cites Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.274360Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.274360Z digest=sha256:fb82a4297f7daf82a866f29342dd623666bc3b78e7316ebefb703b7f1d5a3e3e

Observation fd6314a9-eb3e-4343-9c59-039a6a44a791 · outbound

This paper cites SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.269468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.269468Z digest=sha256:4058ea5c04b8af06eef2117293b71fa80ee1dc5479191f546dd3ad910e3b563f

Observation 2d1278a0-fa7f-4c21-85a8-724fb267ccb1 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning Adam: A Method for Stochastic Optimization

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-09T14:52:27.253504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T14:52:27.253504Z digest=sha256:22a83425eff6d87ebbfb8c917cf24c3968a84b047723a89115897d82363934ee

Observation 6333525d-a069-470e-a3c0-ad5c063c3b37 · outbound

This paper cites L., Faust, A., Fiser, M., and Francis, A.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning L., Faust, A., Fiser, M., and Francis, A

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:52:27.556361Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.238592Z digest=sha256:20e57e1bf18c01f6f02e1841acbfe965a4764766d572d8e56cae14e3ecc5faa8

Observation 8d897723-7d68-4c35-bf67-316560bffee0 · outbound

This paper cites The reward model is trained with a learning rate of 0.0003, a batch size of 128, and 200 update steps per iteration.

Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning The reward model is trained with a learning rate of 0.0003, a batch size of 128, and 200 update steps per iteration

Reference 3000

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T14:52:27.510462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-09T14:52:27.301719Z digest=sha256:01cb627bf221edc307493cf81d75cd37247929a3f8674fcc03b18f667e16a54f

Pith citing papers

Observation 221239e0-a543-4473-9f65-15c87a0442a3 · inbound

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations cites this paper.

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning

Reference 27

Resolution
verified exact
arxiv_id, observed 2026-05-22T05:34:40.346889Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T05:32:17.780012Z digest=sha256:997c29df668b2af718ede530b5253c964fead402f762efcfa55b57ded4db77be

Observation da783f53-7c16-476c-8fa3-c88d44d7d78e · inbound

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning cites this paper.

CoRe: Combined Rewards with Vision-Language Model Feedback for Preference-Aligned Reinforcement Learning Preference VLM: Leveraging VLMs for Scalable Preference-Based Reinforcement Learning

Reference 83

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T12:38:07.211254Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-07-03T12:29:40.316336Z digest=sha256:476ca7c98d9d959e72020a69acfc47505d94db308a0aaa79e4082f0bcfcf381d