Pith. sign in

Paper Citation Record · LEDGER

RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

As of 23 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2402.03681.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2402.03681 v4

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 38 of 38 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-23T06:30:58.430688+00:00

measured 38 of 38 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T05:31:55.956455Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

6
pith, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation cc57d9c5-0e98-4c8f-95e1-cf4e4564c3f0 · inbound

ViSTa Dataset: Do vision-language models understand sequential tasks? cites this paper.

ViSTa Dataset: Do vision-language models understand sequential tasks? RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T16:45:47.260990Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T16:45:47.260990Z digest=sha256:6286d3e46dc123a5e5a1f7bc6e3a4ca82b8ce5a4ad8679c805ef2c646f7be91b

Observation 7face66c-8094-4861-8bb5-e0511b7b31ba · inbound

LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble cites this paper.

LLM-Based Offline Learning for Embodied Agents via Consistency-Guided Reward Ensemble RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-12T12:33:07.169030Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T12:33:07.169030Z digest=sha256:17abbdc85e3cbd4200ef7dd98ab675f7e2efbf220e4d5dc6beccc34d5125b067

Observation e923c4c4-e55c-4e44-b176-e626888b8f78 · inbound

MALMM: Multi-Agent Large Language Models for Zero-Shot Robotics Manipulation cites this paper.

MALMM: Multi-Agent Large Language Models for Zero-Shot Robotics Manipulation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-12T11:57:03.861532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-12T11:57:03.861532Z digest=sha256:6bd3e1d4236889ef32e88f1166e2a55b414a7ae2e1c8cfd7fb1e394009879ac9

Observation 386c3901-3ef0-45c6-8a8e-f23fb05974a4 · inbound

SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation cites this paper.

SILMM: Self-Improving Large Multimodal Models for Compositional Text-to-Image Generation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-11T20:25:14.989517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T20:25:14.989517Z digest=sha256:e802b9928841f5b1776bc8ddfe27fd328934484b076e9b933600a136af2421b1

Observation 08752a8d-6ae4-4138-9b49-da9046bd152a · inbound

YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls cites this paper.

YingSound: Video-Guided Sound Effects Generation with Multi-modal Chain-of-Thought Controls RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 100

Resolution
unresolved
no resolver link, observed 2026-08-11T17:17:49.488002Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T17:17:49.488002Z digest=sha256:3b2038f9d9e563bf412d4133e09b0e5df5647f7bc1143e3a63391a37a3fcbce4

Observation 00b8eccd-443e-422a-a52b-e4e2b94300da · inbound

VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving cites this paper.

VLM-RL: A Unified Vision Language Models and Reinforcement Learning Framework for Safe Autonomous Driving RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-11T11:25:15.406842Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T11:25:15.406842Z digest=sha256:6c73d34a1d39fe4b02c110b4621604db57160a0062c715ab2241e939636e1a60

Observation 72d9408e-e95e-407a-bcba-4cf965a72b72 · inbound

CLIP-RLDrive: Human-Aligned Autonomous Driving via CLIP-Based Reward Shaping in Reinforcement Learning cites this paper.

CLIP-RLDrive: Human-Aligned Autonomous Driving via CLIP-Based Reward Shaping in Reinforcement Learning RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T14:10:08.693481Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T14:10:08.693481Z digest=sha256:848e25860cde738842974b91214d588d2e028b932c5aabd386e5ea867428e94c

Observation 2e8e269f-ae0d-4245-a649-6aad57ad9ed3 · inbound

Contrastive Learning from Exploratory Actions: Leveraging Natural Interactions for Preference Elicitation cites this paper.

Contrastive Learning from Exploratory Actions: Leveraging Natural Interactions for Preference Elicitation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T22:32:07.962630Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T22:32:07.962630Z digest=sha256:23f8d296046ca9a25f3823e1cb49205dd79a3c4e44a27fb5aed4d8e044e643e9

Observation 7463f495-a244-4402-95be-4bc5fd03023d · inbound

FDPP: Fine-tune Diffusion Policy with Human Preference cites this paper.

FDPP: Fine-tune Diffusion Policy with Human Preference RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T20:34:07.043762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T20:34:07.043762Z digest=sha256:2e47c8db4e7c18752cf3a114251cf7819899b9fa0b2c8cf000e4f9858a04b2e3

Observation 1e78bded-9810-45f3-9f60-d1d02b92c022 · inbound

PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations cites this paper.

PRISM: Projection-based Reward Integration for Scene-Aware Real-to-Sim-to-Real Transfer with Few Demonstrations RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-16T05:31:55.956455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T05:31:55.956455Z digest=sha256:4fdcf160300263e5919e09d5326b036f3fe4e47900a17382b5173bd2ffec579c

Observation cb0a0399-3f18-42a0-bdf4-76f5bfcbbff7 · inbound

TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations cites this paper.

TREND: Tri-teaching for Robust Preference-based Reinforcement Learning with Demonstrations RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T22:52:23.759155Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T22:52:23.759155Z digest=sha256:fa06a169a315a082441e8e3491a80c3b8930da645c3ef7d6c22a82ae16549edb

Observation d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884 · inbound

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation cites this paper.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.208656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.208656Z digest=sha256:f8f422723439e663f800be4644c8efdb80971567f5882f64401987dffa6ccf44

Observation 507ccd29-01c6-4931-9078-8b810bcaa289 · inbound

ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making cites this paper.

ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T13:53:59.540056Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:53:59.540056Z digest=sha256:56d2b7d233479e4a6f9a104ac74536ae244b52e74c26db43d8117212d1eabc48

Observation aad52432-1358-4d8d-8388-110825fd8d6a · inbound

ROAD: Responsibility-Oriented Reward Design for Reinforcement Learning in Autonomous Driving cites this paper.

ROAD: Responsibility-Oriented Reward Design for Reinforcement Learning in Autonomous Driving RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T12:32:06.318385Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T12:32:06.318385Z digest=sha256:61867e96de151ddcf5816e44cedf8f236142a0bf25d48644164c9ab76e7e1a33

Observation 1debe993-d244-4a08-84cc-9bc6ccd864dc · inbound

HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation cites this paper.

HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T05:41:42.219536Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:41:42.219536Z digest=sha256:0c2d22487147ddc0768f245c24562e48b1f4c1742e3176eeabd42b660ab0f67e

Observation c5684732-36b4-4776-8e20-104819cb6eb6 · inbound

UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning cites this paper.

UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-18T22:21:53.346287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T22:17:41.758059Z digest=sha256:73a2158c6c3338988d3b309bd82ab6cfe0f454ca1793b4724bb10ceac9e5a70a

Observation 060d5b69-72d5-4948-9dd6-85d684d9fe3c · inbound

Reflection-Based Task Adaptation for Self-Improving VLA cites this paper.

Reflection-Based Task Adaptation for Self-Improving VLA RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 39

Resolution
verified exact
arxiv_id, observed 2026-05-18T07:31:02.945003Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-18T07:28:11.187479Z digest=sha256:1af4a62e925356c374189bcbe4011bf9a8b7c8557fd2ae8c5402ea4c28b42270

Observation 8145122e-b207-4fe9-ad62-9219e51fd3a4 · inbound

Meta-Learning and Meta-Reinforcement Learning -- Tracing the Path towards DeepMind's Adaptive Agent cites this paper.

Meta-Learning and Meta-Reinforcement Learning -- Tracing the Path towards DeepMind's Adaptive Agent RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 182

Resolution
verified exact
arxiv_id, observed 2026-05-15T20:46:35.641376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-15T20:46:15.275441Z digest=sha256:ccddc219f5510038bd4f20d0bfaa689069b6bc461ad85e50a1af45465cdb7fad

Observation b0f84f00-831b-4459-8c57-1980f1a76a1b · inbound

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning cites this paper.

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 59

Resolution
unresolved
no resolver link, observed 2026-07-13T16:10:12.689957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T16:10:12.689957Z digest=sha256:032cb32a0733dd916a1a2d956bf1851353c6c01cbe177eaeac9c3ad1d02ae2e0

Observation be41da0a-9061-4663-b6dd-701b2e2ac0e9 · inbound

AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents cites this paper.

AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 43

Resolution
metadata mismatch
arxiv_id, observed 2026-05-20T11:28:14.482581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T11:24:48.558423Z digest=sha256:70168d9e75b4cf4f21b6878bc68073d4a762fca1c927a1d6e554091673c88c6e

Observation 595aa6c1-82b7-4519-8978-ab500322f516 · inbound

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era cites this paper.

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-20T13:33:19.313918Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-20T13:29:11.509966Z digest=sha256:19641e001b41daa0c28cd7dec8c69ae2c87e536e6606bdec0559477caef34c0a

Observation 1cc2b38f-b9e8-463c-b334-a8bb8672514d · inbound

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations cites this paper.

Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-22T05:34:40.341672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-05-22T05:32:17.780012Z digest=sha256:acb621d17e7b49a2660300f71a93c26a76a5dc0d46f09031457b1b156a589bfb

Observation 2e8cf5b5-b2c5-4f1d-8830-fa282443f118 · inbound

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences cites this paper.

CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 71

Resolution
verified exact
arxiv_id, observed 2026-06-28T20:32:37.635642Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T18:36:46.381564Z digest=sha256:676d25a8f9f85565ea2aa40d0b0cd8e7fcad6bf2ea427d1a0a6b1bd182aec5a4

Observation 58dec1c0-6e7c-4150-8538-f0174bd95a96 · inbound

World Model Self-Distillation: Training World Models to Solve General Tasks cites this paper.

World Model Self-Distillation: Training World Models to Solve General Tasks RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-07-03T10:07:55.861633Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-27T10:16:35.511426Z digest=sha256:846e1548bbbac1a03c1af5b29ef7735c44ea3fa540bb5c2c685fe1a7eaade6c4

Observation 1549fe9b-7479-4347-8a31-cc63ad680120 · inbound

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning cites this paper.

MAGNIFIED: RL Fine-tuning of Multimodal Large Language Models for Motion Planning RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:56:35.152732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-28T09:31:56.712360Z digest=sha256:bf59300ce12045ebd9e2c01cc35da674990995c1910b4d40e5b0adb1f4cc9bf5

Observation bed6605d-e35a-41f4-81bb-bc60db7357fe · inbound

Learning Process Rewards via Success Visitation Matching for Efficient RL cites this paper.

Learning Process Rewards via Success Visitation Matching for Efficient RL RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 89

Resolution
verified exact
arxiv_id, observed 2026-07-04T09:59:44.552947Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-26T09:20:35.062060Z digest=sha256:b5b32df657f9fb093f597d27597e6fa92a7ee971b87df76f31822030e3ea5ddc

Observation 3c476429-1c35-4df5-8adf-9aa9847da207 · inbound

MAPL: Multi-Objective Preference Learning for Robot Locomotion cites this paper.

MAPL: Multi-Objective Preference Learning for Robot Locomotion RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-07-04T19:40:06.247908Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-25T21:11:00.753949Z digest=sha256:0df47cd7e1f7d7946e051e35d79e0a10a35f817eb759bb7178f21b6e018b4587

Observation 597a613c-efae-4c62-b916-b96e68cab2fb · inbound

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG cites this paper.

Digitizing Coaching Intelligence: An Agentic Framework for Holistic Athlete Profiling using VLM and RAG RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-07-01T15:45:48.629240Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-06-30T01:04:10.556608Z digest=sha256:caa115d09e617f471d49fcc46091edb9593cb88e7860e5363768761fb53ff2a6

Observation 7942573f-050a-4597-90c3-7c9f599cb04a · inbound

Freeform Preference Learning for Robotic Manipulation cites this paper.

Freeform Preference Learning for Robotic Manipulation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-07-01T10:55:41.993344Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-07-01T04:58:28.971536Z digest=sha256:daf550b24228423ae4903362602c62ba9a5b71651e77c81a84d279930d514e38

Observation 0caae5b4-41cc-49c5-a5a7-dcc07bdc7d52 · inbound

Freeform Preference Learning for Robotic Manipulation cites this paper.

Freeform Preference Learning for Robotic Manipulation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 42

Resolution
unresolved
no resolver link, observed 2026-07-14T16:55:18.028851Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-14T16:55:18.028851Z digest=sha256:f34809105e4cf426f0278ef53656289260450bc4d6e1f054a57c9f365ad4c096

Observation e14f6cc5-e031-4ecd-8ea1-afff73aff912 · inbound

Freeform Preference Learning for Robotic Manipulation cites this paper.

Freeform Preference Learning for Robotic Manipulation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-04T02:32:21.801763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T02:32:21.801763Z digest=sha256:1c964185c5988b36db1da5ec7a4a02e9752b11c6401f04e09574f8ace9f2d72f

Observation f7fe787f-399f-467c-971e-38c5db5a2352 · inbound

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents cites this paper.

QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 25

Resolution
metadata mismatch
arxiv_id, observed 2026-07-01T06:05:28.995527Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=arxiv_source observed=2026-07-01T05:59:13.631078Z digest=sha256:b42d762e1bf445d42117a4c16f57227ba05410b5a2fbbfdcc65dbd3c60cf04ed

Observation 03ba039f-d16d-4838-a07f-6ea9688dbcf6 · inbound

LLM-as-a-Verifier: A General-Purpose Verification Framework cites this paper.

LLM-as-a-Verifier: A General-Purpose Verification Framework RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 80

Resolution
verified exact
local_arxiv, observed 2026-07-07T12:53:50.157230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.

source=pdf_text observed=2026-07-07T12:47:29.552283Z digest=sha256:2860c8cadc2d9a0ed4afe9466ec8523895585e40956e48f1c358c1bb54e9328d

Observation 2159aea4-c9d6-488c-bf68-f1ac3e07fd84 · inbound

LLM-as-a-Verifier: A General-Purpose Verification Framework cites this paper.

LLM-as-a-Verifier: A General-Purpose Verification Framework RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 80

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:3afcf8e09746da342205a5eb916a35a468abe8fd785d088fd3a18211e4fecb99

Observation cb1fefb5-d847-43f4-98f8-0233a4d79a31 · inbound

Prompt-Driven Exploration cites this paper.

Prompt-Driven Exploration RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 115

Resolution
unresolved
no resolver link, observed 2026-07-13T06:21:42.026251Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-13T06:21:42.026251Z digest=sha256:3931f3171fd7b85b3763e4e97b2d25bbfb33cc4a5e71f9daa725daacab61d617

Observation aaa22542-473a-4093-a51c-0125399e5ac2 · inbound

Learning More from Less: Reinforcement Learning from Hindsight cites this paper.

Learning More from Less: Reinforcement Learning from Hindsight RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-13T00:46:28.503923Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T00:46:28.503923Z digest=sha256:1d4f84e5476ae724a98d67e7654ae8bff99dbb9da07d8f28e126b2785c5d0987

Observation 886dba74-5a71-4507-9b08-7e7097e3363a · inbound

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation cites this paper.

MARS-RA: Rank Aggregation for Credit Assignment via Multimodal Comparisons in Embodied Multi-Agent Cooperation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 68

Resolution
unresolved
no resolver link, observed 2026-07-31T21:55:17.393310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-31T21:55:17.393310Z digest=sha256:6ea544167148dd7af5535a01d22dfb05eda5f5fbf06862b4bf5da3f69db08a8b

Observation 0513bdd3-5d69-46bb-8356-dde3addce4f4 · inbound

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills cites this paper.

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 260

Resolution
unresolved
no resolver link, observed 2026-08-04T19:45:35.307263Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T19:45:35.307263Z digest=sha256:7cda689a7d1caeb37d33466427ad12cbbdb0a1d06310908dcf10c3eed5fa1911