Pith. sign in

Paper Citation Record · LEDGER

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

As of 19 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 5 inbound Pith citation observations for arXiv:2506.12822.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.12822 v1

Coverage vector

measured 74 of 74 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:11:50.133035Z

measured 79 of 79 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 5 of 5 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-06T10:13:19.750837Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T09:59:44.448427Z

Reference resolution

74 of 74 outbound references displayed

  • verified exact1
  • verified fuzzy52
  • unresolved21
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 68ee3853-d796-4007-b9af-4e41c84ac977 · outbound

This paper cites write newline.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:49.939631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:49.939631Z digest=sha256:05f17eb93aaa2e68fa7779f82c3d53221602932beb5e3fb65e701d9f73a9cd6e

Observation f9489836-0ef5-42a7-b7e3-5561118e5122 · outbound

This paper cites Deep Reinforcement Learning from Policy-Dependent Human Feedback.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Deep Reinforcement Learning from Policy-Dependent Human Feedback

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:49.943101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:49.943101Z digest=sha256:da8ac706792bc786c7815165f4f5615f996b9dad94730360b5684ff7ccb715f0

Observation 65d87bfe-81af-4a10-a255-9fe155452616 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:49.947297Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:49.947297Z digest=sha256:76db51aa657ca688bb249238daac5831526ee8c4f9f3e5405fabfdb09a230ccb

Observation dce72d38-18ba-417f-b6dc-5f4f7fdd2b76 · outbound

This paper cites AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:49.950159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:49.950159Z digest=sha256:1d7bb194d857cdad8509ef8a222fbb0e3ade2d9ed4c24360bddbd7ca14e02de0

Observation a8affdad-f919-43ec-a38c-de0c8d33911c · outbound

This paper cites Vision-Language Models as a Source of Rewards.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Vision-Language Models as a Source of Rewards

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:49.953188Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:49.953188Z digest=sha256:9791e600a1da888ad3a105095bb89419b876667e10e4c549f6c193c7439e6653

Observation 2f01d4f4-886d-4ae6-af93-5f83a825f8a0 · outbound

This paper cites G., Candido, S., Castro, P.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models G., Candido, S., Castro, P

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.680954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.956050Z digest=sha256:59b41aa4a5c154937a243f1b1b662dcb9c49058558daca2001f4abfd34942cf7

Observation 2e3019e8-f9cf-41f4-972b-636ed83a6da7 · outbound

This paper cites K., Scheurer, J., Rando, J., Freedman, R., Korbak, T., Lindner, D., Freire, P., et al.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models K., Scheurer, J., Rando, J., Freedman, R., Korbak, T., Lindner, D., Freire, P., et al

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.674355Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.958669Z digest=sha256:fb664525f8302436944af79edf659619dbf092a876c275c02b63e1077f785365

Observation 860e48b7-e2c2-4796-922c-af17bf59873c · outbound

This paper cites Towards human-level bimanual dexterous manipulation with reinforcement learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Towards human-level bimanual dexterous manipulation with reinforcement learning

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.667584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.961448Z digest=sha256:1bfbae8f3f606382625f46254dbcda60181fa1a0400045a7ebad2eed03803e44

Observation 0660c414-b87b-48e7-934a-bcacd23dec3a · outbound

This paper cites F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.660515Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.963797Z digest=sha256:e6668e366c8c8001c778c76a7e268e88cc707ed336cb865a72fd7dccc6844cf8

Observation 58359cb2-5f24-4f9b-bb9f-37e620a6e465 · outbound

This paper cites Can foundation models perform zero-shot task specification for robot manipulation? In Learning for Dynamics and Control Conference (L4DC), 2022.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Can foundation models perform zero-shot task specification for robot manipulation? In Learning for Dynamics and Control Conference (L4DC), 2022

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.653678Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.966338Z digest=sha256:85446a5a8c676134f37a400f85cc0414a6ad6aa8e34eb01e4564b5caba3dbc9f

Observation b4dae81b-de05-4d3f-bbc8-4c1f9d69ceb9 · outbound

This paper cites K., Joty, S., Li, B., and Bing, L.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models K., Joty, S., Li, B., and Bing, L

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.646358Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.968759Z digest=sha256:b739b8b1417bfdad1590693040bcef71513cebd8c9beefb8dbf8728663f0b756

Observation 9287fbae-e1a6-4cb9-9258-fc38125a756c · outbound

This paper cites Minedojo: Building open-ended embodied agents with internet-scale knowledge.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Minedojo: Building open-ended embodied agents with internet-scale knowledge

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.638636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.971226Z digest=sha256:00f06533516c914534e82a66c7051c9996ef34c4462b96c1e1b7cda367544038

Observation ee3c3b87-86ad-403d-8cb1-a56d8f250120 · outbound

This paper cites Guided cost learning: Deep inverse optimal control via policy optimization.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Guided cost learning: Deep inverse optimal control via policy optimization

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.631171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.973668Z digest=sha256:f6a743ee7169d64f5a417923c40282d9facb1fc8631f88cdee3a2d44e12948a7

Observation d7061f3f-87ab-42b9-902a-69ec7285a0ca · outbound

This paper cites Learning robust rewards with adversarial inverse reinforcement learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Learning robust rewards with adversarial inverse reinforcement learning

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.623726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.977200Z digest=sha256:ff18c7c212f03e73333f21087827eb79190cd60e7be32b30aa3a35a185276220

Observation cd8c370e-555d-4377-9cff-e77261b78781 · outbound

This paper cites an unresolved cited work.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Unresolved cited work

Reference 15

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:11:50.616712Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.979596Z digest=sha256:d92f32396fc0d75ad09fa9a2585b71bcf687077680d849bdf405b4942e0069f9

Observation 96291906-b98e-4abe-83df-0f85346a9661 · outbound

This paper cites Chatgpt outperforms crowd workers for text-annotation tasks.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Chatgpt outperforms crowd workers for text-annotation tasks

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.609420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.981921Z digest=sha256:80ed435f18f77ec6a5496076e5714c2efc03fbdccc565e12de5852b4c6929f61

Observation cba57434-9900-4784-99cb-471828cd9122 · outbound

This paper cites B., and Kambhampati, S.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models B., and Kambhampati, S

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.602044Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.984138Z digest=sha256:54c626dfc9e6eca66e4e9e7b5aeb4855129157d4928d1c7fbb8d990827be2b4e

Observation e0aff4bf-415a-4e57-b994-a914491521ae · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:49.986568Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:49.986568Z digest=sha256:5f9c4cf98eacc1aebb97d27a12de005b65eae93933a4c45bd4920c5a5b423e54

Observation b367b4f9-25ee-4e4e-87b4-8cffe889b291 · outbound

This paper cites Autoreward: Closed-loop reward design with large language models for autonomous driving.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Autoreward: Closed-loop reward design with large language models for autonomous driving

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.590521Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.989805Z digest=sha256:cf4a80e5b9376414d74c8d991d69b7f18fe8e887261df5c40c2695505b1994d0

Observation b29f3da4-f1ce-4fa2-b596-371ae53ded88 · outbound

This paper cites Deep residual learning for image recognition.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Deep residual learning for image recognition

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.582110Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.992448Z digest=sha256:6b07c020ad24862bdb183727213eae4c5536f99e2a8f750208583713c8fe34cd

Observation 56e91edb-ca8a-4af1-ab82-53145a5911d7 · outbound

This paper cites an unresolved cited work.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:11:50.575429Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.994816Z digest=sha256:21a9729b58c4942999e4ab58e94c985edcf74be0d4c306c983335dda195e6341

Observation 64db9b0d-ac07-469d-8703-f57432542c2e · outbound

This paper cites and Ermon, S.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models and Ermon, S

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.568726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:49.997194Z digest=sha256:32ad96ee20b3f3f4311f134db62b903e0c3ed6507fdce6cd1999b6f6edcd2b66

Observation 7665c5da-b4a6-4c52-8913-6ed6d4587f0b · outbound

This paper cites Reward learning from human preferences and demonstrations in atari.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Reward learning from human preferences and demonstrations in atari

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.562160Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.000442Z digest=sha256:f8afe6aedc7e4f82b67445e0334072e6f099986a3d009ea47f3dee6a9333bee4

Observation 99c935c1-5c6d-45e7-bbdb-109e99b889bc · outbound

This paper cites Reinforcement learning friendly vision-language model for minecraft.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Reinforcement learning friendly vision-language model for minecraft

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.555403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.002923Z digest=sha256:1745a8a1e1a264f1ce4e515608d83bbd5425d9349a8a1efb6805b1a059f06dfa

Observation 1e42208a-231a-402e-bcae-58c2a232a244 · outbound

This paper cites Scalable deep reinforcement learning for vision-based robotic manipulation.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Scalable deep reinforcement learning for vision-based robotic manipulation

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.548275Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.005261Z digest=sha256:94d08e02ff4a41fc0a6d9f99234f9b8a35b3cc1ab9a90f939bc826de0da46a44

Observation a739b6b5-dc1e-4991-bc8b-cbb1d9b92bf1 · outbound

This paper cites Champion-level drone racing using deep reinforcement learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Champion-level drone racing using deep reinforcement learning

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.541204Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.007684Z digest=sha256:8f61983789c6ee22a5c64ca012349b38b98609365d1f97b39172db784d82f063

Observation 46f564a4-a23e-4fbd-a944-409edba38e42 · outbound

This paper cites Motif: Intrinsic Motivation from Artificial Intelligence Feedback.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Motif: Intrinsic Motivation from Artificial Intelligence Feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.010153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.010153Z digest=sha256:1d47eb198b8973511bb534f5bf0a2c69cf7ec9b979dabac40e46deb3d635e498

Observation 32cf2daa-3a5f-413f-961b-8853995d9ca0 · outbound

This paper cites an unresolved cited work.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Unresolved cited work

Reference 28

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:11:50.534558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.012927Z digest=sha256:3349e4bf196bc5f09ce6a8d7e0071824a11a7b015c3e9e49a5d8d04e80157fa1

Observation 9e467907-f43b-4ea8-8428-c96654c184ec · outbound

This paper cites Offline reinforcement learning with implicit q-learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Offline reinforcement learning with implicit q-learning

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.527843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.015662Z digest=sha256:ad6198d8f842f82c41b4be087a03b031c24c07ab91563ffe272993c2cef1da58

Observation b6705ab9-4b1c-48ed-a82d-f860aa98633c · outbound

This paper cites M., Bullard, K., and Sadigh, D.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models M., Bullard, K., and Sadigh, D

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.519796Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.018090Z digest=sha256:21d55c20acc756c8861e236517b1b136457ece0f011a12cfe321a00f7df656a8

Observation 78b54101-5bfe-455c-b8be-a59f587bc846 · outbound

This paper cites R., Bishop, C., Hall, E., Carbune, V., Rastogi, A., et al.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models R., Bishop, C., Hall, E., Carbune, V., Rastogi, A., et al

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.512559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.020993Z digest=sha256:34568e41319555a3ab4d5c3e25a8f14f6be3a5ea545df3f6bc30c082cd039d7d

Observation ffeee6bf-655e-42ed-a489-0e9af6233fc0 · outbound

This paper cites PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.023721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.023721Z digest=sha256:e10cb4a3b83b031214eda8f5735a1344e5b2dcbedcdcebf2d930bf34752fb1f4

Observation 5013d33a-a277-4ec7-98f6-b4739f917d35 · outbound

This paper cites B-pref: Benchmarking preference-based reinforcement learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models B-pref: Benchmarking preference-based reinforcement learning

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.505831Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.026478Z digest=sha256:9fbff53eb026ec5e4f64d60a93f6ecda32b11977fd9099dbb9109bdd08856560

Observation 37b4b192-0527-42df-b159-8b5db85c7832 · outbound

This paper cites Scalable agent alignment via reward modeling: a research direction.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Scalable agent alignment via reward modeling: a research direction

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.028767Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.028767Z digest=sha256:10bd0b57579e36dec685d419e5d810650c00330de0239732374c7584f7cafb81

Observation ac8d4815-f657-43a6-b599-22ea01fb1a56 · outbound

This paper cites Nonlinear inverse reinforcement learning with gaussian processes.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Nonlinear inverse reinforcement learning with gaussian processes

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.499273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.031343Z digest=sha256:bafc78ee0b08b4cb9314950579f89113971807592ed6242ad22b172f0fbba930

Observation 4aa0930a-324b-4efe-922d-c1deadfc2893 · outbound

This paper cites Silkie: Preference Distillation for Large Visual Language Models.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Silkie: Preference Distillation for Large Visual Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.033688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.033688Z digest=sha256:870f97d408c990dfe385285746297b13c00a76678ea33a38e719f5ad65902718

Observation 88383d7e-6338-4a20-8ef8-969b5ba4b932 · outbound

This paper cites M., Stepputtis, S., Campbell, J., and Sycara, K.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models M., Stepputtis, S., Campbell, J., and Sycara, K

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.492457Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.036441Z digest=sha256:f2d23e3a98f0a7ac4fc049f1e1b655ed44156bc2825776dfe656d8e729d4415f

Observation 9fe1f92b-d999-4cec-8231-4b9433cb29cb · outbound

This paper cites J., Kumar, V., Zhang, A., Bastani, O., and Jayaraman, D.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models J., Kumar, V., Zhang, A., Bastani, O., and Jayaraman, D

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.485541Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.038617Z digest=sha256:0ed6d504be282191081e7e50119fa61351a2d7ee1384ac5e9e9cfcea1e774f13

Observation 22492e8d-ccf7-48ed-bee9-3f42daa534ad · outbound

This paper cites J., Liang, W., Wang, G., Huang, D.-A., Bastani, O., Jayaraman, D., Zhu, Y., Fan, L., and Anandkumar, A.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models J., Liang, W., Wang, G., Huang, D.-A., Bastani, O., Jayaraman, D., Zhu, Y., Fan, L., and Anandkumar, A

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.478135Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.041126Z digest=sha256:c06cdcafd429945d76531baa3c421eab22a5e219e604d81e43117a05ab137e86

Observation 286effa6-3e25-47d1-994a-81615bd9a976 · outbound

This paper cites L., Muresan, S., Squire, S., Tellex, S., Arumugam, D., and Yang, L.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models L., Muresan, S., Squire, S., Tellex, S., Arumugam, D., and Yang, L

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.471411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.043480Z digest=sha256:f4386c38a5f6d9942a5bf38cb05ed3110542e4427235c66600a79ef06c8ad23e

Observation a0be76ed-85e9-421c-983b-f99d72739127 · outbound

This paper cites K., Loftin, R., Peng, B., Wang, G., Roberts, D.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models K., Loftin, R., Peng, B., Wang, G., Roberts, D

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.464415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.045898Z digest=sha256:646f40cec599f7323205c9d426f3dbefd1c13cba28e7008a04d7ff142bdaa4bc

Observation 506d9324-f27b-40fb-bcf9-8b2ba9bfef7a · outbound

This paper cites Zero-shot reward specification via grounded natural language.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Zero-shot reward specification via grounded natural language

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.457226Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.049003Z digest=sha256:feb0b3c2dc86c29f5b95679972e751b500b06d675d0bbc44a19e1753c6452796

Observation ad59621a-3199-4a47-a542-f36ce6db24e7 · outbound

This paper cites R3m: A universal visual representation for robot manipulation.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models R3m: A universal visual representation for robot manipulation

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.450140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.051415Z digest=sha256:adcdae14c27a0a6c839b009744f0c6723ca27214fa883933d861fe24eead7a2e

Observation 9a240ec4-d408-4b05-9466-77bf85cc2931 · outbound

This paper cites T., Burch, N., Anthony, T., et al.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models T., Burch, N., Anthony, T., et al

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.443290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.054069Z digest=sha256:73b5f640eec4043bfe29c33978792a49d29666861ff229d40c5afda347692a8a

Observation 7cc25b73-e6f9-474c-8e1b-9bbb409c0048 · outbound

This paper cites W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.436465Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.056476Z digest=sha256:71a9e642b2233389df4a3e884fecdfa6b785b1d9e5c3d08ef12de76b63cc1921

Observation 79f6e373-a879-4232-a29c-ab44d0342d36 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.058812Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.058812Z digest=sha256:57b9650b4cb1b0b29e32296230797a2b09316196f7afbc38c354144218477742

Observation a4ec7725-1129-417a-b37c-6c56cc759b92 · outbound

This paper cites Vision-language models are zero-shot reward models for reinforcement learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Vision-language models are zero-shot reward models for reinforcement learning

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.427785Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.061146Z digest=sha256:e12bfbb59e710f7c41c1bb2f6a9b5bd1c6948d6927299bd7a6808723f70cdbaf

Observation 152e4a5f-c165-4bbf-b6ea-99fa8a4866d3 · outbound

This paper cites Alfred: A benchmark for interpreting grounded instructions for everyday tasks.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Alfred: A benchmark for interpreting grounded instructions for everyday tasks

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.420356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.063491Z digest=sha256:3dd7eb688eb661a5c6e0c81f5f1d369e23e7fc451ad300d98b5f3ff5b7a9805d

Observation 47344c4e-5fef-4ef5-8a8b-101afd9f329e · outbound

This paper cites Mastering the game of go without human knowledge.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Mastering the game of go without human knowledge

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.413259Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.066287Z digest=sha256:d50e8864ee5928c9ca9d51774569fb9c3a344a04abb218d67fc6d44cd4697f2a

Observation fb2e8de6-62c5-4a73-b20b-371a725d6b4d · outbound

This paper cites Defining and characterizing reward gaming.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Defining and characterizing reward gaming

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.406207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.068655Z digest=sha256:fe5aec81038783c56af55c57a7a7cf82191bfc714ac1d3b2eb5f4260aa3a7a70

Observation bc7cffd5-1760-4a80-b29c-ed8ab87adccf · outbound

This paper cites Roboclip: One demonstration is enough to learn robot policies.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Roboclip: One demonstration is enough to learn robot policies

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.398503Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.071301Z digest=sha256:6952111f1daf5b74f5a27ef61bec4947bcc8ddc67568d2220f56852de0c964da

Observation bf5652b2-7b96-4a8d-b8e8-691262f6813c · outbound

This paper cites an unresolved cited work.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.073605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.073605Z digest=sha256:a9731370dfe3b03b922155f4d89b94f4b8f2c2b6993a4a8f1f08fdc04a450478

Observation 31100d27-f70c-4fa8-adb3-8340e9ff7d8a · outbound

This paper cites BC-IRL: Learning Generalizable Reward Functions from Demonstrations.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models BC-IRL: Learning Generalizable Reward Functions from Demonstrations

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-08-15T20:11:50.215316Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.075826Z digest=sha256:ffce3c2797e2ffe62bdcdcfb04052923072f24c22f5fc2367ba7cb2cbd20f24f

Observation b82791c4-b971-4804-91ea-9bb40540b6c1 · outbound

This paper cites N., Klissarov, M., Precup, D., Yang, S., and Anand, A.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models N., Klissarov, M., Precup, D., Yang, S., and Anand, A

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.388067Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.078985Z digest=sha256:b778c3820fcc6ce872f26dc4adf6b247a305baa2c3bd7b040bbb27daf300b7c0

Observation 3501a304-cb98-4603-9b4d-5673e051e416 · outbound

This paper cites M., Mathieu, M., Dudzik, A., Chung, J., Choi, D.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models M., Mathieu, M., Dudzik, A., Chung, J., Choi, D

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.381016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.081232Z digest=sha256:d7577c410fe668d1b29ef781bb0ade6458b1300a26b099fa0f226f0eaf24b18f

Observation 92a42e9a-0cbe-4c9a-bf1e-62977c6c1554 · outbound

This paper cites Prefclm: Enhancing preference-based reinforcement learning with crowdsourced large language models.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Prefclm: Enhancing preference-based reinforcement learning with crowdsourced large language models

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.374280Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.083692Z digest=sha256:c3668edcd2e675eb64724dd78a8f5d53f28e5593731d2bb40191859de4b63802

Observation 03bfdcc6-f154-466d-99a4-dde754301ab3 · outbound

This paper cites Rl-vlm-f: Reinforcement learning from vision language foundation model feedback.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Rl-vlm-f: Reinforcement learning from vision language foundation model feedback

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.367587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.086890Z digest=sha256:9ca4c42e242cfbd2e6aa3ba96e21b8f0f852184ec4495595a1a1ebc1de0a0219

Observation e0471fd0-7f57-4b2c-af2a-4befcde083e3 · outbound

This paper cites Robogen: Towards unleashing infinite data for automated robot learning via generative simulation.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Robogen: Towards unleashing infinite data for automated robot learning via generative simulation

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.360775Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.089133Z digest=sha256:a1980c33fd57c3ab1588ebf99332fdcb7d0e640af1cb19bc14744b740547f29f

Observation 0edab5db-26c1-4525-876f-eed1a70c5a89 · outbound

This paper cites Deep tamer: Interactive agent shaping in high-dimensional state spaces.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Deep tamer: Interactive agent shaping in high-dimensional state spaces

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.353946Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.091625Z digest=sha256:d8e7132021ebefce8feee0cb62e5bb2cfd16e5b5ad417f187add49b91f0614dd

Observation 3f135604-048a-4d78-9985-8e7d0b55331c · outbound

This paper cites To Smooth or Not? When Label Smoothing Meets Noisy Labels.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models To Smooth or Not? When Label Smoothing Meets Noisy Labels

Reference 60

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.094005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.094005Z digest=sha256:492659b5de6d64db5be521665ee9602745ce8efb3c6dbe52061ef736bdd55fe5

Observation f4722e6c-bd5d-4f97-be78-d59bd0e4c1b4 · outbound

This paper cites J., Waytowich, N., and Cao, Y.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models J., Waytowich, N., and Cao, Y

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.347047Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.097699Z digest=sha256:3e935d6173829cf41345df0b5dc30b708481946b145be055e738f4e3e24b9873

Observation 0454f6b4-69e9-4380-8b8d-e7e885f68c85 · outbound

This paper cites A survey of preference-based reinforcement learning methods.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models A survey of preference-based reinforcement learning methods

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.340165Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.100052Z digest=sha256:1f5e3e4f5070eee114a2ee317d427899353fcef49d4516aebc9925925b2af20f

Observation 8cbf753c-9b97-412e-aba5-7d66e7933de1 · outbound

This paper cites Maximum Entropy Deep Inverse Reinforcement Learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Maximum Entropy Deep Inverse Reinforcement Learning

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.103304Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.103304Z digest=sha256:a1b5fe307213f1b8c5db3af0ada4d5ff6013a9afc5fd0e92c14b799cfbbf7627

Observation 1f3c16bc-3931-4810-a9e1-23dff2cc7c20 · outbound

This paper cites Rethinking spatiotemporal feature learning: Speed-accuracy trade-offs in video classification.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Rethinking spatiotemporal feature learning: Speed-accuracy trade-offs in video classification

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.332839Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.105846Z digest=sha256:5034efaa35c8394a9a96ad52c45f364968e88f96370de2636c6805f75e76ec16

Observation 6c125c0c-8ac2-4e67-8025-1f79f779982a · outbound

This paper cites H., Liu, Y., Luo, Q., Zhong, V., Yang, Y., and Yu, T.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models H., Liu, Y., Luo, Q., Zhong, V., Yang, Y., and Yu, T

Reference 65

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.325574Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.108031Z digest=sha256:8d798acb5aa31563ec6e10478b5ad5882aa6f2e126a7eca0c4f4b442d0380672

Observation 8dfe1053-c665-45b2-97a7-4efdf4604d4b · outbound

This paper cites S., Hasegawa-Johnson, M.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models S., Hasegawa-Johnson, M

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.318199Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.110422Z digest=sha256:6d5623bc537f120a25f85a9b20f08893236017235075e242501a248b0dfcba45

Observation 76f92c68-e6b3-4c0e-9d94-6299c2633139 · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning

Reference 67

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.310928Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.112749Z digest=sha256:142876ca7de7096e03884e2c69b8d26fea50299372afdef75f18c8a15e3d0943

Observation fd1e9ae3-03b0-441f-993c-9d2c3098e3ff · outbound

This paper cites Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Rlaif-v: Aligning mllms through open-source ai feedback for super gpt-4v trustworthiness

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.115163Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.115163Z digest=sha256:c1d65cf6cc95519be1682b6744af3f50b6810d15c8eaa7f5102ee85c3e45717f

Observation 50d0fdfb-a02a-45a9-8138-a4f0d9b62ad1 · outbound

This paper cites Uni-rlhf: Universal platform and benchmark suite for reinforcement learning with diverse human feedback.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Uni-rlhf: Universal platform and benchmark suite for reinforcement learning with diverse human feedback

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.303190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.117653Z digest=sha256:0f5af11a51441bbec73727dbc9fbd91b6af094f00124405e189e040eb700b391

Observation 8843c7e3-8d65-444d-a5d2-8a30acfaeeab · outbound

This paper cites an unresolved cited work.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Unresolved cited work

Reference 70

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:11:50.295836Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.121196Z digest=sha256:77b6a1e22a5e1f3ddef47d3ee9533d8416dce884fde4d6f2fae28f99549ba9b9

Observation 3283974b-49e9-405c-a254-8fabfc8cf2ac · outbound

This paper cites Vision-language models for vision tasks: A survey.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Vision-language models for vision tasks: A survey

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.288621Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.123581Z digest=sha256:f036de378d149b90693fa3b3db16aae3e972c8f61baa75bbe8bdbc0e7776d288

Observation fd38fa2a-c157-4b9f-9580-a45c191aad7c · outbound

This paper cites Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-15T20:11:50.126624Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T20:11:50.126624Z digest=sha256:4a64ae02a462098fb730497efc04fa5c2a38910043d551b35f4a85cb618f5923

Observation 15e08b51-856f-419a-bd78-e2a3c9a54d08 · outbound

This paper cites an unresolved cited work.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models Unresolved cited work

Reference 73

Resolution
unresolved
raw_fallback, observed 2026-08-15T20:11:50.280981Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.129401Z digest=sha256:9aa8bff35274441e50e4664c0b7a45ea2c68b6a8235661bc2a15641202e23b5c

Observation 1c7435ff-d998-4abb-88c6-544dba34c2c7 · outbound

This paper cites D., Maas, A.

Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models D., Maas, A

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:11:50.274071Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=arxiv_source observed=2026-08-15T20:11:50.133035Z digest=sha256:f7eb174668c44f9ebb7dcf105b74b4ce16a90c7008914105a5feacfd49bf274e

Pith citing papers

Observation 8674e6ba-bf86-4071-b0a2-26340077f810 · inbound

Occlusion-robust Stylization for Drawing-based 3D Animation cites this paper.

Occlusion-robust Stylization for Drawing-based 3D Animation Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T10:13:19.750837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:13:19.750837Z digest=sha256:63a25ea073fe4c3ac953097caaad283ac5f1715ebd031755e425f88e5148fb5c

Observation 5b704c8c-fc4a-4656-9aa9-60b8aa3f330d · inbound

Self-Rewarding Vision-Language Model via Reasoning Decomposition cites this paper.

Self-Rewarding Vision-Language Model via Reasoning Decomposition Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T21:06:50.849423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-18T21:03:31.606674Z digest=sha256:43728859664ca9cb4aea5aa585dbe4b103e3033140c824c79e1154c238191ae4

Observation 0e9d3458-f541-44cc-bb1f-2ae14dbf8d0c · inbound

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning cites this paper.

SOLE-R1: Video-Language Reasoning as the Sole Reward for On-Robot Reinforcement Learning Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-13T16:10:12.689957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-13T16:10:12.689957Z digest=sha256:c459a447ff6e4a06ef4065b5060d1e687c83f944e4cd5cfb9ff4395afb2a6df1

Observation 97bc0aea-a88f-49e0-9bdf-0e44fc281504 · inbound

Learning Process Rewards via Success Visitation Matching for Efficient RL cites this paper.

Learning Process Rewards via Success Visitation Matching for Efficient RL Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

Reference 51

Resolution
metadata mismatch
arxiv_id, observed 2026-07-04T09:59:44.450686Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-26T09:20:35.062060Z digest=sha256:877c1868ac3ccc1d6d230e0de5b0658894ebee46594d25410e1744d7c6deabe1

Observation 38e1e6d2-6dc9-4c28-bcfd-3ae2414ab0c7 · inbound

Towards General Language-Conditioned Latent Safety Filters cites this paper.

Towards General Language-Conditioned Latent Safety Filters Enhancing Rating-Based Reinforcement Learning to Effectively Leverage Feedback from Large Vision-Language Models

Reference 213

Resolution
unresolved
no resolver link, observed 2026-08-04T00:49:36.677298Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T00:49:36.677298Z digest=sha256:36f9c5d17ea0c84a67802d0283303846791cdc8d2deabf4439aa0d367bfdf352