Pith. sign in

Paper Citation Record · LEDGER

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation

As of 16 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.11221.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.11221 v1

Coverage vector

measured 50 of 50 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:59:41.281514Z

measured 50 of 50 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-16T06:30:59.297886+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

50 of 50 outbound references displayed

  • verified exact0
  • verified fuzzy26
  • unresolved24
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 12b45feb-cf55-4525-be8a-32e6644f08ae · outbound

This paper cites Mastering the game of go with deep neural networks and tree search,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Mastering the game of go with deep neural networks and tree search,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.016760Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.016760Z digest=sha256:87414e8e725b5102dcdf4b4d5b11f00fe425fb54621686898624fcf41cdf4333

Observation 374f6784-dfc4-457b-873e-63da11c83dc0 · outbound

This paper cites Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.197622Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.022428Z digest=sha256:4f10e3a7384a474f370fcaf285b4a11284af76ead0e32875d56b8b57de187b38

Observation 2ada002b-50ab-4b48-999c-61eff2ab90db · outbound

This paper cites Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.180669Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.027555Z digest=sha256:5debae8f9e9a2f10e0cb9810fd11801d9358db7c97e52acf38c121372a413d9f

Observation 88899db3-57af-4c87-973e-c91341cb9213 · outbound

This paper cites Mastering atari, go, chess and shogi by planning with a learned model,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Mastering atari, go, chess and shogi by planning with a learned model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.161273Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.033210Z digest=sha256:9f5bc526ae164fcdb1e1021ba5666950bba104bfe9cbce16af0edcfb20df5f09

Observation e761d655-2eb4-46a3-b0a8-a6924722d97d · outbound

This paper cites Hindsight goal ranking on replay buffer for sparse reward environment,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Hindsight goal ranking on replay buffer for sparse reward environment,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.138548Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.038495Z digest=sha256:6913622ad97e250dd45c1145488a48244ddad4d9c1ad7f4887d4d02e0c46e78d

Observation cacf23d0-8b6d-43f3-afdb-3bcaa311684c · outbound

This paper cites Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.116098Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.044058Z digest=sha256:febd8d87723d9b86caf2b9592c8bbbcffaeac35585636ed6ff6cf9c921cca433

Observation 23b1ea9c-e676-46a9-9cc5-63fada2bb3e8 · outbound

This paper cites Predictive coding for decision transformer,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Predictive coding for decision transformer,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.096012Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.050425Z digest=sha256:024f24a6d4b3a5ae1382ffd6ea8db2e8c1a655a1f26a60b705940f81880894bc

Observation 6a11b1b3-ac27-41a0-9bfa-2f64ad4911f9 · outbound

This paper cites Dota 2 with Large Scale Deep Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Dota 2 with Large Scale Deep Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.056303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.056303Z digest=sha256:9bbcd81217d8855719384f21d25b76f972dd2186e086a6822b17346513f583de

Observation e12c152e-d9b1-43e1-abd5-c26168028409 · outbound

This paper cites A comprehensive survey on safe reinforce- ment learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation A comprehensive survey on safe reinforce- ment learning,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.078854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.061637Z digest=sha256:0ca9fbedb50c3d77ace9af4f0e44f01720a252bd700b3f4d0ad9210849621daf

Observation 21454ae8-9264-4d55-b328-08ade17e5816 · outbound

This paper cites No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.060001Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.067101Z digest=sha256:cda3494c5cea1080eff42172305f4a22fabbe98082161ca700bbd04453a39f0c

Observation 2819d1b1-c94e-4d10-aebe-a8f57790659b · outbound

This paper cites Deep reinforcement learning: A brief survey,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Deep reinforcement learning: A brief survey,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.040985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.071821Z digest=sha256:3ae0adcbd221ce12a4bfacb771322133dc64ab3004d32775dcd0de71b51c6c11

Observation 004f6a71-28d9-429f-8bff-8b3771b7e502 · outbound

This paper cites Language models are unsupervised multitask learners,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language models are unsupervised multitask learners,

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.076975Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.076975Z digest=sha256:dc57733a663097b41e51ab589eadef3a359fbdf6eef8221d365948029101a01c

Observation 1a12b399-4e20-4909-9477-33ca8df11950 · outbound

This paper cites Language Models are Few-Shot Learners.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language Models are Few-Shot Learners

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.082178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.082178Z digest=sha256:5abe255a3b7d1868e1278e040501d3b2d156641c527ee8064f9df8c81d4daa11

Observation 3b9b039e-4a3d-4c01-98fe-c08c0e227e66 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation On the Opportunities and Risks of Foundation Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.087154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.087154Z digest=sha256:50971cbb9a807bcaf7826ef68a7f0b29a167eaa35b70738f8293163ad26efc77

Observation 309e9cdc-7ec7-45f7-8d12-f298c6c72fd6 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.091688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.091688Z digest=sha256:a92fda5fde0074e6682b35cfa1e7a6acd09c66a306dbdeb5bd055eca46d4f14f

Observation e853ad67-0be1-4149-8690-34eeb5e2efdc · outbound

This paper cites Openai. gpt-4v,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Openai. gpt-4v,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:42.009167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.097123Z digest=sha256:954eaec4c46f2cc7f928211079d7f45a4f55008f5d1fa46cefe7f3fa042cbba9

Observation 73121656-f8a6-48f4-94f6-cee085346f26 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.101775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.101775Z digest=sha256:50dea8420fae20abef35b19c793af6f1aa755e923d6abe0c6340b54eea1f4e8e

Observation 0887c92a-18f5-4763-9aa5-0fb8b905530d · outbound

This paper cites Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.989419Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.106538Z digest=sha256:b4f2fd7fdcf9f623886c6ba977b9abfc3c3f2e8378d5561d8fc478acab52de2e

Observation fcbea04e-e131-4401-9fec-3787d0fbcbee · outbound

This paper cites Large language models as generalizable policies for embodied tasks,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Large language models as generalizable policies for embodied tasks,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.972020Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.111452Z digest=sha256:ca6f425aee11714c50cf8dce98c9c8ae115dbca87ac524bed4219f672841bb83

Observation e1b7d85e-be24-4f27-acb9-2c7dc0e7d20f · outbound

This paper cites Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.116130Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.116130Z digest=sha256:224c49d97d95a04c9dee15c4a751f174915917673b2740060687ec9c093f2e94

Observation 399ad55a-72b2-4784-9348-0ab362b99e56 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation LLaMA: Open and Efficient Foundation Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.122020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.122020Z digest=sha256:07062b48286be595e2ef9cfbcb1a7d75fc2f776490e8269f82aeda8848da47dc

Observation 72b92636-9d51-4181-8bd3-1892a3bd2cb7 · outbound

This paper cites Palm: Scaling language modeling with pathways,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Palm: Scaling language modeling with pathways,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.954129Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.126397Z digest=sha256:8fe703a6b28dd20f87a31f86281a4797f5b4425d9c0244845eba73f478b1e932

Observation 98407cff-95d8-42a0-8cb6-470690c23c8a · outbound

This paper cites Distilling the Knowledge in a Neural Network.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Distilling the Knowledge in a Neural Network

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.131638Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.131638Z digest=sha256:df5e1966084b45023b956281f17a034b373d8d15fd176fcea280dc8e79c00f61

Observation 304c07cf-6812-4672-98ba-78a28767842e · outbound

This paper cites Proximal Policy Optimization Algorithms.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Proximal Policy Optimization Algorithms

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.136847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.136847Z digest=sha256:fd0b70a825b211391c0aa5c6253423a3417e1dfb24cc0a3e1fdccc1150b8fe4f

Observation 9375b1ad-ebf4-4abd-8857-850b3cbece2d · outbound

This paper cites Asynchronous methods for deep reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Asynchronous methods for deep reinforcement learning,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.936201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.141241Z digest=sha256:69375efafd2dd8d7992df545c7fe53787395c030f3ff28d1cef60d7709f73b87

Observation 7ae865fb-960e-4774-9e16-aa28089e8908 · outbound

This paper cites Guiding pretraining in reinforcement learning with large language models,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Guiding pretraining in reinforcement learning with large language models,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.919926Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.147213Z digest=sha256:3ced415aca3009f52fa375d2bd23c539c1de71ffc944ac6d0df37ff20af277d5

Observation cb90abaf-fed4-450d-a731-507c58d1852f · outbound

This paper cites Progprompt: Generating situated robot task plans using large language models,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Progprompt: Generating situated robot task plans using large language models,

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.152352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.152352Z digest=sha256:cac1870ea545ce3f9dcb4e1f8a3f17b3d27a775c1d85c75eeae0daefc5a5df15

Observation 921fad93-7cc5-4c14-8671-f21cf653fcb2 · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.157203Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.157203Z digest=sha256:2e7a66e92d4943f65012dd1f3de9f76e7c7312f2f39237f279dc3ba9f2c32e3b

Observation ba6aa2d7-a84e-4c0f-88e2-76eb8fa93d00 · outbound

This paper cites Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.892063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.162015Z digest=sha256:fdd94092dacada6b195e5711f28c54dc5f47c751a6ecadf136d3de70ded9b1ba

Observation 90e9c8ea-ab1c-4d35-9c1c-09e51f68285c · outbound

This paper cites Grounding large language models in interactive environments with online reinforcement learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Grounding large language models in interactive environments with online reinforcement learning,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.874356Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.167776Z digest=sha256:9dfdd70604e593d99b0a403454176e7df6d7f8769b2fb3b304fd65443af83139

Observation 627dc17b-390e-4f3b-9360-b7d22f48d547 · outbound

This paper cites Introducing gemini: our largest and most capable ai model,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Introducing gemini: our largest and most capable ai model,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.856431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.173907Z digest=sha256:615e708c46ef6ed7fa35ddbc535b32841a03364ad9dce2b3c3954d6fde18a1ef

Observation dfcedf34-5a29-42cc-844b-085a800a7dfd · outbound

This paper cites Qwen2.5 Technical Report.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Qwen2.5 Technical Report

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.179132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.179132Z digest=sha256:61bb3c2cc3913f7b39a7315b740f5938b066038661db92ac7bcd1b90a24fd031

Observation 8db894f0-eb4a-4bec-93d9-24ca9e2e60c6 · outbound

This paper cites The claude 3 model family: Opus, sonnet, haiku.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation The claude 3 model family: Opus, sonnet, haiku

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.184370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.184370Z digest=sha256:8426a2ba5cdff6413fafa597921882ae39789c8c92b694089922998444eef3c3

Observation c5d046f5-9430-464c-a32b-38894c703de5 · outbound

This paper cites Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.189783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.189783Z digest=sha256:ece013be6c9f25ccf37683682aeb33fe59eee6d1beeae47258c8ecb46a03c975

Observation f9347ac1-3a04-4b37-87f8-a2a89600d53f · outbound

This paper cites Reward Design with Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reward Design with Language Models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.196985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.196985Z digest=sha256:2e192eb285fdc18943354fae16dd81a1aab0c06ff8a9ff8b3a4594ff2d099f18

Observation 4541a172-4582-4d2f-91c1-6f0dc5d04da7 · outbound

This paper cites Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.202600Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.202600Z digest=sha256:af2613986f498ca656fed6d47187094fee2469db683f6bdb9cbc0891b6d23442

Observation d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884 · outbound

This paper cites RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.208656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.208656Z digest=sha256:46a4d8fc6f9af740bd103553cb39c3bd0a60b921f0b83a3344e719eb1b90d13d

Observation 79cb93c5-bbab-4fc9-a2e6-0b13b27de1a8 · outbound

This paper cites Voyager: An Open-Ended Embodied Agent with Large Language Models.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Voyager: An Open-Ended Embodied Agent with Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.214510Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.214510Z digest=sha256:a8399ccdb7dacb5b51d712df5ffa780ae3cd06716540f92ee12e93d356296279

Observation aa1c2f58-d289-44cb-b677-69551e889f3e · outbound

This paper cites Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.221259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.221259Z digest=sha256:e42e6864a7d37d8fbc6a5ded6e0b59b7a9920a5a9592fc7cfc9112cc1597f32d

Observation 8bdc0382-62f0-44ac-9437-0d12274b4263 · outbound

This paper cites Embodiedgpt: Vision-language pre-training via embodied chain of thought,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Embodiedgpt: Vision-language pre-training via embodied chain of thought,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.826830Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.226802Z digest=sha256:a51e404d862d2e7377506829be9c33fd3c0541ce50eed460cd9586a412438a77

Observation 0c388fba-6c6c-49d7-862e-aad30cc1e6e5 · outbound

This paper cites Vision-Language Models Provide Promptable Representations for Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Vision-Language Models Provide Promptable Representations for Reinforcement Learning

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.232110Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.232110Z digest=sha256:14d0138244c57eebb43d46c10df3631c50b5fb441fd1265e18931654b9b85bc9

Observation 86f2b24e-5c2f-49cb-a5e0-0fa78e362dbe · outbound

This paper cites Policy distillation,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Policy distillation,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.810268Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.237652Z digest=sha256:1bc04316cfb1e9c37347bf2d50e51878ba2376de337610141c494eb9a087e545

Observation ff176453-e3da-4a72-8bc3-f890816a73d3 · outbound

This paper cites Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.244006Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.244006Z digest=sha256:6236b1095a31bc55d51ee37343394c6b72f0cfc22234fc9da4a99a2cd73957cb

Observation ae662865-6a6f-42fe-b1ad-6f57d153b6d1 · outbound

This paper cites Guided policy search,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Guided policy search,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.793015Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.249797Z digest=sha256:a3c85b6e6f4d9cc9d3b9671e2d3907fe5dcde8fb3ebd1c25fb4d900b1e61aee7

Observation 44c0d836-a331-474c-9338-6de3c43ae6bb · outbound

This paper cites Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.764856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.255806Z digest=sha256:e61b667d181b230c44892bf942c73f28b5a514ce201a89713dac923c66774697

Observation 497f7ed1-13c2-4fea-a19c-dea6c2b02efc · outbound

This paper cites Agents teaching agents: a survey on inter-agent transfer learning,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Agents teaching agents: a survey on inter-agent transfer learning,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.746078Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.260660Z digest=sha256:3f63d7b4b4bd72d0053c0edcc2c4df2229da064c07d9136f5beb89e66224993d

Observation 9424baa2-0bc3-4fa1-b8f1-3a8f7965de6d · outbound

This paper cites Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.725844Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.265404Z digest=sha256:c2e706f41097880c9cbcf573421cebf85b22040f2311a8667d75e41ed4dc32d5

Observation 7e66c295-55df-46b2-a47f-c04b0a8c8b1d · outbound

This paper cites Kickstarting Deep Reinforcement Learning.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Kickstarting Deep Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-15T20:59:41.270545Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:59:41.270545Z digest=sha256:352e563aa9298d0727298d6a0d14b4314d8db3364380b8f4bb0fe41ac5abf8f3

Observation 7ee6f8c5-bf57-4e97-bcb9-0211e6784704 · outbound

This paper cites When does label smoothing help?.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation When does label smoothing help?

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.707149Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.276607Z digest=sha256:d664e541dc4219b37f056fea447fa69256aadb3e02f7354c413b38e2fc53203e

Observation 1a679df0-1267-4705-a418-1b30313f31c6 · outbound

This paper cites Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,.

Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:59:41.688286Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.

source=pdf_text observed=2026-08-15T20:59:41.281514Z digest=sha256:1376507959da994e0b06c81ccdb3ce817e0aba5905f2c83e38132dc82957c3dd

Pith citing papers

No inbound Pith citation observations are available.