Pith. sign in

Paper Citation Record · LEDGER

Improving Vision-Language-Action Model with Online Reinforcement Learning

As of 21 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 34 inbound Pith citation observations for arXiv:2501.16664.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2501.16664 v1

Coverage vector

measured 55 of 55 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-10T11:39:56.248989Z

measured 89 of 89 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 34 of 34 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T12:02:43.017171Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-04T09:59:44.548397Z

Reference resolution

55 of 55 outbound references displayed

  • verified exact1
  • verified fuzzy15
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 4ca4a5c0-e137-4ee5-a4d9-5611a1d9aa9f · outbound

This paper cites Training language models to follow instructions with human feedback,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Training language models to follow instructions with human feedback,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.991651Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.012689Z digest=sha256:4a389b8eaf5f40bcc0373078dda74b370870c0aa6e811e0c44413d9e8d7caa6f

Observation 34225ca0-7377-480e-964a-f12ea759e71f · outbound

This paper cites Improving alignment of dialogue agents via targeted human judgements.

Improving Vision-Language-Action Model with Online Reinforcement Learning Improving alignment of dialogue agents via targeted human judgements

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.017865Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.017865Z digest=sha256:818100e6b8e7acc9178d5c0cd5815442deef4c9821534d7dc178b5114e7239cd

Observation da756296-10e2-402d-b8cd-d79a7c141e67 · outbound

This paper cites LaMDA: Language Models for Dialog Applications.

Improving Vision-Language-Action Model with Online Reinforcement Learning LaMDA: Language Models for Dialog Applications

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.022515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.022515Z digest=sha256:0ec76a4215cb73e508a19dd2759a0e507c42a1f54fa1714547652534d2528c5b

Observation 2a3ca115-cde0-4104-a4c9-13334df3f68e · outbound

This paper cites Evaluating Large Language Models Trained on Code.

Improving Vision-Language-Action Model with Online Reinforcement Learning Evaluating Large Language Models Trained on Code

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.027365Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.027365Z digest=sha256:256b9c70f962a41ac0a8da43c17cc42d94d5c8b837cd34e965120bbf3b17f96a

Observation 1b41036e-dd35-4d00-8dae-5a5979e4d840 · outbound

This paper cites Do As I Can, Not As I Say: Grounding Language in Robotic Affordances.

Improving Vision-Language-Action Model with Online Reinforcement Learning Do As I Can, Not As I Say: Grounding Language in Robotic Affordances

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.032353Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.032353Z digest=sha256:7e5412c03b109ae48bdb613571454f99386d565ce969d0b42739a6579777e079

Observation d02f40da-e6ae-4a6e-943c-5c771f8af09e · outbound

This paper cites Inner Monologue: Embodied Reasoning through Planning with Language Models.

Improving Vision-Language-Action Model with Online Reinforcement Learning Inner Monologue: Embodied Reasoning through Planning with Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.036900Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.036900Z digest=sha256:f53ceb60ec4cbe0d51e2f719b2f041c9b6982969e8dbd7e58da2cbda994fe806

Observation 888e2de0-db23-492c-b225-5cc9bc0f05fa · outbound

This paper cites RT-1: Robotics Transformer for Real-World Control at Scale.

Improving Vision-Language-Action Model with Online Reinforcement Learning RT-1: Robotics Transformer for Real-World Control at Scale

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.041679Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.041679Z digest=sha256:42d9e8229654f01a8276c9e1aefcc20d6acedef7300ec9afd056ae0a395bc95d

Observation 632c73c7-66a5-4494-abeb-292de82cfc4f · outbound

This paper cites RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control.

Improving Vision-Language-Action Model with Online Reinforcement Learning RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.046012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.046012Z digest=sha256:bc93ef413c00900f4b82c95d99428ccc04d803aafd7d0dac03184c782fe7dadf

Observation edf33287-b221-4324-ac5b-f616fd3ad41b · outbound

This paper cites A Survey on Vision-Language-Action Models for Embodied AI.

Improving Vision-Language-Action Model with Online Reinforcement Learning A Survey on Vision-Language-Action Models for Embodied AI

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.050100Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.050100Z digest=sha256:b7d26e7e97bd01100f091d9d0132a81c404d2d68ac87cd3295aafb1337ea0d67

Observation 3fe8b26d-df61-47b0-b545-368be1f23d13 · outbound

This paper cites Hirt: Enhancing robotic control with hierarchical robot transformers,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Hirt: Enhancing robotic control with hierarchical robot transformers,

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.975134Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.054300Z digest=sha256:7d1cb6a637fcd87d2c0038e72b913f04b176df340d6ce3201a84fa36d1a281fe

Observation ac41728e-41a9-47c1-bddc-354ccd085d3e · outbound

This paper cites Vision-Language Foundation Models as Effective Robot Imitators.

Improving Vision-Language-Action Model with Online Reinforcement Learning Vision-Language Foundation Models as Effective Robot Imitators

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.058905Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.058905Z digest=sha256:cd16bb174da4b4c8778ae6870e8924dc05cf08abbeea97d865747470f394aa3b

Observation 2f743d18-c3bf-4e2b-8ad5-8eb37e1df240 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Chain-of-thought prompting elicits reasoning in large language models,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.959597Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.063948Z digest=sha256:da42c94c35dcc924fd334052fc41c7dd9786f57dd30c065aa8714341ceae8a14

Observation 79c7c249-caf3-450f-8837-c1be54add358 · outbound

This paper cites Open X-Embodiment: Robotic Learning Datasets and RT-X Models.

Improving Vision-Language-Action Model with Online Reinforcement Learning Open X-Embodiment: Robotic Learning Datasets and RT-X Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.068654Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.068654Z digest=sha256:133e0478b737870dc2cc5cc084ab6105416ef5d87d8821fa7ff4bb1cc723bfcd

Observation bbda4d70-8437-4dbf-88f1-2288d9cf30a6 · outbound

This paper cites Data quality in imitation learn- ing,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Data quality in imitation learn- ing,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.944376Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.073033Z digest=sha256:d44684cbc2cc96fa1ba8251dda9d155e88faf2243ebe55b85d5402229ee3a9fc

Observation 021b381e-610e-4990-8bc2-80032795aa18 · outbound

This paper cites Conservative q- learning for offline reinforcement learning,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Conservative q- learning for offline reinforcement learning,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.929848Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.077018Z digest=sha256:c8fb48d199248277576e332b1a457e4d83023fbc9fec1f071a2a01d579e41599

Observation e1add7f7-cee4-4bea-a5b0-843957fda167 · outbound

This paper cites Learning to summarize from human feedback,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Learning to summarize from human feedback,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.915304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.081200Z digest=sha256:c32d2ceda3cc81b3623e95733d200a7a07afe8dfa7403b20ed322c1d25995fd4

Observation dd6c7b63-915f-4d85-870b-91ffaea0f988 · outbound

This paper cites Deep reinforcement learning from human preferences,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Deep reinforcement learning from human preferences,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.084970Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.084970Z digest=sha256:88db10d9f1e29b0248932a0475a85ef98ac65204da7da757cfff6dc617c15fad

Observation 2dde8dfa-2086-414e-b676-2deb21d13a71 · outbound

This paper cites Stabilizing transformers for reinforcement learning,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Stabilizing transformers for reinforcement learning,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.891837Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.088801Z digest=sha256:2b983ec265fd1f73b83866c666d194872ed8c05bf3a1f204735af364051aff50

Observation 6b6372a7-f651-4083-b671-057d8223725a · outbound

This paper cites What matters for on-policy deep actor-critic methods? a large-scale study,.

Improving Vision-Language-Action Model with Online Reinforcement Learning What matters for on-policy deep actor-critic methods? a large-scale study,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.876951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.092638Z digest=sha256:e121727a2136d6b1d2814bbc14b49d06d64ac28e814de5b4be7e3c0d7e71ac4b

Observation f09bf7b5-5e32-4408-bdd7-9f6b7ea461d6 · outbound

This paper cites Training Larger Networks for Deep Reinforcement Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning Training Larger Networks for Deep Reinforcement Learning

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.097738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.097738Z digest=sha256:0bc0aea41f592d863868690e71c758717e4a316474942b0a6b27707c965998b4

Observation 7a8e40d1-c93c-42e1-8e4f-ea9e5428aebd · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.101831Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.101831Z digest=sha256:5362ea1c732410b89a779441ab36df5f6b19aed54ac0b5b2e08e9b13287664ac

Observation 3c5aec9e-e848-48b4-adce-5ba4702c699e · outbound

This paper cites Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.105672Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.105672Z digest=sha256:1046029e2d8615acf9b78b993a8f552063d1490a26476acae68ae9f89079ca03

Observation 0ead807a-a00f-483b-98d3-695f3f7bd88f · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

Improving Vision-Language-Action Model with Online Reinforcement Learning Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.110024Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.110024Z digest=sha256:a2dd1b97234c109cee2edd6d343e5e7e05d87e7ef83c504a4e81abdf1b7a19cd

Observation b5feda6e-87cd-4782-8d98-e3d621ab3b80 · outbound

This paper cites Minedojo: Building open- ended embodied agents with internet-scale knowledge,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Minedojo: Building open- ended embodied agents with internet-scale knowledge,

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.114339Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.114339Z digest=sha256:2ed36b9e461a2b625acdbe9f4b002c160202e1e8ce412c46b967ef3904f067d6

Observation b5079cf3-34dc-4d7f-bafa-83893cb2a5af · outbound

This paper cites Language Reward Modulation for Pretraining Reinforcement Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning Language Reward Modulation for Pretraining Reinforcement Learning

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.118369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.118369Z digest=sha256:bc42ae1936eadd647bb28eb325c998dd86c222bced1c4d4ef0a7e43eb5cd43fb

Observation 641188bd-4d7f-4b84-9886-1b045d375180 · outbound

This paper cites Learning to Model the World with Language.

Improving Vision-Language-Action Model with Online Reinforcement Learning Learning to Model the World with Language

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.122452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.122452Z digest=sha256:45e63a3284fde3d18871aea8ac6c5ab6d9ae3f55ec4fa82f1292fb6fd56afc20

Observation 7a3e71a8-1df3-4afe-acf9-ce56e2b88004 · outbound

This paper cites Grounding language to entities and dynamics for generalization in reinforcement learning,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Grounding language to entities and dynamics for generalization in reinforcement learning,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.848133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.126601Z digest=sha256:056c97a57949596bddd3b40f04c2c3bb4151ac47737007d101c59a5a2847f7e3

Observation 4c2d6656-e7ad-4a14-b2fb-bbd4988ff49e · outbound

This paper cites Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language.

Improving Vision-Language-Action Model with Online Reinforcement Learning Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.130847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.130847Z digest=sha256:b3938c2a8a11c0dc644336149d57ac8cd0023a55c46bed8381fa5ecd26a9a634

Observation a93d13f5-ad75-4fea-b855-4df3adffdde8 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Improving Vision-Language-Action Model with Online Reinforcement Learning PaLM-E: An Embodied Multimodal Language Model

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.134999Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.134999Z digest=sha256:3912798d7c6d83a444942aac51bdf149f7ae7276e1997ececf91ee34dc812f1a

Observation e8fd803f-e8e3-4706-ab09-2e1cf7883c5a · outbound

This paper cites DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment.

Improving Vision-Language-Action Model with Online Reinforcement Learning DoReMi: Grounding Language Model by Detecting and Recovering from Plan-Execution Misalignment

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-10T11:39:56.481389Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.139199Z digest=sha256:bd07df8aa77065541a55ecc3258d467060ff47076aa717e94635b83c0470d23c

Observation b3d59818-6969-48fb-b7b8-985ba977473d · outbound

This paper cites Collaborating with language models for embodied reasoning.

Improving Vision-Language-Action Model with Online Reinforcement Learning Collaborating with language models for embodied reasoning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.143523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.143523Z digest=sha256:b7a88feec2101644191c4a9b546519ff0541b0ba063044b45be42e9c91305f82

Observation ec3def7f-3dfb-469e-b933-b7fb45cf9005 · outbound

This paper cites Prompt a Robot to Walk with Large Language Models.

Improving Vision-Language-Action Model with Online Reinforcement Learning Prompt a Robot to Walk with Large Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.147898Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.147898Z digest=sha256:8d88a19a046ad8502604135dd8e5c95e4a4592f6a910b277d83631f326b79c16

Observation 2ff6a15b-a345-4b56-9074-18853aa64dc7 · outbound

This paper cites Code as Policies: Language Model Programs for Embodied Control.

Improving Vision-Language-Action Model with Online Reinforcement Learning Code as Policies: Language Model Programs for Embodied Control

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.152120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.152120Z digest=sha256:7161b34f0b3d70ff0e2a939e2580a7c6219b73f054b7d719cebaec5771059215

Observation 711876c2-32e3-47eb-ad4c-4e7bfbd5ee24 · outbound

This paper cites Vision-Language Models Provide Promptable Representations for Reinforcement Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning Vision-Language Models Provide Promptable Representations for Reinforcement Learning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.156128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.156128Z digest=sha256:97e430916f969206780dd7c3a41ebe234779096e58dccd14dd955bcb297b8d2e

Observation ca8f1f87-fbd0-4df1-a885-97eb384485d3 · outbound

This paper cites Learning to summarize with human feedback,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Learning to summarize with human feedback,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.833208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.160408Z digest=sha256:b6434b654aa297e77fa9e7b112ffe8172a19dd7b0bd52213f69c7cfca402ce68

Observation 6956eb4e-c778-4d35-9b66-da394f6e2173 · outbound

This paper cites Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization.

Improving Vision-Language-Action Model with Online Reinforcement Learning Is Reinforcement Learning (Not) for Natural Language Processing: Benchmarks, Baselines, and Building Blocks for Natural Language Policy Optimization

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.164394Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.164394Z digest=sha256:54307f766d227c0cc74234535d1f6efe77532e7df213e3462cbb1c3563db7666

Observation a124d586-bb0c-40ce-bc27-b9262472fcf5 · outbound

This paper cites Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems.

Improving Vision-Language-Action Model with Online Reinforcement Learning Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.168660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.168660Z digest=sha256:536375e9bde3650fcc4a71b70d4202562c8ed0b0f29bcb8c63a0702a3a7bd021

Observation 7674b840-e200-4f01-95af-002683741b02 · outbound

This paper cites Grounding large language models in interactive environ- ments with online reinforcement learning,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Grounding large language models in interactive environ- ments with online reinforcement learning,

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.172817Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.172817Z digest=sha256:e32d89c14070f814b55e8d8763a69bf795d3ba7272691dee15bfad9cb9043e91

Observation 0dcba127-0551-4671-8812-e3dc282d1bec · outbound

This paper cites Large language models as generalizable policies for embodied tasks,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Large language models as generalizable policies for embodied tasks,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.808005Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.176756Z digest=sha256:f7154c9bdefb1878c9a952b15069bd5568c663b135436becd285ae6d8d445f33

Observation 6af1a7e6-4817-452c-8227-94dc0a889695 · outbound

This paper cites Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.180466Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.180466Z digest=sha256:527bd3a8ea0797ef589c03b451bc564eb3435df0c1416544fdd3440c610c6e47

Observation 206a948f-f3e9-49d2-bbf5-db00b6626942 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Learning transferable visual models from natural language supervision,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.184885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.184885Z digest=sha256:4503d51319ad47119be7cd9d22d6bc659104cde7116e40a7a838cfc6c9f99749

Observation 979533f5-be29-4925-b3a6-78d0b5736011 · outbound

This paper cites Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.188850Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.188850Z digest=sha256:cfbbf3351192b7f1a6171632af172595364b5bb670ff8ec644ef4081d3ee8d05

Observation bd9a4171-2f6c-44fd-9d3d-0d65787c0651 · outbound

This paper cites Instructblip: Towards general-purpose vision- language models with instruction tuning,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Instructblip: Towards general-purpose vision- language models with instruction tuning,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.773513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.192784Z digest=sha256:f0daf3840aa5e7919abd9d52150ea0e43a02bee06423a4d670c3813771c26851

Observation 53383857-eaf3-44ae-991d-af29289cb0ac · outbound

This paper cites Set transformer: A framework for attention-based permutation-invariant neural networks,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Set transformer: A framework for attention-based permutation-invariant neural networks,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.759993Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.199741Z digest=sha256:972bfed5ade8b4aa5f520a00ff1a222317c8afe3211a5099069b0d79c9316852

Observation cd51998c-a8aa-40ec-80e4-9a2de31f642a · outbound

This paper cites Multi layer perceptron,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Multi layer perceptron,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.745458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.205238Z digest=sha256:5008303374b19cbbfd4ba37e7dc160d8176f0471d44a2bb5d74324888588e524

Observation 143775d4-b6a4-4799-9166-1102c6e1380b · outbound

This paper cites LoRA: Low-Rank Adaptation of Large Language Models.

Improving Vision-Language-Action Model with Online Reinforcement Learning LoRA: Low-Rank Adaptation of Large Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.211616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.211616Z digest=sha256:1dafacddce25274110b467744fd8d37edcdc0a0c03c20ed9cadc9e562f45c734

Observation 93fe08f0-e7bb-4869-b9eb-f37508278cea · outbound

This paper cites TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models.

Improving Vision-Language-Action Model with Online Reinforcement Learning TAIL: Task-specific Adapters for Imitation Learning with Large Pretrained Models

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.215688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.215688Z digest=sha256:35f963ac803a9eb3b5bf6896dfaee627da216868a2623ed020ee1c7b11afdde4

Observation c5ad8d96-bdee-49cf-abbb-fd04e117f5bc · outbound

This paper cites RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation.

Improving Vision-Language-Action Model with Online Reinforcement Learning RoboCat: A Self-Improving Generalist Agent for Robotic Manipulation

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.219890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.219890Z digest=sha256:87cfeeb015458125397b01965860a3ce6469c13fbde43eda421b4bca5bfe66e4

Observation 95432a34-162e-4957-92e8-8ef20c55a993 · outbound

This paper cites Catastrophic interference in connec- tionist networks: The sequential learning problem,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Catastrophic interference in connec- tionist networks: The sequential learning problem,

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.223806Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.223806Z digest=sha256:a32d1b10d7b31d0658d6fed670bae74435ba0e8ddc7e552da8202deabf9d2fa6

Observation ff449bde-51f1-4d24-9e9b-17008d405a6d · outbound

This paper cites Octo: An open-source generalist robot policy,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Octo: An open-source generalist robot policy,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-10T11:39:56.723510Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-08-10T11:39:56.228047Z digest=sha256:70c94301f40e02bc888e75c09a3d80ed4a6e72ce10d592cd143c90ee0ed3aeaa

Observation 8a1dd051-fe4d-4618-9beb-509c30ec7095 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Improving Vision-Language-Action Model with Online Reinforcement Learning Proximal Policy Optimization Algorithms

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.232268Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.232268Z digest=sha256:5d04c7ed4475dda748edd66de691ab6f6352164a95fae029a8d73a6d34054d5b

Observation 5e395ff8-c048-45d3-9100-51c08801f75f · outbound

This paper cites SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning SERL: A Software Suite for Sample-Efficient Robotic Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.236498Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.236498Z digest=sha256:5f9fd87e42e69bb02f99f1b83b50fdec205c83a0b0dd725daad86df5a71e15a3

Observation af934db7-e170-40db-9e11-6854753de815 · outbound

This paper cites FMB: a Functional Manipulation Benchmark for Generalizable Robotic Learning.

Improving Vision-Language-Action Model with Online Reinforcement Learning FMB: a Functional Manipulation Benchmark for Generalizable Robotic Learning

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.240680Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.240680Z digest=sha256:931fe857f529d675257ece2359459dc4b0276bbb3fc913a92b70e2332860c246

Observation 8df84912-ce53-425a-8214-f4e6b0672e6a · outbound

This paper cites Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards.

Improving Vision-Language-Action Model with Online Reinforcement Learning Leveraging Demonstrations for Deep Reinforcement Learning on Robotics Problems with Sparse Rewards

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.244575Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.244575Z digest=sha256:7826501bf45c8e230a17788cc55096af2b70d7a35181eb8667dc07d47bc95a50

Observation 093aedf0-9136-4e86-a557-d2c2d2d4afca · outbound

This paper cites Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,.

Improving Vision-Language-Action Model with Online Reinforcement Learning Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-10T11:39:56.248989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T11:39:56.248989Z digest=sha256:f68eaf705559a20b0ee4c2c97f43a2d0012f31a62ec4fb99f084e6283ddbe6af

Pith citing papers

Observation a4dcedf2-a314-48ff-a734-3fb524645888 · inbound

Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations cites this paper.

Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 101

Resolution
verified exact
arxiv_id, observed 2026-05-12T18:38:11.188770Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-12T18:38:11.110166Z digest=sha256:363dbf83ec520d5c850a78105b52797a36efc61b4903951da59c898fa533b5fb

Observation b0f97b08-27e5-4fcf-a420-409b0c1ef202 · inbound

DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control cites this paper.

DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-14T19:48:48.815167Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-14T19:48:48.725800Z digest=sha256:011f3ffabcefe5976d8e66f06f7933e956e39d5dd88b8931f797b27cd24da942

Observation 8d2ecca4-10a1-4fb7-ab40-3303c1c91845 · inbound

Generative AI Act II: Test Time Scaling Drives Cognition Engineering cites this paper.

Generative AI Act II: Test Time Scaling Drives Cognition Engineering Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 102

Resolution
unresolved
no resolver link, observed 2026-08-16T12:02:43.017171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-16T12:02:43.017171Z digest=sha256:2845a38c9d0ab305b81ef840a9cc95d04d9e381222bdb6e5f883112964e44540

Observation ed18330e-329b-432b-bc7a-086823ea5350 · inbound

ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning cites this paper.

ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-15T22:23:37.985151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T22:23:37.985151Z digest=sha256:ada0ff760adacecd3fb55ade748add35e49ab838c639d09e98fca2ba64c41995

Observation 7108ed8c-d69a-4c54-b1fd-20506952726b · inbound

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning cites this paper.

VLA-RL: Towards Masterful and General Robotic Manipulation with Scalable Reinforcement Learning Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 22

Resolution
verified exact
arxiv_id, observed 2026-05-16T12:55:40.499761Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-16T12:55:40.245908Z digest=sha256:83b5394974532a3d8a2060faba9d6af9bb14fbbd39aea925aa22fc17954e36ff

Observation a27cf8f7-cea0-43b4-b7c8-1ec0799ea99a · inbound

RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback cites this paper.

RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:10:11.693083Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:10:11.693083Z digest=sha256:8f51a7a563cbcf2ab966a104380d4c27c48493e6fa06c7031c88787091a8ec27

Observation 7c594d43-1aa7-4147-8322-d05287c928d0 · inbound

Continual Learning for Generative AI: From LLMs to MLLMs and Beyond cites this paper.

Continual Learning for Generative AI: From LLMs to MLLMs and Beyond Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T00:40:21.447558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T00:40:21.447558Z digest=sha256:adf587f2aa6066c8546535eb3de6046d1a2a8475d17833a49286ca79d46f489c

Observation 65301ea4-71ca-451a-a691-056ceb3600ae · inbound

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models cites this paper.

RLRC: Reinforcement Learning-based Recovery for Compressed Vision-Language-Action Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-15T19:10:14.889198Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T19:10:14.889198Z digest=sha256:c7927fee0213f79624b2e8d1c472b32fbe48d64b34eb5848494c9188d6680eae

Observation 689c3033-cf16-4782-a3a7-eb31f2b0ae21 · inbound

SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training cites this paper.

SimLauncher: Launching Sample-Efficient Real-world Robotic Reinforcement Learning via Simulation Pre-training Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T19:53:06.290688Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T19:53:06.290688Z digest=sha256:bf7e027f0870679c15cf7d494d58f16d8c1c1c9f098ce3b6a36312e1298aa098

Observation 2634ff7d-e50f-4d87-b330-b96d3689fa0c · inbound

Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach cites this paper.

Source Component Shift Adaptation via Offline Decomposition and Online Mixing Approach Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T20:35:43.638797Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T20:35:43.638797Z digest=sha256:e8516019b6becc33fd648333015f60c96b825e80bf1a2e48e7df0238d8c01de4

Observation cd37d08d-cc3e-430e-9226-c59979728f02 · inbound

Leveraging OS-Level Primitives for Robotic Action Management cites this paper.

Leveraging OS-Level Primitives for Robotic Action Management Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T20:38:40.022379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T20:38:40.022379Z digest=sha256:219461d003d6a5db946be9f6b1fe9062ff34f1843836d78749a0adb945382c4a

Observation 35ba3196-ca77-4c1e-8e83-1549cb75e2ac · inbound

Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models cites this paper.

Balancing Signal and Variance: Adaptive Offline RL Post-Training for VLA Flow Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T10:30:23.538701Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T10:30:23.538701Z digest=sha256:e06606c2296ff3d525b60a43b49e211945f1c240d7de460180d063e8a452c0f0

Observation 2725aca8-5c7c-48f3-8fbf-57cd903c3e8f · inbound

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization cites this paper.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.875241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.875241Z digest=sha256:cbb41c5aab2dc1c8e31794c896af96b21b0175e6914a1514c73c4d134fa6316a

Observation 0bfe0573-d8ee-4686-9445-2942dda656c4 · inbound

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning cites this paper.

SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 41

Resolution
verified exact
arxiv_id, observed 2026-05-15T08:02:11.482284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-15T08:02:11.189795Z digest=sha256:b01809cef39f475be8be2bb6d969abc6ded6d0cfbbbf1db8eed9c387d37030cb

Observation 1ab1b8f3-bc2c-4628-bbb2-d0007fb19793 · inbound

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models cites this paper.

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T10:24:56.027069Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:24:56.027069Z digest=sha256:1d9014f9faa1ef65100001de4fa1f3579385622d0c38605dcd203bcb64ae3063

Observation 98b2c27e-2eaa-4d5d-bc6d-f8c540b37840 · inbound

Ctrl-World: A Controllable Generative World Model for Robot Manipulation cites this paper.

Ctrl-World: A Controllable Generative World Model for Robot Manipulation Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-16T01:14:10.368029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-16T01:14:10.174044Z digest=sha256:16cfe838c49f78f5631c2b37f72247b445f6f0b558d9292ec7987affe99cd360

Observation 90b52234-e401-4d30-be29-95df048fed96 · inbound

Reflection-Based Task Adaptation for Self-Improving VLA cites this paper.

Reflection-Based Task Adaptation for Self-Improving VLA Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-18T07:31:02.913540Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-18T07:28:11.187479Z digest=sha256:955148dd8c6d8901ce3c34dcb49b23ddc21fc94dab9c8666ae915e660dcc65f8

Observation 96f1fb71-e18f-481e-972d-a1fafab88cf6 · inbound

$\pi^{*}_{0.6}$: a VLA That Learns From Experience cites this paper.

$\pi^{*}_{0.6}$: a VLA That Learns From Experience Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-12T10:34:59.347237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-12T10:34:59.134604Z digest=sha256:4aa8947a74ee07d0cdd097f8ff02bda55bc4e93c5066f70f0b080bb659de9343

Observation 1ab87388-22a1-49df-b0e9-e41fa555e3f4 · inbound

VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models cites this paper.

VLA-Arena: An Open-Source Framework for Benchmarking Vision-Language-Action Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-03T13:53:24.794126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T13:53:24.794126Z digest=sha256:35a693af0efa965972200359d420c553649b801af06d029dc8beff39ad3b0bb9

Observation 50f1e294-9b47-479e-a108-da46695ada15 · inbound

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models cites this paper.

VLM4VLA: Revisiting Vision-Language-Models in Vision-Language-Action Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-03T12:30:33.790260Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T12:30:33.790260Z digest=sha256:4d25f7bac3fa5cfe50cfd70b45135341fc925202d9afedd1c91d43b2b102f5c2

Observation 58ea4866-2491-401c-8be1-2517f1eb356e · inbound

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation cites this paper.

VGAS: Value-Guided Action-Chunk Selection for Few-Shot Vision-Language-Action Adaptation Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 11

Resolution
verified exact
arxiv_id, observed 2026-05-25T07:00:25.994640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-25T07:00:01.741166Z digest=sha256:eb1a2a914992830be0274cfadd6311de78a88661af689bbf29fe71fa43afc198

Observation a8596dfc-c014-4905-aa7b-adc13a2adb55 · inbound

TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation cites this paper.

TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-21T13:14:10.897478Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-21T13:13:53.818915Z digest=sha256:c016b1d532a0d8f58b54d5903ac5cb1ab96ef2f548fb918295214413ab9e88cb

Observation 0d17fbb1-bf9e-414c-b44b-a41290644b48 · inbound

Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning cites this paper.

Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 21

Resolution
verified exact
arxiv_id, observed 2026-05-21T14:10:13.288701Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-21T14:07:10.387869Z digest=sha256:e93ec3f9fb139ba0452b54cf920b8b81daff7a45b6aa488b02142ca3b6538b5a

Observation 694260c5-fe28-4f0e-baf9-87fcd39c434c · inbound

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal cites this paper.

PhySe-RPO: Physics and Semantics Guided Relative Policy Optimization for Diffusion-Based Surgical Smoke Removal Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-05-15T01:23:26.867422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-15T01:22:42.691009Z digest=sha256:c62ede38180d8177dbd5b72b0cde91233bf713073fd0810ee0145485b150be1d

Observation bbc803a6-8cfe-467b-9d40-981a1f8da0fa · inbound

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation? cites this paper.

Veo-Act: How Far Can Frontier Video Models Advance Generalizable Robot Manipulation? Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-05-10T22:10:49.569291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-10T20:10:54.362107Z digest=sha256:e1929e04d4c714a8809c15f36a851ea5c7ce11ac1bb5a46f86471cc27badd5c6

Observation f1ace14f-8eea-428c-b697-830e5a049e2a · inbound

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes cites this paper.

E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-10T22:00:48.347579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-10T20:21:45.365156Z digest=sha256:2d1ab010319d3489d9fc223e4c7e416d98237cbbc13840f2099836a1b7f9d553

Observation 44d8d85a-3225-42b0-bb30-1eb410e04121 · inbound

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking cites this paper.

Learn Where Outcomes Diverge: Efficient VLA RL via Probabilistic Chunk Masking Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-05-20T21:09:02.659480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-20T21:05:45.024226Z digest=sha256:1951d38899589d94c589f3838c33844421a622ee379e8ec3af939e62fd25de48

Observation 56c18ea0-13ad-4965-98ff-870fb0e1512d · inbound

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization cites this paper.

DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 133

Resolution
verified exact
arxiv_id, observed 2026-05-20T12:43:17.257279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-05-20T12:39:50.004269Z digest=sha256:a1de2d5e00aa68439768010475e5e4db60fec8cfa693a6d8cf8ddb685972b6c2

Observation 510528f5-e4b1-4196-8011-37b2e07639e6 · inbound

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models cites this paper.

Agentic-VLA: Efficient Online Adaptation for Vision-Language-Action Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-05-25T05:50:23.617278Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-25T05:49:15.137844Z digest=sha256:71f3288e4c0df6b85b408bdd416bdb4ca8aac2956ca4e71999996b6c7ba0186b

Observation bbde08bf-32e7-433b-9ce7-afe9dc3ef770 · inbound

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning cites this paper.

AllDayNav: Lifelong Navigation via Real-World Reinforcement Learning Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-07-03T05:07:39.001497Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-27T13:25:59.194721Z digest=sha256:8a996c653013094923f555ca8d42941af8dc3ea5f77fea4420e2982ada0f234c

Observation 69d21ad9-a07a-4301-af0e-5d08773fa56a · inbound

Learning Process Rewards via Success Visitation Matching for Efficient RL cites this paper.

Learning Process Rewards via Success Visitation Matching for Efficient RL Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 28

Resolution
verified exact
arxiv_id, observed 2026-07-04T09:59:44.550081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-06-26T09:20:35.062060Z digest=sha256:3ec3dae17ec6acc7cbbbf550bcd43d4d98ba9e23cfd536fbb38f2380f971dd33

Observation 5a0155eb-bdf8-4494-bf6d-5b47aabf7ef9 · inbound

Adapting Generalist Robot Policies with Semantic Reinforcement Learning cites this paper.

Adapting Generalist Robot Policies with Semantic Reinforcement Learning Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 26

Resolution
verified exact
arxiv_id, observed 2026-07-01T10:45:42.654679Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-07-01T05:09:29.625066Z digest=sha256:f4455f41d1dca513e87bc1d8dce751490ca0f0bbfd9dfd20e02760008acee02d

Observation 844fe8d3-167e-4ef6-a8df-f31242600c73 · inbound

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment cites this paper.

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T00:37:40.214321Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T00:37:40.214321Z digest=sha256:90023c84a96b72696b42d9f6ac0666c99dc1eb6bcab1ed0ddb55792ffd4af388

Observation edfee9b4-2bab-447b-8495-e59005959870 · inbound

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models cites this paper.

TEMPO: Semantic-Action Decoupled RL Post-Training for Vision-Language-Action Models Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-10T10:29:55.270093Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T10:29:55.270093Z digest=sha256:fad8d14e9df5e88290b21ac5a5e82be84946dc5bbbb1cc94e13154d71465c72a