Pith. sign in

Paper Citation Record · LEDGER

Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2405.10292.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2405.10292 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 15 of 15 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 15 of 15 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T17:13:25.992116Z

measured 1 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

8
arxiv_reference, observed 2026-08-05T02:28:24.338817Z

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 354caf9c-1843-4282-97a9-d1b7c9a86b19 · inbound

Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs cites this paper.

Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 146

Resolution
verified exact
arxiv_id, observed 2026-05-17T00:05:03.846403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-17T00:05:03.547664Z digest=sha256:1f65b20ffe910f089bb6f2cf55f4571987d4236d9cb1893a6f0daf67f45b21cb

Observation 4137cb0c-8afa-49a0-85d7-81fbf13774a8 · inbound

Large Language Model-Brained GUI Agents: A Survey cites this paper.

Large Language Model-Brained GUI Agents: A Survey Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 269

Resolution
verified exact
arxiv_id, observed 2026-05-19T11:08:27.881216Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-19T11:08:27.472508Z digest=sha256:bffaab392378628c6aa2e1f985d36e071962e8eea486066eb163838812813935

Observation f0b0febd-18cd-41bb-9ee6-6268daf9c69d · inbound

Training Software Engineering Agents and Verifiers with SWE-Gym cites this paper.

Training Software Engineering Agents and Verifiers with SWE-Gym Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 11

Resolution
metadata mismatch
arxiv_id, observed 2026-05-18T05:20:40.538094Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-18T05:20:40.483057Z digest=sha256:2da32f2419657a7829ee5658181535661f65aff864ce1303ff530452960b12ce

Observation d0f68463-bb30-4748-9bd5-897400fff841 · inbound

Digi-Q: Learning Q-Value Functions for Training Device-Control Agents cites this paper.

Digi-Q: Learning Q-Value Functions for Training Device-Control Agents Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T20:57:48.541871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T20:57:48.541871Z digest=sha256:2230af21b95082fbdc817469a4918f671eff0ac9f2f52028dd542b086837cd7d

Observation bba994c9-ecbb-4d74-89c2-672229ac6d0a · inbound

Grounded Reinforcement Learning for Visual Reasoning cites this paper.

Grounded Reinforcement Learning for Visual Reasoning Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-22T01:05:52.205820Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-22T01:05:18.801388Z digest=sha256:35a87d6d24678c585adb085250e1aef34b761373ed315dab014b57b4f7151ac4

Observation 53650ddf-b229-4629-83b1-d4d6810ccd85 · inbound

Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction cites this paper.

Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:27:49.911434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:27:49.911434Z digest=sha256:286785a8b8395ba26a912e9edd0fdc1c0d1117e5799535a71f4414a4bac1b57d

Observation a4ff4c6b-9d2e-4e44-9182-ff5299d37b8d · inbound

HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation cites this paper.

HALO: Human Preference Aligned Offline Reward Learning for Robot Navigation Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T05:41:42.254081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:41:42.254081Z digest=sha256:7e60408b9e8a74c9939b08cc5ce89dd9621d6fb8ecf6040feb9ca1868910be1c

Observation b18ca34b-7c07-4afa-a6ef-4bc5352c6030 · inbound

UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning cites this paper.

UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 14

Resolution
verified exact
arxiv_id, observed 2026-05-18T22:21:53.258075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-18T22:17:41.758059Z digest=sha256:ff63bc349f4dfff22fc63159a1d51277c4c41e1b55406af2a9c55d50b64befdf

Observation 35288331-b6b7-471c-92c2-4973e245f65b · inbound

GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL cites this paper.

GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-02T20:51:45.970836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-02T20:51:45.970836Z digest=sha256:46f4d098351ef466ca5ce81281cc9d38c4154e22e0624333d148d6c3195c8871

Observation ae5a3308-4ade-4f84-ba32-d0d685819d3e · inbound

PRISM: Perception Reasoning Interleaved for Sequential Decision Making cites this paper.

PRISM: Perception Reasoning Interleaved for Sequential Decision Making Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 32

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T17:46:17.089189Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-08T17:07:16.531726Z digest=sha256:e66dd1f5c0d578d5c27eb492835e995874f0dd25b166d21445fba3f7df004bea

Observation 7cc824c7-d025-4952-8f58-3ee68f85ef0b · inbound

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era cites this paper.

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 64

Resolution
verified exact
arxiv_id, observed 2026-05-20T13:33:19.441984Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-20T13:29:11.509966Z digest=sha256:23cbe487dae8a52a719363788d64338d9d1e72c55aea6a452b0f29fa71af4a40

Observation c20353e4-cf20-4934-97b5-fc85df66e18a · inbound

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation cites this paper.

Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 234

Resolution
metadata mismatch
arxiv_id, observed 2026-07-03T17:18:43.955672Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-06-27T04:19:26.332718Z digest=sha256:50e9bf7c9df7004dc8f281fbdf908c6075353041fc86821142efbfb6a0c38b99

Observation 72adbdd6-61dc-484b-97e8-4343b05cb815 · inbound

Rank-Then-Act: Reward-Free Control from Frame-Order Progress cites this paper.

Rank-Then-Act: Reward-Free Control from Frame-Order Progress Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 30

Resolution
verified exact
arxiv_id, observed 2026-07-03T17:48:45.228474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-07-03T17:42:44.309030Z digest=sha256:970f753c95e90f236f21d852fe4caef4c1bf1563579b8ff3bbcf4db347707e4b

Observation 577c25f7-95a5-4198-bcee-4fbe5d33cfec · inbound

Qwen-Audio-VAE Technical Report cites this paper.

Qwen-Audio-VAE Technical Report Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 241

Resolution
unresolved
no resolver link, observed 2026-07-14T03:31:19.309532Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-14T03:31:19.309532Z digest=sha256:4ccc7646b552b6816604cb82e98ca95fde1e9ec333ac31b34aaec16a6c58db41

Observation f1f80f45-9484-4442-bc68-1e528424f735 · inbound

PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis cites this paper.

PRISM: Priority-aware Rubric Internalization via Structured Multimodal Data Synthesis Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-08T17:13:25.992116Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T17:13:25.992116Z digest=sha256:56e625449bc3a4be37c044a756bf2821f6be06e26cc7b5159f4eaf9d22660041