Pith. sign in

Paper Citation Record · LEDGER

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2509.06759.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2509.06759 v1

Coverage vector

measured 44 of 44 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-04T23:11:33.916383Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-08T06:32:00.761636+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-06-28T10:06:15.623188Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-02T03:26:28.843655Z

Reference resolution

44 of 44 outbound references displayed

  • verified exact3
  • verified fuzzy24
  • unresolved17
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 0b7ddbe5-6805-4d44-8d87-936c0c175228 · outbound

This paper cites Visual instruction tuning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Visual instruction tuning,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.758397Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:29.712782Z digest=sha256:f59aa1fd49539f1f7050dab6be7724d9b1b91471cdc197b2c112889a69c16afc

Observation 82d881f1-e063-4db4-87d4-7c06c0718ac1 · outbound

This paper cites MiniGPT-4: Enhancing vision-language understanding with advanced large language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization MiniGPT-4: Enhancing vision-language understanding with advanced large language models,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.750942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:29.810781Z digest=sha256:cce086bcc6cca9b9777ada8c9c11eec643352ed26f8e888456edee3d0c47b5dd

Observation a9705884-29bd-481d-ad90-0883b4698e2a · outbound

This paper cites FuRL: visual-language models as fuzzy rewards for reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization FuRL: visual-language models as fuzzy rewards for reinforcement learning,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.741768Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:29.936043Z digest=sha256:a5c840e1554267bffddfd816002cdea230fdda8fab8cf619f32b654a19fcdbbd

Observation 285986a1-08cd-473a-b33e-adbfa20b63a4 · outbound

This paper cites Direct preference optimization: your language model is secretly a reward model,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Direct preference optimization: your language model is secretly a reward model,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.733910Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:30.083034Z digest=sha256:c65e35cb9e0d0f81180527f396bc85f52538ef168bb530f284c29b8e0f06057e

Observation 937d651a-f762-4345-9648-4634aaeccb1f · outbound

This paper cites Proximal Policy Optimization Algorithms.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Proximal Policy Optimization Algorithms

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.185541Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.185541Z digest=sha256:73963b0566336c85126f9cb1567fc42f80bb2f88516d29f29b16abfc212d4302

Observation 81e810d6-b6a1-4164-b624-1301cfb1878b · outbound

This paper cites Deep reinforcement learning for cyber security,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Deep reinforcement learning for cyber security,

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.327881Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.327881Z digest=sha256:914703698dc8fae6d645e05c0a21b9417ecc352c7092d318769323ea41eb0d93

Observation 2530fe82-4bf8-404e-b646-29e7b055609f · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.433159Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.433159Z digest=sha256:4074c7416ea63078678e61adf9e222dfbfc0b3eba2f0ac4ae7b7f1d48f987376

Observation 5eb4008c-f784-4649-a0cc-4dd41817ff9d · outbound

This paper cites Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Vision-R1: Evolving Human-Free Alignment in Large Vision-Language Models via Vision-Guided Reinforcement Learning

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.555836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.555836Z digest=sha256:ff5591e1e451d58616400d897c63883cf7ee995225a4f3c9e74a286eff892bbf

Observation 96de6b97-b3f9-44e5-8037-ad88ddfeb846 · outbound

This paper cites GPT-4V(ision) System Card,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization GPT-4V(ision) System Card,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.722313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:30.681453Z digest=sha256:62dce6c5c67172377995576388f602b7c7a9c8ece5323ae1390fd588068b11c1

Observation f32b6995-f3cb-4e21-a4d0-c354ea1c84f7 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:30.789285Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:30.789285Z digest=sha256:88c64597ab6048d5600f94edbc7f21a6ed13d1ecac6ed24cfc3a89c095a14e53

Observation 2b2055ae-7013-4777-aa96-0396d55ff61c · outbound

This paper cites The Claude 3 model family: Opus, Sonnet, Haiku,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Claude 3 model family: Opus, Sonnet, Haiku,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.715410Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:30.892892Z digest=sha256:a65ff597cc9671c9db2e93a477219d801285b369f5c0d24910b8670dc1b1d770

Observation d4d1a607-5086-4fe1-8c10-dd42cd967546 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.049107Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.049107Z digest=sha256:c7269ebf3bd45d79900e888db234307c85231c74bc4d0074d88e20dc34089ae4

Observation c7afd6ff-f37d-48fc-8971-c23572d2a6f2 · outbound

This paper cites The Llama 3 Herd of Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.172246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.172246Z digest=sha256:7cb8ef33ddbbee45461f9d695c5f92ad6ec58cfaa6827452b89137afc5ea35e4

Observation 06c642ba-e757-4f1a-b582-dd08acd688e4 · outbound

This paper cites Qwen2.5-VL Technical Report.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Qwen2.5-VL Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.322246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.322246Z digest=sha256:2d7da50257ee429505cb0b8b3560af6e8d7792b7d28105731ec4d413b0f63bfe

Observation 6dea6216-c277-41e8-8d9c-deff99a9c82c · outbound

This paper cites The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization The Llama 4 herd: The beginning of a new era of natively multimodal AI innovation,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.707253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:31.455348Z digest=sha256:7c79922b8f2012710fc5d3d4dee4360973ceca6a05a9eb5d4ef5597e97aca921

Observation 05d60a77-9a45-47f1-aa8b-e5d7ef872968 · outbound

This paper cites Aligning large multimodal models with factually augmented RLHF,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Aligning large multimodal models with factually augmented RLHF,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.697317Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:31.557083Z digest=sha256:5e0f2fe22a66bd5e612c48cd88d26e38a8da7aa70896bc89bb78f6e0ce613d28

Observation 5515cda2-59b6-4b31-9a73-4a4ed8eef351 · outbound

This paper cites Fusing pre-trained language models with multimodal prompts through reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Fusing pre-trained language models with multimodal prompts through reinforcement learning,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.689442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:31.659056Z digest=sha256:5b696c25c28e9410e335cc60e1ffeb0f724a4120192099c6d7568dacd9a936f6

Observation eca955ef-ec96-4f6a-bc04-9842a5ae3694 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Learning transferable visual models from natural language supervision,

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.774303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.774303Z digest=sha256:75bf12b3a9832962ad29484ffc14c46356bd22101d58c3cccdb5be783dc165e1

Observation 2725aca8-5c7c-48f3-8fbf-57cd903c3e8f · outbound

This paper cites Improving Vision-Language-Action Model with Online Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Improving Vision-Language-Action Model with Online Reinforcement Learning

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:31.875241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:31.875241Z digest=sha256:13e4428ee17643bd69d5e7c67f4adff58f09a1c15133e17b374f066d8f778d57

Observation 584d7002-35ed-412f-885a-9e1b337db0e4 · outbound

This paper cites Fine-tuning large vision-language models as decision-making agents via reinforcement learning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Fine-tuning large vision-language models as decision-making agents via reinforcement learning,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.678223Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:31.972932Z digest=sha256:816dcdcff3bd3bb5e8e7459801c413af85d616ce415e2589378b12eb5102958a

Observation 9dd998c8-ec99-4eb2-951b-5774943f28c6 · outbound

This paper cites VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VLFeedback: A large-scale AI feedback dataset for large vision-language models alignment,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.671740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.078379Z digest=sha256:7bcdd60a4b7a75de358224a22840fddb5788f9b3b8ee5d5bc79c193f24e69f1c

Observation 1e71b9a7-b5a1-432e-9845-65efc072eef0 · outbound

This paper cites MM-RLHF: The Next Step Forward in Multimodal LLM Alignment.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization MM-RLHF: The Next Step Forward in Multimodal LLM Alignment

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.187646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.187646Z digest=sha256:389662a8afe93702eca50eb1117d1db53e90a33eb87c906e9658daa84617dbbc

Observation d62c896b-9f3a-4713-8d08-1799de8b65e5 · outbound

This paper cites Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.319995Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.319995Z digest=sha256:6498e19c41fc33113c9b47b35547f67dd04c482f7365596fb67c582b83a6c725

Observation 73f1b11e-3aba-4ab6-9a34-d35332c2bece · outbound

This paper cites Training language models to follow instructions with human feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Training language models to follow instructions with human feedback,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.665282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.400862Z digest=sha256:8196b233976d19e98f37dee87796becd4fdcfe9bf0252fcc88bed05d1c2e5466

Observation dd0286eb-b055-4f36-99dd-9cb8bb277b00 · outbound

This paper cites RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RLHF-V: Towards trustworthy MLLMs via behavior alignment from fine-grained correctional human feedback,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.658696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.459930Z digest=sha256:99228217cfdb476244edf358176fc70316db51b48e6e83418b051626461ef91c

Observation 1ed9281b-9ea0-449d-809a-5428edc78ccd · outbound

This paper cites RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RLAIF-V: Aligning MLLMs through open- source AI feedback for super GPT-4V trustworthiness,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.518338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.518338Z digest=sha256:205680517bbb42cd836fd9fa415c88ab6acefb23cc08f2fa95602c456f079dbd

Observation 9c0e0dba-87fe-4724-8c9b-7450768ae793 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:32.623370Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:32.623370Z digest=sha256:3fee39267ef90bba772324514661ec2bd2e553a8d7d9ea35741288999fbb2a8f

Observation 4d9d970f-7b5a-4ed0-ba28-4912501b0c8b · outbound

This paper cites Aligning modalities in vision large language models via preference fine-tuning,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Aligning modalities in vision large language models via preference fine-tuning,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.652391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.712851Z digest=sha256:59a1194ed4557ade6b3e268ea99797a1a65a349354771773456c5abe099deabc

Observation 98be5315-ceb8-4cbd-9ca8-eb2959294c31 · outbound

This paper cites Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Re-Align: Aligning vision language models via retrieval-augmented direct preference optimization,

Reference 29

Resolution
verified exact
arxiv_id, observed 2026-08-04T23:11:34.328168Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.788914Z digest=sha256:7b941d26c5418c78330f538eceb25a7e400e4aa4b4eb9d2e46c63b52c781baa9

Observation 44d826cd-ca6d-4d51-a385-502c419dcf59 · outbound

This paper cites Enhancing visual-language modality alignment in large vision language models via self-improvement,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Enhancing visual-language modality alignment in large vision language models via self-improvement,

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.644815Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.858563Z digest=sha256:c5bf929effde5c5fa474c72189df1b51b440a8e4a739f15969b8a2b9045dbac2

Observation 340830de-37de-418f-a89a-309ae2e27376 · outbound

This paper cites VILA: On pre-training for visual language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VILA: On pre-training for visual language models,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.637399Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:32.938809Z digest=sha256:dabdb3874b005373402f1d89183cb676612c78d32632cdcb6065474c987ef3bd

Observation 08d7f4a5-692d-40ce-a274-cc75b88179e0 · outbound

This paper cites SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization SPA-VL: A Comprehensive Safety Preference Alignment Dataset for Vision Language Model

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.026717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.026717Z digest=sha256:8f51fa86be1ce148a7f9f399198636e0e810f911534cb292d0689adda578cd73

Observation cb03875e-d4b2-4db5-be8d-34f9a673557b · outbound

This paper cites DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization DRESS: Instructing large vision-language models to align and interact with humans via natural language feedback,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.629758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.113237Z digest=sha256:e5e0746ca504e947978c5d5368daed8df977cdf49f6b7d61f6f87de2c616faad

Observation 4f1bbaf7-89cd-4365-bcb9-edf78b7b875c · outbound

This paper cites Active learning for vision-language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Active learning for vision-language models,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.622360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.169468Z digest=sha256:77bde43b7e343f9c4ae9bf4f9265fd854dac55519716165d2c03b4bbe0b0a6d8

Observation 947346f9-f031-49f6-8893-3e196311fc20 · outbound

This paper cites S-CLIP: Semi-supervised vision- language learning using few specialist captions,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization S-CLIP: Semi-supervised vision- language learning using few specialist captions,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.614867Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.253965Z digest=sha256:110f095215945fdf3c04ff2cf0ae1946d6f20f3c3f6063ca732f8a90bf71017e

Observation 39cd1753-ca90-4451-b2a6-3e7b88b37ceb · outbound

This paper cites RL-VLM-F: reinforcement learning from vision language foundation model feedback,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization RL-VLM-F: reinforcement learning from vision language foundation model feedback,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.606114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.336199Z digest=sha256:1726736478093b41c01dd2a6db53f0736e2716c95338ce835c2d483856b20bd1

Observation 8f86d631-de35-4c62-b3b9-ab9639bc0c06 · outbound

This paper cites VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.426693Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.426693Z digest=sha256:c30f2b1ead124f9ba4f370a3885810c9a03fa636bdf7ac410d91dab701c4cfd4

Observation 50ab2a2b-223e-4db1-a473-b074a11bb0f2 · outbound

This paper cites Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Text-to-decision agent: Offline meta-reinforcement learning from natural language supervision,

Reference 38

Resolution
verified exact
arxiv_id, observed 2026-08-04T23:11:34.192544Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.506496Z digest=sha256:e14ed7c933336b3459439df5357c938c16dba65cdc69dac83db63e4143715043

Observation 275b609a-a0c7-4d8e-87f6-14be0bb1e33e · outbound

This paper cites Zero-shot model-based reinforcement learning using large language models,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Zero-shot model-based reinforcement learning using large language models,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.492893Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.588219Z digest=sha256:f30ae6ea1a6bb02032578c520f03be998ad6edcf421aa013358ed9186114c4a3

Observation 81da2cfc-2953-4d37-9707-0803e844cfca · outbound

This paper cites Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Boosting the Generalization and Reasoning of Vision Language Models with Curriculum Reinforcement Learning

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-04T23:11:33.680238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T23:11:33.680238Z digest=sha256:ec5b46ea71368a4c8c7b60a7ac1091828e3572d12605b72effd04cdd7dd37189

Observation fb608950-511f-4461-ab83-d883d128b16e · outbound

This paper cites Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Open-ended VQA benchmarking of vision-language models by exploiting classification datasets and their semantic hierarchy,

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:35.213474Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.749871Z digest=sha256:76c0b10eac3bcce8c736819e8618f43ac52d553bf7ecbf49aaf8ae6be475836d

Observation b37a8033-2b5a-4f9b-b754-91d30b904049 · outbound

This paper cites VLP: Vision-Language Preference Learning for Embodied Manipulation.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization VLP: Vision-Language Preference Learning for Embodied Manipulation

Reference 42

Resolution
verified exact
local_arxiv, observed 2026-08-04T23:11:34.055141Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.816944Z digest=sha256:17a43d8775307ac7c5aaa77f70aeae7868facfa29cc4cbd67bcdda7cb12000d3

Observation c0650d6e-0169-4640-a19c-fd7cc2086343 · outbound

This paper cites Multi-agent deep reinforcement learning with human strategies,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization Multi-agent deep reinforcement learning with human strategies,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:34.879301Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.871306Z digest=sha256:b641edf823b8bceabba377f091032f0e20e9827199366498858eb13ca3c1b615

Observation 7336f9a6-1f18-42b4-a64b-401378996dcb · outbound

This paper cites ETA: Evaluating then align- ing safety of vision language models at inference time,.

Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization ETA: Evaluating then align- ing safety of vision language models at inference time,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-04T23:11:34.656421Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-08-04T23:11:33.916383Z digest=sha256:f88d3955054e03f8f0a2c9bb155ba9f01a3a68fb278a86fcdfdee6ec3a4dfbcd

Pith citing papers

Observation f4c65fd8-781c-4f7a-88f2-3b0a19ee93ef · inbound

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding cites this paper.

Beyond the Literal: Decomposing Pragmatic Intent in Multimodal Meme Understanding Aligning Large Vision-Language Models by Deep Reinforcement Learning and Direct Preference Optimization

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-07-02T03:26:28.845645Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.

source=pdf_text observed=2026-06-28T10:06:15.623188Z digest=sha256:4295d5a4da8479585caec651753e00569df8590bf46a64c48581d70cdd2a2935