Pith. sign in

Paper Citation Record · LEDGER

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

As of 4 August 2026, this Paper Citation Record lists 100 of 155 outbound references and 27 inbound Pith citation observations for arXiv:2402.11411.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2402.11411 v1

Coverage vector

measured 100 of 155 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-05-17T10:58:53.215887Z

measured 127 of 127 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-04T06:34:03.388597+00:00

measured 27 of 27 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-02T19:56:33.552171Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-04T17:40:00.879942Z

Reference resolution

100 of 155 outbound references displayed

  • verified exact13
  • verified fuzzy72
  • unresolved9
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch5

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 153cdda1-d688-4453-8701-caf449085967 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.636275Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:6a2a983d217a691d9a543c83ab13b6ff5dccad598000d8aa4be6cb6d02f28153

Observation 06933d7c-7eb1-4682-9343-c22fa8616370 · outbound

This paper cites Langley , title =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Langley , title =

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.739110Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:ccc004dba7ccc592b729be809dbd26f83223b6ef44385e0f862af6d5c5cd4fb3

Observation 33b0833c-0fb4-4cc3-92ea-aca8fa3d5f88 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 21

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.742119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:db55fff3f274ada62919fb0b9fc0f63c5582208b3e99b03a64719f44dbccb682

Observation 95a066c1-31d1-447a-8a9a-80e58bc7e44f · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 22

Resolution
parse uncertain
raw_fallback, observed 2026-05-17T10:58:53.745578Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:2d3833654d47947f42bb3a0b5e613c806ce4f0eaeb4ca474b7a1acfe986de7fc

Observation 622b4e56-da39-4dc3-852f-024b599aa5df · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.748284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:6725938b31382515513e055aa5557e5e37038645228b68a3202344910ac1a330

Observation fd8002db-4b26-458c-bbc2-4cfd1b253e38 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 24

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.752059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:2697a36a78ef3cd06bef02d0aa3ff4b559d55e12c1e0a8b26a660d18c6ee8bec

Observation ba21b236-f1b1-47fd-8197-1ff799fcb325 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.756371Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:9d93bb7ccdab926d9c1515d3428defaabc5e2a5ade41a9377a25beff196163e7

Observation 68bc68bf-447f-45a1-a0c7-42d1d166be28 · outbound

This paper cites Newell and P.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Newell and P

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.759572Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:21a29cfbd41b295c2ad795e39fcc439c3d65abc6ad7851ec07f4294c552f82ce

Observation 6c4bccda-9217-4ce5-a7f3-2185b674e214 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.764517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:f2482169d2505fee201e1bb8893aa1ee4dd6b72f810e00ec3c2ee18ed07f397c

Observation 1524f71d-4944-4c38-a24e-358d147c093f · outbound

This paper cites 2018 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2018 , eprint=

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.767516Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:698811077bd2877f08c638902af15a0d80423d3dcc6452dd2b8f9b998432a312

Observation 7090b34e-14c8-4c5e-a496-229971446916 · outbound

This paper cites Generalized Results for the Existence and Consistency of the.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Generalized Results for the Existence and Consistency of the

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.770641Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:d6748354ec158b4bbdc94969db83872bebb6726d13e7eac219e0236c889de4fe

Observation a1a0114c-98ff-4d5e-b913-d88116dc8950 · outbound

This paper cites 2017 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2017 , eprint=

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.774166Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:a1605ccbfb65a0b789535910139b783e371b342089c36252f9a9b0189704f7d5

Observation 924fe2e0-4b3e-4e30-948a-f342a8e26543 · outbound

This paper cites John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov

Reference 31

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.336840Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:c0a9fbeca8313423ffe03746f51eb58c0a87556188bcc52629b5bb82c8fd373c

Observation 48bd1444-e949-4f50-ae5d-4f662e403f1a · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.776899Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:9573c6b9c87da90dbc240de8c92f2fc819eb315fd40070c29cecdff58d1268c2

Observation 1c7af20a-ab58-400e-987c-2897c2d88739 · outbound

This paper cites Terry , title =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Terry , title =

Reference 33

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.321709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:3e5594a922df404d1e890dac36245fc163a1ee5e983530c8000011e7288a180a

Observation d3ca8f6b-689b-4ed0-a65b-d3d1b60b9c42 · outbound

This paper cites 2020 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2020 , eprint=

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.779724Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:0a91eff338e79333bde148daa41e5cb196ff1edaf38ab32edfa7f31f828abc80

Observation 77d6c134-de3f-49df-a06f-e95b777def7e · outbound

This paper cites 2022 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , eprint=

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.782406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:0bb81da833bfdc00afbdd35b4c17c353157e41508728d153fa5e6a8cabe1a344

Observation 86e55eeb-96aa-4a38-b75f-f2e800ec79e7 · outbound

This paper cites Training language models to follow instructions with human feedback , url =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Training language models to follow instructions with human feedback , url =

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.786488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:e333e7cb1ba437e9b8edd15c90376c08ef21b3319d307dcca3c6bae209f85a04

Observation b922897d-ca25-44c2-84cc-db5d1a1bd561 · outbound

This paper cites 2022 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , eprint=

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.789525Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:d9c2e22fe0c83909911c5eeb75669b7e2c9d5d8fae5e34e409cc62ac09c34084

Observation aad52aa3-5365-4913-8b87-c242d7b2280c · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.792401Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:89a79c47b3bf6d17bd4ca1fd795544a43f85e3970048c161491613c626209001

Observation ea0ac31f-b85b-4bfa-bbef-63dffc856517 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 39

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.795413Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:ed2c7b6322c40c0c223fd6535c7d2b4cd9ddc756831890b35f09a77dfcbfd3a1

Observation e532c140-da7b-44a7-bbd4-ebd0e38069e8 · outbound

This paper cites and Daly, Raymond E.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning and Daly, Raymond E

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.798422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:5bb88382547204027e34100d3852e1b62f886acd2fdf260a161a4135f93aed03

Observation 3a7814c9-7c7b-4e2e-8adc-d22e833c29eb · outbound

This paper cites ArXiv , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning ArXiv , year=

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.801325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:e64aff673d7f19a0f8adf45d4744e8938f1956163ea836c6bfedd02c40df0cf6

Observation 19823bbb-f4ee-4757-a3f8-126aa7a014ec · outbound

This paper cites TL ; DR : Mining R eddit to Learn Automatic Summarization.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning TL ; DR : Mining R eddit to Learn Automatic Summarization

Reference 42

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.317955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:f40312859e16c1d3df6cac0ad4dc3e571b7a2c69a7ef74be0d77fbc135bc6283

Observation b556c141-9f37-44e5-a9c2-47a47aca6a07 · outbound

This paper cites 2022 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , eprint=

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.804081Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:b56abec198dc5c668664ebcefb2012b00906c10b593fc56340b4a4c9ab057b19

Observation c63f9a51-6b5c-432d-b3e6-a60a3a332c90 · outbound

This paper cites Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =

Reference 44

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T10:58:53.331632Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:e218fa1882d293bbfcfab1e08af7a4b6f5c858dcd0c711ddf7a475a1132751e1

Observation 7561de3b-4e58-4f88-857b-b9f1752fce78 · outbound

This paper cites Robotics Research: Volume 1.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Robotics Research: Volume 1

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.807185Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:75e93e3428210cb20d9cc02064e7e50ea602ab778859b499af70d7cb8ea1e56c

Observation d3df402f-f646-40ad-862f-b01d275518fd · outbound

This paper cites Active preference-based learning of reward functions , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Active preference-based learning of reward functions , year=

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.810466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:df23fc86c50c884f2d717989b58990565eb0baacc84a551f3167f8fe0fa01281

Observation 076d7655-acaa-444d-ae07-6902750fcfa3 · outbound

This paper cites 2019 , note=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2019 , note=

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.813475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:2a8aa8b214534f2854167f97202ed5557d9385ca5ec42d48f79acdd8d659fc08

Observation 834c1b48-c271-4432-a583-3ef56530f0e4 · outbound

This paper cites doi: 10.18653/v1/K16-1028.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning doi: 10.18653/v1/K16-1028

Reference 48

Resolution
metadata mismatch
doi, observed 2026-05-17T10:58:53.325610Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:7354e382bf71fd48c1681c9de37746cc1ea3c604e82f8e9f6c079978946a8498

Observation 44564c8f-d724-4eb9-819f-a537e9d7dbb5 · outbound

This paper cites Aligning Language Models with Preferences through F-Divergence Minimization , year =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Aligning Language Models with Preferences through F-Divergence Minimization , year =

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.816445Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:1bed9f98c8ff1dbe54c48709e4d104d72e3dda8eedf19581dbfb90c6618cfb93

Observation 58f2176f-975b-4f63-8e1d-064652138264 · outbound

This paper cites On Reinforcement Learning and Distribution Matching for Fine-Tuning Language Models with no Catastrophic Forgetting , url =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning On Reinforcement Learning and Distribution Matching for Fine-Tuning Language Models with no Catastrophic Forgetting , url =

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.819537Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:ba43c011b344fdfd3c3d173617b30f5791c0e2b2370922d2c0689f57a2230eca

Observation 291d7115-b28f-4ad3-a41c-7f00e9fc733e · outbound

This paper cites International Conference on Learning Representations , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning International Conference on Learning Representations , year=

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.822746Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:eac25ce19c1b7645fe7b6ed5cdc5d66886182521973e36ce0f004fc9c5e7a93e

Observation 74bf7bf7-2af6-4ddc-922f-ba1a7b4e5cb0 · outbound

This paper cites 2022 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , eprint=

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.825693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:9bcfa0722db5fd5618a1b277965801d544709774793843911c20d1286974a9c9

Observation a39cfc73-afc6-49ad-90aa-0c8683e2a3c7 · outbound

This paper cites The Eleventh International Conference on Learning Representations , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning The Eleventh International Conference on Learning Representations , year=

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.828687Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:5a7bb2e2db2a58ba8ecf968f60d10d82e97e646b6bf636cd85bf5542ac5b70f3

Observation 777e0c8c-3f89-4e9b-8df5-6a605efeb707 · outbound

This paper cites Cross-Task Generalization via Natural Language Crowdsourcing Instructions.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Cross-Task Generalization via Natural Language Crowdsourcing Instructions

Reference 54

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.306090Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:2eb864f8ba64f55a3fbb04f83917c2b96c2a1d4e2fc6941eb359345a91e4ced6

Observation 1150b912-f0a8-4046-a9b3-1148db1a7402 · outbound

This paper cites Language Models are Few-Shot Learners , url =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Language Models are Few-Shot Learners , url =

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.831626Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:ca0c12163a4b94428f2947f3f3d2521e9bd8e1c102bc82cbfb16e15f5f06948d

Observation ac1ccb8a-6b45-44ea-aec3-6f664bf169f1 · outbound

This paper cites Proceedings of The 26th International Conference on Artificial Intelligence and Statistics , pages =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Proceedings of The 26th International Conference on Artificial Intelligence and Statistics , pages =

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.834441Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:891bb04dfa43c0bebace6a2b2789b60ca14b990c7495aebda5911ba2e207d215

Observation 5dfc7e9f-d4d9-422a-a8cd-fdd5c076a88e · outbound

This paper cites 2020 , url=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2020 , url=

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.837115Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:9c15ad0e55938974067b8739ef6aede36701d3892faab2a43be3e0eafd79c221

Observation dd750685-7730-49aa-a374-3525bff1d284 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 58

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.839762Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:1fe531fa684f9d419c07426bc0697e805e1d7150205f20858f87fc032d43546c

Observation cf02fe79-5fd7-4501-8eb1-f2a7299b887c · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 59

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.352235Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:0f6339e73b80908c88ca4c7176898c7b523e8fe3e1c2fa7de994808b0cb2a182

Observation 653ab24f-86b5-462f-8a6f-6e4f99433501 · outbound

This paper cites CoRR , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning CoRR , year=

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.844153Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:4e4c204daf6438b50af08023ff6da7ac80d1adcbbf91aba35081a774a1408993

Observation d3cbcf5f-0d71-49c3-b16d-85fa5a15bb05 · outbound

This paper cites Williams.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Williams

Reference 61

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.301539Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:c2bc258de5910ee8528150d911aa9b3e9d76009cf1c34ecf75c21288f6183803

Observation 040137f9-1727-489b-a9f5-4ec2c150fbe0 · outbound

This paper cites Reliability and Learnability of Human Bandit Feedback for Sequence-to-Sequence Reinforcement Learning.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Reliability and Learnability of Human Bandit Feedback for Sequence-to-Sequence Reinforcement Learning

Reference 62

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.341854Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:e06b1c9a3e001bc1d81315be020e1c9960079d97d48c6f7736a1974a72782b3a

Observation d3c58c59-0199-4f7d-9723-9bd2adf6a258 · outbound

This paper cites International Conference on Learning Representations , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning International Conference on Learning Representations , year=

Reference 63

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.847192Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:3f1a7fff541a070ddd931a180132dab6a5a1b19f118c4392089b953b790ecea2

Observation 55e34d42-ed59-4c4a-9391-76f9a5fbff88 · outbound

This paper cites Deep Reinforcement Learning from Human Preferences , url =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Deep Reinforcement Learning from Human Preferences , url =

Reference 64

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.850171Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:4891fad1780022064a3d155c38d83444d071faf59bdf9d56a1d765ae5c786609

Observation 45166038-66f7-461a-bbd2-e854031e93ed · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 65

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.311202Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:254c4b0ca8e2e33737106810d197fad891b6bdb051f83be60e40d8efd8d5376b

Observation 11578261-5952-4cdb-9189-6428fc856be7 · outbound

This paper cites Learning Trajectory Preferences for Manipulators via Iterative Improvement , url =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Learning Trajectory Preferences for Manipulators via Iterative Improvement , url =

Reference 66

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.853057Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:95a9a4778f9412c33aedae4a03061e08636eba14cfde5a8804c0558a11c13465

Observation 28f33914-69e7-4d4b-84f0-03edb6d4e435 · outbound

This paper cites Preference-based reinforcement learning: evolutionary direct policy search using a preference-based racing algorithm , journal =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Preference-based reinforcement learning: evolutionary direct policy search using a preference-based racing algorithm , journal =

Reference 67

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.347055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:79652894a8dbf649f4e4c6f7aac9238d5e386d45925f4e98b5fd3bfc20d29efc

Observation f3029aa3-35b3-4eb1-944c-7c8ccae57767 · outbound

This paper cites The K-armed dueling bandits problem , journal =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning The K-armed dueling bandits problem , journal =

Reference 68

Resolution
verified exact
doi, observed 2026-05-17T10:58:53.357718Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:df46d9ab54ea4cd5aa22d578a270562aaf427136ef619a64e4b55e552e6fdc93

Observation 69898394-0bf6-4bb7-87be-300c163f91da · outbound

This paper cites Proceedings of The 28th Conference on Learning Theory , pages =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Proceedings of The 28th Conference on Learning Theory , pages =

Reference 69

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.855781Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:b068958ba690b9c4e0923d17365a52468cbf45aad8ba8c7f76d91b72cfd4dbe9

Observation 8595e394-5c1a-4297-b818-30d2a07e4dc2 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning PaLM: Scaling Language Modeling with Pathways

Reference 70

Resolution
metadata mismatch
local_arxiv, observed 2026-05-17T10:58:53.475843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:3756d047d18a8ef5feccd063afa15bec48115b4f037437d0752badcb8b178411

Observation 4f6c83c5-1cc3-4a08-84de-263fea9a110d · outbound

This paper cites Advances in neural information processing systems , volume=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Advances in neural information processing systems , volume=

Reference 71

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.858851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:2fe5347f3f54a22290f0df9620158b77c9683840ede67fb90eb26b03ceaeecbc

Observation 0d6de068-0e3a-492e-a612-7b0519c372f7 · outbound

This paper cites Sparks of Artificial General Intelligence: Early experiments with GPT-4.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Sparks of Artificial General Intelligence: Early experiments with GPT-4

Reference 73

Resolution
verified exact
local_arxiv, observed 2026-05-17T10:58:53.503814Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:f5a7e81485b4bd8816c788801b9dbf29edc7eb80f96ce3d6d3920d94f29f9a27

Observation 8f1e4349-7987-49d4-8d72-5ea700e43444 · outbound

This paper cites Proceedings of the 24th international conference on Machine learning , pages=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Proceedings of the 24th international conference on Machine learning , pages=

Reference 74

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.862584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:9d7337a08f9a61f8294a3ed753af2366e802a7df97f156cabf390ee69c14dc98

Observation 869ea475-59ab-4ee6-872e-4871193cedc0 · outbound

This paper cites Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning

Reference 75

Resolution
metadata mismatch
local_arxiv, observed 2026-05-17T10:58:53.512739Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:cd5b95b7755ce8dafa32086475fd036f9d947f75cb145421fb315a8eba7d95e2

Observation c95a52db-fc14-43e6-b792-a57acb23f7e2 · outbound

This paper cites Neural Text Generation with Unlikelihood Training.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Neural Text Generation with Unlikelihood Training

Reference 76

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T10:58:53.517004Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:d4fdb7fa1f41611137b99995e85b69ce493d5105721ab45c81fbf3390899a7f0

Observation d7f6ea5e-f465-4fa6-811b-d240a2bb62a8 · outbound

This paper cites Thirty-seventh Conference on Neural Information Processing Systems , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Thirty-seventh Conference on Neural Information Processing Systems , year=

Reference 78

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.866826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:dcde7e80c68115530eaca87112be98ec90210a47bfa590cd150264527307710b

Observation fbab6bb0-a921-440a-8e7c-db75b5090ffb · outbound

This paper cites 2023 , jouranl=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , jouranl=

Reference 79

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.872381Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:e75a984577ba4e2ca5a01ca6ba1f46522c86bd0eeb736330d21f46d9031ca29d

Observation f3809557-a219-4b0c-b329-35f7f9dda6f2 · outbound

This paper cites 2019 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2019 , eprint=

Reference 80

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.875357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:69dd988fc59c7589a056fd0d0be562d8ac1525ec71aeb387e13eacdf625af01a

Observation cb2885d3-5ac1-403b-8d39-009b16eb70ca · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 81

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.878394Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:96fe9f593182270daf69873fe6d4bea5e17e120d954b1d1167ba9daa3ab4da37

Observation 48db0e37-7184-4f93-97b7-bce0e4c01d2f · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 82

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.881307Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:d211c1c29307a01cd75f20826052856e99e7cafd66ff67b8fd0c15239d83fe91

Observation 0115f249-be4a-4212-90a5-3e30e02fc2f5 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 83

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.883907Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:312261ed67c6311d8b952026bef0298aa41258115de7631b73eede3dd56aa0e6

Observation bd64859f-7d23-4031-8c80-bbac08e0d11c · outbound

This paper cites 2024 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2024 , eprint=

Reference 84

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.886888Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:9ef1d24e3a855815d983d37b8bbcd81e94e67c65a437d48caf45d83d1daaf927

Observation 92f01713-7fd3-46ef-adb9-dd2eeb63665d · outbound

This paper cites 2024 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2024 , eprint=

Reference 85

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.889932Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:06788d7bef8efbd442df789e2d7d62bbca58945eca838c3986fc1d43aff1eb82

Observation d552d09d-2e91-46d9-bb5e-41c33f9b453c · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 86

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.892571Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:93e74573d5dd0d3eb011e2ea8e2790b941fdb2b90331079bc108b05fbe36aca1

Observation 9c3fc964-fd97-4ed0-a812-4c167c0e90b9 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 87

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.556736Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:b47ccd31e9b8dce038e6b1bf7f59ec9ebf8d2709cf7ffec50c25b7102119810b

Observation d06aa540-a865-4e65-b9de-adf91add97ff · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 88

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.559553Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:3275a50091061afc3ae7fc94e9ba3087161e4612f01c0c8a903447368a3a6ba5

Observation d5922ec7-ef27-46f6-97ae-03b1cf7dfe44 · outbound

This paper cites 2022 , url=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , url=

Reference 89

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.562331Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:24cac3dd2c182440c1c7bac6305846554bcdec92064186e6764cfa782416b26a

Observation 3f7af7c4-329f-4396-9049-924abeba60b3 · outbound

This paper cites 2023 , journal =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , journal =

Reference 90

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.565099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:4117515477e10df0cc5a26399960b3866c847fdfba3ddaec4d8e7dac272aa9f3

Observation 9186b98a-fb40-44ec-8e2f-a30594f46fd7 · outbound

This paper cites 2023 , journal =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , journal =

Reference 91

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.568007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:563cbe33a66112f565588718fe558125fb44007c411e6b775ca65268b2ddef18

Observation 20cc911a-f32e-4481-a0e2-936172ea44c1 · outbound

This paper cites The method of paired comparisons , author=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning The method of paired comparisons , author=

Reference 93

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.571132Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:80bc7047cb5736a5bffac3dc75ab4f13232c603c6874f8298e3c970881395694

Observation 92ecd3ef-bb9d-40f6-abd0-b7fb885ac8a2 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 94

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.573911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:3b9d69538d842da322a107630312d40baa291112b41f90b904f3776f1ff74cfd

Observation 70e536ae-f7a9-45fe-af82-c7f6bc2a396b · outbound

This paper cites The 36th Conference on Neural Information Processing Systems (NeurIPS) , year=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning The 36th Conference on Neural Information Processing Systems (NeurIPS) , year=

Reference 95

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.577431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:d5e18f05b711a4626509571bf6fabe2f3be94cee8598b8ddc5240ad9db34d48b

Observation d80cc23c-0874-4759-aa8f-c457cbdf41ed · outbound

This paper cites Leveraging Vision-Language Models for Granular Market Change Prediction.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Leveraging Vision-Language Models for Granular Market Change Prediction

Reference 96

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.521157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:7a859cf6682012504c6e02c4f100b0c209cc524edde6469ea447b4b74073054e

Observation e197ca5e-53ec-43f2-80fe-f5ca3812de62 · outbound

This paper cites Advances in Neural Information Processing Systems , volume=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Advances in Neural Information Processing Systems , volume=

Reference 97

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.580831Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:de566b4d1a85c5e0f34cadbfff1ae7c6504a4cfa5f6058a4c5948b3f13e460a5

Observation 3aa9b8b4-bf5c-4f15-a4c5-a53ce07fc804 · outbound

This paper cites International conference on machine learning , pages=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning International conference on machine learning , pages=

Reference 99

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.583892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:f36a747af3e83b73aa02a88cb562e5c84421ed528ce336281e554afefb954dfd

Observation b2fbcb8b-0a54-401e-98a3-804569077cd5 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 100

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.586702Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:6de7ddc8c66160fc6e9825436b9716ba0eae39541929fc2b4e84dabd348ae355

Observation b3b00542-5ce1-4b38-a27f-62ce79999461 · outbound

This paper cites Hashimoto , title =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Hashimoto , title =

Reference 101

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.589480Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:854d6ca81cc07b0c9481df9a4bf74a164dd0c21a27974554f7829808363ad17b

Observation e2c0e346-1f0e-4f4f-ad9c-55340e05a152 · outbound

This paper cites Medical Image Understanding with Pretrained Vision Language Models: A Comprehensive Study.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Medical Image Understanding with Pretrained Vision Language Models: A Comprehensive Study

Reference 102

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.384587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:32bf8d720f70aa67f0246a32d7bd324ce716124c3cc12d57cb3fe1d8b99701ec

Observation 395f5aae-546c-4906-9bb4-a968de4d363c · outbound

This paper cites ArXiv , volume =.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning ArXiv , volume =

Reference 104

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.592007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:20b701b99eaf220b807950aed832f96da0c4292bd4e9aa6b8cf9c3302916c71b

Observation bb0f1236-eab3-4e04-ae4d-712852f71cc7 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 106

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.594415Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:73a303d5e4b00070bc3044dead729fbed4c584d75a41d62684d3fb41c0422f9a

Observation 1e1ad3cc-47e6-4423-87c5-22d9012ed816 · outbound

This paper cites 2023 , journal=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , journal=

Reference 107

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.597055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:886a0bb70ea86c0f8fcfb75ec047cbe3f3930a30c11ea871c2bead999c538122

Observation 4feda9ac-034f-43c1-83c8-f6a18c55c1d0 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 108

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.601395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:df226ab9300c32a35a6b95f97667798de8bd9135a180640b5f617c4b0610f28d

Observation ea6e499f-d4d4-4cf8-a0a0-4897c07a4e04 · outbound

This paper cites an unresolved cited work.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Unresolved cited work

Reference 109

Resolution
unresolved
raw_fallback, observed 2026-05-17T10:58:53.604332Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:badbb374ad74adb2f546a8d39bb553d55e4ea77b721a0888fd1e5051f2f8c4ee

Observation 86ce2efd-55f9-4c77-90c8-d75e408645c9 · outbound

This paper cites 2020 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2020 , eprint=

Reference 110

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.607117Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:598c9208268460157df47da607b4e61631a0060d93ef4e3c1232b20dc180504e

Observation f27c654c-ebd4-42b7-a941-c0568f55d8ba · outbound

This paper cites 2022 , journal=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , journal=

Reference 111

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.609882Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:226e8c05b1872c88b2842e9effa8e144b2d45cae6201e33301178675f9c9d7af

Observation b0345305-1f1b-4876-825c-13c6729b6fe5 · outbound

This paper cites 2016 , journal=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2016 , journal=

Reference 112

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.612422Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:a8b91287947017962843b3cffd55b7150f478a0142c4ade5a386429cb596de40

Observation e35ba45c-277c-4059-be38-fe52da81c9c4 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 113

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.615190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:c56ce13af3d110a67f490946807a5e54526ac8b083a099e9a7d55dd69d8d4c5e

Observation 4f2f7c76-5d29-4d02-872a-a3a3f9bf9c70 · outbound

This paper cites 2016 , url=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2016 , url=

Reference 114

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.617716Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:f03982462bd681e383d2f81ba3dbba3fe145978e8b69e3293413c6d6994cd0cd

Observation c11b25c7-e01d-40ca-8512-33bcaf17e99b · outbound

This paper cites 2022 , journal=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , journal=

Reference 115

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.620279Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:ca0f671c39601b819a78411365c727e436460d67f80c6f6b2047aa180b0f2024

Observation 6f31a737-4e07-4105-99a0-8e40819306c2 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 116

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.622921Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:192dcef8f85ae0a6b4c89f46ca2d2b638893844f233fefc2ef5dc5448dc070ab

Observation 76bf69e4-134d-40b5-be13-501c256e2713 · outbound

This paper cites 2022 , journal=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2022 , journal=

Reference 117

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.625568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:4ad71614a110e48b3707678c99190697321643d127ec7c2c5a8abc686e61ac88

Observation b6c2a7e6-4087-42ca-aba7-37e856b2bba9 · outbound

This paper cites 2023 , journal=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , journal=

Reference 118

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.628114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:d74bf59d316ec255584f0a3d6dbeae3344fc528a4dd7e9e3da8d7d0c3b49a023

Observation 3fb2ba25-0561-439e-bc55-f540deabc583 · outbound

This paper cites Understanding Dataset Difficulty with.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning Understanding Dataset Difficulty with

Reference 119

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.630931Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:dbef3ec37308fa3c2bcdba5a8b86c06e1231b166b37b867599d0c489472d8e83

Observation 3fcb5033-3a5d-4db2-a045-fb255fa55a4a · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 120

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.633677Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:b6706b3f92a80a968d9d3352b3915f479f9045669a60947ad9f8db805d731678

Observation 8ad383c5-2e53-430a-be9f-b6a72c05e482 · outbound

This paper cites 2023 , url=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , url=

Reference 121

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.736157Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:e4750400c79dab75d4cc9c954abf2bad2c906735f69a1801824e6359b8c5915f

Observation da78542d-85a1-487d-9e6d-b13c27a314a4 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 122

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.638769Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:56d7cc6d2ec2f6b3988872fbc824658b788fe50b21ef6bcbc7b30d3d282ff7c2

Observation 0c6006e1-a58d-4a09-8ff7-7a2f670d1fd2 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 123

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.641305Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:a531fdf14f08ceea9aec6b8c238823c980cefd832a60cc2a2ebf9759f0087605

Observation 6d30c901-6d3a-4b4d-9eab-3ea02a4e1854 · outbound

This paper cites 2023 , eprint=.

Aligning Modalities in Vision Large Language Models via Preference Fine-tuning 2023 , eprint=

Reference 124

Resolution
verified fuzzy
raw_fallback, observed 2026-05-17T10:58:53.643806Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-17T10:58:53.215887Z digest=sha256:f64417d6bc1c119edf576d31a30a478ab5c24a33e07442e720ee4502a162abec

Pith citing papers

Observation be264d2a-80aa-4fa5-9f5c-2405eb800588 · inbound

Hallucination of Multimodal Large Language Models: A Survey cites this paper.

Hallucination of Multimodal Large Language Models: A Survey Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 230

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-11T12:33:32.631346Z digest=sha256:3021fdc71cf92c4cfaf8fef150851eae5ca4d8d10fa3b1d531b1c62c68d711c2

Observation 4333e800-1215-4743-824c-3182ebe00606 · inbound

InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output cites this paper.

InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 183

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-17T10:46:28.447347Z digest=sha256:aa49421e6bc04258a7b1cf343476d75c8d29e56731a6ff5a225f438115e4dcaa

Observation e1c57527-ba88-4854-b44e-60aca8582f2a · inbound

Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization cites this paper.

Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 120

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-16T09:16:17.150383Z digest=sha256:217f20fa8d2c05bf1bd5dab3cf2850ae65f834bd45763eb376d7a44193ae9441

Observation 998d0e57-9131-4403-b214-5b3736738381 · inbound

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs cites this paper.

VidHal: Benchmarking Temporal Hallucinations in Vision LLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 71

Resolution
verified exact
local_arxiv, observed 2026-05-23T16:58:12.008190Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-23T16:57:12.821916Z digest=sha256:7a79bdecae97e7d929a8872a46b2cd51208ffbe6d690e555a726bac138be8933

Observation 82567c0a-0954-4279-a60b-f7b26c0491a6 · inbound

Visual-RFT: Visual Reinforcement Fine-Tuning cites this paper.

Visual-RFT: Visual Reinforcement Fine-Tuning Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-13T22:16:16.528682Z digest=sha256:ea19a1e2cbcc46cb67562bf67bc6159764b0148f09611849d84adbdb0186977b

Observation 90b4d342-0c3d-4bed-bcd9-25b54fa1cbaf · inbound

Seed1.5-VL Technical Report cites this paper.

Seed1.5-VL Technical Report Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 180

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-11T05:26:04.960844Z digest=sha256:8037d891516762458248418c58567523574eb36d39a381a958b1e86ff4296256

Observation edb6763f-e2c1-4a77-b79f-f724c776e5dd · inbound

Mitigating Object Hallucinations via Sentence-Level Early Intervention cites this paper.

Mitigating Object Hallucinations via Sentence-Level Early Intervention Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 86

Resolution
verified exact
local_arxiv, observed 2026-05-25T08:35:32.493103Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-25T08:31:24.173135Z digest=sha256:bf0005c184474f82b11337f848797e145f4392b0d91a181d2564b84df1de75e8

Observation 30b42ec6-0547-43d4-b6b9-6efe512f3a97 · inbound

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation cites this paper.

Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-02T19:56:33.552171Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T19:56:33.552171Z digest=sha256:2198f675209c72fd7098c803bf2f4cdafa36dd4d8b931981d3f48c09aec2cba6

Observation 26deb965-bb6e-4225-aa4c-6412f0f3efe2 · inbound

HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models cites this paper.

HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 52

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T15:13:49.239474Z digest=sha256:d003492a7565442a974c929fbb84c500442e4089b691fb39fed44add1fd28480

Observation 11e65227-ea07-4a2d-9b53-a6858eb8e864 · inbound

Visual Preference Optimization with Rubric Rewards cites this paper.

Visual Preference Optimization with Rubric Rewards Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T15:45:52.980881Z digest=sha256:a9f32723e40f35a97cf5dfa12c4ee38ed49ba7b3fe760a633c9a47cc033c1722

Observation 7b57ff5e-77d4-4e92-a03e-d0de8794041f · inbound

S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models cites this paper.

S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 133

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-10T05:38:01.208136Z digest=sha256:a7e2171963d8d83004f3fa119924b065528be6416b373237db9a08be5c044ab9

Observation 9a008cd4-7980-46e1-b6f8-c688e827671d · inbound

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling cites this paper.

DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 66

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T01:45:30.001398Z digest=sha256:757cd65aac5ec9c3267a9ec5fa0c6135e0f2a8b4ac61c5d921b09f1ed0c32baf

Observation e53a8fc6-98c3-4489-8446-c11c810bc9f3 · inbound

R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs cites this paper.

R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-10T01:28:14.039910Z digest=sha256:9c9ba7af573580d5e5851d76a14d0f896c7322bcd3d9934c388dd99c2c217ca3

Observation 67b11d97-2991-46f5-a364-5d92e71a201d · inbound

When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs cites this paper.

When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 52

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-09T22:11:40.905814Z digest=sha256:ec1caf5e373cddb42ba55255724b4ac8546cff335d2ee0fea875bd56b45f9621

Observation b6634a58-0134-4dce-82c1-9563085a49f2 · inbound

Online Self-Calibration Against Hallucination in Vision-Language Models cites this paper.

Online Self-Calibration Against Hallucination in Vision-Language Models Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 46

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-09T20:20:27.931679Z digest=sha256:bbcb9d553e335c36e71e6b1f33800ca92b63d465ff7ce4572a640ee2173ffab8

Observation 3b2b0c1d-6aa8-48bf-9e3d-b81bf2bcb8be · inbound

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models cites this paper.

Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 29

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-07T04:07:58.031100Z digest=sha256:2480618f3cf551d3a1e2b67ec97adc73950ef1385e3c26eb215cbd90ff436c76

Observation 008f94a0-f7c3-495e-9658-3a08eccb3a0e · inbound

Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models cites this paper.

Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-08T17:00:36.574362Z digest=sha256:8542f6cc42ed4169b10917aa92b70c6a7fcd2ef698c7f25e7717b74e92afaabe

Observation eb15ce03-13b6-46af-9b05-b7d08b7704e2 · inbound

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination cites this paper.

Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 58

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-12T05:15:34.156717Z digest=sha256:ea25912d6ba9c8d9e72484a67f099327e3143130bddf09848400900e610a2e51

Observation 8ca5ef37-69d0-4287-8caa-6e96270fbace · inbound

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone cites this paper.

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-13T02:52:43.674969Z digest=sha256:2c4fd78f3e67aeb7dbe4e56d86d0451077662d80ac8b8d8fccd3e3c60d6630e5

Observation 0fbebd25-d68f-48b6-ac7f-f543fa69cbbd · inbound

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone cites this paper.

20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 40

Resolution
verified exact
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-05-14T21:28:37.680681Z digest=sha256:cd768e4565c681317d9e1f7b1d1764703670c3599586ce9550cc9846eed21e96

Observation 466356d0-9174-4779-8775-327286404a22 · inbound

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning cites this paper.

Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 14

Resolution
metadata mismatch
arxiv_id, observed 2026-05-17T10:58:53.893696Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-15T05:14:28.256032Z digest=sha256:1e9e681e3c17bb082c968bc15c840d0c9065103c0feebf3202aed7f9740d6eb7

Observation 159dee4a-0d09-4053-bbab-ef110ae5b5de · inbound

Deep Pre-Alignment for VLMs cites this paper.

Deep Pre-Alignment for VLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 78

Resolution
metadata mismatch
local_arxiv, observed 2026-05-19T16:27:39.606281Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-05-19T16:26:41.094936Z digest=sha256:76a9541099b9d3bf1eb13201639b9cd9f58eb192c1f9b804fc972cb75a29509c

Observation bf691ecf-e3aa-4ace-b4ef-ef1b10052822 · inbound

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization cites this paper.

P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 122

Resolution
verified exact
local_arxiv, observed 2026-07-02T02:06:27.182299Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=arxiv_source observed=2026-06-28T11:13:37.291834Z digest=sha256:5fe609a81c955a06f2b2206d76485107af6765f5ab9a98690d36c5a5bd153338

Observation 2a539766-1815-478b-94ae-c444d89c6c15 · inbound

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning cites this paper.

CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-07-04T17:40:00.881290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-25T23:29:24.520537Z digest=sha256:efa3c46fd54bc81c0e06c43ac6080765cbce4891ed662423ef8e44109cf4df12

Observation 058de06d-e698-41f4-8a54-b166c7ee7a66 · inbound

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs cites this paper.

Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 46

Resolution
verified exact
local_arxiv, observed 2026-07-01T15:35:47.620953Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-06-30T01:22:16.176398Z digest=sha256:ef16f7626be54997e756f206fee4a75cd9974de1cbb340ab1cac59acf5a30137

Observation fffd69ff-93a4-4867-bf75-206b969c592f · inbound

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs cites this paper.

No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 96

Resolution
metadata mismatch
local_arxiv, observed 2026-07-01T10:25:41.372451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.

source=pdf_text observed=2026-07-01T05:35:08.200219Z digest=sha256:3ef07333f8691842c68f5b604fbf49f2bf4720c14b3bbc7164230edd7aa216a8

Observation 80be012f-6bf8-4f8b-9ecb-e46c0bec50dd · inbound

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs cites this paper.

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-02T04:15:39.465899Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-02T04:15:39.465899Z digest=sha256:824f488019d65e9742588fd4ead3269b29ab85f992d556d842337a856494836a