Pith. sign in

Paper Citation Record · LEDGER

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs

As of 7 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2505.22396.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.22396 v1

Coverage vector

measured 82 of 82 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T13:14:12.081333Z

measured 82 of 82 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

82 of 82 outbound references displayed

  • verified exact0
  • verified fuzzy14
  • unresolved67
  • parse uncertain0
  • malformed identifier1
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7b818da2-af0c-41cb-a27e-46eefe6f5ef4 · outbound

This paper cites Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:01.772785Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:01.772785Z digest=sha256:5cbeb6f354e45a711a2fea97c42184a4a21bdd74e802e2c9861ac9ed286248cb

Observation 4681f850-b3f1-48c3-9422-1a801a1c9c6a · outbound

This paper cites Seed1.5-VL Technical Report.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Seed1.5-VL Technical Report

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:01.890332Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:01.890332Z digest=sha256:cb80df261ff468dd285f58453ee66005d41f49c16c4729e8a49700f9b888e7eb

Observation bd609cff-e1f7-4966-be18-429f51a0773b · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:02.046571Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:02.046571Z digest=sha256:88f77d49aee5281fd2566c8fc5ce881511bcacaef3087800030c450c0ca27254

Observation 3e8613e0-9b8f-43d8-96b5-74253538e336 · outbound

This paper cites Vqa: Visual question answering.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Vqa: Visual question answering

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:02.195508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:02.195508Z digest=sha256:4af8c9e33e8b58916d1425b35bebf8689ae7f803092007d6cca399060bf3ab30

Observation 8724dce0-149c-4e87-8b19-3eecc36e8b5c · outbound

This paper cites Large language models are visual reasoning coordinators.Advances in Neural Information Processing Systems, 36:70115–70140, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Large language models are visual reasoning coordinators.Advances in Neural Information Processing Systems, 36:70115–70140, 2023

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.759029Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:02.734269Z digest=sha256:39a5b27eab5c9d271e41be52d237e75672191e1d219295589dfa883a89c09530

Observation 259b3ba0-7cc2-4266-a150-1781c9c856a2 · outbound

This paper cites Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.638902Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:02.831794Z digest=sha256:31d9ed60b0670883160157ea721100dcef770e528239548453102016382805ee

Observation e3e4986c-e0f0-4373-b274-7ec4587116bd · outbound

This paper cites Vipergpt: Visual inference via python execution for reasoning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Vipergpt: Visual inference via python execution for reasoning

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.515420Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:02.998390Z digest=sha256:d5c7b581c3896a3e8f724b7c72566b7815256530ca8372fa6a93fccb0b15a87d

Observation e1c8132d-48f9-4601-bea8-44d08f70b3a9 · outbound

This paper cites A picture is worth more words over time: Multimodality and narrative structure across eight decades of american superhero comics.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs A picture is worth more words over time: Multimodality and narrative structure across eight decades of american superhero comics

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.123068Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.123068Z digest=sha256:ce520f9e08371b39d71f8573f99ac1db7f049bf4972f721680e8a12f8474e2d4

Observation ff421208-0027-4e5e-b28f-d2c64a2d2cbb · outbound

This paper cites Seed-bench: Benchmarking multimodal large language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Seed-bench: Benchmarking multimodal large language models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.295738Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.295738Z digest=sha256:0fedea4097141365f210f5c8bacac6bfb89c8e4abf5c064661063d2dcfba7363

Observation a332d80a-a365-4f3e-a749-215b8e790b8a · outbound

This paper cites Improved baselines with visual instruction tuning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Improved baselines with visual instruction tuning

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.460259Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.460259Z digest=sha256:233d8a453f1cf1027e47e86eba7e2e4a828ca56f77661ce703db0432c63947bc

Observation ce34df5e-71f0-4643-8045-2ce79608ac47 · outbound

This paper cites Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.604035Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.604035Z digest=sha256:0e2ca1a0ffa1a6696ac1a283e29f6ef66477ee105e1e8bf1f312cc3af632ea03

Observation df3597bb-aaba-4184-ac9d-95cca3d46c49 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.699854Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.699854Z digest=sha256:9875787193b1d3abde84de4fedbf2b1148c4c02725fea35ad49705fcd14700e2

Observation fa126fad-4926-4f28-a97a-4536b5baa132 · outbound

This paper cites Making the v in vqa matter: Elevating the role of image understanding in visual question answering.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Making the v in vqa matter: Elevating the role of image understanding in visual question answering

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.763745Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.763745Z digest=sha256:44e9daaf6151cd7404ef9d0bcf38a5368d0c6565ef8a9a86d00120708018a0a4

Observation b799c378-5b38-4b4e-9eb6-c40805401004 · outbound

This paper cites Ok-vqa: A visual question answering benchmark requiring external knowledge.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Ok-vqa: A visual question answering benchmark requiring external knowledge

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:03.873044Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:03.873044Z digest=sha256:6ece065ea3c752329c65e0eef38ad6f3ff34f8fb207189fee71ee4a78243b81d

Observation f0b91b71-8d4e-4799-abe8-9575339d6475 · outbound

This paper cites What matters when building vision-language models?Advances in Neural Information Processing Systems, 37:87874–87907, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs What matters when building vision-language models?Advances in Neural Information Processing Systems, 37:87874–87907, 2024

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.348575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:04.333850Z digest=sha256:4ff81b7a3e757ae0df7ebccc49e977199c59f92e1dae6d84f34f0e391ad7486b

Observation 97129f29-9379-4e48-ba6a-8dac1e096d3f · outbound

This paper cites Generative multimodal models are in-context learners.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Generative multimodal models are in-context learners

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.438650Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.438650Z digest=sha256:72b4f284cf2dabedcbb785ff73958c985d2c45aa24d9a7001cf574eb3963545b

Observation a3666b32-2ee1-4a69-8e13-e4bb32e7af89 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Direct preference optimization: Your language model is secretly a reward model

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.561866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.561866Z digest=sha256:95c69c1e10b7f71a8619752a42522c95179c197f2df66fd3530af8faadf8e913

Observation 388e6486-af46-446a-be6e-fad635062ad9 · outbound

This paper cites V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.742031Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.742031Z digest=sha256:c1568d240acdd636750047eabe9d09553f1a81e783c8d00ed3827a1636d1d1a5

Observation bf661a58-0dff-4630-838b-4c6efac939b1 · outbound

This paper cites Aligning Modalities in Vision Large Language Models via Preference Fine-tuning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Aligning Modalities in Vision Large Language Models via Preference Fine-tuning

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:04.902892Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:04.902892Z digest=sha256:df9604d10c71b0e23421fb973998ba8fd096307d0cf4713b405759ac08d6bdf7

Observation 3051702f-4258-486d-9388-5c856b21aee1 · outbound

This paper cites VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.050891Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.050891Z digest=sha256:22144d059f19608108dcc76311308af7b6c76a83bad92fdbaebab45d040c9949

Observation 8edcfc12-27b1-4b35-a11c-fe648441b0ac · outbound

This paper cites Automated multi-level preference for mllms.Advances in Neural Information Processing Systems, 37:26171–26194, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Automated multi-level preference for mllms.Advances in Neural Information Processing Systems, 37:26171–26194, 2024

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.225054Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:05.145938Z digest=sha256:2590b5b087430201a4bbf4447586e394d2ec580ed6b8a6ff3777c204817beb85

Observation c8e1ed7f-cbba-426d-929c-74da506f8dc1 · outbound

This paper cites Clip-dpo: Vision- language models as a source of preference for fixing hallucinations in lvlms.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Clip-dpo: Vision- language models as a source of preference for fixing hallucinations in lvlms

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:15.036942Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:05.274462Z digest=sha256:b32bfa248fc98803e860277ddc86ea50a8c1f7b671321e375d748f9068911bab

Observation 6c237cc1-6d68-483d-9468-8bfc76e9a27e · outbound

This paper cites Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.896862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:05.430310Z digest=sha256:a8a70e49c4ba8879fd0e715ff3902df1f4383a864097b3dfc2b3a4090aabb4e9

Observation 62b53938-6dcd-41ba-8599-dc0b41e0c2a8 · outbound

This paper cites Identifying and Mitigating Position Bias of Multi-image Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Identifying and Mitigating Position Bias of Multi-image Vision-Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.544878Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.544878Z digest=sha256:45025918b28f19ee068603aa9bc627514823a8329b9fe4f9ec85e4acdb5ab097

Observation d447e63b-10d3-4cd5-9946-f778494f23d0 · outbound

This paper cites Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation.arXiv preprint arXiv:2503.05255, 2025.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation.arXiv preprint arXiv:2503.05255, 2025

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.712377Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.712377Z digest=sha256:d1fa448a73b49c228bdf8d44979cdb0bb74e70505e36c827f44514e763f2450e

Observation eaf5978a-e6b8-4f6c-928f-420226815c55 · outbound

This paper cites LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:05.941977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:05.941977Z digest=sha256:5118460fb24cdbd5b34e50c6f973d66242ecd359aaff4d93630310ae38221b04

Observation bff41d04-64f7-4048-95f9-c7627027b03f · outbound

This paper cites CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.085419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.085419Z digest=sha256:d1ee591956198a471e573cf90f68d530bb0105e919d1f86e3712a4b16add15da

Observation 5d2c0eea-c039-43a9-b406-d66cf12808d7 · outbound

This paper cites LLaVA-OneVision: Easy Visual Task Transfer.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs LLaVA-OneVision: Easy Visual Task Transfer

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.186485Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.186485Z digest=sha256:a68c2afd414967b4aded459ac3f790449f4e5a40ecdf647c023bb4b7797badfb

Observation 480ea5e2-4e8a-46a0-ab25-c312b9d6454d · outbound

This paper cites Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.400552Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.400552Z digest=sha256:aa65a00e211fc5ba094c388c993f47350bbf38ca4e49e25659ce4c84ef0d2219

Observation 09821de1-a06d-4d42-8d64-0d39800c32f7 · outbound

This paper cites MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.523108Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.523108Z digest=sha256:bf1aaea5954c4e08c1faaa1b8395ccafed3562a7705194ac7f69c31483790fd6

Observation 68bddef1-6493-4d32-ac6b-06f362748d74 · outbound

This paper cites Object Hallucination in Image Captioning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Object Hallucination in Image Captioning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.644471Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.644471Z digest=sha256:e4ce728518d7cdb1d5c1a8eb311f5e8daa9df29abd8c1c3e703e61eaa4dff8ef

Observation a2356e2c-5cbb-45a9-b70d-feee81cdb29b · outbound

This paper cites An llm-free multi-dimensional benchmark for mllms hallucination evaluation.CoRR, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs An llm-free multi-dimensional benchmark for mllms hallucination evaluation.CoRR, 2023

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.756992Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:06.831783Z digest=sha256:a1930d4159fcfebe9363df8097bda86d3c9a48441594b4e5f1b88b2ed712830d

Observation cab32f1f-6284-4759-8859-1976660bfe7f · outbound

This paper cites Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:06.936445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:06.936445Z digest=sha256:614fcefc8999734048c466908f1b6ac18220f558f77b6a68425ed3d23f6b60c8

Observation a399f091-c1ef-4c0a-8ac0-b13368daeaf3 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.103871Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.103871Z digest=sha256:c136c278067022abe6f42ac7618067bd87acb5d75cd445b6a5e6b7a1ad3353f1

Observation 4cba0258-0ee1-4899-8e28-1092ddcecfaa · outbound

This paper cites Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advances in Neural Information Processing Systems, 36:71683–71702, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advances in Neural Information Processing Systems, 36:71683–71702, 2023

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.610044Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:07.316739Z digest=sha256:b90ebab7c0f80cf288d4d2a9452208f98865a95b442bc1562e9fe16c89dd0cdb

Observation ef610710-4787-46de-b778-5ad01d6fe3ae · outbound

This paper cites Multimodal c4: An open, billion-scale corpus of images interleaved with text.Advances in Neural Information Processing Systems, 36:8958–8974, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Multimodal c4: An open, billion-scale corpus of images interleaved with text.Advances in Neural Information Processing Systems, 36:8958–8974, 2023

Reference 41

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.317151Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:07.461701Z digest=sha256:b1c5ca5fed959ff9034ae3bb02e0f2d5660c79cc7fe3ecac63efc6f58897ba5a

Observation d2d47731-ee9a-4505-84c2-338c64a80cf7 · outbound

This paper cites MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.608877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.608877Z digest=sha256:444f21a88cd25a32e20739e8d195a52ba0f728a380a0ef61c121e0ef2c72d83c

Observation a16dd9f2-e92c-46b7-852d-d7a3b0afb6db · outbound

This paper cites Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.799230Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.799230Z digest=sha256:7d35f46777e326cc81fec2c54fb8d18e850566f364abcf2c82af6375b404cc82

Observation e86d8e92-c36b-4122-b80d-2c7f3e74c71c · outbound

This paper cites MANTIS: Interleaved Multi-Image Instruction Tuning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MANTIS: Interleaved Multi-Image Instruction Tuning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:07.931473Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:07.931473Z digest=sha256:7f640863a6da0f8f2d9e965a1829574219cef842ed0c0bbbf5d124459296a458

Observation 805c69e3-cfec-4ccb-b641-a27539f7c170 · outbound

This paper cites Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.070786Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.070786Z digest=sha256:5a91b635088c737af3481b3ba086aaf0d8707c433db29823a72d7616607026fc

Observation 63f74f35-6add-47b5-b9d8-b895e81a7aae · outbound

This paper cites MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.139191Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.139191Z digest=sha256:acb728dd43b9ff11b5feb57f3ba2557972ec443a55694695af7ade52324f84ce

Observation a306a584-cf22-4bf0-b358-9a50034d590d · outbound

This paper cites Mvbench: A comprehensive multi-modal video understanding benchmark.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mvbench: A comprehensive multi-modal video understanding benchmark

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.188089Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.188089Z digest=sha256:35f3cc02a83f42fac2159bd17bc3f2acde836762aa59e92b782468abd657e545

Observation 3de70882-a362-4d61-9004-7cf1590ea603 · outbound

This paper cites Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.265252Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.265252Z digest=sha256:80d0b8c07bc5dbfab7c5c281530368886c57c64c3ddb008d51e1acde8d047ea9

Observation d2a71af7-c1c0-4096-93c8-44a39d3817f5 · outbound

This paper cites Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.332101Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.332101Z digest=sha256:a07f12cab5d6a466b628b8b6d328b8923554428170d4ed903cf018b07a9495b1

Observation 77ad86f5-4f7c-4355-a3b9-7b03f5f1a8b2 · outbound

This paper cites Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.402109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.402109Z digest=sha256:cd3710666f756bcb46098f2f141a2a63cd8d6afae23ea4bb264dc8760b2a53b5

Observation a745cefa-6f64-4205-8f2c-d09036d15a8b · outbound

This paper cites Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.456890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.456890Z digest=sha256:d3e85b8d1c756f32b398b75ca91b97fb6f725f71eb2ca738527542aa897c9df2

Observation 735e8ae9-cdd5-4ebb-b5dd-e497d50ca0fb · outbound

This paper cites Modality-Fair Preference Optimization for Trustworthy MLLM Alignment.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Modality-Fair Preference Optimization for Trustworthy MLLM Alignment

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.503129Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.503129Z digest=sha256:8a1c0bc73c96d2fcb744c18e4e01b87525ef8ed4823494f157439425fb54fdb2

Observation 886de767-1a9b-4a88-a4aa-ddba8880c449 · outbound

This paper cites Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.553085Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.553085Z digest=sha256:dbaee90826ce4a6b05b36f85c25d009348c979b107b286e772bafaa397349840

Observation c272722a-afdf-4f57-af19-96d51716b24b · outbound

This paper cites Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment

Reference 54

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.642768Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.642768Z digest=sha256:95fa106e1e700e96d1401315765da445197c6bd049f59b5868cc9831f6904368

Observation 4945f9f4-5c80-4549-9f52-122edc462dd1 · outbound

This paper cites Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation.arXiv preprint arXiv:2412.14487, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation.arXiv preprint arXiv:2412.14487, 2024

Reference 55

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.728565Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.728565Z digest=sha256:bc58f984b072bd50f57f545ae266e875ff0d07614f8e357985ba81f20d8b9db7

Observation 7c1bdc5a-5958-4900-8a8f-c98ce52e6ba1 · outbound

This paper cites Denseclip: Language-guided dense prediction with context-aware prompting.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Denseclip: Language-guided dense prediction with context-aware prompting

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:14.075232Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:08.809984Z digest=sha256:4fe20785c6407e6ad9bc3b2314c9a422dd9882296d268784b59de3c60b0e65ee

Observation 9969215a-f65e-4db6-8f39-79e1564c36e4 · outbound

This paper cites Segment anything.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Segment anything

Reference 57

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.889619Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.889619Z digest=sha256:5e4fe093ea0e6ccf6adde7a024eec7a69d7f8d299f664aeccf384319b5f241e0

Observation 80bd1e6a-bf70-4d48-8362-865b2c333fc3 · outbound

This paper cites SAM 2: Segment Anything in Images and Videos.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs SAM 2: Segment Anything in Images and Videos

Reference 58

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:08.943710Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:08.943710Z digest=sha256:fb6376ed4762326735140aa1db943bac91e1bf1762ec4d5c7a357b335d254858

Observation 529df681-86c1-47e9-8f35-b8eecb7625ea · outbound

This paper cites What does clip know about a red circle? visual prompt engineering for vlms.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs What does clip know about a red circle? visual prompt engineering for vlms

Reference 59

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.004189Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.004189Z digest=sha256:aecf30f8dd3c5c9400c65b5553123aaf2003bc5bda1ac1bb52cc739895e4c1bb

Observation 2b37f00b-4c98-4816-a4b5-23cac238d526 · outbound

This paper cites Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:13.777666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:09.053089Z digest=sha256:a81b6efc5030a2c16d8763a045168eace612ef3061ff1df2b426b9892fbe34de

Observation 676278fa-89e0-45e1-b6d6-7d401f2740c5 · outbound

This paper cites Controlmllm: Training-free visual prompt learning for multimodal large language models.Advances in Neural Information Processing Systems, 37:45206–45234, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Controlmllm: Training-free visual prompt learning for multimodal large language models.Advances in Neural Information Processing Systems, 37:45206–45234, 2024

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:13.485291Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:09.127164Z digest=sha256:3b337649afd6c9555d5ecdb189b3a04a3e4a24bcf804274c76036c9562fff8d3

Observation 292ce210-3741-4dda-914c-6c06f64f733c · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 62

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.210870Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.210870Z digest=sha256:b3c2d81c1a091895f56546750c7ac2fe7a6288de3ba8b202704d9cf9b159d1a5

Observation 8038ddba-2872-40b6-9f42-843263afc2fe · outbound

This paper cites Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want

Reference 63

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.279344Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.279344Z digest=sha256:902deaefcf1016f08a8fecde81a36bbaa1443b92360fd86d186d1cfb741f98ea

Observation 5911b287-ce2b-415d-80df-111655e77fde · outbound

This paper cites Microsoft coco: Common objects in context.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Microsoft coco: Common objects in context

Reference 64

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.341142Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.341142Z digest=sha256:080b233c2350a42b23545289f3c545a3fbfaed68d63c9450a16d33e55e9713d0

Observation 616cbabc-ee87-4b4a-81fc-493b07965263 · outbound

This paper cites Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling

Reference 66

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.473336Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.473336Z digest=sha256:410bad6671bb95cb854081947ccef1753eaec363d446bff974f39b0e2ceab8dc

Observation d237af20-3268-40ac-9ecb-2bed4a49397d · outbound

This paper cites mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models

Reference 67

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.565939Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.565939Z digest=sha256:cfdfb64758bcd586a888b45a489368dc95e87e89c4147bac296a00a9b50f8d2e

Observation 9f266e29-492b-445e-843a-e74ab1d4d1ef · outbound

This paper cites Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022

Reference 68

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.624040Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.624040Z digest=sha256:c47d2cb1d6979606626547a056258e4690a632c1f0d9a698df2078a4e0558d98

Observation c998bba7-4b75-4325-9045-4da573f3b1b5 · outbound

This paper cites Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning

Reference 69

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.693716Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.693716Z digest=sha256:8a42eab257aa30f4a2f17fbe13dfc37f5d85d85abe29ba8c399cfa8008a58952

Observation 0790cc7a-18a6-45b9-8159-75734a52a955 · outbound

This paper cites Blink: Multimodal large language models can see but not perceive.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Blink: Multimodal large language models can see but not perceive

Reference 70

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T13:14:13.271348Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T13:14:09.751122Z digest=sha256:36737e729a03a2c1c2e4edac644f9871c28c51b20c57f87c0c767c184af6c1c8

Observation 57157a73-db4f-4cc2-9dca-3a313eb825e2 · outbound

This paper cites A Corpus for Reasoning About Natural Language Grounded in Photographs.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs A Corpus for Reasoning About Natural Language Grounded in Photographs

Reference 71

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.813086Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.813086Z digest=sha256:794bb25a98f244df22626b1bffc47eaa1c6b0fa6d733cecc60587c6e81953a51

Observation 321334bc-28a5-40ba-b375-c0a6b8148420 · outbound

This paper cites Q-bench: A benchmark for multi-modal foundation models on low-level vision from single images to pairs.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Q-bench: A benchmark for multi-modal foundation models on low-level vision from single images to pairs.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024

Reference 72

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.862080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.862080Z digest=sha256:1ea446642d6ecfdaf17df2df0136218ff2e241161a5aa534ea4702dce4b1185a

Observation d1f390e2-0e1d-4697-a7f6-530f2d2faf57 · outbound

This paper cites MIBench: Evaluating Multimodal Large Language Models over Multiple Images.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs MIBench: Evaluating Multimodal Large Language Models over Multiple Images

Reference 73

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:09.946184Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:09.946184Z digest=sha256:d80eba65958d2cbccfc7ee07939ac5f3cb815f773bc8a431f3875e74a227d42a

Observation d568806a-1dfe-431a-b577-79d6cb16f583 · outbound

This paper cites Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi

Reference 74

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.032271Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.032271Z digest=sha256:c5c09c8eba36c4323c090435388897b3cc6fd3a13752c1c5ddb4c1521660a0d0

Observation fecade87-d7f8-4e4c-a397-1b88685273b1 · outbound

This paper cites Are We on the Right Way for Evaluating Large Vision-Language Models?.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Are We on the Right Way for Evaluating Large Vision-Language Models?

Reference 75

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.120910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.120910Z digest=sha256:c3dbe77903c37562b7bbd3f673c5ee60578d5d5853eecbd6355672e61b5f0d92

Observation 4337c286-c758-4461-bdc4-3fc61a4fedd4 · outbound

This paper cites Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022

Reference 76

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.166520Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.166520Z digest=sha256:8b700893e10cac0e58c3399cccdd8d199912fb2aef49512ca8804fba38c63d61

Observation 69a6f517-05d2-495e-b990-2a2aa6d00c11 · outbound

This paper cites A diagram is worth a dozen images.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs A diagram is worth a dozen images

Reference 77

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.210781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.210781Z digest=sha256:79588d67733a917d9465f346c17816347b4c3dc4dcac9ce4edb49e588c76c5f0

Observation 90226fa6-d728-4162-9925-18901c45d399 · outbound

This paper cites Evaluating Object Hallucination in Large Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Evaluating Object Hallucination in Large Vision-Language Models

Reference 78

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.325407Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.325407Z digest=sha256:c304673344a295d5ad890d56aca971101b76cf5316d9587a4b6a7b98de8ab00b

Observation 022bb662-11ca-462c-9b9d-8e54356f7a2a · outbound

This paper cites Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233

Reference 79

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.401578Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.401578Z digest=sha256:5516596d62daf9283bbff9e2f88cc9cd000c064fbef8fefddcc7ffad49c015bc

Observation 18319a3c-d290-4fcf-8920-7038aa4346d7 · outbound

This paper cites Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024

Reference 80

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.473287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.473287Z digest=sha256:64c0d3e65e23ca200613a3bdceff80ad03f277b109a61d134d61764f6d648d47

Observation 0bc9fb29-dc0c-40fb-8b1a-65b6daccebc2 · outbound

This paper cites GPT-4 Technical Report.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs GPT-4 Technical Report

Reference 81

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.545631Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.545631Z digest=sha256:9036f53acfc34ec3ca276a16d9e1c1c0f5905ed42a23a3b3ccc6acd87742b76a

Observation 3ce90a9c-56f3-45b9-b71d-3fc4a5572dd5 · outbound

This paper cites Needle in a multimodal haystack.Advances in Neural Information Processing Systems, 37:20540–20565, 2024.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Needle in a multimodal haystack.Advances in Neural Information Processing Systems, 37:20540–20565, 2024

Reference 82

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.674992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.674992Z digest=sha256:5848797f358e6c28b46a1c073fec3f0c9f7c864be15ed3a5f1c6db5bd2282853

Observation 7661d267-206a-4624-a7d2-ad635d018b9d · outbound

This paper cites LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models

Reference 83

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:10.915411Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:10.915411Z digest=sha256:bbc997eb98829d2b237f8ef1e4b4f0f0ac4ecafa1f4d9b2389bd280390195a1d

Observation de1b94e6-fcd7-4656-8ffb-d5da17e00351 · outbound

This paper cites Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond

Reference 84

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.487884Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.487884Z digest=sha256:7f92e3997194aa3d1e41b8f63d09d9e66f5ed2608c87dd753ef1fc4937a112dc

Observation 46af83b8-7631-4679-8f6f-34e9a00903f0 · outbound

This paper cites OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models

Reference 85

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.764663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.764663Z digest=sha256:e655f8ff3669aed19f123d7d2dd8c1a67135ec842e1761356ccdb3da847ee4b7

Observation a367d560-e83e-4c1a-9c08-9bb5995e9579 · outbound

This paper cites Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023

Reference 86

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.846564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.846564Z digest=sha256:e5fd46f816b6802bbcbe8466eaee278d0d52fbdb13325b3f1d1574474703fff6

Observation f7c6305a-5c86-46a5-8d21-618a957ff359 · outbound

This paper cites CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples

Reference 87

Resolution
unresolved
no resolver link, observed 2026-08-07T13:14:11.965719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:11.965719Z digest=sha256:0ee3003b81376985911f67999613949c2cedea4642a24e92b22f2d8048bc83a3

Observation f3831c0b-52d7-46a1-a6cc-16ab5a63680d · outbound

This paper cites FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension.

Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension

Reference 88

Resolution
malformed identifier
no resolver link, observed 2026-08-07T13:14:12.081333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T13:14:12.081333Z digest=sha256:16b2c3e6b222adadc956daf9853ed3f7f3ee37fff9ffbcf112564a7284deea35

Pith citing papers

No inbound Pith citation observations are available.