{"as_of":"2026-08-08T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:194f5a2a8b3dd901721ce33b3d2ba7f296c8d510324eb896917a67bba069ef36","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:14:12.081333Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.22396/citation-record","integrity":"/paper/2505.22396/integrity","json":"/paper/2505.22396/citation-record.json","paper":"/paper/2505.22396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:01.772785Z","title":"Flamingo: a visual language model for few-shot learning.Advances in neural information processing systems, 35:23716–23736, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:01.772785Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5cbeb6f354e45a711a2fea97c42184a4a21bdd74e802e2c9861ac9ed286248cb","observation_id":"7b818da2-af0c-41cb-a27e-46eefe6f5ef4","resolution":{"observed_at":"2026-08-07T13:14:01.772785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T13:14:01.890332Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:01.890332Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:cb80df261ff468dd285f58453ee66005d41f49c16c4729e8a49700f9b888e7eb","observation_id":"4681f850-b3f1-48c3-9422-1a801a1c9c6a","resolution":{"observed_at":"2026-08-07T13:14:01.890332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:14:02.046571Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.046571Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:88f77d49aee5281fd2566c8fc5ce881511bcacaef3087800030c450c0ca27254","observation_id":"bd609cff-e1f7-4966-be18-429f51a0773b","resolution":{"observed_at":"2026-08-07T13:14:02.046571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:02.195508Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.195508Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:4af8c9e33e8b58916d1425b35bebf8689ae7f803092007d6cca399060bf3ab30","observation_id":"3e8613e0-9b8f-43d8-96b5-74253538e336","resolution":{"observed_at":"2026-08-07T13:14:02.195508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.705923Z","title":"Large language models are visual reasoning coordinators.Advances in Neural Information Processing Systems, 36:70115–70140, 2023","venue":null,"work_id":"cfe345e2-7803-4497-9b83-429d25cd927e","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.734269Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:14cb0913bc48e025e9d6c46bba06866ba1097133d6475c08f6bb8bb0c226982e","observation_id":"8724dce0-149c-4e87-8b19-3eecc36e8b5c","resolution":{"observed_at":"2026-08-07T13:14:15.759029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.578348Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models.Advances in Neural Information Processing Systems, 36:43447–43478, 2023","venue":null,"work_id":"9bf39fc8-5602-45e2-9e97-3ae6934858db","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.831794Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a990bb8ae33c69df6b368698d8d009262086e02a6e92332f48ed429c2d516a78","observation_id":"259b3ba0-7cc2-4266-a150-1781c9c856a2","resolution":{"observed_at":"2026-08-07T13:14:15.638902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.446635Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":"18f48a63-2e2a-4d3a-ab34-1673166aa143","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:02.998390Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:369a7e7a47c7b82b463584667c1fd577266778446b220cb1ef8b7e0d9f098f37","observation_id":"e3e4986c-e0f0-4373-b274-7ec4587116bd","resolution":{"observed_at":"2026-08-07T13:14:15.515420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.123068Z","title":"A picture is worth more words over time: Multimodality and narrative structure across eight decades of american superhero comics","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.123068Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:ce520f9e08371b39d71f8573f99ac1db7f049bf4972f721680e8a12f8474e2d4","observation_id":"e1c8132d-48f9-4601-bea8-44d08f70b3a9","resolution":{"observed_at":"2026-08-07T13:14:03.123068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.295738Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.295738Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:0fedea4097141365f210f5c8bacac6bfb89c8e4abf5c064661063d2dcfba7363","observation_id":"ff421208-0027-4e5e-b28f-d2c64a2d2cbb","resolution":{"observed_at":"2026-08-07T13:14:03.295738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.460259Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.460259Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:233d8a453f1cf1027e47e86eba7e2e4a828ca56f77661ce703db0432c63947bc","observation_id":"a332d80a-a365-4f3e-a749-215b8e790b8a","resolution":{"observed_at":"2026-08-07T13:14:03.460259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.604035Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.604035Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:0e2ca1a0ffa1a6696ac1a283e29f6ef66477ee105e1e8bf1f312cc3af632ea03","observation_id":"ce34df5e-71f0-4643-8045-2ce79608ac47","resolution":{"observed_at":"2026-08-07T13:14:03.604035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.699854Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.699854Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:9875787193b1d3abde84de4fedbf2b1148c4c02725fea35ad49705fcd14700e2","observation_id":"df3597bb-aaba-4184-ac9d-95cca3d46c49","resolution":{"observed_at":"2026-08-07T13:14:03.699854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.763745Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.763745Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:44e9daaf6151cd7404ef9d0bcf38a5368d0c6565ef8a9a86d00120708018a0a4","observation_id":"fa126fad-4926-4f28-a97a-4536b5baa132","resolution":{"observed_at":"2026-08-07T13:14:03.763745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:03.873044Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:03.873044Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:6ece065ea3c752329c65e0eef38ad6f3ff34f8fb207189fee71ee4a78243b81d","observation_id":"b799c378-5b38-4b4e-9eb6-c40805401004","resolution":{"observed_at":"2026-08-07T13:14:03.873044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.306525Z","title":"What matters when building vision-language models?Advances in Neural Information Processing Systems, 37:87874–87907, 2024","venue":null,"work_id":"ad1b738a-7d23-4c8a-9c68-8bbf5d95eb5b","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.333850Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:8fd5ee4c0be8af51199f759d84be4baa8eb24dcb53bfac0cb3daf1a55a847132","observation_id":"f0b91b71-8d4e-4799-abe8-9575339d6475","resolution":{"observed_at":"2026-08-07T13:14:15.348575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:04.438650Z","title":"Generative multimodal models are in-context learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.438650Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:72b4f284cf2dabedcbb785ff73958c985d2c45aa24d9a7001cf574eb3963545b","observation_id":"97129f29-9379-4e48-ba6a-8dac1e096d3f","resolution":{"observed_at":"2026-08-07T13:14:04.438650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:04.561866Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.561866Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:95c69c1e10b7f71a8619752a42522c95179c197f2df66fd3530af8faadf8e913","observation_id":"a3666b32-2ee1-4a69-8e13-e4bb32e7af89","resolution":{"observed_at":"2026-08-07T13:14:04.561866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02712","last_updated":"2024-11-05T01:24:37Z","snapshot_observed_at":"2026-07-06T19:45:17.343568Z","submitted_at":"2024-11-05T01:24:37Z","title":"V-DPO: Mitigating Hallucination in Large Vision Language Models via Vision-Guided Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02712","snapshot_observed_at":"2026-08-07T13:14:04.742031Z","title":"V-dpo: Mitigating hallucination in large vision language models via vision-guided direct preference optimization.arXiv preprint arXiv:2411.02712, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.742031Z"},"links":{"cited_paper":"/paper/2411.02712","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c1568d240acdd636750047eabe9d09553f1a81e783c8d00ed3827a1636d1d1a5","observation_id":"388e6486-af46-446a-be6e-fad635062ad9","resolution":{"observed_at":"2026-08-07T13:14:04.742031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-07T13:14:04.902892Z","title":"Aligning modali- ties in vision large language models via preference fine-tuning.arXiv preprint arXiv:2402.11411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:04.902892Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:df9604d10c71b0e23421fb973998ba8fd096307d0cf4713b405759ac08d6bdf7","observation_id":"bf661a58-0dff-4630-838b-4c6efac939b1","resolution":{"observed_at":"2026-08-07T13:14:04.902892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13122","last_updated":"2025-04-17T17:39:41Z","snapshot_observed_at":"2026-08-07T16:01:21.534867Z","submitted_at":"2025-04-17T17:39:41Z","title":"VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13122","snapshot_observed_at":"2026-08-07T13:14:05.050891Z","title":"Vistadpo: Video hierarchical spatial-temporal direct preference optimiza- tion for large video models.arXiv preprint arXiv:2504.13122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.050891Z"},"links":{"cited_paper":"/paper/2504.13122","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:22144d059f19608108dcc76311308af7b6c76a83bad92fdbaebab45d040c9949","observation_id":"3051702f-4258-486d-9388-5c856b21aee1","resolution":{"observed_at":"2026-08-07T13:14:05.050891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:15.139303Z","title":"Automated multi-level preference for mllms.Advances in Neural Information Processing Systems, 37:26171–26194, 2024","venue":null,"work_id":"d65961c7-6c4d-4700-96f7-9dcbf9779043","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.145938Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:48d51a065c1bc1078bdb266cdd3f95506d2c7c08f5cc1f7e758a0bc1a83118b3","observation_id":"8edcfc12-27b1-4b35-a11c-fe648441b0ac","resolution":{"observed_at":"2026-08-07T13:14:15.225054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.973515Z","title":"Clip-dpo: Vision- language models as a source of preference for fixing hallucinations in lvlms","venue":null,"work_id":"daf6ff67-1e1c-482c-8c2d-7157f8495523","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.274462Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d6efbf1f86fcbf5425888457e2f066999d8a46061ec78d5ebe7918ae5d5e6b9d","observation_id":"c8e1ed7f-cbba-426d-929c-74da506f8dc1","resolution":{"observed_at":"2026-08-07T13:14:15.036942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.830005Z","title":"Mia-dpo: Multi-image augmented direct preference optimization for large vision-language models","venue":null,"work_id":"b80a4f85-d96b-4309-a411-2bcc15236ccf","year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.430310Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:8fb4ac1e35f5efe7832cc9685fedeb5fd70d03da7b224c918dd93e1ac16bbd05","observation_id":"6c237cc1-6d68-483d-9468-8bfc76e9a27e","resolution":{"observed_at":"2026-08-07T13:14:14.896862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13792","last_updated":"2025-03-18T00:45:02Z","snapshot_observed_at":"2026-08-07T16:56:19.726284Z","submitted_at":"2025-03-18T00:45:02Z","title":"Identifying and Mitigating Position Bias of Multi-image Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13792","snapshot_observed_at":"2026-08-07T13:14:05.544878Z","title":"Identifying and mitigating position bias of multi-image vision-language models.arXiv preprint arXiv:2503.13792, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.544878Z"},"links":{"cited_paper":"/paper/2503.13792","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:45025918b28f19ee068603aa9bc627514823a8329b9fe4f9ec85e4acdb5ab097","observation_id":"62b53938-6dcd-41ba-8599-dc0b41e0c2a8","resolution":{"observed_at":"2026-08-07T13:14:05.544878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:05.712377Z","title":"Cmmcot: Enhancing complex multi-image comprehension via multi-modal chain-of-thought and memory augmentation.arXiv preprint arXiv:2503.05255, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.712377Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d1fa448a73b49c228bdf8d44979cdb0bb74e70505e36c827f44514e763f2450e","observation_id":"d447e63b-10d3-4cd5-9946-f778494f23d0","resolution":{"observed_at":"2026-08-07T13:14:05.712377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18139","last_updated":"2024-06-26T07:44:24Z","snapshot_observed_at":"2026-08-04T06:27:25.663339Z","submitted_at":"2024-06-26T07:44:24Z","title":"LOOK-M: Look-Once Optimization in KV Cache for Efficient Multimodal Long-Context Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18139","snapshot_observed_at":"2026-08-07T13:14:05.941977Z","title":"Look-m: Look-once optimization in kv cache for efficient multimodal long-context inference.arXiv preprint arXiv:2406.18139, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:05.941977Z"},"links":{"cited_paper":"/paper/2406.18139","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5118460fb24cdbd5b34e50c6f973d66242ecd359aaff4d93630310ae38221b04","observation_id":"eaf5978a-e6b8-4f6c-928f-420226815c55","resolution":{"observed_at":"2026-08-07T13:14:05.941977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16629","last_updated":"2025-01-28T02:05:38Z","snapshot_observed_at":"2026-08-05T19:54:45.452525Z","submitted_at":"2025-01-28T02:05:38Z","title":"CHiP: Cross-modal Hierarchical Direct Preference Optimization for Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16629","snapshot_observed_at":"2026-08-07T13:14:06.085419Z","title":"Chip: Cross-modal hierarchical direct preference optimization for multimodal llms.arXiv preprint arXiv:2501.16629, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.085419Z"},"links":{"cited_paper":"/paper/2501.16629","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d1ee591956198a471e573cf90f68d530bb0105e919d1f86e3712a4b16add15da","observation_id":"bff41d04-64f7-4048-95f9-c7627027b03f","resolution":{"observed_at":"2026-08-07T13:14:06.085419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T13:14:06.186485Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.186485Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a68c2afd414967b4aded459ac3f790449f4e5a40ecdf647c023bb4b7797badfb","observation_id":"5d2c0eea-c039-43a9-b406-d66cf12808d7","resolution":{"observed_at":"2026-08-07T13:14:06.186485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T13:14:06.400552Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.400552Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:aa65a00e211fc5ba094c388c993f47350bbf38ca4e49e25659ce4c84ef0d2219","observation_id":"480ea5e2-4e8a-46a0-ab25-c312b9d6454d","resolution":{"observed_at":"2026-08-07T13:14:06.400552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11833","last_updated":"2024-10-29T12:34:11Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:47Z","title":"MMDU: A Multi-Turn Multi-Image Dialog Understanding Benchmark and Instruction-Tuning Dataset for LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11833","snapshot_observed_at":"2026-08-07T13:14:06.523108Z","title":"Mmdu: A multi-turn multi-image dialog understanding benchmark and instruction-tuning dataset for lvlms.arXiv preprint arXiv:2406.11833, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.523108Z"},"links":{"cited_paper":"/paper/2406.11833","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:bf1aaea5954c4e08c1faaa1b8395ccafed3562a7705194ac7f69c31483790fd6","observation_id":"09821de1-a06d-4d42-8d64-0d39800c32f7","resolution":{"observed_at":"2026-08-07T13:14:06.523108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-07T13:14:06.644471Z","title":"Object hallucination in image captioning.arXiv preprint arXiv:1809.02156, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.644471Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e4ce728518d7cdb1d5c1a8eb311f5e8daa9df29abd8c1c3e703e61eaa4dff8ef","observation_id":"68bddef1-6493-4d32-ac6b-06f362748d74","resolution":{"observed_at":"2026-08-07T13:14:06.644471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.691254Z","title":"An llm-free multi-dimensional benchmark for mllms hallucination evaluation.CoRR, 2023","venue":null,"work_id":"6eff497b-9827-4f8d-9db1-d935937656c8","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.831783Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3b225263b70cd4e0facc4771bb7c739a74e8ea86b0897e204ba512a8d33761d7","observation_id":"a2356e2c-5cbb-45a9-b70d-feee81cdb29b","resolution":{"observed_at":"2026-08-07T13:14:14.756992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:06.936445Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:06.936445Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:614fcefc8999734048c466908f1b6ac18220f558f77b6a68425ed3d23f6b60c8","observation_id":"cab32f1f-6284-4759-8859-1976660bfe7f","resolution":{"observed_at":"2026-08-07T13:14:06.936445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-07T13:14:07.103871Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.103871Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c136c278067022abe6f42ac7618067bd87acb5d75cd445b6a5e6b7a1ad3353f1","observation_id":"a399f091-c1ef-4c0a-8ac0-b13368daeaf3","resolution":{"observed_at":"2026-08-07T13:14:07.103871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.487632Z","title":"Obelics: An open web-scale filtered dataset of interleaved image-text documents.Advances in Neural Information Processing Systems, 36:71683–71702, 2023","venue":null,"work_id":"ef979377-3cf6-4362-938b-162a438325c6","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.316739Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5e7f1db53bc808f21cea16e312756927183f720c297cc5a6bb1dbcfdc388c364","observation_id":"4cba0258-0ee1-4899-8e28-1092ddcecfaa","resolution":{"observed_at":"2026-08-07T13:14:14.610044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:14.236320Z","title":"Multimodal c4: An open, billion-scale corpus of images interleaved with text.Advances in Neural Information Processing Systems, 36:8958–8974, 2023","venue":null,"work_id":"c998e699-f797-4bdd-b10d-f7663905d91e","year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.461701Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a8043ef184df8666f6d7bd2fba32297d264aa9a725e31aa36f3a146603db4364","observation_id":"ef610710-4787-46de-b778-5ad01d6fe3ae","resolution":{"observed_at":"2026-08-07T13:14:14.317151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-06T10:53:26.005728Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-07T13:14:07.608877Z","title":"Muirbench: A comprehensive benchmark for robust multi-image understanding.arXiv preprint arXiv:2406.09411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.608877Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:444f21a88cd25a32e20739e8d195a52ba0f728a380a0ef61c121e0ef2c72d83c","observation_id":"d2d47731-ee9a-4505-84c2-338c64a80cf7","resolution":{"observed_at":"2026-08-07T13:14:07.608877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:07.799230Z","title":"Remi: A dataset for reasoning with multiple images.Advances in Neural Information Processing Systems, 37:60088– 60109, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.799230Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7d35f46777e326cc81fec2c54fb8d18e850566f364abcf2c82af6375b404cc82","observation_id":"a16dd9f2-e92c-46b7-852d-d7a3b0afb6db","resolution":{"observed_at":"2026-08-07T13:14:07.799230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01483","last_updated":"2024-11-15T06:31:44Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:14:57Z","title":"MANTIS: Interleaved Multi-Image Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01483","snapshot_observed_at":"2026-08-07T13:14:07.931473Z","title":"Mantis: Interleaved multi-image instruction tuning.arXiv preprint arXiv:2405.01483, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:07.931473Z"},"links":{"cited_paper":"/paper/2405.01483","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7f640863a6da0f8f2d9e965a1829574219cef842ed0c0bbbf5d124459296a458","observation_id":"e86d8e92-c36b-4122-b80d-2c7f3e74c71c","resolution":{"observed_at":"2026-08-07T13:14:07.931473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18021","last_updated":"2024-12-07T15:34:23Z","snapshot_observed_at":"2026-07-06T16:54:37.940527Z","submitted_at":"2023-11-29T19:08:11Z","title":"Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18021","snapshot_observed_at":"2026-08-07T13:14:08.070786Z","title":"Understanding and improving in-context learning on vision-language models.arXiv preprint arXiv:2311.18021, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.070786Z"},"links":{"cited_paper":"/paper/2311.18021","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5a91b635088c737af3481b3ba086aaf0d8707c433db29823a72d7616607026fc","observation_id":"805c69e3-cfec-4ccb-b641-a27539f7c170","resolution":{"observed_at":"2026-08-07T13:14:08.070786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02718","last_updated":"2024-08-05T17:56:41Z","snapshot_observed_at":"2026-07-06T18:57:09.545013Z","submitted_at":"2024-08-05T17:56:41Z","title":"MMIU: Multimodal Multi-image Understanding for Evaluating Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02718","snapshot_observed_at":"2026-08-07T13:14:08.139191Z","title":"Mmiu: Multimodal multi-image understanding for evaluating large vision-language models.arXiv preprint arXiv:2408.02718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.139191Z"},"links":{"cited_paper":"/paper/2408.02718","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:acb728dd43b9ff11b5feb57f3ba2557972ec443a55694695af7ade52324f84ce","observation_id":"63f74f35-6add-47b5-b9d8-b895e81a7aae","resolution":{"observed_at":"2026-08-07T13:14:08.139191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.188089Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.188089Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:35f3cc02a83f42fac2159bd17bc3f2acde836762aa59e92b782468abd657e545","observation_id":"a306a584-cf22-4bf0-b358-9a50034d590d","resolution":{"observed_at":"2026-08-07T13:14:08.188089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.265252Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.265252Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:80d0b8c07bc5dbfab7c5c281530368886c57c64c3ddb008d51e1acde8d047ea9","observation_id":"3de70882-a362-4d61-9004-7cf1590ea603","resolution":{"observed_at":"2026-08-07T13:14:08.265252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13928","last_updated":"2025-06-02T18:36:08Z","snapshot_observed_at":"2026-08-07T18:04:18.594685Z","submitted_at":"2025-02-19T18:05:42Z","title":"Symmetrical Visual Contrastive Optimization: Aligning Vision-Language Models with Minimal Contrastive Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13928","snapshot_observed_at":"2026-08-07T13:14:08.332101Z","title":"Symmetrical visual contrastive optimization: Aligning vision-language models with minimal contrastive images.arXiv preprint arXiv:2502.13928, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.332101Z"},"links":{"cited_paper":"/paper/2502.13928","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:a07f12cab5d6a466b628b8b6d328b8923554428170d4ed903cf018b07a9495b1","observation_id":"d2a71af7-c1c0-4096-93c8-44a39d3817f5","resolution":{"observed_at":"2026-08-07T13:14:08.332101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-07T13:14:08.402109Z","title":"Enhancing the reasoning ability of multimodal large language models via mixed preference optimization.arXiv preprint arXiv:2411.10442, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.402109Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:cd3710666f756bcb46098f2f141a2a63cd8d6afae23ea4bb264dc8760b2a53b5","observation_id":"77ad86f5-4f7c-4355-a3b9-7b03f5f1a8b2","resolution":{"observed_at":"2026-08-07T13:14:08.402109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07888","last_updated":"2025-01-24T05:16:36Z","snapshot_observed_at":"2026-07-06T20:20:47.146343Z","submitted_at":"2025-01-14T06:54:39Z","title":"Tarsier2: Advancing Large Vision-Language Models from Detailed Video Description to Comprehensive Video Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07888","snapshot_observed_at":"2026-08-07T13:14:08.456890Z","title":"Tarsier2: Advanc- ing large vision-language models from detailed video description to comprehensive video understanding.arXiv preprint arXiv:2501.07888, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.456890Z"},"links":{"cited_paper":"/paper/2501.07888","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d3e85b8d1c756f32b398b75ca91b97fb6f725f71eb2ca738527542aa897c9df2","observation_id":"a745cefa-6f64-4205-8f2c-d09036d15a8b","resolution":{"observed_at":"2026-08-07T13:14:08.456890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15334","last_updated":"2025-06-06T02:50:17Z","snapshot_observed_at":"2026-07-06T19:36:36.994783Z","submitted_at":"2024-10-20T08:56:52Z","title":"Modality-Fair Preference Optimization for Trustworthy MLLM Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15334","snapshot_observed_at":"2026-08-07T13:14:08.503129Z","title":"Modality-fair preference optimization for trustworthy mllm alignment.arXiv preprint arXiv:2410.15334, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.503129Z"},"links":{"cited_paper":"/paper/2410.15334","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:8a1c0bc73c96d2fcb744c18e4e01b87525ef8ed4823494f157439425fb54fdb2","observation_id":"735e8ae9-cdd5-4ebb-b5dd-e497d50ca0fb","resolution":{"observed_at":"2026-08-07T13:14:08.503129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01258","last_updated":"2024-04-02T12:47:49Z","snapshot_observed_at":"2026-08-08T06:22:53.769876Z","submitted_at":"2024-04-01T17:28:16Z","title":"Direct Preference Optimization of Video Large Multimodal Models from Language Model Reward","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01258","snapshot_observed_at":"2026-08-07T13:14:08.553085Z","title":"Direct preference optimization of video large multimodal models from language model reward.arXiv preprint arXiv:2404.01258, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.553085Z"},"links":{"cited_paper":"/paper/2404.01258","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:2aea436bfc656c997da1160046fb3a9cb0a52a6d1fbbc2106772599198702caf","observation_id":"886de767-1a9b-4a88-a4aa-ddba8880c449","resolution":{"observed_at":"2026-08-07T13:14:08.553085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14148","last_updated":"2025-04-21T04:04:53Z","snapshot_observed_at":"2026-07-06T19:35:44.200337Z","submitted_at":"2024-10-18T03:34:32Z","title":"Fine-Grained Verifiers: Preference Modeling as Next-token Prediction in Vision-Language Alignment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14148","snapshot_observed_at":"2026-08-07T13:14:08.642768Z","title":"Fine-grained verifiers: Preference modeling as next-token prediction in vision-language alignment.arXiv preprint arXiv:2410.14148, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.642768Z"},"links":{"cited_paper":"/paper/2410.14148","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:95fa106e1e700e96d1401315765da445197c6bd049f59b5868cc9831f6904368","observation_id":"c272722a-afdf-4f57-af19-96d51716b24b","resolution":{"observed_at":"2026-08-07T13:14:08.642768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.728565Z","title":"Token preference optimization with self-calibrated visual-anchored rewards for hallucination mitigation.arXiv preprint arXiv:2412.14487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.728565Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:bc58f984b072bd50f57f545ae266e875ff0d07614f8e357985ba81f20d8b9db7","observation_id":"4945f9f4-5c80-4549-9f52-122edc462dd1","resolution":{"observed_at":"2026-08-07T13:14:08.728565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.957705Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting","venue":null,"work_id":"90ea0977-e1f8-440e-829d-96f1da535c32","year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.809984Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:9d1f4b38ac39f9c84a76a42d942baf3a5ed7824e5bb00e9a7e7ceef61e65ca28","observation_id":"7c1bdc5a-5958-4900-8a8f-c98ce52e6ba1","resolution":{"observed_at":"2026-08-07T13:14:14.075232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:08.889619Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.889619Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5e4fe093ea0e6ccf6adde7a024eec7a69d7f8d299f664aeccf384319b5f241e0","observation_id":"9969215a-f65e-4db6-8f39-79e1564c36e4","resolution":{"observed_at":"2026-08-07T13:14:08.889619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T13:14:08.943710Z","title":"Sam 2: Segment anything in images and videos.arXiv preprint arXiv:2408.00714, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:08.943710Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:fb6376ed4762326735140aa1db943bac91e1bf1762ec4d5c7a357b335d254858","observation_id":"80bd1e6a-bf70-4d48-8362-865b2c333fc3","resolution":{"observed_at":"2026-08-07T13:14:08.943710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.004189Z","title":"What does clip know about a red circle? visual prompt engineering for vlms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.004189Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:aecf30f8dd3c5c9400c65b5553123aaf2003bc5bda1ac1bb52cc739895e4c1bb","observation_id":"529df681-86c1-47e9-8f35-b8eecb7625ea","resolution":{"observed_at":"2026-08-07T13:14:09.004189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.622956Z","title":"Cpt: Colorful prompt tuning for pre-trained vision-language models.AI Open, 5:30–38, 2024","venue":null,"work_id":"ec4d33ed-0608-4cea-856d-2a20ace4e481","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.053089Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:fb0a1be7589ed65fbc9ef4d63dbee1e9d30e5fb230878a3b90a32ce226797260","observation_id":"2b37f00b-4c98-4816-a4b5-23cac238d526","resolution":{"observed_at":"2026-08-07T13:14:13.777666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.393214Z","title":"Controlmllm: Training-free visual prompt learning for multimodal large language models.Advances in Neural Information Processing Systems, 37:45206–45234, 2024","venue":null,"work_id":"a7de460b-a8ae-4415-9998-3141bda6dd67","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.127164Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:4cfc24982774c316f801c83c1636ab985e9fa6a1a10acdc429816e718e83ea43","observation_id":"676278fa-89e0-45e1-b6d6-7d401f2740c5","resolution":{"observed_at":"2026-08-07T13:14:13.485291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.210870Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.210870Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:b3c2d81c1a091895f56546750c7ac2fe7a6288de3ba8b202704d9cf9b159d1a5","observation_id":"292ce210-3741-4dda-914c-6c06f64f733c","resolution":{"observed_at":"2026-08-07T13:14:09.210870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20271","last_updated":"2025-02-22T14:02:39Z","snapshot_observed_at":"2026-08-08T00:53:06.955281Z","submitted_at":"2024-03-29T16:26:20Z","title":"Draw-and-Understand: Leveraging Visual Prompts to Enable MLLMs to Comprehend What You Want","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20271","snapshot_observed_at":"2026-08-07T13:14:09.279344Z","title":"Draw-and-understand: Leveraging visual prompts to enable mllms to comprehend what you want.arXiv preprint arXiv:2403.20271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.279344Z"},"links":{"cited_paper":"/paper/2403.20271","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d790b99b9cd050484be8708786f6316c02149ba64c1087a731a7a6bc911fe26b","observation_id":"8038ddba-2872-40b6-9f42-843263afc2fe","resolution":{"observed_at":"2026-08-07T13:14:09.279344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.341142Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.341142Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:080b233c2350a42b23545289f3c545a3fbfaed68d63c9450a16d33e55e9713d0","observation_id":"5911b287-ce2b-415d-80df-111655e77fde","resolution":{"observed_at":"2026-08-07T13:14:09.341142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T13:14:09.473336Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.473336Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:410bad6671bb95cb854081947ccef1753eaec363d446bff974f39b0e2ceab8dc","observation_id":"616cbabc-ee87-4b4a-81fc-493b07965263","resolution":{"observed_at":"2026-08-07T13:14:09.473336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-07T13:14:09.565939Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models.arXiv preprint arXiv:2408.04840, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.565939Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:cfdfb64758bcd586a888b45a489368dc95e87e89c4147bac296a00a9b50f8d2e","observation_id":"d237af20-3268-40ac-9ecb-2bed4a49397d","resolution":{"observed_at":"2026-08-07T13:14:09.565939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.624040Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.624040Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c47d2cb1d6979606626547a056258e4690a632c1f0d9a698df2078a4e0558d98","observation_id":"9f266e29-492b-445e-843a-e74ab1d4d1ef","resolution":{"observed_at":"2026-08-07T13:14:09.624040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12742","last_updated":"2024-06-18T16:02:18Z","snapshot_observed_at":"2026-07-06T18:33:07.118735Z","submitted_at":"2024-06-18T16:02:18Z","title":"Benchmarking Multi-Image Understanding in Vision and Language Models: Perception, Knowledge, Reasoning, and Multi-Hop Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12742","snapshot_observed_at":"2026-08-07T13:14:09.693716Z","title":"Benchmarking multi-image understanding in vision and language models: Perception, knowledge, reasoning, and multi-hop reasoning.arXiv preprint arXiv:2406.12742, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.693716Z"},"links":{"cited_paper":"/paper/2406.12742","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:8a42eab257aa30f4a2f17fbe13dfc37f5d85d85abe29ba8c399cfa8008a58952","observation_id":"c998bba7-4b75-4325-9045-4da573f3b1b5","resolution":{"observed_at":"2026-08-07T13:14:09.693716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:13.153364Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"865a0e28-7827-429a-be1e-1abf3d35fa8f","year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.751122Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:3827f4862fe50b28aaf76c0a3a255d690ee59c0f2171cad96f37b94ca4c91811","observation_id":"0790cc7a-18a6-45b9-8159-75734a52a955","resolution":{"observed_at":"2026-08-07T13:14:13.271348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-01T22:56:26.162617Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-07T13:14:09.813086Z","title":"A corpus for reasoning about natural language grounded in photographs.arXiv preprint arXiv:1811.00491, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.813086Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:794bb25a98f244df22626b1bffc47eaa1c6b0fa6d733cecc60587c6e81953a51","observation_id":"57157a73-db4f-4cc2-9dca-3a313eb825e2","resolution":{"observed_at":"2026-08-07T13:14:09.813086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:09.862080Z","title":"Q-bench: A benchmark for multi-modal foundation models on low-level vision from single images to pairs.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.862080Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:1ea446642d6ecfdaf17df2df0136218ff2e241161a5aa534ea4702dce4b1185a","observation_id":"321334bc-28a5-40ba-b375-c0a6b8148420","resolution":{"observed_at":"2026-08-07T13:14:09.862080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15272","last_updated":"2024-10-08T07:18:21Z","snapshot_observed_at":"2026-07-06T18:49:46.992782Z","submitted_at":"2024-07-21T21:22:58Z","title":"MIBench: Evaluating Multimodal Large Language Models over Multiple Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15272","snapshot_observed_at":"2026-08-07T13:14:09.946184Z","title":"Mibench: Evaluating multimodal large language models over multiple images.arXiv preprint arXiv:2407.15272, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:09.946184Z"},"links":{"cited_paper":"/paper/2407.15272","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d80eba65958d2cbccfc7ee07939ac5f3cb815f773bc8a431f3875e74a227d42a","observation_id":"d1f390e2-0e1d-4697-a7f6-530f2d2faf57","resolution":{"observed_at":"2026-08-07T13:14:09.946184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.032271Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.032271Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c5c09c8eba36c4323c090435388897b3cc6fd3a13752c1c5ddb4c1521660a0d0","observation_id":"d568806a-1dfe-431a-b577-79d6cb16f583","resolution":{"observed_at":"2026-08-07T13:14:10.032271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-07T13:14:10.120910Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.120910Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c3dbe77903c37562b7bbd3f673c5ee60578d5d5853eecbd6355672e61b5f0d92","observation_id":"fecade87-d7f8-4e4c-a397-1b88685273b1","resolution":{"observed_at":"2026-08-07T13:14:10.120910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.166520Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering.Advances in Neural Information Processing Systems, 35:2507–2521, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.166520Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:8b700893e10cac0e58c3399cccdd8d199912fb2aef49512ca8804fba38c63d61","observation_id":"4337c286-c758-4461-bdc4-3fc61a4fedd4","resolution":{"observed_at":"2026-08-07T13:14:10.166520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.210781Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.210781Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:79588d67733a917d9465f346c17816347b4c3dc4dcac9ce4edb49e588c76c5f0","observation_id":"69a6f517-05d2-495e-b990-2a2aa6d00c11","resolution":{"observed_at":"2026-08-07T13:14:10.210781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T13:14:10.325407Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.325407Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:c304673344a295d5ad890d56aca971101b76cf5316d9587a4b6a7b98de8ab00b","observation_id":"90226fa6-d728-4162-9925-18901c45d399","resolution":{"observed_at":"2026-08-07T13:14:10.325407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.401578Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.401578Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5516596d62daf9283bbff9e2f88cc9cd000c064fbef8fefddcc7ffad49c015bc","observation_id":"022bb662-11ca-462c-9b9d-8e54356f7a2a","resolution":{"observed_at":"2026-08-07T13:14:10.401578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.473287Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.473287Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:64c0d3e65e23ca200613a3bdceff80ad03f277b109a61d134d61764f6d648d47","observation_id":"18319a3c-d290-4fcf-8920-7038aa4346d7","resolution":{"observed_at":"2026-08-07T13:14:10.473287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:14:10.545631Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.545631Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:9036f53acfc34ec3ca276a16d9e1c1c0f5905ed42a23a3b3ccc6acd87742b76a","observation_id":"0bc9fb29-dc0c-40fb-8b1a-65b6daccebc2","resolution":{"observed_at":"2026-08-07T13:14:10.545631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:10.674992Z","title":"Needle in a multimodal haystack.Advances in Neural Information Processing Systems, 37:20540–20565, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.674992Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:5848797f358e6c28b46a1c073fec3f0c9f7c864be15ed3a5f1c6db5bd2282853","observation_id":"3ce90a9c-56f3-45b9-b71d-3fc4a5572dd5","resolution":{"observed_at":"2026-08-07T13:14:10.674992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T13:14:10.915411Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:10.915411Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:bbc997eb98829d2b237f8ef1e4b4f0f0ac4ecafa1f4d9b2389bd280390195a1d","observation_id":"7661d267-206a-4624-a7d2-ad635d018b9d","resolution":{"observed_at":"2026-08-07T13:14:10.915411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T13:14:11.487884Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 1(2):3, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.487884Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:7f92e3997194aa3d1e41b8f63d09d9e66f5ed2608c87dd753ef1fc4937a112dc","observation_id":"de1b94e6-fcd7-4656-8ffb-d5da17e00351","resolution":{"observed_at":"2026-08-07T13:14:11.487884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-07T13:14:11.764663Z","title":"Openflamingo: An open- source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.764663Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e655f8ff3669aed19f123d7d2dd8c1a67135ec842e1761356ccdb3da847ee4b7","observation_id":"46af83b8-7631-4679-8f6f-34e9a00903f0","resolution":{"observed_at":"2026-08-07T13:14:11.764663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:14:11.846564Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.846564Z"},"links":{"citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:e5fd46f816b6802bbcbe8466eaee278d0d52fbdb13325b3f1d1574474703fff6","observation_id":"a367d560-e83e-4c1a-9c08-9bb5995e9579","resolution":{"observed_at":"2026-08-07T13:14:11.846564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13254","last_updated":"2024-06-12T17:59:55Z","snapshot_observed_at":"2026-07-06T17:33:00.716054Z","submitted_at":"2024-02-20T18:59:55Z","title":"CounterCurate: Enhancing Physical and Semantic Visio-Linguistic Compositional Reasoning via Counterfactual Examples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13254","snapshot_observed_at":"2026-08-07T13:14:11.965719Z","title":"Countercurate: Enhancing physical and semantic visio-linguistic compositional reasoning via counterfactual examples.arXiv preprint arXiv:2402.13254, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:11.965719Z"},"links":{"cited_paper":"/paper/2402.13254","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:0ee3003b81376985911f67999613949c2cedea4642a24e92b22f2d8048bc83a3","observation_id":"f7c6305a-5c86-46a5-8d21-618a957ff359","resolution":{"observed_at":"2026-08-07T13:14:11.965719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14750","last_updated":"2025-01-11T15:12:37Z","snapshot_observed_at":"2026-07-06T19:20:14.980387Z","submitted_at":"2024-09-23T06:56:51Z","title":"FineCops-Ref: A new Dataset and Task for Fine-Grained Compositional Referring Expression Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14750","snapshot_observed_at":"2026-08-07T13:14:12.081333Z","title":"Describe the following images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:12.081333Z"},"links":{"cited_paper":"/paper/2409.14750","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:16b2c3e6b222adadc956daf9853ed3f7f3ee37fff9ffbcf112564a7284deea35","observation_id":"f3831c0b-52d7-46a1-a6cc-16ab5a63680d","resolution":{"observed_at":"2026-08-07T13:14:12.081333Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:05:45.295882Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2505.22396."}