{"as_of":"2026-08-05T11:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:003ac5ff728d124623a93ed0ab1ec9ffeb3e1fe6702d867077d0f84cb3de0f63","coverage":[{"denominator":155,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T10:58:53.215887Z","state":"measured"},{"denominator":127,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":127,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T19:56:33.552171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T17:40:00.879942Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-05T02:45:38.008864Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":230,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:82aaf0bfe2a6dc1dc6262a3beee0780bfd90cee71b19519be639762ff8d17435","observation_id":"be264d2a-80aa-4fa5-9f5c-2405eb800588","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:5b8c7d5983e5409fe64cc4c5dcb7d9a6f7f2434ed90e0d2e75c443a09e9b77a7","observation_id":"4333e800-1215-4743-824c-3182ebe00606","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:17.150383Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2411.10442"},"observation_digest":"sha256:7d7eb0956afdf346a8c43727c00a55a8b5b59d942cd8390393d9ef2e93238333","observation_id":"e1c57527-ba88-4854-b44e-60aca8582f2a","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2411.16771","last_updated":"2026-04-23T13:21:19Z","snapshot_observed_at":"2026-08-02T03:20:43.405143Z","submitted_at":"2024-11-25T06:17:23Z","title":"VidHal: Benchmarking Temporal Hallucinations in Vision LLMs","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-23T16:57:12.821916Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2411.16771"},"observation_digest":"sha256:0d5d46e24a9b51b4107b813b9febe326a286560db9b35401f391c9b0643c6ccf","observation_id":"998d0e57-9131-4403-b214-5b3736738381","resolution":{"observed_at":"2026-05-23T16:58:12.008190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T22:16:16.528682Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2503.01785"},"observation_digest":"sha256:158b17e991e09794c8cac8cf99927d8247c365578d70a2aeacacdd5b2076bd4b","observation_id":"82567c0a-0954-4279-a60b-f7b26c0491a6","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":180,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:de661de8b87d362c386aa4b0934ed47876825b5c90790b6988f8370fcd6250b9","observation_id":"90b4d342-0c3d-4bed-bcd9-25b54fa1cbaf","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2507.12455","last_updated":"2026-05-22T04:17:50Z","snapshot_observed_at":"2026-08-02T08:13:56.451097Z","submitted_at":"2025-07-16T17:55:43Z","title":"Mitigating Object Hallucinations via Sentence-Level Early Intervention","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-25T08:31:24.173135Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2507.12455"},"observation_digest":"sha256:052e825cb2273cfe5ca0165ddc1f27a0562d4cfe9dfbcb357f249b4542862f69","observation_id":"edb6763f-e2c1-4a77-b79f-f724c776e5dd","resolution":{"observed_at":"2026-05-25T08:35:32.493103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-02T19:56:33.552171Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-02T19:56:26.982189Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:33.552171Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:2198f675209c72fd7098c803bf2f4cdafa36dd4d8b931981d3f48c09aec2cba6","observation_id":"30b42ec6-0547-43d4-b6b9-6efe512f3a97","resolution":{"observed_at":"2026-08-02T19:56:33.552171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2604.12115","last_updated":"2026-04-13T22:47:27Z","snapshot_observed_at":"2026-07-06T23:00:22.690154Z","submitted_at":"2026-04-13T22:47:27Z","title":"HTDC: Hesitation-Triggered Differential Calibration for Mitigating Hallucination in Large Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:13:49.239474Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2604.12115"},"observation_digest":"sha256:5ed7a8a2ece0369eafd8fd61d5f3b4114eaae8c894d106dda163b8a52ac88a8c","observation_id":"26deb965-bb6e-4225-aa4c-6412f0f3efe2","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:2eec6f2c75b38138bc0154368833376bc0451ada8f95668193346a601f9fd8e2","observation_id":"11e65227-ea07-4a2d-9b53-a6858eb8e864","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2604.18512","last_updated":"2026-04-20T17:06:20Z","snapshot_observed_at":"2026-08-04T23:53:40.564219Z","submitted_at":"2026-04-20T17:06:20Z","title":"S2H-DPO: Hardness-Aware Preference Optimization for Vision-Language Models","version":1},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-10T05:38:01.208136Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2604.18512"},"observation_digest":"sha256:7b06c6574b363d8dfb940904aa9ab11cf2994ad0dcb09bee97da44c36c39b188","observation_id":"7b57ff5e-77d4-4e92-a03e-d0de8794041f","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2604.19544","last_updated":"2026-04-21T15:02:50Z","snapshot_observed_at":"2026-07-06T23:06:12.542013Z","submitted_at":"2026-04-21T15:02:50Z","title":"DT2IT-MRM: Debiased Preference Construction and Iterative Training for Multimodal Reward Modeling","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-10T01:45:30.001398Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2604.19544"},"observation_digest":"sha256:fb38b918167165d1821d0d61085787f41d10321529320d742a471baf6932e8d5","observation_id":"9a008cd4-7980-46e1-b6f8-c688e827671d","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2604.20696","last_updated":"2026-04-22T15:41:33Z","snapshot_observed_at":"2026-08-02T21:16:36.054502Z","submitted_at":"2026-04-22T15:41:33Z","title":"R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T01:28:14.039910Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2604.20696"},"observation_digest":"sha256:4c34e5b80e45e1f3178eb7cdd5825846d3158866ed6d050ff8e52038b7d1c708","observation_id":"e53a8fc6-98c3-4489-8446-c11c810bc9f3","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2604.21911","last_updated":"2026-04-23T17:54:36Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:54:36Z","title":"When Prompts Override Vision: Prompt-Induced Hallucinations in LVLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-09T22:11:40.905814Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2604.21911"},"observation_digest":"sha256:b0f874f82d9f3526e646e9ec4dc8662bd9cbf7f6c10b885f6b75266aae35acc0","observation_id":"67b11d97-2991-46f5-a364-5d92e71a201d","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.00323","last_updated":"2026-05-01T01:03:05Z","snapshot_observed_at":"2026-08-02T17:57:46.804255Z","submitted_at":"2026-05-01T01:03:05Z","title":"Online Self-Calibration Against Hallucination in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T20:20:27.931679Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.00323"},"observation_digest":"sha256:3d3f9d288882b370762c57219851887243c68c56010b6c8f2794663a2648d136","observation_id":"b6634a58-0134-4dce-82c1-9563085a49f2","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.03426","last_updated":"2026-05-05T07:02:50Z","snapshot_observed_at":"2026-07-06T23:16:20.322265Z","submitted_at":"2026-05-05T07:02:50Z","title":"Replacing Parameters with Preferences: Federated Alignment of Heterogeneous Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-07T04:07:58.031100Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.03426"},"observation_digest":"sha256:6f1c465af6bd7b8ed25b49909a29cd99283b10fba464c58af4e349828dcd9b58","observation_id":"3b2b0c1d-6aa8-48bf-9e3d-b81bf2bcb8be","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.04874","last_updated":"2026-05-06T13:08:12Z","snapshot_observed_at":"2026-07-06T23:17:33.252539Z","submitted_at":"2026-05-06T13:08:12Z","title":"Uncertainty-Aware Exploratory Direct Preference Optimization for Multimodal Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T17:00:36.574362Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.04874"},"observation_digest":"sha256:40cbbd10c64cbc22e369c190c473a569f785afa615e17ac5b5ea6d1820b007c5","observation_id":"008f94a0-f7c3-495e-9658-3a08eccb3a0e","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.10622","last_updated":"2026-05-11T14:16:25Z","snapshot_observed_at":"2026-07-06T23:22:32.858399Z","submitted_at":"2026-05-11T14:16:25Z","title":"Vocabulary Hijacking in LVLMs: Unveiling Critical Attention Heads by Excluding Inert Tokens to Mitigate Hallucination","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T05:15:34.156717Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.10622"},"observation_digest":"sha256:3d82af7626e0851e2d420737b9a0fccf49987e66ca7078f880d32d2323e4ccab","observation_id":"eb15ce03-13b6-46af-9b05-b7d08b7704e2","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T02:52:43.674969Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:1b363d8ce6a3708e0fb48d50f0638e1fde8947dd2c825b0dee439c7dff21a480","observation_id":"8ca5ef37-69d0-4287-8caa-6e96270fbace","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.11405","last_updated":"2026-05-13T01:55:26Z","snapshot_observed_at":"2026-07-06T23:23:16.461539Z","submitted_at":"2026-05-12T01:51:03Z","title":"20/20 Vision Language Models: A Prescription for Better VLMs through Data Curation Alone","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:37.680681Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.11405"},"observation_digest":"sha256:3b5bc29ab1871bf7f5089cd449a8067194be69b9c1f4fa2e3d780c9b6c234641","observation_id":"0fbebd25-d68f-48b6-ac7f-f543fa69cbbd","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.14054","last_updated":"2026-06-02T19:43:46Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T19:23:53Z","title":"Bad Seeing or Bad Thinking? Rewarding Perception for Multimodal Reasoning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-15T05:14:28.256032Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.14054"},"observation_digest":"sha256:3e9d80c67ea5a6e9962d1e0c7686ed52eada003edc6c463e2abdd3045628e7b5","observation_id":"466356d0-9174-4779-8775-327286404a22","resolution":{"observed_at":"2026-05-17T10:58:53.893696Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:59e5e47a796506e09d8a845b84ec3cba6d48c72126fc60bf6f3f67642ae4f870","observation_id":"159dee4a-0d09-4053-bbab-ef110ae5b5de","resolution":{"observed_at":"2026-05-19T16:27:39.606281Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2606.03376","last_updated":"2026-06-03T03:21:53Z","snapshot_observed_at":"2026-07-06T23:43:40.769504Z","submitted_at":"2026-06-02T09:22:53Z","title":"P$^2$-DPO: Grounding Hallucination in Perceptual Processing via Calibration Direct Preference Optimization","version":2},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-06-28T11:13:37.291834Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2606.03376"},"observation_digest":"sha256:47de117caadd9a94c6821915a107f57b4b94a35e937f42028c06062db2f2af38","observation_id":"bf691ecf-e3aa-4ace-b4ef-ef1b10052822","resolution":{"observed_at":"2026-07-02T02:06:27.182299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2606.24636","last_updated":"2026-06-23T14:29:40Z","snapshot_observed_at":"2026-07-06T23:59:13.320720Z","submitted_at":"2026-06-23T14:29:40Z","title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-25T23:29:24.520537Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2606.24636"},"observation_digest":"sha256:ec79b67527cf2eb9ecad673150c0da45b3ae5cfe0a4d6866e7a16bdceceed32a","observation_id":"2a539766-1815-478b-94ae-c444d89c6c15","resolution":{"observed_at":"2026-07-04T17:40:00.881290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2606.28401","last_updated":"2026-06-24T11:06:22Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-24T11:06:22Z","title":"Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T01:22:16.176398Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2606.28401"},"observation_digest":"sha256:c782201e675457a3f4ae5b3c639d7b0189d9d068d3454ba649b8cfb498251e1a","observation_id":"058de06d-e698-41f4-8a54-b166c7ee7a66","resolution":{"observed_at":"2026-07-01T15:35:47.620953Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":"2402.11411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-07-04T17:40:00.879942Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","venue":"cs.LG","work_id":"a8910c81-2aeb-4d34-a30e-6f3306810261","year":2024},"citing_paper":{"arxiv_id":"2606.31933","last_updated":"2026-06-30T16:38:41Z","snapshot_observed_at":"2026-08-02T09:05:31.252280Z","submitted_at":"2026-06-30T16:38:41Z","title":"No Place to Hide: Benchmarking Video Hallucination with Background-Controlled Pairs","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-01T05:35:08.200219Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2606.31933"},"observation_digest":"sha256:22e8ed296e1ad7af88af59f720c831fdee96dba4ff5cf124708482f4384d6f54","observation_id":"fffd69ff-93a4-4867-bf75-206b969c592f","resolution":{"observed_at":"2026-07-01T10:25:41.372451Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-02T04:15:39.465899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13712","last_updated":"2026-07-15T11:28:27Z","snapshot_observed_at":"2026-08-02T04:15:34.488106Z","submitted_at":"2026-07-15T11:28:27Z","title":"Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T04:15:39.465899Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2607.13712"},"observation_digest":"sha256:824f488019d65e9742588fd4ead3269b29ab85f992d556d842337a856494836a","observation_id":"80be012f-6bf8-4f8b-9ecb-e46c0bec50dd","resolution":{"observed_at":"2026-08-02T04:15:39.465899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.11411/citation-record","integrity":"/paper/2402.11411/integrity","json":"/paper/2402.11411/citation-record.json","paper":"/paper/2402.11411"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"2a233147-17ae-4a84-a51a-aeaa6303e8e1","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:f8a8cccd26419eded180a727bdab785052977081b3118cba57a744593ac7e281","observation_id":"153cdda1-d688-4453-8701-caf449085967","resolution":{"observed_at":"2026-05-17T10:58:53.636275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:07:34.119737Z","title":"Langley , title =","venue":null,"work_id":"6cd283dc-0548-45e9-af07-6bc1005593ad","year":2000},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:6aa41cde3c4be429f2bde237bef65c4879c822d15bd02d6651ae8d572a4fec36","observation_id":"06933d7c-7eb1-4682-9343-c22fa8616370","resolution":{"observed_at":"2026-05-17T10:58:53.739110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.976173Z","title":null,"venue":null,"work_id":"6b09bca6-ef5d-4a83-8c8e-219f23cbd761","year":1980},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:ca87e06c43cf9cfd3d2045a20846cebc02378436759326082569f2b30918924d","observation_id":"33b0833c-0fb4-4cc3-92ea-aca8fa3d5f88","resolution":{"observed_at":"2026-05-17T10:58:53.742119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.841265Z","title":null,"venue":null,"work_id":"8efd8073-6f5d-45c5-94d5-62d366b52518","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0559082a101963894bec9d1daa4fb3dcbb02c91af902089aad4663396b325664","observation_id":"95a066c1-31d1-447a-8a9a-80e58bc7e44f","resolution":{"observed_at":"2026-05-17T10:58:53.745578Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.783905Z","title":null,"venue":null,"work_id":"51835800-f16e-4534-8339-d3ea09147556","year":1983},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:25520d8a5975e6a6350634b5b3bfbc22d08438a7bc9e2ae065580a88662dc9bf","observation_id":"622b4e56-da39-4dc3-852f-024b599aa5df","resolution":{"observed_at":"2026-05-17T10:58:53.748284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.877035Z","title":null,"venue":null,"work_id":"a24cb892-7ac9-4509-8f5b-abbdfb15998b","year":2000},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:d2b3166b4c3215feb649190bc69e0c793515d41a250430443436dccc3e9d4599","observation_id":"fd8002db-4b26-458c-bbc2-4cfd1b253e38","resolution":{"observed_at":"2026-05-17T10:58:53.752059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:55.004500Z","title":null,"venue":null,"work_id":"744d3ca1-d321-4345-b9e3-30a42bcf1b37","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:19556e5c2739c52bd445b3e7306cdd5f786e811792cb333c4da0386712b0abb8","observation_id":"ba21b236-f1b1-47fd-8197-1ff799fcb325","resolution":{"observed_at":"2026-05-17T10:58:53.756371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.757534Z","title":"Newell and P","venue":null,"work_id":"c2e14246-296a-4c66-84e9-a797b1c9d6da","year":1981},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:45ed183b63840feff451a1043a82c6ea5fda2de97455251f7061abfa60820532","observation_id":"68bc68bf-447f-45a1-a0c7-42d1d166be28","resolution":{"observed_at":"2026-05-17T10:58:53.759572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T00:47:54.727878Z","title":null,"venue":null,"work_id":"8d7d9e29-63b8-4039-8dc1-7059f06840ea","year":1959},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:dfc9160dc9d81cffe3b67b666160352d79e1d7b47eddefd40ab31086d6cb2762","observation_id":"6c4bccda-9217-4ce5-a7f3-2185b674e214","resolution":{"observed_at":"2026-05-17T10:58:53.764517Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2018 , eprint=","venue":null,"work_id":"ba2c871c-1336-4f53-8ca7-041fccc4c47a","year":2018},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:228b07be0e2ca1165ab9f01db868ebcf7ebe68cd6a5cf7833221bd77a9a8c5e4","observation_id":"1524f71d-4944-4c38-a24e-358d147c093f","resolution":{"observed_at":"2026-05-17T10:58:53.767516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generalized Results for the Existence and Consistency of the","venue":null,"work_id":"da5c4302-3d4e-4896-b5c3-f8b35b97abdf","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:8bc9a77409ecab9a93be2f488aa90c74f15ce69d800f476c1fca5fa3bc4b8d8c","observation_id":"7090b34e-14c8-4c5e-a496-229971446916","resolution":{"observed_at":"2026-05-17T10:58:53.770641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.243842Z","title":"2017 , eprint=","venue":null,"work_id":"5a794cfe-c0fb-4191-a347-b4e935d39d00","year":2017},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:22c220a7b04ddf3f1f379db283d0ec405d255257c138fb8b3fe02d106ad569a4","observation_id":"a1a0114c-98ff-4d5e-b913-d88116dc8950","resolution":{"observed_at":"2026-05-17T10:58:53.774166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/2346567","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"John Schulman, Filip Wolski, Prafulla Dhariwal, Alec Radford, and Oleg Klimov","venue":"Journal of the Royal Statistical Society Series C (Applied Statistics)","work_id":"23ecc077-b581-458b-bab0-a9af051cd110","year":1975},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:74ef708eac32e5797e4577ed623c9ac4a9b1a2058226754f71eadd41878348ad","observation_id":"924fe2e0-4b3e-4e30-948a-f342a8e26543","resolution":{"observed_at":"2026-05-17T10:58:53.336840Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7f41e87f-f779-401f-83b8-a6011deebf01","year":2012},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:c2337a337ffa14f4d8c0b62d5319afbf0c824dec4a66dc9e0647afb58b36c738","observation_id":"48bd1444-e949-4f50-ae5d-4f662e403f1a","resolution":{"observed_at":"2026-05-17T10:58:53.776899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.2307/2334029","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terry , title =","venue":"Biometrika","work_id":"bf78367e-d1e1-4ba5-a5d3-66f3de5a79a3","year":1952},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:4cb9c9775715bd7b62135b3290102b6cc1900b11e72cf522991ec1bff2248314","observation_id":"1c7af20a-ab58-400e-987c-2897c2d88739","resolution":{"observed_at":"2026-05-17T10:58:53.321709Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T07:53:24.186445+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T07:53:24.186445+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.106294Z","title":"2020 , eprint=","venue":null,"work_id":"a2c3ed4a-e3f5-4b3f-a871-514ef4ba4ba1","year":2020},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9dd0a3af795a1083525b292ae9c3ceef736d413ac49cc35e13472758a6cd6140","observation_id":"d3ca8f6b-689b-4ed0-a65b-d3d1b60b9c42","resolution":{"observed_at":"2026-05-17T10:58:53.779724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"37b2ad29-a42f-4662-9e07-224c2d79bba0","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:5625677a51b01223baa1b2e0d681d5c301a4e5397e173f0e272f5278db8d0dd0","observation_id":"77d6c134-de3f-49df-a06f-e95b777def7e","resolution":{"observed_at":"2026-05-17T10:58:53.782406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T00:26:39.952324Z","title":"Training language models to follow instructions with human feedback , url =","venue":null,"work_id":"04f44026-8d59-44c7-9381-031151587087","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:101ddc65baaee59e210109f353b341cab01adc648e99b11055471215f159af17","observation_id":"86e55eeb-96aa-4a38-b75f-f2e800ec79e7","resolution":{"observed_at":"2026-05-17T10:58:53.786488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"0c3518de-b8ae-42fc-99a6-15a2b3d15e1f","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:e2101186c78fd845f8cbce67a5c3e893e72664347175db1bab2326f3e10961ed","observation_id":"b922897d-ca25-44c2-84cc-db5d1a1bd561","resolution":{"observed_at":"2026-05-17T10:58:53.789525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.723353Z","title":"2023 , eprint=","venue":null,"work_id":"d5d20a89-f262-4c7c-8354-cb5508d8feba","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:5a8deff3c2bd621cf5fc18dc94a0acb42861b437a405897fecbfb3fecb525c47","observation_id":"aad52aa3-5365-4913-8b87-c242d7b2280c","resolution":{"observed_at":"2026-05-17T10:58:53.792401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"23ed1803-c83e-4c8c-a100-ea0342e64155","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:4407b11a89a8958758465e12bfaeee5031a4051ebd25d0fdd72f243cca21e001","observation_id":"ea0ac31f-b85b-4bfa-bbef-63dffc856517","resolution":{"observed_at":"2026-05-17T10:58:53.795413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Daly, Raymond E","venue":null,"work_id":"4739cd35-b3ec-49b9-8401-0e015e75a3c4","year":2011},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:d20779fe17a6518e6955dc93065de0be53167b3f557e11a5b5f184b10d756ed3","observation_id":"e532c140-da7b-44a7-bbd4-ebd0e38069e8","resolution":{"observed_at":"2026-05-17T10:58:53.798422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , year=","venue":null,"work_id":"3d29ef7f-a362-43f7-8742-711ec20d8d1d","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:1a3af10093c7a3ff57a7e24c5bcf8f2d6adbae9209ccdabd0a24cf3049cf79aa","observation_id":"3a7814c9-7c7b-4e2e-8adc-d22e833c29eb","resolution":{"observed_at":"2026-05-17T10:58:53.801325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/w17-4508","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"TL ; DR : Mining R eddit to Learn Automatic Summarization","venue":null,"work_id":"31271dfe-43f6-4a8c-9c62-9a09ee5744b1","year":2017},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0e7c63d5543a3bfde72083f4ed483b2c75db633b3978f1745a99a472104b917f","observation_id":"19823bbb-f4ee-4757-a3f8-126aa7a014ec","resolution":{"observed_at":"2026-05-17T10:58:53.317955Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"1bf99847-dedf-4930-9683-195631ade6ff","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:2897696a018b8b8ddf226696de2d8fbe4f4577888793100914d3172c2694d5ca","observation_id":"b556c141-9f37-44e5-a9c2-47a47aca6a07","resolution":{"observed_at":"2026-05-17T10:58:53.804081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8817.347620","doi":"10.1145/3458817.3476205","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proceedings of the International Conference for High Performance Computing, Networking, Storage and Analysis , articleno =","venue":null,"work_id":"65666e92-1679-4e6b-831b-29afb00b2254","year":2021},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:847b7567c8f1e36e7a45e4ae7bfdf33d7010e4a0c0952b622f01f368c0d4806c","observation_id":"c63f9a51-6b5c-432d-b3e6-a60a3a332c90","resolution":{"observed_at":"2026-05-17T10:58:53.331632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T23:52:07.370374+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robotics Research: Volume 1","venue":null,"work_id":"9b8bfba2-9afc-4bd6-a2ea-525346226af0","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:e91bd570398d7a89d5b9ae5093fa2eccd838b1ae0195c0b572c06cce79f7fe52","observation_id":"7561de3b-4e58-4f88-857b-b9f1752fce78","resolution":{"observed_at":"2026-05-17T10:58:53.807185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Active preference-based learning of reward functions , year=","venue":null,"work_id":"83d07222-7e41-4b12-8df9-d46390382f51","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9ceecb8b61ac3c20faf01acbaa4fc2a0e98e6e7c0b7ed8a9dffeedfcc296c3ce","observation_id":"d3df402f-f646-40ad-862f-b01d275518fd","resolution":{"observed_at":"2026-05-17T10:58:53.810466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , note=","venue":null,"work_id":"f4842347-e289-4a9e-83f6-9bf13c7a8aae","year":2019},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:1a758e129ed5c3e0609ec10294b56fae3ec57fefd08a4b82babde246597919ef","observation_id":"076d7655-acaa-444d-ae07-6902750fcfa3","resolution":{"observed_at":"2026-05-17T10:58:53.813475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/k16-1028","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/K16-1028","venue":null,"work_id":"c6848274-3353-4417-9ad4-b34ccead1119","year":2016},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:fc45a8e65575a650d6e3136ab89ba983d417b84aec980aeb671b07c571c5be66","observation_id":"834c1b48-c271-4432-a583-3ef56530f0e4","resolution":{"observed_at":"2026-05-17T10:58:53.325610Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aligning Language Models with Preferences through F-Divergence Minimization , year =","venue":null,"work_id":"72e6bb98-56a0-456a-9ed7-d39d5d34230d","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:ba43b494f6b2949d30c831688d404787b28f68f1aea9be5ed91da8ed759387bf","observation_id":"44564c8f-d724-4eb9-819f-a537e9d7dbb5","resolution":{"observed_at":"2026-05-17T10:58:53.816445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On Reinforcement Learning and Distribution Matching for Fine-Tuning Language Models with no Catastrophic Forgetting , url =","venue":null,"work_id":"179bd37a-1c18-4137-8563-3de7a816d7df","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9b64a8f1be9e493e9fad1b8ca4d8819bd18015fb74a4ade5b9a7144b666a1235","observation_id":"58f2176f-975b-4f63-8e1d-064652138264","resolution":{"observed_at":"2026-05-17T10:58:53.819537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"d89e0c80-1a3d-485c-bad2-75cbde1de012","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9d508ddac8755c0c962e9a3c246e99f4bc8556407c495690734bf719a8c88c0d","observation_id":"291d7115-b28f-4ad3-a41c-7f00e9fc733e","resolution":{"observed_at":"2026-05-17T10:58:53.822746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , eprint=","venue":null,"work_id":"f6b073cd-30e3-4ca1-8157-f25b09827e84","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:f1b9ca67b52828f395d15129a6d8ffe371ef313eda0e2f2680fdcba50d3448ae","observation_id":"74bf7bf7-2af6-4ddc-922f-ba1a7b4e5cb0","resolution":{"observed_at":"2026-05-17T10:58:53.825693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":"540dc875-ccec-47f6-83df-5cba9951fdb2","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:fba1a50420ea1972e6613842ea8edf8c6e822bc40f5cb095586678c3c905d1a5","observation_id":"a39cfc73-afc6-49ad-90aa-0c8683e2a3c7","resolution":{"observed_at":"2026-05-17T10:58:53.828687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.244","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cross-Task Generalization via Natural Language Crowdsourcing Instructions","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"29367bfd-9b7c-4428-856b-8a8298f8379b","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:580fd6a6833dd8a88cc68bcaae092946658c4f9cebc766cea5eea55f08368a77","observation_id":"777e0c8c-3f89-4e9b-8df5-6a605efeb707","resolution":{"observed_at":"2026-05-17T10:58:53.306090Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:09.600002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:09.600002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.657431Z","title":"Language Models are Few-Shot Learners , url =","venue":null,"work_id":"518a19dc-59e5-4fa9-b31b-b2c1f0d6676c","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:f0ca382775117687da3cffb9e470219594f9b4d1d6558ce4a3abd37eee81a907","observation_id":"1150b912-f0a8-4046-a9b3-1148db1a7402","resolution":{"observed_at":"2026-05-17T10:58:53.831626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of The 26th International Conference on Artificial Intelligence and Statistics , pages =","venue":null,"work_id":"a9b16b65-57e2-4d2b-be8a-9945cfdea645","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:1d0fd3cab3b20598b48fe3c49bbf542e8b7f5088bb70425422078fed84c6aae0","observation_id":"ac1ccb8a-6b45-44ea-aec3-6f664bf169f1","resolution":{"observed_at":"2026-05-17T10:58:53.834441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , url=","venue":null,"work_id":"78699bc6-6ae1-4e7f-9188-84ea668bae91","year":2020},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:01e57f44512e750b3ebeac30161dce9a808973fd1e95fa535c9691b216e1ce2d","observation_id":"5dfc7e9f-d4d9-422a-a8cd-fdd5c076a88e","resolution":{"observed_at":"2026-05-17T10:58:53.837115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b44bdd72-aa58-441c-972c-b43b7a033d20","year":2018},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9a5af77211580901e83ad052064d63bc1413357370d0b9c87c3d4810dc64028b","observation_id":"dd750685-7730-49aa-a374-3525bff1d284","resolution":{"observed_at":"2026-05-17T10:58:53.839762Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.7790115","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"0aa10afb-8bbe-4512-87a3-e67963ea0d1c","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:78e385da049fdc097edd3e01667d62dad34589e99d649e7f97ff60c2716081d8","observation_id":"cf02fe79-5fd7-4501-8eb1-f2a7299b887c","resolution":{"observed_at":"2026-05-17T10:58:53.352235Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , year=","venue":null,"work_id":"c33f2508-0810-47f6-b35c-2b1ef9993e72","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:bbe65a66988e5b9e00ef091a3be344ee3d4423d5f0b1e34daaefd3a6de501e3c","observation_id":"653ab24f-86b5-462f-8a6f-6e4f99433501","resolution":{"observed_at":"2026-05-17T10:58:53.844153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/bf00992696","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:47:34.373100Z","title":"Williams","venue":"Machine Learning","work_id":"469b3b81-55f9-4542-9dd7-570a63cfda74","year":1992},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:d068af1ea27c66612761dc43900e36604f2b4a1ea40d6dfd36bdce1d182d33e2","observation_id":"d3cbcf5f-0d71-49c3-b16d-85fa5a15bb05","resolution":{"observed_at":"2026-05-17T10:58:53.301539Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-18T14:51:33.972563+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T14:51:33.972563+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p18-1165","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reliability and Learnability of Human Bandit Feedback for Sequence-to-Sequence Reinforcement Learning","venue":null,"work_id":"b6c1f13d-c10b-4b33-a9dd-62abf789b124","year":2018},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:521a40c1c425b6028f9f1c2a2920de7be04e3f639cf0dcb618549de78458e96e","observation_id":"040137f9-1727-489b-a9f5-4ec2c150fbe0","resolution":{"observed_at":"2026-05-17T10:58:53.341854Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"933b8155-4481-4475-b364-5f25365683ed","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9dba54a3e2f6de55c00c8e149360fe423322bba866dd01c118687e159f241231","observation_id":"d3c58c59-0199-4f7d-9723-9bd2adf6a258","resolution":{"observed_at":"2026-05-17T10:58:53.847192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep Reinforcement Learning from Human Preferences , url =","venue":null,"work_id":"670e8b04-92a7-444b-b82a-7553c0e59baf","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:12deb482fe10786443f051100378ac5a269279e44e6e1909c5c34d3189945cc6","observation_id":"55e34d42-ed59-4c4a-9391-76f9a5fbff88","resolution":{"observed_at":"2026-05-17T10:58:53.850171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7495.353199","doi":"10.1145/3477495.3531991","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval","work_id":"47c53574-1e74-4e77-be07-f233baf6c2e3","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:ae5fac0c692aba2c3026a41925632294a1e68d432f56d09cf1525e9f3597c34e","observation_id":"45166038-66f7-461a-bbd2-e854031e93ed","resolution":{"observed_at":"2026-05-17T10:58:53.311202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Trajectory Preferences for Manipulators via Iterative Improvement , url =","venue":null,"work_id":"906c0459-cda9-45eb-a6bf-db52ff5b8f71","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:adf60989ae019b3c63960824e51e174ef00720d383539296fcae16d377bda8d4","observation_id":"11578261-5952-4cdb-9189-6428fc856be7","resolution":{"observed_at":"2026-05-17T10:58:53.853057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10994-014-5458-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Preference-based reinforcement learning: evolutionary direct policy search using a preference-based racing algorithm , journal =","venue":"Machine Learning","work_id":"e12a75bb-5ac4-4393-844b-4e86c578ca5e","year":2014},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:800eeb39b8c71c304545cd4785e0fbb17b2f6230a67ee190a484878d6cb83798","observation_id":"28f33914-69e7-4d4b-84f0-03edb6d4e435","resolution":{"observed_at":"2026-05-17T10:58:53.347055Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.jcss.2011.12.028","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The K-armed dueling bandits problem , journal =","venue":"Journal of Computer and System Sciences","work_id":"77fbf554-f95b-4fc3-90fe-fc50ff7d3491","year":2012},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:f7df8bb0253d6f03b7e4bd4f36520f91a6dad366e17ac95c9ac3a411d1bcafcb","observation_id":"f3029aa3-35b3-4eb1-944c-7c8ccae57767","resolution":{"observed_at":"2026-05-17T10:58:53.357718Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of The 28th Conference on Learning Theory , pages =","venue":null,"work_id":"5bbd66b3-bfa7-48fa-960c-7230a992d05d","year":2015},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9886ea31eb830dc7e78038b4fb78fec7d971693b1e20b4f8f42b27989b443da9","observation_id":"69898394-0bf6-4bb7-87be-300c163f91da","resolution":{"observed_at":"2026-05-17T10:58:53.855781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":"2204.02311","doi":"10.48550/arxiv.2204.02311","metadata_source":"pith","pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaLM: Scaling Language Modeling with Pathways","venue":"cs.CL","work_id":"a94f3ef7-2c49-4445-93fe-6ec16aafd966","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:babfa8c605c2edb6bcd8e48b716d67c660efd1498c4b3bafd4863e3e9be4e435","observation_id":"8595e394-5c1a-4297-b818-30d2a07e4dc2","resolution":{"observed_at":"2026-05-17T10:58:53.475843Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T12:25:21.411055+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.834973Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"12f5a236-ef7a-4d13-b4de-b51465a6f977","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0a9a94d4b1cb347e709c8883a338083405129b1a91768f75fc8c064c2abc4a8f","observation_id":"4f6c83c5-1cc3-4a08-84de-263fea9a110d","resolution":{"observed_at":"2026-05-17T10:58:53.858851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":"2303.12712","doi":"10.48550/arxiv.2303.12712","metadata_source":"pith","pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","venue":"cs.CL","work_id":"a23cfe92-7f7c-424b-98d4-b386a83002fb","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:bc38d0e1631ec6bd1d98f649023a2c78c2aeecec60b91357f96942065ddac365","observation_id":"0d6de068-0e3a-492e-a612-7b0519c372f7","resolution":{"observed_at":"2026-05-17T10:58:53.503814Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 24th international conference on Machine learning , pages=","venue":null,"work_id":"6d681761-d8eb-41b4-b829-e1528ef960b0","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:3d6e3a8486461cf132803810aa63ca900581391e328325d54961a224a60c02c2","observation_id":"8f1e4349-7987-49d4-8d72-5ea700e43444","resolution":{"observed_at":"2026-05-17T10:58:53.862584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:728b2857f4e655b0f48b96c65e4f9349d417042f22ca25216dea6b8de25d8cfd","observation_id":"869ea475-59ab-4ee6-872e-4871193cedc0","resolution":{"observed_at":"2026-05-17T10:58:53.512739Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04319","last_updated":"2019-09-26T23:57:44Z","snapshot_observed_at":"2026-07-06T08:13:55.544875Z","submitted_at":"2019-08-12T18:09:04Z","title":"Neural Text Generation with Unlikelihood Training","version":2},"cited_work":{"arxiv_id":"1908.04319","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04319","snapshot_observed_at":"2026-07-04T19:40:07.174377Z","title":"Neural text generation with unlikelihood training","venue":null,"work_id":"f5c0999f-3f2c-4fd2-be5b-486e99399ccf","year":2020},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/1908.04319","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:15194a936c0ccd47d7457398fbf0b92e2a1858763168a760c813f3d05a82ec41","observation_id":"c95a52db-fc14-43e6-b792-a57acb23f7e2","resolution":{"observed_at":"2026-05-17T10:58:53.517004Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:06:16.663793Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"5fb2a5c0-2fa4-4940-995f-db97d9c74c78","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:7f2ceb2c11985bcbc7877c0aeb824e7166570d9d310656ab3f30dd0002ac8de8","observation_id":"d7f6ea5e-f465-4fa6-811b-d240a2bb62a8","resolution":{"observed_at":"2026-05-17T10:58:53.866826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , jouranl=","venue":null,"work_id":"7047eafd-ea4b-4d46-b643-548c91291c23","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0fcc97263031b991976fc79dd54b364fb308d8d621e1de30d4e8b0be43ce8444","observation_id":"fbab6bb0-a921-440a-8e7c-db75b5090ffb","resolution":{"observed_at":"2026-05-17T10:58:53.872381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , eprint=","venue":null,"work_id":"7f5bb3f4-412c-4ede-8d12-b7022dd98914","year":2019},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0929143b0a6509c51fef1290aacb5a484a268c44a2a031c8e6ce29ddbe1984ce","observation_id":"f3809557-a219-4b0c-b329-35f7f9dda6f2","resolution":{"observed_at":"2026-05-17T10:58:53.875357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"382e724f-6ef8-437f-8862-5038ef2ece44","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9e36e881b12cccdc727cb360ee6b44a8069a685dea8df8b2cc30a772755a4701","observation_id":"cb2885d3-5ac1-403b-8d39-009b16eb70ca","resolution":{"observed_at":"2026-05-17T10:58:53.878394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"bcc5ba27-7d9d-4b54-a601-56fd054a2afe","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:f7bfaf4359e3c5d509bc1dbe9b632052204ad1691f4856e842dded432cbe7680","observation_id":"48db0e37-7184-4f93-97b7-bce0e4c01d2f","resolution":{"observed_at":"2026-05-17T10:58:53.881307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4d02ed3f-0836-473e-b830-4b7aaa0a5f4d","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:a42a758a6591e02638a420a3ca9aad701e998ee22a685d798ef2b906795d0750","observation_id":"0115f249-be4a-4212-90a5-3e30e02fc2f5","resolution":{"observed_at":"2026-05-17T10:58:53.883907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , eprint=","venue":null,"work_id":"51d9d2db-4710-4f3c-a410-a74914f7586c","year":2024},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:330bf9c66357fe3c572f0ae4ed375fe9dd20c2f63f9f7953bf98595bc46faa7b","observation_id":"bd64859f-7d23-4031-8c80-bbac08e0d11c","resolution":{"observed_at":"2026-05-17T10:58:53.886888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.777742Z","title":"2024 , eprint=","venue":null,"work_id":"10282c20-c103-47de-8e6b-afec9b46d071","year":2024},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:65551d0ee3f8f7f3e2f9c9abd051daf32282d8d32581a7b18ba04dd014920065","observation_id":"92f01713-7fd3-46ef-adb9-dd2eeb63665d","resolution":{"observed_at":"2026-05-17T10:58:53.889932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"76e347c5-a1bd-44be-ba67-7bcc8e4f7fc3","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:5d1117747e112f67488b3c7ee50357bfc5fcb4373974bc089bc97c50d467081d","observation_id":"d552d09d-2e91-46d9-bb5e-41c33f9b453c","resolution":{"observed_at":"2026-05-17T10:58:53.892571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"57fb54a2-fcb9-41c2-82bd-e1663ee7cc41","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:acab6b7a6cf1068bbe0e498762628b1970d7e2147fc43f1a7009888c6155b6b1","observation_id":"9c3fc964-fd97-4ed0-a812-4c167c0e90b9","resolution":{"observed_at":"2026-05-17T10:58:53.556736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"165a259c-0b10-464a-9d2a-14275e1208f2","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:6ca42a5d64f358fca1ecacd49015bee7417735cef1e2b0e177e3f9e538795132","observation_id":"d06aa540-a865-4e65-b9de-adf91add97ff","resolution":{"observed_at":"2026-05-17T10:58:53.559553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , url=","venue":null,"work_id":"8afa812f-6329-41b3-9028-57bb6f08d0a7","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:e5fd2a0184c131561008388b3e895836c5df1f989a066f0623f471ff656ec723","observation_id":"d5922ec7-ef27-46f6-97ae-03b1cf7dfe44","resolution":{"observed_at":"2026-05-17T10:58:53.562331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , journal =","venue":null,"work_id":"80a73ac1-4fb5-4a86-8dec-160d1f113afb","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:816e5e413b9d4ca5b6e83d8caf3d15478f7d939f3f611c9479d9f94f263bfeb1","observation_id":"3f7af7c4-329f-4396-9049-924abeba60b3","resolution":{"observed_at":"2026-05-17T10:58:53.565099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , journal =","venue":null,"work_id":"fb2130ab-11f7-45ec-a97c-aec4944b750a","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:75b7b164583072b60beb87ad69a281e268cf605ee6dd4bd78e63c496dfe5ce68","observation_id":"9186b98a-fb40-44ec-8e2f-a30594f46fd7","resolution":{"observed_at":"2026-05-17T10:58:53.568007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.951245Z","title":"The method of paired comparisons , author=","venue":null,"work_id":"5feb0654-e8a0-4d93-967e-9878e00988c5","year":1952},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:b6778f15c6b7a430b6b0445c8fc061fdd659d72c5268157d079167dbbb04012a","observation_id":"20cc911a-f32e-4481-a0e2-936172ea44c1","resolution":{"observed_at":"2026-05-17T10:58:53.571132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"d3670003-811e-494e-b001-fa07e671cbf5","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:4e8f3fa657af69b15f9dc973fc20ba556b503751cd212abcffdfe3b6de3e18f2","observation_id":"92ecd3ef-bb9d-40f6-abd0-b7fb885ac8a2","resolution":{"observed_at":"2026-05-17T10:58:53.573911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:40:44.362172Z","title":"The 36th Conference on Neural Information Processing Systems (NeurIPS) , year=","venue":null,"work_id":"d3a43987-8e4c-490b-8e91-cb2a09713dce","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:34191e15e09b95ed65ec70dee7045e8658d3522a7505de1df32308dd81941a28","observation_id":"70e536ae-f7a9-45fe-af82-c7f6bc2a396b","resolution":{"observed_at":"2026-05-17T10:58:53.577431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10166","last_updated":"2023-01-17T19:37:19Z","snapshot_observed_at":"2026-07-06T14:44:16.786216Z","submitted_at":"2023-01-17T19:37:19Z","title":"Leveraging Vision-Language Models for Granular Market Change Prediction","version":1},"cited_work":{"arxiv_id":"2301.10166","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2301.10166","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2301.10166 , year=","venue":null,"work_id":"8c0fa3d5-8375-4f84-a830-09ae43919b2c","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/2301.10166","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:85b3f1f45c9f1fdef937eaaf094ba1a1aafeda65fc20420f06c882729bb668ec","observation_id":"d80cc23c-0874-4759-aa8f-c457cbdf41ed","resolution":{"observed_at":"2026-05-17T10:58:53.521157Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T09:10:52.167787Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"c2cc414b-17c6-4006-b389-f3ec0bf8141b","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:d9a26eb41933129fbce850fb353bcd610219a84a4c83cbf0c01a65e869405c20","observation_id":"e197ca5e-53ec-43f2-80fe-f5ca3812de62","resolution":{"observed_at":"2026-05-17T10:58:53.580831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:06:59.813749Z","title":"International conference on machine learning , pages=","venue":null,"work_id":"9b33e965-febc-471c-9229-4b0fb36227f8","year":2021},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0a3190795c2c31085f2addc2e30d9d8caa0506c8615da86125209752b7eea442","observation_id":"3aa9b8b4-bf5c-4f15-a4c5-a53ce07fc804","resolution":{"observed_at":"2026-05-17T10:58:53.583892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"58c6a506-4715-4093-80dc-c6e84d0b07cc","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:b3d58820fb35051fcdfad82f8eec565e697e58b9a641d52e647998c16a638b8b","observation_id":"b2fbcb8b-0a54-401e-98a3-804569077cd5","resolution":{"observed_at":"2026-05-17T10:58:53.586702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:46:21.684188Z","title":"Hashimoto , title =","venue":null,"work_id":"fadc9cdf-612b-4081-85df-c1904ccef4c8","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:519a51281911258c7cc16d51a6a5a38238efb2417271a5c1ef4bca96d2cb9a4e","observation_id":"b3b00542-5ce1-4b38-a27f-62ce79999461","resolution":{"observed_at":"2026-05-17T10:58:53.589480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15517","last_updated":"2023-02-07T16:11:42Z","snapshot_observed_at":"2026-07-06T13:58:18.393526Z","submitted_at":"2022-09-30T15:06:13Z","title":"Medical Image Understanding with Pretrained Vision Language Models: A Comprehensive Study","version":2},"cited_work":{"arxiv_id":"2209.15517","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.15517","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2209.15517 , year=","venue":null,"work_id":"81cec985-5f6a-49ba-9065-4c0c758e8359","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"cited_paper":"/paper/2209.15517","citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:3b87af18fe69d9b5182e6fd1b96ed1dbc6d73d77ee46877ca6f93d7c34386b97","observation_id":"e2c0e346-1f0e-4f4f-ad9c-55340e05a152","resolution":{"observed_at":"2026-05-17T10:58:53.384587Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ArXiv , volume =","venue":null,"work_id":"a2300e5f-b111-42c8-8002-42006b6668f9","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:d51371240db4e7a9ef19b9f4ce7c30acd501390a269edbfb463a3a4c2519c1a1","observation_id":"395f5aae-546c-4906-9bb4-a968de4d363c","resolution":{"observed_at":"2026-05-17T10:58:53.592007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"784655d8-64db-4952-a4a2-58d61f4e8ac8","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:bbc399f558a839039f97cdd20abb2e7de8c9681613214ba1c71767999b9aed18","observation_id":"bb0f1236-eab3-4e04-ae4d-712852f71cc7","resolution":{"observed_at":"2026-05-17T10:58:53.594415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , journal=","venue":null,"work_id":"dae430ee-ccbd-4e3f-8b80-b8f03ecb2914","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:14f27ee4528144416ac65fa2fc52292482f44f1e166abfec25ebc1476241a13a","observation_id":"1e1ad3cc-47e6-4423-87c5-22d9012ed816","resolution":{"observed_at":"2026-05-17T10:58:53.597055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"264aff11-adea-4fe0-8c7c-61cc7ac4fbed","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:e489a0c266aeae0ce29a50ad9208f1ea52856837ff9e4dcaa300d5ffe57eca81","observation_id":"4feda9ac-034f-43c1-83c8-f6a18c55c1d0","resolution":{"observed_at":"2026-05-17T10:58:53.601395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7a00a1d8-15b2-465b-8553-651dbb9054db","year":null},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:fc38a4f4c195372983a1887c8686f8045d3cc95a45834791af0cdab1fdd2e889","observation_id":"ea6e499f-d4d4-4cf8-a0a0-4897c07a4e04","resolution":{"observed_at":"2026-05-17T10:58:53.604332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:46:18.257768Z","title":"2020 , eprint=","venue":null,"work_id":"fb5e1d20-8ee9-497d-9dd8-255ad1cdabfa","year":2020},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:567c5f694cd9d811f0c44fe5c995637b1f28701758e95dba4d2093804b25e1e9","observation_id":"86ce2efd-55f9-4c77-90c8-d75e408645c9","resolution":{"observed_at":"2026-05-17T10:58:53.607117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , journal=","venue":null,"work_id":"a14af77c-2ed6-41bc-a791-4d91cc21ada4","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:80afb17bf1c27a25ec4635060d78d0c0901a24ebe51ff506af1049b16caee804","observation_id":"f27c654c-ebd4-42b7-a941-c0568f55d8ba","resolution":{"observed_at":"2026-05-17T10:58:53.609882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , journal=","venue":null,"work_id":"03ddb2a6-093f-4746-98a0-5a72a92fc801","year":2016},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:c704e6d5ca6a058100173904b6555e929293f06944cf347acf189dc127eb0630","observation_id":"b0345305-1f1b-4876-825c-13c6729b6fe5","resolution":{"observed_at":"2026-05-17T10:58:53.612422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T01:01:40.109415Z","title":"2023 , eprint=","venue":null,"work_id":"e51fd8a1-9351-46d1-8c50-77c97e9148a0","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:b7d7fd035b91191aca8b2bd6b422cccc5984cf9cd54142914f95248a96e76d31","observation_id":"e35ba45c-277c-4059-be38-fe52da81c9c4","resolution":{"observed_at":"2026-05-17T10:58:53.615190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2016 , url=","venue":null,"work_id":"a9dbe721-cc07-415b-a47e-135aca0d58b3","year":2016},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0e1e34de905e5a1218386a0ed614746c5c669d353269c16911ff0bc99aee392a","observation_id":"4f2f7c76-5d29-4d02-872a-a3a3f9bf9c70","resolution":{"observed_at":"2026-05-17T10:58:53.617716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , journal=","venue":null,"work_id":"f95dc734-99c4-4e86-992c-b3a41bb00e5e","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:5576b7133c4fb2d9f8b6cda2f356d9d496d5a9362ab404850ccad3b491c1832a","observation_id":"c11b25c7-e01d-40ca-8512-33bcaf17e99b","resolution":{"observed_at":"2026-05-17T10:58:53.620279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"5c9e71f5-e23e-4f3c-864e-4c51e7510d70","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:1071f7f6130548dcf6219eed97b3afb5edd3edf2f023e2130ea99011eba021a4","observation_id":"6f31a737-4e07-4105-99a0-8e40819306c2","resolution":{"observed_at":"2026-05-17T10:58:53.622921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , journal=","venue":null,"work_id":"18e7ffbc-feab-436f-a92c-c05e7f0d88de","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:6df1ae3280e6a848db15c287e4101cc80c4957f8b503eaf98a0e0743a4373870","observation_id":"76bf69e4-134d-40b5-be13-501c256e2713","resolution":{"observed_at":"2026-05-17T10:58:53.625568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , journal=","venue":null,"work_id":"96caa493-1c40-4d7f-b815-d5bddef5fe54","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:cc4b3aea99da99ee80ebfd29af7247fe7af575bddac4f85f6946b56256c7be85","observation_id":"b6c2a7e6-4087-42ca-aba7-37e856b2bba9","resolution":{"observed_at":"2026-05-17T10:58:53.628114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:47:55.932908Z","title":"Understanding Dataset Difficulty with","venue":null,"work_id":"1db96b79-a85a-403f-ba2b-d80b3ba649fc","year":2022},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:a0e12d5e87d6d7642b6e66c1617dab69c02b4e17f579a7ea04025480fde92247","observation_id":"3fb2ba25-0561-439e-bc55-f540deabc583","resolution":{"observed_at":"2026-05-17T10:58:53.630931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T03:25:58.132918Z","title":"2023 , eprint=","venue":null,"work_id":"865f7077-57b7-4cf5-b1c5-4996fcad2063","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:0ad057a86e3a6eb782c95d5af777ca621cd3010da64f75908de8b2b45f86a06c","observation_id":"3fcb5033-3a5d-4db2-a045-fb255fa55a4a","resolution":{"observed_at":"2026-05-17T10:58:53.633677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , url=","venue":null,"work_id":"9ad749bd-a805-4e86-b9c2-4dc7f20f2c49","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:5823df06c929333e24ad96a3c3a9471908de3e7f653459e906b9335808b08194","observation_id":"8ad383c5-2e53-430a-be9f-b6a72c05e482","resolution":{"observed_at":"2026-05-17T10:58:53.736157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"ff616a8c-a8cb-40ae-a6ce-8241db52f243","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:7e5c5b3e78347bc0c51908ad6460a0b3cb5418fd920b4527fca42c0a9541e72b","observation_id":"da78542d-85a1-487d-9e6d-b13c27a314a4","resolution":{"observed_at":"2026-05-17T10:58:53.638769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"4b332d24-0eb2-4158-bda7-39e7f9738f21","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:12e2f9bf47a8720df6d81f6b35d28e88383b3fbbb53286e9f654eeef8f8bf26a","observation_id":"0c6006e1-a58d-4a09-8ff7-7a2f670d1fd2","resolution":{"observed_at":"2026-05-17T10:58:53.641305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T17:22:42.095074Z","title":"2023 , eprint=","venue":null,"work_id":"e50bd430-fd24-42da-af42-66dff24c7ca0","year":2023},"citing_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"reference_index":124,"source":"arxiv_source","source_observed_at":"2026-05-17T10:58:53.215887Z"},"links":{"citing_paper":"/paper/2402.11411"},"observation_digest":"sha256:9033b447ecff61fbe6dbf15b1175d8adc49976581b00531da0ad0b08d98a9f5c","observation_id":"6d30c901-6d3a-4b4d-9eab-3ea02a4e1854","resolution":{"observed_at":"2026-05-17T10:58:53.643806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:31:41.687799Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":1,"unresolved":9,"verified_exact":13,"verified_fuzzy":72},"total_outbound_references":155},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 155 outbound references and 27 inbound Pith citation observations for arXiv:2402.11411."}