{"as_of":"2026-08-12T23:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3a6746e3590344c0f15e453c0aa5d276396267b8ca4439895f2a318fc073afc2","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:19:45.907689Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:18:39.999709Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T17:18:42.348103Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"cited_work":{"arxiv_id":"2411.13697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.13697","snapshot_observed_at":"2026-08-10T17:18:42.348103Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","venue":"cs.CV","work_id":"aa06bd68-8ccf-4d1c-ad7b-054b96ed2b78","year":2024},"citing_paper":{"arxiv_id":"2501.12368","last_updated":"2025-05-20T11:36:34Z","snapshot_observed_at":"2026-08-12T10:02:12.958369Z","submitted_at":"2025-01-21T18:47:32Z","title":"InternLM-XComposer2.5-Reward: A Simple Yet Effective Multi-Modal Reward Model","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T17:18:39.999709Z"},"links":{"cited_paper":"/paper/2411.13697","citing_paper":"/paper/2501.12368"},"observation_digest":"sha256:334d222e6bee0b713882ad0763c607a342e6c980d46323015d020f656a8cd3c5","observation_id":"a76663c8-4a8f-4508-9668-446e09af7a64","resolution":{"observed_at":"2026-08-10T17:18:42.352989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13697/citation-record","integrity":"/paper/2411.13697/integrity","json":"/paper/2411.13697/citation-record.json","paper":"/paper/2411.13697"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.347131Z","title":"Llama 3.1 8b instruct","venue":null,"work_id":"77b9ffbc-1edf-4e22-9f3e-18940747c72e","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.617545Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:41b7984c0b0d6de982a6f66ad2a1d845987fba07727ae86ff7015bd54c4bab27","observation_id":"e856053a-6e0c-4a4f-b7fe-56e089518534","resolution":{"observed_at":"2026-08-12T16:19:57.352098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.331655Z","title":"Neural module networks","venue":null,"work_id":"b21d6769-44c5-4cc9-88af-bd0f387c2f69","year":2016},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.623178Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:40e64451832c4596189fef00145ce387bef05f9d9eafd27bc54be687217a31b6","observation_id":"60ae80d8-2c42-495e-b593-0390a4b8b6a8","resolution":{"observed_at":"2026-08-12T16:19:57.336364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T16:19:45.628581Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.628581Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:1fc7d466777c79df3e617cd949fb867418877a7be6a7527d4dddd5ef48bea176","observation_id":"f12f664c-4f19-4989-8a7d-daa471ee13ab","resolution":{"observed_at":"2026-08-12T16:19:45.628581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.315355Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":"09c071c2-9290-4b6f-a3d9-987fb627599f","year":1952},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.634687Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:a2bcd06cdc2c36283c177866ebde4c79d734b9f6c18dda06e0481f715373e589","observation_id":"f3f049da-c169-4a70-939d-8025379a2636","resolution":{"observed_at":"2026-08-12T16:19:57.321195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.295982Z","title":"Modularized zero-shot VQA with pre-trained models","venue":null,"work_id":"e017e93c-0afd-4447-8627-ce0301c128af","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.639961Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:19d164f37f958bedd290812e81e0740557aad4d27fae7867bbf6d419d0b7cf67","observation_id":"81ac125f-6d5e-4013-9888-b504a77fef0b","resolution":{"observed_at":"2026-08-12T16:19:57.301616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.279799Z","title":"Complex claim verification with evidence re- trieved in the wild","venue":null,"work_id":"e118fa7f-8c7e-49a1-94a3-f12e8cfe1938","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.645297Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:dd5ea671a7c88b2b9b9e7f20d04b52fea4f709068354f9e83942121c2b462128","observation_id":"2d805f23-9fcc-43d2-a855-7147837deef0","resolution":{"observed_at":"2026-08-12T16:19:57.285170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-12T16:19:45.653175Z","title":"MME: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.653175Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:73d6a4b540fa49b15cf9b20130ba261af91d4ab14eded850329522889cf4e911","observation_id":"210b3e1b-eab2-45ac-84b4-a6dccdecdd07","resolution":{"observed_at":"2026-08-12T16:19:45.653175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.263239Z","title":"Making the V in VQA matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":"a2dc68bc-1cd5-4422-9bab-4594465be4c5","year":2017},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.658498Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:15c7e446f54b2f27c46f5daf32537554089887ecad01fb887849177b98cd2fa8","observation_id":"89ea2ab6-5635-46fe-b44e-ec01a53e9f69","resolution":{"observed_at":"2026-08-12T16:19:57.268963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.244961Z","title":"Breaking common sense: Whoops! A vision-and- language benchmark of synthetic and compositional images","venue":null,"work_id":"de2fcd8e-fe36-47b0-bd33-374b053605e1","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.663625Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:928b9073ca13960e19e5b112cfb0eac51395b45f8c9897a88e168278e6712dbb","observation_id":"32f2aad0-d4e5-4acc-960e-edf2128df124","resolution":{"observed_at":"2026-08-12T16:19:57.250746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11530","last_updated":"2024-07-22T09:54:40Z","snapshot_observed_at":"2026-08-12T21:55:47.427140Z","submitted_at":"2024-02-18T10:09:10Z","title":"Efficient Multimodal Learning from Data-centric Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11530","snapshot_observed_at":"2026-08-12T16:19:45.669568Z","title":"Efficient mul- timodal learning from data-centric perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.669568Z"},"links":{"cited_paper":"/paper/2402.11530","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:2ec047bedb495e5311362a38d8fcef189021d39e581c1c33976088cf4309b49b","observation_id":"711b46af-a74a-47e0-a91f-b5a38aca166c","resolution":{"observed_at":"2026-08-12T16:19:45.669568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.226201Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"a4dae413-0267-4e92-b2ef-db5ecb25a7c9","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.675412Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e4adb0f7e803383eb5801b6e62059c0c0736a0c0b5a652cc941a6c93941e1397","observation_id":"20631d07-13c1-4d08-8294-9f391786b97e","resolution":{"observed_at":"2026-08-12T16:19:57.233252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.207047Z","title":"Learning to reason: End-to-end module networks for visual question answering","venue":null,"work_id":"027a51b0-58c1-475f-a97d-e220e5a229b0","year":2017},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.681503Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:f807137b0508e17d0b2fd19a6418a016730741865d46be51bb939fdef302a308","observation_id":"b4c42340-4a5c-45d5-9213-fa1d075372fe","resolution":{"observed_at":"2026-08-12T16:19:57.212297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.188877Z","title":"Opera: Alleviating hallucination in multi- modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"e5a715b7-0c87-4aa9-ae63-ca2ee02be234","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.687036Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:66c1bc7dd78db3687f9e8248639c6e9301809ad27f3b72d547b3db3d6794ad89","observation_id":"7a7eaa0a-5988-427c-ad5c-bc22122c910d","resolution":{"observed_at":"2026-08-12T16:19:57.194409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.170236Z","title":"Hudson and Christopher D","venue":null,"work_id":"d4fcf501-6b12-420a-a2e9-40cf0fbc5dbb","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.692794Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e05e0171ed31b7ad23ec4f099854ccc9dba2eb1b7411e3ce43ff3dfbf03111f9","observation_id":"a7617016-d6cd-4281-88a9-0c132aa9a876","resolution":{"observed_at":"2026-08-12T16:19:57.176796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.150770Z","title":"Hallucination augmented contrastive learning for multimodal large language model","venue":null,"work_id":"7abfc5b3-11e4-4682-9fbe-16baf740b2d3","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.698531Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:b6fdfe60e7b2849192095225c84a7a1c3b8dd309a785cb1ad7803559ce8a9a5a","observation_id":"47bf757d-5a76-4b4e-82d0-9cd359ffe7e8","resolution":{"observed_at":"2026-08-12T16:19:57.156178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15721","last_updated":"2024-11-08T05:08:43Z","snapshot_observed_at":"2026-07-06T17:34:53.153463Z","submitted_at":"2024-02-24T05:14:52Z","title":"Hal-Eval: A Universal and Fine-grained Hallucination Evaluation Framework for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15721","snapshot_observed_at":"2026-08-12T16:19:45.703566Z","title":"Hal-eval: A uni- versal and fine-grained hallucination evaluation framework for large vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.703566Z"},"links":{"cited_paper":"/paper/2402.15721","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:5f2d5b5241105a2824b0807bf188d0a2e42d0577f0f423a8e8560794e8c86920","observation_id":"503ae8ae-5719-42b0-b0d1-1def6e291805","resolution":{"observed_at":"2026-08-12T16:19:45.703566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.133013Z","title":"What’s ”up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":"f2f44dfe-a1ef-4a18-94c1-329ae4419cbd","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.709416Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:2e4ef6f6ba62b87e94dcf9a6581465a81c6c07a74c2b5f2ca82c0445885b0b64","observation_id":"7ee622db-7b9b-48ba-84f1-693bd84cb659","resolution":{"observed_at":"2026-08-12T16:19:57.139146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.112266Z","title":"Shamma, Michael S","venue":null,"work_id":"6a02aeeb-3978-47fb-9cc9-81f46f07c0f7","year":2017},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.715042Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:0ec8c06bea0719ae7d2c8d7a603a0ea46a630a7ae9269d86d71a41551808e2d0","observation_id":"79ed3313-35b0-4be9-bf92-0a156e22896f","resolution":{"observed_at":"2026-08-12T16:19:57.119188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.088003Z","title":"Mitigating object hallucinations in large vision-language models through vi- sual contrastive decoding","venue":null,"work_id":"ccf0f615-fd7c-46ca-bb95-a57bff2992ed","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.720246Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e6030bee5195b78a0fd255d1ff191714b6fb9be1a64a56f8e7104982e5048135","observation_id":"e5e98b55-daa9-4db5-bf27-cff4e094e6d0","resolution":{"observed_at":"2026-08-12T16:19:57.093735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.069353Z","title":null,"venue":null,"work_id":"7a08e2a3-0aa9-46bd-b8c4-6e579308d5e8","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.726063Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:539471456f7fbdb4e1a90e48fe7bc4b03d52e732b242773cba27fa7436104e21","observation_id":"f3485cbb-1db5-4fd5-b709-581e204e9658","resolution":{"observed_at":"2026-08-12T16:19:57.075879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-07-06T17:04:13.625458Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-12T16:19:45.731027Z","title":"Silkie: Preference distillation for large visual lan- guage models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.731027Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:028ef8c05cb8c5d37985a7381eeb204ee176c5c4ccda1f6a229e1f7751d08079","observation_id":"4a215b56-61d5-4b59-9c3e-91dad1ac794f","resolution":{"observed_at":"2026-08-12T16:19:45.731027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.050891Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"707433e0-af2d-4e84-864e-1478b4f815a7","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.736090Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:4a8cfac031a6491832b64b525a8b810e1e2adf7f6461ecdb12f11a1ff3038b82","observation_id":"bf3af5f6-456b-489d-b3fc-5371f602f1c8","resolution":{"observed_at":"2026-08-12T16:19:57.056305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.032688Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"7de3e1a4-bcf4-4e5d-9273-fe833d70c2be","year":2014},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.741796Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e4b9f19aa88af3be2055b16de80111754cf060969bdbc0c6e0a1f93362ee5471","observation_id":"0d488472-9d28-400b-b160-f52ff37fed44","resolution":{"observed_at":"2026-08-12T16:19:57.038420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-12T16:19:45.746266Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.746266Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:83ac3d2b8d1c64720eaa41fbae6de31b74e4236452b3f0477483632d7f0fd451","observation_id":"33dc35c4-8198-4966-b538-5526e5d36670","resolution":{"observed_at":"2026-08-12T16:19:45.746266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:57.012828Z","title":"Visual instruction tuning","venue":null,"work_id":"fe83077c-f339-49d1-8d29-74ce7bccbd90","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.752362Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:5cf2d5028e80d0cceff1e02ebac5ccfb90196e9da75aa4f7c59a73bc1de0d207","observation_id":"f1fa9123-ad8a-41a9-8c06-7fdaf60de9b2","resolution":{"observed_at":"2026-08-12T16:19:57.020016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.990909Z","title":"OK-VQA: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":"12a02924-0415-4803-971d-7f7c66b44ad1","year":2019},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.757094Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:99d3dfb2483f2decca7664dd289eca1fe987ec81d756ce65ddd47a06d9fddfaf","observation_id":"b8ea8780-131f-40e6-af45-df2c5a4489c5","resolution":{"observed_at":"2026-08-12T16:19:56.997419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.972654Z","title":"Factscore: Fine-grained atomic evaluation of factual precision in long form text generation","venue":null,"work_id":"ad8bc8c4-6a0c-4d7a-bcb8-d545a86d1639","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.762073Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:9769a4495f2886be5ca37d2eb42f80ed7aad2f3401309527a3007f81969d77f5","observation_id":"74492595-f18e-4550-82aa-ecd00f0933b6","resolution":{"observed_at":"2026-08-12T16:19:56.977946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06230","last_updated":"2022-07-20T12:24:25Z","snapshot_observed_at":"2026-07-06T13:09:25.356940Z","submitted_at":"2022-05-12T17:20:36Z","title":"Simple Open-Vocabulary Object Detection with Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06230","snapshot_observed_at":"2026-08-12T16:19:45.767294Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.767294Z"},"links":{"cited_paper":"/paper/2205.06230","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:83aa1c9fb248f1594b1d713a0f88c3d29c2aa8db2afba20d5f8b658a2513ca7c","observation_id":"f3140a77-321f-4304-b80d-f00ae3241971","resolution":{"observed_at":"2026-08-12T16:19:45.767294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.955575Z","title":"Compositional chain-of-thought prompting for large multimodal models","venue":null,"work_id":"9474f73b-aad4-45f5-beaa-21b23d7548b6","year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.772200Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:6b8900e8768c07367fd3eb67bc56864072f4a9b444506ba2685e0e0bf11bf709","observation_id":"7db73d87-d104-4f06-b485-27237718928a","resolution":{"observed_at":"2026-08-12T16:19:56.961296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.939439Z","title":"Morris, Eli Lifland, Jin Yong Yoo, Jake Grigsby, Di Jin, and Yanjun Qi","venue":null,"work_id":"69ccd1ad-b886-4c0b-bbd4-d84be428e700","year":2020},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.776930Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:c3bf5c489f5cd1d1cb271fbbcddc242a460c8942adc76d6975367b43601f28ad","observation_id":"51092136-b004-4cc0-8694-69fe49af5349","resolution":{"observed_at":"2026-08-12T16:19:56.944636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:19:45.782370Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.782370Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:137d17f5d0f9fa6b50f6c8446c6f1e8b1c3268534cacf56ed7cb01ef10dbb355","observation_id":"d5def5ee-c41a-4c82-a70e-64e9ec9750bd","resolution":{"observed_at":"2026-08-12T16:19:45.782370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.919148Z","title":null,"venue":null,"work_id":"f40de2c9-8684-48c8-ae81-e845e4cca7e2","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.788154Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e4486f71094085727fbd05ffcd6ddf3e48575ea3b8892f1344442939ffb76531","observation_id":"d4acb592-47a9-4d75-8a8d-eec4f4b653f5","resolution":{"observed_at":"2026-08-12T16:19:56.925402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.897011Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":"42acb6b2-1ad2-4a3c-93c8-578765809b53","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.792880Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:7102fe896c91805e803937776194fb0d7e5c342a9281c5294e7aef2c909381ae","observation_id":"8dd92a20-2a24-4a0f-8491-9d5b5597c2e2","resolution":{"observed_at":"2026-08-12T16:19:56.904101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:45.797663Z","title":"Object hallucination in image cap- tioning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.797663Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:3599912ba909924d9e22024f56396ac5fdf85ddf4be598535b06a92f406bc958","observation_id":"195df677-367f-4b23-9313-fe107c63c567","resolution":{"observed_at":"2026-08-12T16:19:45.797663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18654","last_updated":"2025-02-28T00:26:42Z","snapshot_observed_at":"2026-08-04T21:04:25.264907Z","submitted_at":"2024-05-28T23:36:00Z","title":"Mitigating Object Hallucination in MLLMs via Data-augmented Phrase-level Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18654","snapshot_observed_at":"2026-08-12T16:19:45.802265Z","title":"Arik, and Tomas Pfister","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.802265Z"},"links":{"cited_paper":"/paper/2405.18654","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:bc077b693bde439892bbc8397823dc16662b5bef59581b3b44c6f2bc5bbed9a6","observation_id":"8d86171e-de17-4411-888f-2c2101986102","resolution":{"observed_at":"2026-08-12T16:19:45.802265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.863476Z","title":"Toolformer: Lan- guage models can teach themselves to use tools","venue":null,"work_id":"08faaa4d-549a-4130-8075-2726c844ae10","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.807698Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:8ef43201bbbb77bddf59fa3de7830cfcdc71e0d370380280ee2b4e634942c58c","observation_id":"d05d7781-24a7-4386-a523-9fc6ad15e9a6","resolution":{"observed_at":"2026-08-12T16:19:56.869860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.845504Z","title":"Averitec: A dataset for real-world claim verification with ev- idence from the web","venue":null,"work_id":"ab5177cc-6937-473a-aaba-b6760f954b75","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.813661Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:eb1d50cad297b5b90b4ba33bfe90490fda814dfca56b56be09f280f96c380b0c","observation_id":"14eae642-95d4-4eb1-89f7-a02f446fd42f","resolution":{"observed_at":"2026-08-12T16:19:56.851223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.826114Z","title":"Towards VQA models that can read","venue":null,"work_id":"e209c8a7-79e3-4b8d-bf7c-3c88a803b737","year":2019},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.818960Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:62bbb8485693da0a8def462e50939e2932b789f5f9440a415c340c08a15a1c49","observation_id":"89250df4-7829-4ab8-b33b-fb3b36af9054","resolution":{"observed_at":"2026-08-12T16:19:56.832658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.801999Z","title":"Reclip: A strong zero-shot baseline for referring expression compre- hension","venue":null,"work_id":"cbc6066e-37ee-4aea-9605-6d6546ebd515","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.824360Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:8ad8931f466edd80dd0cc05290169c73742a69bab617d981f03b38da77a733a4","observation_id":"5a041ad3-fc9a-4441-aa80-15e68acb0fb2","resolution":{"observed_at":"2026-08-12T16:19:56.808390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.778563Z","title":"Aligning large multimodal models with factually aug- mented RLHF","venue":null,"work_id":"32064c81-1682-4a10-af6e-513ee503b378","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.829246Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:1cf0c95ff43488bbf26d49afe6f57b582324487235d17d3dd776d3ff9d3ed086","observation_id":"4272d5f7-1285-4f9d-97fc-d494b65de514","resolution":{"observed_at":"2026-08-12T16:19:56.786805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.758488Z","title":"Winoground: Probing vision and language models for visio- linguistic compositionality","venue":null,"work_id":"bdd3b297-72d7-43c5-afdb-057c862c6951","year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.834397Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:ad4c3f0dc4249f6f483a08ce09d749181a5e39ca06fd3fd9bd448b6fb4bee58b","observation_id":"24009d21-2838-45f5-b1c7-f608ec8eb06c","resolution":{"observed_at":"2026-08-12T16:19:56.763724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-12T16:19:45.840224Z","title":"An llm-free multi-dimensional benchmark for mllms hallu- cination evaluation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.840224Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:567221442e4960fe03cdd0616a74a4871e1e34ac04f76e408511148dd96e3093","observation_id":"8c198218-3604-4888-9501-cfca0cedf142","resolution":{"observed_at":"2026-08-12T16:19:45.840224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-12T16:19:45.846143Z","title":"Visual chatgpt: Talking, drawing and editing with visual foundation models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.846143Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:a340de5f69c9c73f2abba496c608f179518e11b25611096536b710108b33c373","observation_id":"c49e7674-0f24-430b-a717-72fb8183d2c2","resolution":{"observed_at":"2026-08-12T16:19:45.846143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14233","last_updated":"2025-01-06T13:58:45Z","snapshot_observed_at":"2026-08-11T06:17:48.689367Z","submitted_at":"2024-04-22T14:46:10Z","title":"Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14233","snapshot_observed_at":"2026-08-12T16:19:45.852589Z","title":"Detecting and mitigating hallucination in large vi- sion language models via fine-grained AI feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.852589Z"},"links":{"cited_paper":"/paper/2404.14233","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:4425576666ea0f29e34ac90428f994a860202dc7af85f263b6a1c4abfabeae15","observation_id":"abb57ec7-d839-4ee2-aff5-5ac93aeef63a","resolution":{"observed_at":"2026-08-12T16:19:45.852589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T16:19:45.857856Z","title":"mplug-owl: Modularization empowers large language models with mul- timodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.857856Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:e3df743acef18dcf238866572d4897dec5de3c1ed1013ebe8ed066d976b21d0f","observation_id":"2e0f2944-4597-4162-b86d-a19b143ecf7b","resolution":{"observed_at":"2026-08-12T16:19:45.857856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-10T17:39:16.504791Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-12T16:19:45.864159Z","title":"Woodpecker: Hallucination correction for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.864159Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:4623407965be837e0668df0bd218b932572af098b40acd165a59ed673777cbbb","observation_id":"23fbd567-653a-4f0f-aee5-3b77a5136fd1","resolution":{"observed_at":"2026-08-12T16:19:45.864159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.739046Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"23fd846c-8016-4735-86ca-5445912f9c41","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.869769Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:038a960be495d9e324905ec356e95bcafb71a1e9863d1b7b20f2f16bc64f8e54","observation_id":"070514aa-d647-4995-9df7-f3f2f0995191","resolution":{"observed_at":"2026-08-12T16:19:56.745479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:45.875159Z","title":"RLAIF-V: aligning mllms through open-source AI feedback for super GPT-4V trustworthiness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.875159Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:26e6b13f2df0edb6a3269bf8b1cac221ac3546315a2677d8503e347c3d672bb4","observation_id":"0ea2a3c2-2946-4c1f-aa6b-dc5e1eaec77d","resolution":{"observed_at":"2026-08-12T16:19:45.875159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.718183Z","title":"Less is more: Miti- gating multimodal hallucination from an EOS decision per- spective","venue":null,"work_id":"a0dc5874-5df6-46e1-8e9a-e0e61a4b6b5f","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.880507Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:b498909b4814d33cc7392368de1339a36c02505fb35e5c9dc2610ee2ddabc5f0","observation_id":"05dfe205-3478-4350-afee-968d54eb9446","resolution":{"observed_at":"2026-08-12T16:19:56.724835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00221","last_updated":"2023-06-22T16:55:44Z","snapshot_observed_at":"2026-08-10T11:59:13.699690Z","submitted_at":"2022-07-01T06:25:53Z","title":"VL-CheckList: Evaluating Pre-trained Vision-Language Models with Objects, Attributes and Relations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00221","snapshot_observed_at":"2026-08-12T16:19:45.886327Z","title":"Vl- checklist: Evaluating pre-trained vision-language mod- els with objects, attributes and relations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.886327Z"},"links":{"cited_paper":"/paper/2207.00221","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:dddd7754b1166ce29c4cbf693784d13c4c4076ebdb060f81da1bd35c2b1148f2","observation_id":"f76ee1ca-8be6-4b4d-8d62-c1543f2210fa","resolution":{"observed_at":"2026-08-12T16:19:45.886327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-08T04:17:23.797697Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-12T16:19:45.891415Z","title":"Beyond hallucinations: Enhanc- ing lvlms through hallucination-aware direct preference op- timization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.891415Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:a3eab30ef65e13701424eb6541ee7f0082d23ec2681de838c632899cf300874d","observation_id":"8217e480-5c65-4cf6-8ed8-8967d74ffa66","resolution":{"observed_at":"2026-08-12T16:19:45.891415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.694267Z","title":"ROME: evaluating pre-trained vision-language models on reasoning beyond visual common sense","venue":null,"work_id":"9ba671dc-2543-4c5a-8aab-fd01aa11eab8","year":2023},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.896930Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:33a50c837314c0cf14dfb2b0b5242b1c0a84b867a5c629cc287173ae0beebba2","observation_id":"672a8d6a-4b5d-4751-838f-50e30593158b","resolution":{"observed_at":"2026-08-12T16:19:56.701669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11411","last_updated":"2024-02-18T00:56:16Z","snapshot_observed_at":"2026-08-10T21:21:50.749962Z","submitted_at":"2024-02-18T00:56:16Z","title":"Aligning Modalities in Vision Large Language Models via Preference Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11411","snapshot_observed_at":"2026-08-12T16:19:45.901914Z","title":"Aligning modalities in vision large language models via preference fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.901914Z"},"links":{"cited_paper":"/paper/2402.11411","citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:a3176c79c70045c9135a490f63c8eaf5b1dcd38ee47b006351450a50e8fa1de5","observation_id":"0544ff14-ccb0-47a9-bf0e-41073097769a","resolution":{"observed_at":"2026-08-12T16:19:45.901914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:19:56.672871Z","title":"Is the {sub} {relation} {obj}?","venue":null,"work_id":"aff01a56-4e3b-4150-bd76-47513bf67a42","year":2024},"citing_paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:19:45.907689Z"},"links":{"citing_paper":"/paper/2411.13697"},"observation_digest":"sha256:990f76ee5a5ec42d7cfd9de0c6ec6a4d762f69c7e837dc8c7ab2935658cea498","observation_id":"252f9984-8921-40f9-b03b-4fb8f2b2d412","resolution":{"observed_at":"2026-08-12T16:19:56.680852Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13697","last_updated":"2024-11-20T20:28:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:57:07.149950Z","submitted_at":"2024-11-20T20:28:04Z","title":"Decompose and Leverage Preferences from Expert Models for Improving Trustworthiness of MLLMs"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":32},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2411.13697."}